สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
ช่วงความเชื่อมั่นสำหรับความแตกต่างของวิธีการในการถดถอย
สมมติว่าฉันมีรูปแบบการถดถอยแบบสมการกำลังสอง โดยมีข้อผิดพลาดเป็นไปตามสมมติฐานปกติ (อิสระปกติเป็นอิสระจากค่า ) ให้เป็นค่าประมาณกำลังสองน้อยที่สุดY=β0+β1X+β2X2+ϵY=β0+β1X+β2X2+ϵ Y = \beta_0 + \beta_1 X + \beta_2 X^2 + \epsilon ϵϵ\epsilonXXXb0,b1,b2b0,b1,b2b_0, b_1, b_2 ฉันมีค่าใหม่สองค่าและและฉันสนใจที่จะรับช่วงความมั่นใจสำหรับ2)XXXx1x1x_1x2x2x_2v=E(Y|X=x2)−E(Y|X=x1)=β1(x2−x1)+β2(x22−x21)v=E(Y|X=x2)−E(Y|X=x1)=β1(x2−x1)+β2(x22−x12)v = E(Y|X = x_2) - E(Y|X=x_1) = \beta_1 (x_2 - x_1) + \beta_2 (x_2^2 - x_1^2) การประมาณจุดคือและ (แก้ไขฉันถ้าฉันผิด) ฉันสามารถประมาณความแปรปรวนโดยโดยใช้การประมาณค่าความแปรปรวนและความแปรปรวนร่วมของค่าสัมประสิทธิ์ที่ได้รับจากซอฟต์แวร์v^=b1(x2−x1)+b2(x22−x21)v^=b1(x2−x1)+b2(x22−x12)\hat{v} = b_1 (x_2 - x_1) + b_2 (x_2^2 - x_1^2)s^2= (x2-x1)2วาร์(ข1) …

1
จะคำนวณความผิดพลาดมาตรฐานของอัตราต่อรองได้อย่างไร
ฉันมีสองชุดข้อมูลจากการศึกษาความสัมพันธ์ของจีโนมกว้าง ข้อมูลเท่านั้นที่มีคืออัตราส่วนอัตราต่อรองและค่า p สำหรับชุดข้อมูลแรก สำหรับชุดข้อมูลที่สองฉันมีอัตราต่อรอง, p-value และความถี่อัลลีล (AFD = โรค, AFC = การควบคุม) (เช่น: 0.321) ฉันพยายามทำการวิเคราะห์เมตาดาต้าของข้อมูลเหล่านี้ แต่ฉันไม่มีพารามิเตอร์ขนาดผลเพื่อดำเนินการนี้ มีความเป็นไปได้ในการคำนวณช่วงเวลา SE และ OR สำหรับแต่ละข้อมูลเหล่านี้โดยใช้ข้อมูลที่มีให้หรือไม่? ขอบคุณล่วงหน้า ตัวอย่าง: ข้อมูลที่มีอยู่: Study SNP ID P OR Allele AFD AFC 1 rs12345 0.023 0.85 2 rs12345 0.014 0.91 C 0.32 0.25 ด้วยข้อมูลเหล่านี้ฉันสามารถคำนวณ SE และ CI95% หรือ ขอบคุณ

2
จะสรุปและเปรียบเทียบความสัมพันธ์ที่ไม่ใช่เชิงเส้นได้อย่างไร
ฉันมีข้อมูลเกี่ยวกับเปอร์เซ็นต์ของอินทรียวัตถุในตะกอนทะเลสาบจาก 0 ซม. (กล่าวคือตะกอน - อินเทอร์เฟซน้ำ) ลงไป 9 ซม. สำหรับทะเลสาบประมาณ 25 ในแต่ละทะเลสาบ 2 แกนถูกนำมาจากแต่ละสถานที่ดังนั้นฉันจึงมีการทำซ้ำ 2 เปอร์เซ็นต์ของปริมาณอินทรียวัตถุในแต่ละระดับความลึกของตะกอนสำหรับแต่ละทะเลสาบ ฉันสนใจที่จะเปรียบเทียบความแตกต่างของความสัมพันธ์ระหว่างอินทรียวัตถุเปอร์เซ็นต์กับความลึกของตะกอนในทะเลสาบ (เช่นความชัน) ในบางทะเลสาบความสัมพันธ์ระหว่างเปอร์เซ็นต์อินทรียวัตถุและความลึกของตะกอนปรากฏเป็นเส้นตรง แต่ในกรณีอื่นความสัมพันธ์นั้นซับซ้อนมากขึ้น (ดูตัวอย่างด้านล่าง) ความคิดเริ่มต้นของฉันคือการปรับความสัมพันธ์เชิงเส้นให้เหมาะสมกับทั้งเส้นโค้งทั้งหมดหรือส่วนย่อยของเส้นโค้งถ้ามันเป็นเส้นตรง "ส่วนใหญ่" และเปรียบเทียบทะเลสาบเหล่านั้นเท่านั้นที่พบความสัมพันธ์เชิงเส้นที่สำคัญ อย่างไรก็ตามฉันไม่พอใจกับวิธีการนี้ในการที่จะต้องกำจัดข้อมูลด้วยเหตุผลอื่นที่ไม่ใช่แบบจำลองเชิงเส้นและไม่สนใจข้อมูลที่น่าสนใจเกี่ยวกับความสัมพันธ์ระหว่างเปอร์เซ็นต์อินทรีย์วัตถุและความลึกของตะกอน อะไรจะเป็นวิธีที่ดีในการสรุปและเปรียบเทียบโค้งจากทะเลสาบต่าง ๆ ขอบคุณ ตัวอย่างเส้นโค้ง: ในทุกกรณีแกน y คืออินทรียวัตถุร้อยละในตะกอนและแกน x คือความลึกของตะกอนที่ 0 = อินเทอร์เฟซของตะกอนน้ำ ตัวอย่างเชิงเส้นที่ดี: 2 ตัวอย่างที่ไม่ใช่เชิงเส้น: ตัวอย่างที่ไม่มีความสัมพันธ์ที่ชัดเจน:

3
ปัญหากับดักตัวแปร Dummy
ฉันใช้การถดถอย OLS ขนาดใหญ่ที่ตัวแปรอิสระทั้งหมด (ประมาณ 400) เป็นตัวแปรจำลอง หากรวมทั้งหมดแล้วจะมีความสมบูรณ์แบบหลายค่า (ความแตกต่างของตัวแปรดัมมี่) ดังนั้นฉันต้องตัดตัวแปรตัวใดตัวหนึ่งก่อนที่จะทำการถดถอย คำถามแรกของฉันคือสิ่งที่ควรละเว้นตัวแปร? ฉันได้อ่านแล้วว่าเป็นการดีกว่าถ้าละเว้นตัวแปรที่มีอยู่ในการสังเกตหลายครั้งแทนที่จะเป็นตัวแปรที่มีอยู่ในไม่กี่ตัวเท่านั้น (เช่นถ้าการสังเกตเกือบทั้งหมดเป็น "ผู้ชาย" หรือ "ผู้หญิง" และเพียงไม่กี่คนเท่านั้นที่ไม่รู้จัก "ละเว้น" ชาย "หรือ" หญิง ") เป็นธรรมหรือไม่? หลังจากรันการถดถอยด้วยตัวแปรที่ละเว้นฉันสามารถประเมินค่าสัมประสิทธิ์ของตัวแปรที่ละเว้นได้เพราะฉันรู้ว่าค่าเฉลี่ยโดยรวมของตัวแปรอิสระทั้งหมดของฉันควรเป็น 0 ดังนั้นฉันจึงใช้ความจริงนี้เพื่อเปลี่ยนค่าสัมประสิทธิ์สำหรับทุก ตัวแปรที่รวมอยู่และรับการประมาณค่าสำหรับตัวแปรที่ละเว้น คำถามต่อไปของฉันคือว่ามีเทคนิคที่คล้ายกันบางอย่างที่สามารถใช้เพื่อประเมินข้อผิดพลาดมาตรฐานสำหรับค่าสัมประสิทธิ์ของตัวแปรที่ตัดทิ้งหรือไม่ เนื่องจากฉันต้องเรียกใช้การถดถอยอีกครั้งโดยละเว้นตัวแปรที่แตกต่างกัน (และรวมถึงตัวแปรที่ฉันละเว้นในการถดถอยครั้งแรก) เพื่อรับการประเมินข้อผิดพลาดมาตรฐานสำหรับค่าสัมประสิทธิ์ของตัวแปรที่ละเว้นเดิม ในที่สุดฉันสังเกตเห็นว่าค่าสัมประสิทธิ์ประมาณที่ฉันได้รับ (หลังจากจัดศูนย์กลางอีกครั้งรอบศูนย์) จะแตกต่างกันเล็กน้อยขึ้นอยู่กับตัวแปรที่ถูกละเว้น ในทางทฤษฎีแล้วมันจะดีกว่าไหมถ้าใช้การถดถอยหลาย ๆ ตัวแต่ละตัวจะละเว้นตัวแปรที่ต่างกันแล้วเฉลี่ยค่าสัมประสิทธิ์ประมาณจากการถดถอยทั้งหมด

4
จะรับค่าที่ใช้ใน plot.gam เป็น mgcv ได้อย่างไร?
ฉันต้องการทราบค่าที่(x, y)ใช้ในการลงจุดplot(b, seWithMean=TRUE)ในแพ็คเกจmgcv ไม่มีใครรู้ว่าฉันสามารถแยกหรือคำนวณค่าเหล่านี้ได้อย่างไร นี่คือตัวอย่าง: library(mgcv) set.seed(0) dat <- gamSim(1, n=400, dist="normal", scale=2) b <- gam(y~s(x0), data=dat) plot(b, seWithMean=TRUE)

2
วิธีสร้างตัวอย่างตัวแทนจากชุดข้อมูลขนาดใหญ่โดยรวม
เทคนิคทางสถิติในการสร้างชุดตัวอย่างซึ่งเป็นตัวแทนของประชากรทั้งหมด (ด้วยระดับความเชื่อมั่นที่รู้จักกัน) คืออะไร? นอกจากนี้ วิธีการตรวจสอบถ้าตัวอย่างที่ตรงกับชุดข้อมูลโดยรวม? เป็นไปได้หรือไม่หากไม่แยกชุดข้อมูลทั้งหมด (ซึ่งอาจเป็นหลายพันล้านรายการ)

6
การหาจุดเปลี่ยนแปลงในข้อมูลจากฟังก์ชันเชิงเส้นแบบต่อเนื่อง
ทักทาย, ฉันกำลังทำการวิจัยที่จะช่วยกำหนดขนาดของพื้นที่ที่สังเกตและเวลาที่ผ่านไปนับตั้งแต่บิ๊กแบง หวังว่าคุณจะช่วยได้! ฉันมีข้อมูลที่สอดคล้องกับฟังก์ชันเชิงเส้นเป็นเส้นตรงซึ่งฉันต้องการดำเนินการถดถอยเชิงเส้นสองแบบ มีประเด็นที่ความชันและการสกัดกั้นเปลี่ยนไปและฉันต้องการ (เขียนโปรแกรมเป็น) เพื่อหาจุดนี้ คิด?

1
วิธีจัดการกับคำถามสำรวจความคิดเห็นที่มีหลายคำตอบ
ฉันมีชุดข้อมูลถามผู้คนว่าพวกเขาเคยไปสถานที่ต่าง ๆ (เช่น A, B, C, D) และพวกเขาสามารถเลือกได้มากกว่าหนึ่งตัวเลือกจากนั้นตัวอย่างจะถูกนำมาจากจมูกของพวกเขาเพื่อดูว่าพวกเขาติดเชื้อ โรค. ฉันต้องหาความเสี่ยงสัมพัทธ์ของการติดเชื้อสำหรับคนที่ไปสถานที่หนึ่งฉันสามารถนึกถึงการถดถอยโลจิสติกส์ตอนนี้มีคำแนะนำอื่น ๆ อีกไหม? ขอบคุณ
10 logistic 

4
รับโซ่ 10D MCMC ฉันจะกำหนดโหมดหลังได้อย่างไรใน R
คำถาม:ด้วยห่วงโซ่ MCMC แบบ 10 มิติสมมติว่าฉันพร้อมที่จะมอบเมทริกซ์การจับ: 100,000 ซ้ำ (แถว) โดย 10 พารามิเตอร์ (คอลัมน์) ฉันจะระบุโหมดหลังได้ดีที่สุดอย่างไร ฉันกังวลเป็นพิเศษกับหลายโหมด พื้นหลัง:ฉันคิดว่าตัวเองเป็นนักสถิติที่มีความชำนาญ แต่เมื่อเพื่อนร่วมงานถามคำถามนี้กับฉันฉันรู้สึกละอายใจที่ไม่สามารถหาคำตอบที่เหมาะสมได้ ข้อกังวลหลักคืออาจมีหลายโหมดปรากฏขึ้น แต่หากพิจารณาอย่างน้อยแปดหรือมากกว่านั้นในสิบส่วนข้อมูล ความคิดแรกของฉันคือการใช้การประมาณความหนาแน่นของเคอร์เนล แต่การค้นหาผ่าน R เปิดเผยว่าไม่มีอะไรน่ากังวลสำหรับปัญหาที่มีขนาดเกินกว่าสามมิติ เพื่อนร่วมงานได้เสนอกลยุทธ์เฉพาะกิจในสิบมิติและค้นหาสูงสุด แต่ข้อกังวลของฉันคือแบนด์วิดท์อาจนำไปสู่ปัญหาการกระจัดกระจายที่สำคัญหรือขาดความละเอียดในการแยกแยะหลายโหมด ที่กล่าวว่าฉันยินดีรับข้อเสนอแนะสำหรับคำแนะนำแบนด์วิดธ์อัตโนมัติลิงก์ไปยังตัวประมาณความหนาแน่นเคอร์เนล 10 ตัวหรือสิ่งอื่นที่คุณรู้ ความกังวลเกี่ยวกับ: เราเชื่อว่าการกระจายอาจเบ้ค่อนข้าง ดังนั้นเราต้องการระบุโหมดด้านหลังไม่ใช่วิธีหลัง เรากังวลว่าอาจมีโหมดหลังหลายโหมด หากเป็นไปได้เราต้องการคำแนะนำจาก R แต่อัลกอริทึมใด ๆ ที่จะทำตราบเท่าที่มันไม่ยากอย่างไม่น่าเชื่อที่จะใช้ ฉันเดาว่าฉันไม่ต้องการใช้ตัวประมาณความหนาแน่นของเคอร์เนลด้วยการเลือกแบนด์วิดท์อัตโนมัติตั้งแต่เริ่มต้น

5
Omega กำลังสองสำหรับการวัดผลกระทบใน R
หนังสือสถิติที่ฉันกำลังอ่านแนะนำให้โอเมก้ากำลังสองเพื่อวัดผลกระทบของการทดลองของฉัน ฉันได้พิสูจน์แล้วว่าใช้การออกแบบการแบ่งส่วน (ผสมผสานระหว่างการออกแบบภายในและระหว่างวิชา) ว่าปัจจัยภายในเรื่องของฉันมีความสำคัญทางสถิติด้วย p <0.001 และ F = 17 ตอนนี้ฉันกำลังมองหาว่าความแตกต่างใหญ่แค่ไหน ... มีการใช้โอเมก้ากำลังสองหา R (หรือ python หรือไม่ฉันรู้ว่า ... ใครจะฝันได้;) การค้นหาบนอินเทอร์เน็ตสำหรับสิ่งที่เกี่ยวข้องกับ R คือ เจ็บปวด*ฉันไม่รู้ว่าฉันจะหาสิ่งของด้วย C ได้อย่างไร ขอบคุณ!

1
เอาต์พุตของโมเดลโลจิสติกใน R
ฉันพยายามตีความโมเดลโลจิสติกส์ประเภทต่อไปนี้: mdl <- glm(c(suc,fail) ~ fac1 + fac2, data=df, family=binomial) ผลลัพธ์ของpredict(mdl)อัตราความสำเร็จที่คาดหวังสำหรับแต่ละจุดข้อมูลเป็นเท่าใด มีวิธีง่าย ๆ ในการกำหนดอัตราเดิมพันสำหรับแต่ละระดับของโมเดลแทนที่จะเป็นจุดข้อมูลทั้งหมดหรือไม่

3
สำหรับปัญหาการจำแนกถ้าตัวแปรคลาสมีการกระจายที่ไม่เท่ากันเราควรใช้เทคนิคใด?
สำหรับเช่น ถ้าฉันมีการให้คะแนนเครดิตระดับตัวแปรโดยมีสองคลาสดีและไม่ดีโดยที่ # (ดี) = 700 และ # (ไม่ดี) = 300 ฉันไม่ต้องการย่อข้อมูลของฉันให้สั้นลง ฉันควรใช้เทคนิคใด ฉันใช้ SVM แต่มันให้ผลดีกับการคาดการณ์ทั้งหมด


1
ข้อมูลประเภทใดที่ควรทำให้เป็นมาตรฐานด้วย KNN?
ฉันรู้ว่ามีการทำให้เป็นปกติมากกว่าสองประเภท ตัวอย่างเช่น, 1- การแปลงข้อมูลโดยใช้คะแนน z หรือคะแนน t ซึ่งมักเรียกว่ามาตรฐาน 2- การลดขนาดข้อมูลให้มีค่าระหว่าง 0 ถึง 1 คำถามตอนนี้ถ้าฉันต้องการ normalizing ข้อมูลประเภทใดที่ควรทำให้เป็นมาตรฐานด้วย KNN? และทำไม?

2
การทดสอบตามฤดูกาลของอนุกรมเวลา
การทดสอบฤดูกาลที่ง่ายที่สุดสำหรับอนุกรมเวลาคืออะไร? เฉพาะเจาะจงมากขึ้นฉันต้องการทดสอบว่าspecific time series the seasonal componentมีความหมายหรือไม่ แพ็คเกจที่แนะนำใน Python / R คืออะไร?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.