สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

4
เปรียบเทียบความสำคัญของชุดทำนายที่แตกต่างกัน
ฉันให้คำปรึกษากับนักศึกษาวิจัยเกี่ยวกับปัญหาบางอย่างและฉันก็กระตือรือร้นที่จะรับข้อมูลของผู้อื่นในเว็บไซต์นี้ บริบท: ผู้วิจัยมีตัวแปรทำนายสามประเภท แต่ละประเภทมีตัวแปรทำนายจำนวนแตกต่างกัน ตัวทำนายแต่ละตัวเป็นตัวแปรต่อเนื่อง: สังคม: S1, S2, S3, S4 (เช่นตัวทำนายสี่ตัว) เกี่ยวกับความรู้ความเข้าใจ: C1, C2 (เช่น, ผู้ทำนายสองคน) เกี่ยวกับพฤติกรรม: B1, B2, B3 (เช่นผู้ทำนายสามคน) ตัวแปรผลลัพธ์ก็ต่อเนื่องเช่นกัน กลุ่มตัวอย่างประกอบด้วยผู้เข้าร่วมประมาณ 60 คน ผู้วิจัยต้องการแสดงความคิดเห็นเกี่ยวกับประเภทของตัวทำนายที่สำคัญกว่าในการอธิบายตัวแปรผลลัพธ์ สิ่งนี้เกี่ยวข้องกับความกังวลทางทฤษฎีที่กว้างขึ้นเกี่ยวกับความสำคัญเชิงสัมพัทธ์ของตัวทำนายประเภทนี้ คำถาม เป็นวิธีที่ดีในการประเมินความสำคัญสัมพัทธ์ของชุดทำนายหนึ่งเมื่อเทียบกับชุดอื่นคืออะไร? อะไรคือกลยุทธ์ที่ดีในการจัดการกับความจริงที่ว่ามีตัวทำนายจำนวนต่างกันในแต่ละชุด? คุณควรแนะนำการตีความแบบใด การอ้างอิงใด ๆ กับตัวอย่างหรือการอภิปรายเกี่ยวกับเทคนิคก็ยินดีด้วยเช่นกัน


3
ตัวทำนายที่มีความแปรปรวนมากขึ้น“ ดีกว่า” หรือไม่?
ฉันมีคำถามแนวคิดเกี่ยวกับ "สถิติพื้นฐาน" ในฐานะนักเรียนฉันอยากรู้ว่าฉันกำลังคิดผิดเกี่ยวกับเรื่องนี้โดยสิ้นเชิงหรือไม่และถ้าเป็นเช่นนั้น: สมมุติว่าฉันพยายามดูความสัมพันธ์ระหว่าง "ปัญหาการจัดการความโกรธ" และพูดว่าการหย่า (ใช่ / ไม่ใช่) ในการถดถอยโลจิสติกส์และฉันมีตัวเลือกในการใช้คะแนนการจัดการความโกรธสองแบบ - ทั้ง 100 คะแนน 1 มาจากเครื่องมือให้คะแนนแบบสอบถาม 1 และตัวเลือกอื่นของฉัน คะแนน 2 มาจากแบบสอบถามอื่น สมมุติฐานเรามีเหตุผลที่จะเชื่อว่าจากการทำงานก่อนหน้านี้ว่าปัญหาการจัดการความโกรธทำให้เกิดการหย่าร้าง หากในตัวอย่างของฉันมีคน 500 คนความแปรปรวนของคะแนน 1 สูงกว่าคะแนน 2 มากมีเหตุผลใดที่เชื่อว่าคะแนน 1 จะเป็นคะแนนที่ดีกว่าที่จะใช้เป็นตัวทำนายการหย่าร้างตามความแปรปรวนหรือไม่ สำหรับฉันแล้วสัญชาตญาณดูเหมือนว่าจะถูก แต่มันเป็นอย่างนั้นเหรอ?

4
จะคำนวณความสัมพันธ์ระหว่าง / ภายในกลุ่มของตัวแปรอย่างไร
ฉันมีเมทริกซ์จำนวน 1,000 การสังเกตและ 50 ตัวแปรแต่ละตัววัดในระดับ 5 จุด ตัวแปรเหล่านี้ถูกจัดกลุ่มเป็นกลุ่ม แต่มีจำนวนตัวแปรไม่เท่ากันในแต่ละกลุ่ม ฉันต้องการคำนวณสหสัมพันธ์สองประเภท: ความสัมพันธ์ภายในกลุ่มของตัวแปร (ในลักษณะ): การวัดว่าตัวแปรภายในกลุ่มของตัวแปรกำลังวัดสิ่งเดียวกันหรือไม่ ความสัมพันธ์ระหว่างกลุ่มของตัวแปร: การวัดบางอย่างสมมติว่าแต่ละกลุ่มสะท้อนลักษณะโดยรวมหนึ่งลักษณะว่าแต่ละลักษณะ (กลุ่ม) เกี่ยวข้องกับลักษณะอื่น ๆ อย่างไร ลักษณะเหล่านี้เคยถูกจำแนกออกเป็นกลุ่ม ฉันสนใจที่จะหาความสัมพันธ์ระหว่างกลุ่ม - เช่นสมมติว่าลักษณะภายในกลุ่มกำลังวัดลักษณะพื้นฐานเดียวกัน (หลังจากเสร็จสิ้น # 1 ด้านบน - อัลฟ่าของครอนบาค) มีความสัมพันธ์กันหรือไม่? ไม่มีใครมีคำแนะนำสำหรับการเริ่มต้นหรือไม่

2
การเรียนรู้ภายใต้การดูแลภายใต้เหตุการณ์“ หายาก” เมื่อความหายากเกิดขึ้นเนื่องจากเหตุการณ์ที่เกิดขึ้นจริงจำนวนมาก
สมมติว่าคุณได้รับการ "จับคู่" ระหว่างผู้ซื้อและผู้ขายในตลาด คุณจะได้สังเกตลักษณะของทั้งผู้ซื้อและผู้ขายซึ่งคุณต้องการใช้ในการทำนายการแข่งขันในอนาคต & ให้คำแนะนำกับทั้งสองด้านของตลาด เพื่อความง่ายให้สมมติว่ามีผู้ซื้อ N รายและผู้ขาย N คนและแต่ละคนพบการแข่งขัน มีการแข่งขัน N รายการและ (N-1) (N-1) ไม่ใช่การแข่งขัน ชุดข้อมูลการฝึกแบบรวมทุกอย่างมีการสังเกตแบบ N + (N-1) * (N-1) ซึ่งอาจมีขนาดใหญ่มาก ดูเหมือนว่าการสุ่มตัวอย่างจาก (N-1) (N-1) ไม่ตรงและการฝึกอบรมอัลกอริทึมเกี่ยวกับข้อมูลที่ลดลงอาจมีประสิทธิภาพมากขึ้น คำถามของฉันคือ: (1) การสุ่มตัวอย่างจากผู้ไม่ตรงกันเพื่อสร้างชุดข้อมูลการฝึกอบรมเป็นวิธีที่เหมาะสมในการจัดการกับปัญหานี้หรือไม่ (2) ถ้า (1) เป็นจริงมีวิธีการที่เข้มงวดในการตัดสินใจว่าชิ้นใหญ่ (N-1) (N-1) รวมหรือไม่

2
จำนวนตัวเลขสำคัญที่จะใส่ในตาราง?
มีกฎที่ก่อตั้งมาอย่างดีสำหรับจำนวนตัวเลขที่สำคัญในการเผยแพร่หรือไม่? นี่คือตัวอย่าง / คำถามที่เฉพาะเจาะจง: มีวิธีใดที่จะเชื่อมโยงจำนวนตัวเลขที่มีนัยสำคัญกับค่าสัมประสิทธิ์การแปรปรวนหรือไม่? ตัวอย่างเช่นหากค่าประมาณ 12.3 และค่า CV เท่ากับ 50% นั่นหมายความว่าข้อมูลที่แสดงด้วย '.3' เข้าใกล้ศูนย์หรือไม่ หากช่วงความมั่นใจมีช่วงของขนาดของคำสั่งพวกเขาควรจะยังคงมีตัวเลขที่มีนัยสำคัญเท่ากันเช่น: 12.3 (1.2, 123.4) กับ 12 (1.2, 120) จำนวนตัวเลขที่มีนัยสำคัญในการประมาณการข้อผิดพลาดควรเท่ากันหรือน้อยกว่าจำนวนตัวเลขนัยสำคัญในค่าเฉลี่ยหรือไม่?
13 tables 

5
สามารถใช้ไคสแควร์เพื่อเปรียบเทียบสัดส่วนได้หรือไม่?
ฉันได้อ่านว่าการทดสอบไคสแควร์มีประโยชน์เพื่อดูว่าตัวอย่างแตกต่างจากชุดของค่าที่คาดหวังอย่างมีนัยสำคัญหรือไม่ ตัวอย่างเช่นนี่คือตารางผลการสำรวจเกี่ยวกับสีโปรดของผู้คน (n = 15 + 13 + 10 + 17 = 55 ผู้ตอบแบบสอบถามทั้งหมด): red,blue,green,yellow 15,13,10,17 การทดสอบไคสแควร์สามารถบอกฉันได้ว่าตัวอย่างนี้แตกต่างจากสมมุติฐานว่างของความน่าจะเป็นที่เท่ากันของผู้ที่ชื่นชอบแต่ละสีหรือไม่ คำถาม: สามารถทำการทดสอบตามสัดส่วนของผู้ตอบแบบสอบถามทั้งหมดที่ชอบสีที่ต้องการได้หรือไม่? ชอบด้านล่าง: red,blue,green,yellow 0.273,0.236,0.182,0.309 แน่นอนที่ 0.273 + 0.236 + 0.182 + 0.309 = 1 หากการทดสอบไคสแควร์ไม่เหมาะในกรณีนี้การทดสอบแบบใดจะเป็นอย่างไร ขอบคุณ! แก้ไข: ฉันลอง @Roman Luštrikคำตอบด้านล่างและได้ผลลัพธ์ต่อไปนี้เหตุใดฉันจึงไม่ได้รับค่า p และทำไม R บอกว่า "การประมาณ Chi-squared อาจไม่ถูกต้อง"? > chisq.test(c(0,0,0,8,6,2,0,0),p = c(0.406197174,0.088746395,0.025193306,0.42041479,0.03192905,0.018328576,0.009190708,0)) Chi-squared …

1
การถดถอยอนุกรมเวลาด้วยข้อมูลที่ทับซ้อนกัน
ฉันเห็นรูปแบบการถดถอยซึ่งกำลังถดถอยผลตอบแทนดัชนีปีต่อปีจากความล่าช้า (12 เดือน) ผลตอบแทนปีต่อปีของดัชนีหุ้นเดียวกันการกระจายเครดิต (ความแตกต่างระหว่างค่าเฉลี่ยรายเดือนของพันธบัตรปลอดความเสี่ยงและพันธบัตรองค์กร อัตราผลตอบแทน) อัตราเงินเฟ้อ YoY และดัชนีการผลิตอุตสาหกรรม ดูเหมือนว่า (แม้ว่าคุณจะให้ข้อมูลเฉพาะกับอินเดียในกรณีนี้) SP500YOY(T) = a + b1*SP500YOY(T-12) + b2*CREDITSPREAD(T) + b4*INDUSTRIALPRODUCTION(T+2) + b3*INFLATION(T+2) + b4*INFLATIONASYMM(T+2) SP500YOY คือผลตอบแทนปีต่อปีสำหรับดัชนี SP500 เพื่อคำนวณสิ่งนี้ค่าเฉลี่ยรายเดือนของค่า SP500 จะถูกคำนวณแล้วแปลงเป็นผลตอบแทนปีต่อปีสำหรับแต่ละเดือน (เช่น Jan'10-Jan'11, Feb'10 - Feb'11, Mar'10-Mar'11,..) ในด้านตัวแปรอธิบายค่าที่ล่าช้า 12 เดือนของ SP500YOY ถูกนำมาใช้พร้อมกับ CREDITSPREAD ณ เวลาที่ T และอัตราเงินเฟ้อและอุตสาหกรรมนำสองช่วง AHEAD INFLATIONASYMM เป็นตัวอย่างว่าอัตราเงินเฟ้อสูงกว่าค่าเกณฑ์ 5.0% …

3
ต้องการความช่วยเหลือในการระบุการแจกแจงโดยฮิสโตแกรม
ฉันมีประชากรตัวอย่างของแอมพลิจูดขนาดสูงสุดของสัญญาณที่แน่นอน ประชากรประมาณ 15 ล้านตัวอย่าง ฉันสร้างฮิสโตแกรมของประชากร แต่ไม่สามารถคาดเดาการกระจายด้วยฮิสโตแกรมนั้นได้ แก้ไข 1: ไฟล์ที่มีค่าตัวอย่างดิบอยู่ที่นี่: ข้อมูลดิบ ใครสามารถช่วยประมาณการการกระจายด้วยฮิสโตแกรมต่อไปนี้:

1
การถดถอยโลจิสติกพร้อมข้อมูลทิศทางเป็น IV
ฉันกำลังมองหาการอ้างอิงที่ดีเกี่ยวกับการใช้ข้อมูลทิศทาง (การวัดทิศทางเป็นองศา) เป็นตัวแปรอิสระในการถดถอย เป็นการดีที่มันจะมีประโยชน์สำหรับโมเดลที่ไม่เป็นเชิงเส้นลำดับชั้น (ข้อมูลซ้อนกัน) ฉันสนใจข้อมูลทิศทางมากกว่าปกติด้วย ฉันได้พบข้อความโดย Mardia ซึ่งฉันจะได้รับ แต่สงสัยว่ามีบทความที่ดีหรือไม่ ฉันสนใจบทความเชิงปฏิบัติเกี่ยวกับวิธีจัดการกับข้อมูลประเภทนี้มากกว่าในทฤษฎีและบทพิสูจน์หรือข้อความทางการของการแจกแจงอย่างเป็นทางการและเช่นนั้น ขอบคุณ อัปเดตฉันได้รับข้อความ Mardia ซึ่งค่อนข้างครอบคลุม หลังจากอ่านเพิ่มเติมฉันอาจกลับมาพร้อมคำถามเพิ่มเติม

3
ความน่าจะเป็นที่การแจกแจงแบบปกติที่มีความแปรปรวนแบบไม่สิ้นสุดมีค่ามากกว่าค่าเฉลี่ยของมันคืออะไร
วันนี้ฉันถูกถามอะไรทำนองนี้ ผู้สัมภาษณ์ต้องการที่จะรู้ว่าความเป็นไปได้ที่ตัวเลือกเงินจะสิ้นสุดที่เงินเมื่อความผันผวนมีแนวโน้มที่จะไม่มีที่สิ้นสุด ฉันบอกว่า 0% เพราะการแจกแจงแบบปกติที่อยู่ภายใต้โมเดล Black-Scholes และสมมติฐานการเดินสุ่มจะมีความแปรปรวนไม่สิ้นสุด แล้วผมก็หาความน่าจะเป็นของค่าทั้งหมดจะเป็นศูนย์ ผู้สัมภาษณ์ของฉันบอกว่าคำตอบที่ถูกคือ 50% เพราะการแจกแจงแบบปกติจะยังคงสมมาตรและเกือบจะเหมือนกัน ดังนั้นเมื่อคุณรวมจากค่าเฉลี่ยถึง + อินฟินิตี้คุณจะได้รับ 50% ฉันยังไม่มั่นใจกับเหตุผลของเขา ถูกต้องใคร

4
ตัวประมาณที่ไม่เอนเอียงสำหรับตัวแปรสุ่มสองตัวที่เล็กกว่า
สมมติว่าและY ∼ N ( μ y , σ 2 y )X∼N(μx,σ2x)X∼N(μx,σx2)X \sim \mathcal{N}(\mu_x, \sigma^2_x)Y∼ N( μY, σ2Y)Y∼N(μy,σy2)Y \sim \mathcal{N}(\mu_y, \sigma^2_y) ฉันสนใจในmu_y) มีตัวประมาณค่าที่เป็นกลางสำหรับzหรือไม่zZ= min ( μx, μY)z=min(μx,μy)z = \min(\mu_x, \mu_y)Zzz ตัวประมาณอย่างง่ายของขั้นต่ำ( x¯, y¯)min(x¯,y¯)\min(\bar{x}, \bar{y})โดยที่x¯x¯\bar{x}และY¯y¯\bar{y}เป็นตัวอย่างค่าเฉลี่ยของXXXและYYYตัวอย่างเช่นมีความเอนเอียง (แม้ว่าจะสอดคล้องกัน) มันมีแนวโน้มที่ undershoot ZZzz ฉันไม่สามารถคิดถึงตัวประมาณค่าที่เป็นกลางสำหรับZzzได้ มีอยู่จริงไหม? ขอบคุณสำหรับความช่วยเหลือ

1
วิธีการปรับโมเดลข้อผิดพลาดในการวัด“ แบบง่าย”
ฉันกำลังมองหาวิธีการที่สามารถใช้ในการประมาณรูปแบบข้อผิดพลาดในการวัด "OLS" x i = X i + e x , i Y i = α + β X iyi=Yi+ey,iyi=Yi+ey,iy_{i}=Y_{i}+e_{y,i} xผม= Xผม+ ex , ixi=Xi+ex,ix_{i}=X_{i}+e_{x,i} Yผม= α + βXผมYi=α+βXiY_{i}=\alpha + \beta X_{i} ในกรณีที่ข้อผิดพลาดที่มีความเป็นอิสระปกติที่ไม่รู้จักแปรปรวนและ{2} OLS "มาตรฐาน" จะไม่ทำงานในกรณีนี้ σ 2 xσ2Yσy2\sigma_{y}^{2}σ2xσx2\sigma_{x}^{2} วิกิพีเดียมีวิธีแก้ปัญหาที่ไม่น่าสนใจ - ทั้งสองบังคับให้คุณคิดว่า "อัตราส่วนแปรปรวน"หรือ " อัตราส่วนความน่าเชื่อถือ "เป็นที่รู้จักที่คือความแปรปรวนของ regressor จริงx_iฉันไม่พอใจกับสิ่งนี้เพราะคนที่ไม่รู้ความแปรปรวนจะรู้อัตราส่วนได้อย่างไร λ=σ 2 …

4
แพ็กเกจ R / Stata สำหรับ GEE ลบทวินามลบศูนย์ที่ถูกตัดทอน?
นี่คือโพสต์แรกของฉัน ฉันขอบคุณสำหรับชุมชนนี้อย่างแท้จริง ฉันพยายามวิเคราะห์ข้อมูลการนับตามยาวที่ไม่มีการตัดทอน (ความน่าจะเป็นที่ตัวแปรตอบสนอง = 0 คือ 0) และค่าเฉลี่ย! = ความแปรปรวนดังนั้นการกระจายแบบทวินามลบจึงถูกเลือกผ่านปัวซอง ฟังก์ชั่น / คำสั่งที่ฉันได้ตัดออก: R ฟังก์ชั่น gee () ใน R ไม่ได้เป็นศูนย์สำหรับการตัดทอนหรือการแจกแจงแบบทวินามเชิงลบ (แม้จะไม่ได้โหลดแพ็คเกจ MASS) glm.nb () ใน R ไม่อนุญาตสำหรับโครงสร้างความสัมพันธ์ที่แตกต่างกัน vglm () จากแพ็คเกจ VGAM สามารถใช้ประโยชน์จากตระกูล posnegbinomial แต่มีปัญหาเช่นเดียวกับคำสั่ง ztnb ของ Stata (ดูด้านล่าง) ซึ่งฉันไม่สามารถปรับรูปแบบใหม่โดยใช้โครงสร้างความสัมพันธ์ที่ไม่ขึ้นกับอิสระ Stata หากข้อมูลไม่ยาวฉันสามารถใช้แพ็คเกจ Stata ztnb เพื่อทำการวิเคราะห์ของฉันได้ แต่คำสั่งนั้นจะถือว่าการสังเกตของฉันเป็นอิสระ ฉันได้จัดการ GLMM ด้วยเหตุผลด้านระเบียบวิธี / …

2
ทำความเข้าใจการเปรียบเทียบผลการจัดกลุ่ม
ฉันกำลังทดลองกับการจำแนกข้อมูลออกเป็นกลุ่ม ฉันค่อนข้างใหม่สำหรับหัวข้อนี้และพยายามเข้าใจผลลัพธ์ของการวิเคราะห์ ใช้ตัวอย่างจากQuick-R แนะนำให้ใช้หลายRแพ็คเกจ ฉันได้ลองใช้แพ็คเกจสองชุดนี้ ( fpcโดยใช้kmeansฟังก์ชั่นและmclust) แง่มุมหนึ่งของการวิเคราะห์ที่ฉันไม่เข้าใจคือการเปรียบเทียบผลลัพธ์ # comparing 2 cluster solutions library(fpc) cluster.stats(d, fit1$cluster, fit2$cluster) ฉันได้อ่านในส่วนต่าง ๆ ที่เกี่ยวข้องของfpc คู่มือและยังไม่ชัดเจนในสิ่งที่ฉันควรจะมุ่ง ตัวอย่างเช่นนี่คือผลลัพธ์ของการเปรียบเทียบวิธีการจัดกลุ่มที่แตกต่างกันสองวิธี: $n [1] 521 $cluster.number [1] 4 $cluster.size [1] 250 119 78 74 $diameter [1] 5.278162 9.773658 16.460074 7.328020 $average.distance [1] 1.632656 2.106422 3.461598 2.622574 $median.distance [1] 1.562625 1.788113 …
13 r  clustering 

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.