สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
การเพิ่มค่าสัมประสิทธิ์เพื่อให้ได้เอฟเฟกต์การโต้ตอบ - จะทำอย่างไรกับ SEs?
ฉันมีการถดถอยหลายตัวแปรซึ่งรวมถึงการโต้ตอบ ตัวอย่างเช่นเพื่อให้ได้ค่าประมาณของผลการรักษาสำหรับควินไทล์ที่แย่ที่สุดฉันจำเป็นต้องเพิ่มค่าสัมประสิทธิ์จาก regressor ของการรักษาไปที่ค่าสัมประสิทธิ์จากตัวแปรปฏิสัมพันธ์ (ซึ่งมีปฏิสัมพันธ์กับการรักษาและควินไทล์ 1) เมื่อเพิ่มสองสัมประสิทธิ์จากการถดถอยหนึ่งจะได้รับข้อผิดพลาดมาตรฐานได้อย่างไร เป็นไปได้หรือไม่ที่จะเพิ่มข้อผิดพลาดมาตรฐานจากสัมประสิทธิ์ทั้งสองนี้? สิ่งที่เกี่ยวกับสถิติ t? เป็นไปได้ที่จะเพิ่มเหล่านี้เช่นกัน? ฉันคาดเดาไม่ได้ แต่ฉันไม่พบคำแนะนำเกี่ยวกับเรื่องนี้ ขอบคุณล่วงหน้ามากสำหรับความช่วยเหลือของคุณ!

3
วิธีการคำนวณ Rousseeuw's และ Croux '(1993) Qn scale estimator สำหรับตัวอย่างขนาดใหญ่
Let ดังนั้นสำหรับตัวอย่างสั้น ๆ เช่น{ 1 , 3 , 6 , 2 , 7 , 5 }มันสามารถคำนวณได้จากการค้นหาลำดับที่kที่มีความแตกต่างกันแบบคู่: Qn= Cn. { | Xผม- XJ| ; ฉัน&lt;j }( k )Qn=Cn.{|Xi−Xj|;i&lt;j}(k)Q_n = C_n.\{|X_i-X_j|;i < j\}_{(k)}{ 1 , 3 , 6 , 2 , 7 , 5 }{1,3,6,2,7,5}\{1,3,6,2,7,5\}kkk 7 6 5 3 2 1 1 …

3
คำอธิบายที่ง่ายสำหรับพล็อตพิกัดขนาน
ฉันได้อ่านและเห็นพล็อตพิกัดขนานมากมาย ใครสามารถตอบคำถามชุดต่อไปนี้: อะไรคือสมการพิกัดขนาน (PCP) ในคำง่ายๆเพื่อให้คนธรรมดาเข้าใจ คำอธิบายทางคณิตศาสตร์พร้อมปรีชาถ้าเป็นไปได้ PCP มีประโยชน์เมื่อใดและควรใช้เมื่อใด PCP ไม่มีประโยชน์เมื่อใดและควรหลีกเลี่ยงเมื่อใด? ข้อดีและข้อเสียที่เป็นไปได้ของ PCP

4
โพสต์การทดสอบใน ANCOVA
คำถาม: วิธีการที่ดีในการดำเนินการทดสอบหลังความแตกต่างระหว่างกลุ่มหมายถึงหลังจากการปรับผลกระทบของ covariate คืออะไร? ตัวอย่างต้นแบบ: สี่กลุ่มผู้เข้าร่วม 30 คนต่อกลุ่ม (เช่นประชากรจิตวิทยาคลินิกสี่คน) ตัวแปรตามคือตัวเลข (เช่นคะแนนเชาวน์ปัญญา) Covariate เป็นตัวเลข (เช่นดัชนีสถานะทางเศรษฐกิจและสังคม) คำถามวิจัยเกี่ยวข้องว่าคู่ของกลุ่มใดมีความแตกต่างอย่างมีนัยสำคัญกับตัวแปรตามหลังจากการควบคุมสำหรับค่า covariate คำถามที่เกี่ยวข้อง : วิธีการที่ต้องการคืออะไร? มีการนำไปใช้งานอะไรบ้างใน R มีการอ้างอิงทั่วไปเกี่ยวกับวิธีการเปลี่ยนแปลงของโควารีเอตสำหรับการดำเนินการทดสอบโพสต์เฉพาะกิจหรือไม่?

9
กระตุ้นการตัดสินใจต้นไม้ในหลาม? [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้เป็นไปตามหัวข้อสำหรับการตรวจสอบข้าม ปิดให้บริการใน6 เดือนที่ผ่านมา มีห้องสมุดไพ ธ อนที่ดีสำหรับการฝึกอบรมต้นไม้ตัดสินใจหรือไม่
13 python  cart  boosting 

3
ประเมินขนาดของประชากรที่ถูกสุ่มตัวอย่างด้วยจำนวนการสังเกตซ้ำ
สมมติว่าฉันมีประชากร 50 ล้านสิ่งที่ไม่เหมือนใครและฉันนำตัวอย่าง 10 ล้านชิ้น (มาทดแทน) ... กราฟแรกที่ฉันแนบมาแสดงให้เห็นว่าฉันได้ทดลองสิ่ง "เดียวกัน" กี่ครั้งซึ่งค่อนข้างหายาก ประชากรใหญ่กว่าตัวอย่างของฉัน อย่างไรก็ตามหากประชากรของฉันมีเพียง 10 ล้านสิ่งและฉันใช้ตัวอย่าง 10 ล้านตัวเนื่องจากกราฟที่สองแสดงให้เห็นว่าฉันมักจะลองทำซ้ำอีกครั้ง คำถามของฉันคือ - จากตารางความถี่การสังเกตของฉัน (ข้อมูลในแผนภูมิแท่ง) เป็นไปได้หรือไม่ที่จะได้ประมาณขนาดประชากรดั้งเดิมเมื่อไม่ทราบ? และมันจะดีมากถ้าคุณสามารถหาตัวชี้ว่าจะทำยังไงในอาร์

1
วิธีการสร้างแบบจำลองโครงข่ายประสาทเทียมได้อย่างมีประสิทธิภาพ?
อัตราส่วนของจำนวนการสังเกตและจำนวนของตัวแปรควรเป็นอย่างไร วิธีการตรวจจับการ overfitting ในรูปแบบโครงข่ายประสาทเทียมและวิธีการหลีกเลี่ยงการ overfitting คืออะไร? หากฉันต้องการจำแนกประเภทด้วย Neural Network คลาสควรมีความถี่เท่ากันหรือไม่? กรุณาช่วยฉันออกไป.

6
วิดีโอออนไลน์สั้น ๆ ที่สามารถช่วยบรรยายเกี่ยวกับสถิติ
เมื่อบรรยายสถิติมันจะมีประโยชน์ในการรวมวิดีโอสั้น ๆ เป็นครั้งคราว ความคิดแรกของฉันรวมถึง: ภาพเคลื่อนไหวและการมองเห็นของแนวคิดทางสถิติ เรื่องราวเกี่ยวกับการประยุกต์ใช้เทคนิคเฉพาะ วิดีโอตลกที่มีความเกี่ยวข้องกับแนวคิดทางสถิติ การสัมภาษณ์กับนักสถิติหรือนักวิจัยที่ใช้สถิติ มีวิดีโอใดที่คุณใช้เมื่อสอนสถิติหรือคิดว่าจะมีประโยชน์หรือไม่ กรุณาระบุ: ลิงก์ไปยังวิดีโอออนไลน์ คำอธิบายของเนื้อหา วิดีโออาจเกี่ยวข้องกับหัวข้อสถิติใด

3
วิธีจำลองการวิเคราะห์พลังงานที่กำหนดเองของ lm model (โดยใช้ R)
ต่อไปนี้เป็นคำถามที่ผ่านมาเรามีที่นี่ ฉันอยากจะรู้ว่าใครเคยเจอหรือสามารถแบ่งปันรหัส R เพื่อทำการวิเคราะห์พลังงานแบบกำหนดเองตามการจำลองสำหรับตัวแบบเชิงเส้น? ต่อมาฉันอยากจะขยายไปยังรุ่นที่ซับซ้อนมากขึ้น แต่ดูเหมือนว่าจะเริ่มต้นได้ทันที ขอบคุณ

1
ทดสอบสองตัวอย่างอิสระเพื่อหาค่าความเอียงที่เท่ากันหรือไม่
การทดสอบใดที่มีให้สำหรับการทดสอบสองตัวอย่างอิสระสำหรับสมมติฐานว่างที่มาจากประชากรที่มีความเบ้เท่ากัน? มีการทดสอบแบบคลาสสิก 1 ตัวอย่างว่าค่าความลาดเอียงนั้นมีค่าคงที่หรือไม่ (การทดสอบเกี่ยวข้องกับช่วงเวลาตัวอย่างที่ 6!); มีการแปลแบบตรงไปตรงมาสำหรับการทดสอบ 2 ตัวอย่างหรือไม่? มีเทคนิคที่ไม่เกี่ยวข้องกับช่วงเวลาที่สูงมากของข้อมูลหรือไม่? (ฉันคาดหวังคำตอบของรูปแบบ 'bootstrap it': เป็นเทคนิคการบูตที่ทราบกันว่าเหมาะสมสำหรับปัญหานี้หรือไม่?)

4
จะสรุปข้อมูลหมวดหมู่ได้อย่างไร
ฉันได้รับการดิ้นรนกับปัญหาต่อไปนี้ด้วยความหวังเป็นเรื่องง่ายสำหรับนักสถิติ (ฉันเป็นโปรแกรมเมอร์ที่มีการสัมผัสกับสถิติบางอย่าง) ฉันต้องสรุปคำตอบของแบบสำรวจ (สำหรับการจัดการ) แบบสำรวจมีคำถามมากกว่า 100 ข้อจัดกลุ่มในพื้นที่ต่าง ๆ (มีประมาณ 5 ถึง 10 คำถามต่อพื้นที่) คำตอบทั้งหมดเป็นหมวดหมู่ (ในระดับปกติพวกเขาเป็นเหมือน "ไม่เลย", "ไม่ค่อย" ... "รายวันหรือบ่อยกว่า") ฝ่ายบริหารต้องการที่จะได้รับการสรุปสำหรับแต่ละพื้นที่และนี่คือปัญหาของฉัน: วิธีการรวมคำตอบที่เป็นหมวดหมู่ภายในคำถามที่เกี่ยวข้อง? . คำถามมีมากเกินกว่าที่จะสร้างกราฟหรือแม้แต่พล็อตขัดแตะสำหรับแต่ละพื้นที่ ฉันชอบวิธีการใช้ภาพหากเป็นไปได้เปรียบเทียบกับพูดด้วยตารางที่มีตัวเลข (อนิจจาพวกเขาจะไม่อ่าน) สิ่งเดียวที่ฉันสามารถทำได้คือการนับจำนวนคำตอบในแต่ละพื้นที่จากนั้นพล็อตกราฟ มีอะไรอีกบ้างที่ใช้ได้สำหรับข้อมูลที่เป็นหมวดหมู่? ฉันใช้ R แต่ไม่แน่ใจว่าเกี่ยวข้องหรือไม่ฉันรู้สึกว่านี่เป็นคำถามทั่วไปเกี่ยวกับสถิติมากกว่า

3
แสดงคำตอบในแง่ของหน่วยดั้งเดิมในกล่องแปลงข้อมูล Box-Cox
สำหรับการวัดบางส่วนผลของการวิเคราะห์จะถูกนำเสนออย่างเหมาะสมในสเกลที่ถูกแปลง อย่างไรก็ตามในกรณีส่วนใหญ่เป็นที่พึงพอใจที่จะนำเสนอผลการวัดในระดับเดิม (มิฉะนั้นงานของคุณจะไร้ค่ามากกว่าหรือน้อยกว่า) ตัวอย่างเช่นในกรณีของข้อมูลที่บันทึกการแปลงปัญหาที่เกิดขึ้นกับการตีความในระดับเดิมเกิดขึ้นเพราะค่าเฉลี่ยของค่าบันทึกไม่ได้เป็นบันทึกของค่าเฉลี่ย การใช้ antilogarithm ของการประมาณค่าเฉลี่ยบนมาตราส่วนบันทึกไม่ได้ให้ค่าประมาณของค่าเฉลี่ยในระดับเดิม อย่างไรก็ตามหากข้อมูลที่แปลงเป็นบันทึกมีการแจกแจงแบบสมมาตรความสัมพันธ์ต่อไปนี้จะถูกเก็บไว้ (เนื่องจากบันทึกจะรักษาลำดับไว้): หมายถึง[ บันทึก( Y) ] = ค่ามัธยฐาน[ บันทึก( Y) ] = บันทึก[ ค่ามัธยฐาน( Y) ]Mean[log⁡(Y)]=Median[log⁡(Y)]=log⁡[Median(Y)]\text{Mean}[\log (Y)] = \text{Median}[\log (Y)] = \log[\text{Median} (Y)] (antilogarithm ของค่าเฉลี่ยของค่าบันทึกเป็นค่ามัธยฐานในระดับเดิมของการวัด) ดังนั้นฉันสามารถทำการอนุมานเกี่ยวกับความแตกต่าง (หรืออัตราส่วน) ของค่ามัธยฐานในระดับการวัดดั้งเดิม t-test สองตัวอย่างและช่วงความเชื่อมั่นมีความน่าเชื่อถือมากที่สุดถ้าประชากรอยู่ในเกณฑ์ปกติโดยมีค่าเบี่ยงเบนมาตรฐานประมาณดังนั้นเราอาจถูกล่อลวงให้ใช้การBox-Coxแปลงสำหรับสมมติฐานปกติที่จะถือ (ฉันยังคิดว่ามันเป็นความแปรปรวน ) อย่างไรก็ตามหากเราใช้เครื่องมือ t-to กับการBox-Coxแปลงข้อมูลเราจะได้รับการอนุมานเกี่ยวกับความแตกต่างของการแปลงข้อมูล เราจะตีความสิ่งเหล่านั้นในระดับการวัดดั้งเดิมได้อย่างไร (ค่าเฉลี่ยของค่าที่แปลงไม่ใช่ค่าเฉลี่ยที่แปลงแล้ว) กล่าวอีกนัยหนึ่งคือการใช้การแปลงผกผันของการประมาณค่าเฉลี่ยบนมาตราส่วนที่แปลงแล้วไม่ได้ให้ค่าประมาณของค่าเฉลี่ยบนมาตราส่วนดั้งเดิม ฉันสามารถทำการอนุมานเกี่ยวกับค่ามัธยฐานในกรณีนี้ได้หรือไม่? มีการเปลี่ยนแปลงที่จะอนุญาตให้ฉันกลับไปที่ค่าเฉลี่ย (ในระดับเดิม) หรือไม่? คำถามนี้ถูกโพสต์ครั้งแรกเป็นความคิดเห็นที่นี่

1
ปรีชาสำหรับช่วงเวลาที่สูงขึ้นในสถิติวงกลม
ในสถิติแบบวงกลมค่าความคาดหวังของตัวแปรสุ่มมีค่าในวงกลมSหมายถึง m 1 ( Z ) = ∫ S z P Z ( θ ) d θ (ดูวิกิพีเดีย ) นี่เป็นคำจำกัดความที่เป็นธรรมชาติมากเช่นเดียวกับนิยามของความแปรปรวน V a r ( Z ) = 1 - | m 1 ( Z ) | . ดังนั้นเราไม่ต้องการช่วงเวลาที่สองเพื่อกำหนดความแปรปรวน!ZZZSSSm1(Z)=∫SzPZ(θ)dθm1(Z)=∫SzPZ(θ)dθ m_1(Z)=\int_S z P^Z(\theta)\textrm{d}\theta Var(Z)=1−|m1(Z)|.Var(Z)=1−|m1(Z)|. \mathrm{Var}(Z)=1-|m_1(Z)|. อย่างไรก็ตามเรากำหนดช่วงเวลาที่สูง ฉันยอมรับว่ามันดูเป็นธรรมชาติเหมือนกันตั้งแต่แรกเห็นและคล้ายกับนิยามในสถิติเชิงเส้น แต่ฉันก็ยังรู้สึกอึดอัดเล็กน้อยและมีสิ่งต่อไปนี้mn(Z)=∫SznPZ(θ)dθ.mn(Z)=∫SznPZ(θ)dθ. m_n(Z)=\int_S z^n P^Z(\theta)\textrm{d}\theta. คำถาม: …

5
การประมวลผลความรู้ความเข้าใจ / ตีความเทคนิคการสร้างภาพข้อมูล
มีใครรู้บ้างเกี่ยวกับการวิจัยที่ตรวจสอบประสิทธิผล (ความเข้าใจ?) ของเทคนิคการสร้างภาพข้อมูลที่แตกต่างกันหรือไม่? ตัวอย่างเช่นผู้คนเข้าใจว่าการสร้างภาพข้อมูลหนึ่งรูปแบบรวดเร็วกว่าอีกรูปแบบหนึ่งได้อย่างไร การโต้ตอบกับการสร้างภาพข้อมูลช่วยให้ผู้คนจำข้อมูลได้หรือไม่? อะไรก็ได้ตามสายเหล่านั้น ตัวอย่างของการสร้างภาพข้อมูลอาจเป็น: แผนการกระจายกราฟเส้นลำดับเวลาแผนที่ส่วนต่อประสานเชิงโต้ตอบ (เช่นพิกัดขนาน) เป็นต้น ฉันสนใจงานวิจัยโดยเฉพาะในกลุ่มคนทั่วไป

3
การใช้ข้อมูลเรขาคณิตเพื่อกำหนดระยะทางและปริมาณ…มีประโยชน์หรือไม่
ฉันมาข้ามขนาดใหญ่ร่างกายของวรรณกรรมซึ่งสนับสนุนโดยใช้สารสนเทศฟิชเชอร์เมตริกเป็นธรรมชาติในท้องถิ่นตัวชี้วัดในพื้นที่ของการกระจายความน่าจะเป็นแล้วการบูรณาการมากกว่านั้นเพื่อกำหนดระยะทางและปริมาณ แต่ปริมาณเหล่านี้ "รวม" มีประโยชน์จริง ๆ สำหรับอะไร? ฉันพบว่าไม่มีเหตุผลทางทฤษฎีและการใช้งานจริงน้อยมาก หนึ่งคือผู้ชายของเลบานอนการทำงานที่เขาใช้ "ระยะทางฟิชเชอร์" เอกสารประเภทและอีกคนหนึ่งคือโรดริเก' เอบีซีของรุ่นเลือก ...ที่ 'ฟิชเชอร์ไดรฟ์' ถูกนำมาใช้สำหรับการเลือกรูปแบบ เห็นได้ชัดว่าการใช้ "ปริมาณข้อมูล" ให้คำสั่ง "ปรับปรุงขนาด" เหนือ AIC และ BIC สำหรับการเลือกแบบจำลอง แต่ฉันไม่ได้เห็นงานใด ๆ ที่ติดตามมา เหตุผลทางทฤษฎีอาจจะมีการวางนัยทั่วไปซึ่งใช้การวัดระยะทางหรือปริมาตรนี้และดีกว่าขอบเขตที่ได้จาก MDL หรือการโต้แย้งแบบอะซิมโทติคหรือวิธีการที่ใช้ปริมาณหนึ่งในนั้นที่ดีขึ้นในสถานการณ์จริงที่เหมาะสม ผลลัพธ์ใด ๆ ของชนิดนี้

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.