สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
ใน CLT ทำไม
Let X1,...,XnX1,...,XnX_1,...,X_nเป็นข้อสังเกตอิสระจากการแจกแจงที่มีค่าเฉลี่ยμμ\muและความแปรปรวนσ2&lt;∞σ2&lt;∞\sigma^2 < \infty , เมื่อn→∞n→∞n \rightarrow \inftyจากนั้น n−−√X¯n−μσ→N(0,1).nX¯n−μσ→N(0,1).\sqrt{n}\frac{\bar{X}_n-\mu}{\sigma} \rightarrow N(0,1). ทำไมสิ่งนี้ถึงบอกว่า X¯n∼N(μ,σ2n)?X¯n∼N(μ,σ2n)?\bar{X}_n \sim N\left(\mu, \frac{\sigma^2}{n}\right)?

1
การป้องกันการสุ่มตัวอย่างสำคัญของ Pareto ทำให้ราบรื่น (PSIS-LOO) จากความล้มเหลว
เมื่อเร็ว ๆ นี้ฉันเริ่มใช้การสุ่มตัวอย่างความสำคัญแบบพาเรนต์แบบเรียบง่ายจาก Pareto การตรวจสอบความถูกต้องแบบ cross-one-out (PSIS-LOO) ที่อธิบายไว้ในเอกสารเหล่านี้: Vehtari, A. , &amp; Gelman, A. (2015) การสุ่มตัวอย่างสำคัญของ Pareto ทำให้ราบรื่น พิมพ์ล่วงหน้า arXiv ( ลิงก์ ) Vehtari, A. , Gelman, A. , &amp; Gabry, J. (2016) การประเมินรูปแบบเบย์ในทางปฏิบัติโดยใช้การตรวจสอบความถูกต้องแบบลาก่อนและ WAIC คำนำหน้า arXiv ( ลิงก์ ) สิ่งนี้แสดงให้เห็นถึงวิธีการที่น่าสนใจอย่างมากในการประเมินแบบจำลองนอกตัวอย่างเนื่องจากช่วยให้สามารถทำการ LOO-CV ด้วยการเรียกใช้ MCMC เดียวและถูกกล่าวหาว่าดีกว่าเกณฑ์ข้อมูลที่มีอยู่เช่น WAIC k^ผมk^ผม\hat{k}_ik^ผม≳ 0.7k^ผม≳0.7\hat{k}_i \gtrsim 0.7 …

3
ทดสอบการเชื่อมโยงสำหรับ DV ที่กระจายตามปกติโดยตัวแปรอิสระในทิศทางหรือไม่
มีการทดสอบสมมติฐานว่าตัวแปรตามที่กระจายตามปกติมีความสัมพันธ์กับตัวแปรกระจายตามทิศทางหรือไม่? ตัวอย่างเช่นหากเวลาของวันเป็นตัวแปรอธิบาย (และสมมติว่าสิ่งต่าง ๆ เช่นวันของสัปดาห์เดือนของปี ฯลฯ ไม่เกี่ยวข้อง) - นั่นคือวิธีการบัญชีสำหรับความจริงที่ว่า 23:00 เป็น 22 ชั่วโมงข้างหน้าของ 1am และ 2 ชั่วโมงหลัง 1am ในการทดสอบของสมาคมหรือไม่ ฉันสามารถทดสอบว่าเวลาต่อเนื่องของวันอธิบายตัวแปรตามหรือไม่โดยไม่คิดว่าเวลาเที่ยงคืน 12:00 ไม่เป็นไปตามเวลาหนึ่งนาทีหลัง 23.59 น. หรือไม่ การทดสอบนี้ใช้กับตัวแปรอธิบายแบบแยกส่วนได้หรือไม่? หรือว่าต้องมีการทดสอบแยกต่างหาก ตัวอย่างเช่นวิธีการทดสอบว่าตัวแปรตามขึ้นอยู่กับการอธิบายตามเดือนของปี (สมมติว่าวันและฤดูกาลของปีและปีที่เฉพาะเจาะจงหรือทศวรรษที่ไม่เกี่ยวข้อง) การรักษาเดือนของปีอย่างเด็ดขาดละเว้นการสั่งซื้อ แต่การรักษาเดือนของปีเป็นตัวแปรลำดับมาตรฐาน (พูด ม.ค. = 1 ... ธันวาคม = 12) ไม่สนใจว่าเดือนมกราคมจะมาสองเดือนหลังจากเดือนพฤศจิกายน

3
กรณีการใช้ RBF SVM (เทียบกับการถดถอยโลจิสติกและฟอเรสต์แบบสุ่ม)
สนับสนุนเครื่องเวกเตอร์ที่มีเคอร์เนลฟังก์ชั่นพื้นฐานเป็นตัวจําแนกภายใต้การดูแลทั่วไป ในขณะที่ฉันรู้พื้นฐานทางทฤษฎีสำหรับ SVM เหล่านี้และจุดแข็งของพวกเขาฉันไม่ทราบถึงกรณีที่พวกเขาเป็นวิธีที่ต้องการ ดังนั้นจึงมีปัญหาหลายระดับที่ RBF SVMs เหนือกว่าเทคนิค ML อื่น ๆ หรือไม่? (ทั้งในแง่ของคะแนนหรืออื่น ๆ - เช่นความแข็งแกร่งความง่ายในการเริ่มต้นการตีความ ฯลฯ ) ฉันถามว่าเนื่องจากวิธีการเริ่มต้นของฉันอยู่ที่การถดถอยแบบโลจิสติกส์ (อาจมีการโต้ตอบ) ป่าสุ่มและเครือข่ายประสาท ไม่มีเพื่อนของฉันที่ทำ ML (บางคนเป็นผู้ชนะ Kaggle) เป็นผู้ใช้ SVM (แต่อาจเป็นสิ่งประดิษฐ์ของชุมชนของฉันหรือปัญหาที่พวกเขาทำ)

2
เหตุใดข้อผิดพลาดประเภท II จึงไม่เน้นในวรรณคดีเชิงสถิติมากนัก
ฉันได้เห็นหลายกรณีที่ข้อผิดพลาดประเภท I ถูกนำมาใช้ (แสดงโดยค่าอัลฟา) ในบทความวิจัยต่างๆ ฉันพบว่าหายากที่นักวิจัยจะพิจารณาถึงพลังหรือข้อผิดพลาดของ type II ข้อผิดพลาด Type II สามารถเป็นเรื่องใหญ่ใช่มั้ย เราได้ปฏิเสธสมมติฐานทางเลือกโดยบังเอิญเมื่อมันผิดจริง ทำไมค่าอัลฟาจึงถูกเน้นย้ำมากกว่าค่าเบต้า เมื่อฉันใช้สถิติปีแรกฉันไม่เคยได้รับการสอนเบต้า - อัลฟ่าเท่านั้น ฉันรู้สึกว่าข้อผิดพลาดสองข้อนี้ควรได้รับการปฏิบัติอย่างเท่าเทียมกัน ทว่าอัลฟ่าเท่านั้นที่จะถูกเน้น

1
เป็นความคิดที่ดีหรือไม่ที่จะให้ "เครดิตบางส่วน" (ผลอย่างต่อเนื่อง) ในการฝึกอบรมการถดถอยโลจิสติก?
ฉันกำลังฝึกอบรมการถดถอยโลจิสติกส์เพื่อคาดการณ์ว่านักวิ่งคนใดที่มีแนวโน้มที่จะจบการแข่งขันที่ทรหด นักวิ่งน้อยมากที่จะเสร็จสิ้นการแข่งขันนี้ดังนั้นฉันจึงมีความไม่สมดุลระดับรุนแรงและเป็นตัวอย่างเล็ก ๆ ของความสำเร็จ ฉันรู้สึกเหมือนฉันจะได้รับบางดี "สัญญาณ" จากหลายสิบของนักวิ่งใครเกือบจะทำให้มัน (ข้อมูลการฝึกอบรมของฉันไม่เพียง แต่ทำให้เสร็จ แต่ยังรวมถึงข้อมูลที่ไม่เสร็จสมบูรณ์ด้วย) ฉันจึงสงสัยว่ามันเป็นความคิดที่น่ากลัวหรือไม่ที่จะรวมบางส่วนของ "เครดิตบางส่วน" ฉันมาพร้อมกับฟังก์ชั่นคู่สำหรับเครดิตบางส่วนทางลาดและโค้งโลจิสติกซึ่งอาจได้รับพารามิเตอร์ต่างๆ ความแตกต่างเพียงอย่างเดียวกับการถดถอยคือฉันจะใช้ข้อมูลการฝึกอบรมเพื่อทำนายผลลัพธ์ที่ได้รับการแก้ไขและต่อเนื่องแทนที่จะเป็นผลลัพธ์ไบนารี การเปรียบเทียบการคาดการณ์ของพวกเขาในชุดทดสอบ (โดยใช้การตอบกลับแบบไบนารี่) ฉันได้ผลลัพธ์ที่สรุปไม่ได้ - เครดิตบางส่วนของโลจิสติกดูเหมือนจะปรับปรุง R-squared, AUC, P / R เล็กน้อย แต่นี่เป็นเพียงความพยายามครั้งเดียว ตัวอย่างเล็ก ๆ ฉันไม่สนใจเกี่ยวกับการคาดการณ์ที่มีอคติอย่างสม่ำเสมอไปสู่ความสมบูรณ์ - สิ่งที่ฉันสนใจคือการจัดอันดับผู้เข้าแข่งขันให้ถูกต้องตามความเป็นไปได้ที่จะเสร็จหรืออาจประเมินความน่าจะเป็นของการทำ ฉันเข้าใจว่าการถดถอยโลจิสติกถือว่าความสัมพันธ์เชิงเส้นระหว่างตัวทำนายและบันทึกของอัตราต่อรองและเห็นได้ชัดว่าอัตราส่วนนี้ไม่มีการตีความที่แท้จริงถ้าฉันเริ่มยุ่งกับผลลัพธ์ ฉันแน่ใจว่านี่ไม่ใช่สมาร์ทจากมุมมองทางทฤษฎี แต่มันอาจช่วยให้ได้รับสัญญาณเพิ่มเติมและป้องกันการ overfitting (ฉันมีตัวทำนายเกือบเท่าความสำเร็จดังนั้นมันอาจเป็นประโยชน์ในการใช้ความสัมพันธ์กับการทำให้สมบูรณ์บางส่วนเป็นการตรวจสอบความสัมพันธ์กับการทำให้สมบูรณ์) วิธีนี้เคยใช้ในการฝึกอย่างรับผิดชอบหรือไม่? ไม่ว่าจะด้วยวิธีใดมีรุ่นอื่น ๆ ออกมาบ้างหรือบางทีอาจเป็นสิ่งที่จำลองแบบอัตราการเกิดอันตรายอย่างชัดเจนใช้ระยะทางมากกว่าระยะเวลาแทนซึ่งอาจเหมาะกว่าสำหรับการวิเคราะห์ประเภทนี้

2
ทำไมทฤษฎีบท Rao-Blackwell จึงต้องการ ?
ทฤษฎีบท Rao-Blackwell ให้เป็นตัวประมาณกับสำหรับทั้งหมด สมมติว่าเพียงพอสำหรับและให้จากนั้นสำหรับ ,ความไม่เท่าเทียมนั้นมีความเข้มงวดเว้นแต่เป็นหน้าที่ของ θE( θ 2)&lt;∞θTθθ*=E( θ |T)θE(θ*-θ)2≤E( θ -θ)2 θ Tθ^θ^\hat{\theta}θθ\thetaE(θ^2)&lt;∞E(θ^2)&lt;∞\Bbb E (\hat{\theta}^2) < \inftyθθ\thetaTTTθθ\thetaθ∗=E(θ^|T)θ∗=E(θ^|T)\theta ^ * = \Bbb E (\hat{\theta}|T)θθ\thetaE(θ∗−θ)2≤E(θ^−θ)2E(θ∗−θ)2≤E(θ^−θ)2\Bbb E (\theta^* - \theta )^2 \leq \Bbb E (\hat{\theta} - \theta )^2θ^θ^\hat{\theta}TTT ถ้าผมเข้าใจทฤษฎีบทนี้อย่างถูกต้องรัฐนี้ว่าถ้าผมมีสถิติที่เพียงพอสำหรับแล้วค่าคาดว่าเงื่อนไขของให้เป็นวิธีการแก้ (\ hat {\ theta} - \ theta) ^ 2TTTθθ\thetaθ^θ^\hat{\theta}TTTminθ^Eminθ^E\min_{\hat{\theta}} \Bbb E (θ^−θ)2(θ^−θ)2(\hat{\theta}-\theta)^2 Quesitons …

5
การอธิบายค่าเฉลี่ยมัธยฐานโหมดตามข้อกำหนดของคนธรรมดา
คุณจะอธิบายแนวคิดเกี่ยวกับค่าเฉลี่ยค่ามัธยฐานและโหมดของรายการตัวเลขอย่างไรและทำไมพวกเขาถึงมีความสำคัญต่อใครบางคนที่มีทักษะการคิดคำนวณขั้นพื้นฐานเท่านั้น อย่าพูดถึงความเบ้, CLT, แนวโน้มกลาง, คุณสมบัติทางสถิติ, ฯลฯ ฉันอธิบายให้คนที่หมายถึงเป็นเพียงวิธีที่รวดเร็วและสกปรกในการ "สรุป" รายการตัวเลข แต่เมื่อมองย้อนกลับไป ความคิดหรือตัวอย่างโลกแห่งความจริง?

3
คุณสมบัติการจัดอันดับในการถดถอยโลจิสติก
ฉันใช้การถดถอยโลจิสติก ฉันมีหกคุณสมบัติฉันต้องการทราบคุณสมบัติที่สำคัญในตัวจําแนกนี้ที่มีผลต่อผลลัพธ์มากกว่าคุณสมบัติอื่น ๆ ฉันใช้ Information Gain แต่ดูเหมือนว่ามันไม่ได้ขึ้นอยู่กับตัวจําแนกที่ใช้แล้ว มีวิธีการจัดอันดับคุณลักษณะตามความสำคัญของพวกเขาตามตัวจําแนกเฉพาะ (เช่น Logistic Regression) หรือไม่ ความช่วยเหลือใด ๆ จะได้รับการชื่นชมอย่างมาก

3
ฟังก์ชันเดลต้าของ Dirac ควรถูกมองว่าเป็นคลาสย่อยของการแจกแจงแบบเกาส์หรือไม่?
ใน Wikidata มีความเป็นไปได้ที่จะเชื่อมโยงการแจกแจงความน่าจะเป็น (เหมือนทุกอย่างอื่น) ใน ontology เช่นว่าการแจกแจงแบบ t เป็นคลาสย่อยของการกระจายตัวแบบ noncentral ดูเช่น https://angryloki.github.io/wikidata-graph-builder/?property=P279&amp;item=Q209675&amp;iterations=3&amp;limit=3 มีหลายกรณีที่ จำกัด เช่นเมื่อองศาอิสระในการแจกแจงแบบ t ไปที่อนันต์หรือเมื่อความแปรปรวนเข้าหาศูนย์สำหรับการแจกแจงแบบปกติ (การแจกแจงแบบเกาส์) ในกรณีหลังการกระจายจะไปสู่ฟังก์ชันเดลต้าของ Dirac ฉันทราบว่าในวิกิพีเดียภาษาอังกฤษพารามิเตอร์ความแปรปรวนระบุไว้ในปัจจุบันว่ามีขนาดใหญ่กว่าศูนย์ดังนั้นด้วยการตีความที่เข้มงวดจะไม่พูดว่าฟังก์ชันเดลต้าของ Dirac เป็นคลาสย่อยของการแจกแจงแบบปกติ อย่างไรก็ตามสำหรับฉันมันค่อนข้างโอเคเพราะฉันจะบอกว่าการแจกแจงแบบเอ็กซ์โพเนนเชียลเป็นซูเปอร์คลาสของฟังก์ชันเดลต้าของ Dirac มีปัญหาใด ๆ หรือไม่ที่ระบุว่าฟังก์ชันเดลต้าของ Dirac เป็นคลาสย่อยของการแจกแจงแบบเกาส์?

1
มีสถิติที่แท้จริงใด ๆ ที่อยู่เบื้องหลัง
ฉันกำลังอ่านหนังสือเกี่ยวกับ sabermetrics โดยเฉพาะ Mathletics ของ Wayne Winston และในบทแรกเขาแนะนำปริมาณที่สามารถใช้ในการทำนายอัตราการชนะของทีม: และดูเหมือนว่าเขาจะบอกใบ้ว่าครึ่งทางของฤดูกาลมันสามารถใช้ทำนายอัตราการชนะได้ดีกว่า อัตราการชนะในครึ่งแรกของฤดูกาล เขาวางสูตรไว้ที่ ที่คืออัตราส่วนของคะแนนที่ทำแต้มได้ จากนั้นเขาก็พบว่าเลขชี้กำลังเหมาะสมที่สุดในการทำนาย% ของเกมที่ชนะสำหรับ 3 กีฬาและหา Points Scored2Points Scored2+Points Against2≈% Games Won,Points Scored2Points Scored2+Points Against2≈% Games Won,\frac{\text{Points Scored}^2 }{\text{Points Scored}^2 + \text{Points Against}^2} \approx \text{% Games Won},RexpRexp+1,RexpRexp+1, \frac{R^{\text{exp}}}{R^{\text{exp}} + 1}, RRRBaseball: exp≈2,Baseball: exp≈2, \text{Baseball: exp} \approx 2 , Football: exp≈2.7,Football: …

2
พล็อตประเภทนี้เรียกว่าอะไรกับแถบความหนาแน่นแนวนอนที่อยู่กึ่งกลางด้านข้าง
สิ่งที่คุณจะเรียกว่าพล็อตประเภทนี้และเป็นไปได้ที่จะสร้างพวกเขาใน R? แก้ไข: ขอบคุณมากทุกคน - เป็นประโยชน์มาก ชื่อที่ดีที่สุดจนถึงตอนนี้: แปลงไวโอลินเชิงปริมาณ!

3
สิ่งที่ไม่เป็นมาก่อนควรเป็นความชันเมื่อทำการถดถอยเชิงเส้น?
เมื่อดำเนินการถดถอยเชิงเส้นแบบเบย์ซึ่งเป็นหนึ่งในความต้องการที่จะกำหนดก่อนสำหรับความลาดชันและตัดขเนื่องจากเป็นพารามิเตอร์ตำแหน่งจึงเหมาะสมที่จะกำหนดชุดก่อน อย่างไรก็ตามสำหรับฉันแล้วดูเหมือนว่าคล้ายกับพารามิเตอร์ของเครื่องชั่งและดูเหมือนว่าไม่เป็นธรรมชาติที่จะกำหนดเครื่องแบบก่อนหน้านี้aaaขbbขbbaaa ในทางกลับกันมันดูเหมือนจะไม่ถูกต้องนักที่จะกำหนดเจฟฟรีย์ที่ไม่รู้เรื่องก่อนหน้า ( ) สำหรับความชันของการถดถอยเชิงเส้น สำหรับหนึ่งอาจเป็นค่าลบ แต่ฉันไม่เห็นว่ามันจะเป็นอะไร1 / a1/a1/a ดังนั้นสิ่งที่ "เหมาะสม" uninformative ก่อนความชันของการถดถอยเชิงเส้นแบบเบย์คืออะไร? (การอ้างอิงใด ๆ จะได้รับการชื่นชม)

1
NeuralNetwork ชั้นเดียวที่มีการเปิดใช้งาน ReLU เท่ากับ SVM หรือไม่
สมมติว่าฉันมีเครือข่ายประสาทเดี่ยวชั้นเดียวที่มีอินพุต n และเอาต์พุตเดียว (งานการจำแนกประเภทไบนารี) ถ้าฉันตั้งค่าฟังก์ชั่นการเปิดใช้งานในโหนดเอาท์พุทเป็นฟังก์ชั่น sigmoid- แล้วผลที่ได้คือลักษณนามลอจิสติกถดถอย ในสถานการณ์เดียวกันนี้ถ้าฉันเปลี่ยนการเปิดใช้งานเอาต์พุตเป็น ReLU (หน่วยเชิงเส้นที่แก้ไขแล้ว) ดังนั้นโครงสร้างผลลัพธ์จะเหมือนกับหรือคล้ายกับ SVM หรือไม่ ถ้าไม่ใช่เพราะอะไร

1
ตัวอย่างการทดสอบไคสองกำลังสอง
คำถามนี้มาจากหนังสือ Asymptotic Statistics, pg. ของ Van Van Vaart 253 # 3: สมมติว่าและเวกเตอร์พหุนามอิสระที่มีพารามิเตอร์และb_k) ภายใต้สมมติฐานว่างที่แสดงให้เห็นว่าXmXm\mathbf{X}_mYnYn\mathbf{Y}_n(m,a1,…,ak)(m,a1,…,ak)(m,a_1,\ldots,a_k)(n,b1,…,bk)(n,b1,…,bk)(n,b_1,\ldots,b_k)ai=biai=bia_i=b_i ∑i=1k(Xm,i−mc^i)2mc^i+∑i=1k(Yn,i−nc^i)2nc^i∑i=1k(Xm,i−mc^i)2mc^i+∑i=1k(Yn,i−nc^i)2nc^i\sum_{i=1}^k \dfrac{(X_{m,i} - m\hat{c}_i)^2}{m\hat{c}_i} + \sum_{i=1}^k \dfrac{(Y_{n,i} - n\hat{c}_i)^2}{n\hat{c}_i}มีการจัดจำหน่าย ที่n)χ2k−1χk−12\chi^2_{k-1}c^i=(Xm,i+Yn,i)/(m+n)c^i=(Xm,i+Yn,i)/(m+n)\hat{c}_i = (X_{m,i} + Y_{n,i})/(m+n) ฉันต้องการความช่วยเหลือในการเริ่มต้น กลยุทธ์ที่นี่คืออะไร? ฉันสามารถรวมการเรียกทั้งสองเข้าด้วยกันเป็น: ∑i=1k(mYn,i−nXm,i)2mn(m+n)c^i∑i=1k(mYn,i−nXm,i)2mn(m+n)c^i\sum_{i=1}^k \dfrac{(mY_{n,i} - nX_{m,i})^2}{mn(m+n)\hat{c}_i} แต่งานนี้เคยชินกับ CLT เพราะการรวมกันถ่วงน้ำหนักของและy_nไม่แน่ใจว่านี่เป็นเส้นทางที่ถูกต้องหรือไม่ ข้อเสนอแนะใด ๆXmXmX_mYnYnY_n แก้ไข: ถ้ามันค่อนข้างง่ายเพราะเราได้รับm=nm=nm=n mYn−nXmmn(m+n)−−−−−−−−−√=Yn−Xm(m+n)−−−−−−−√mYn−nXmmn(m+n)=Yn−Xm(m+n)\begin{align*} \dfrac{mY_{n} - nX_{m}}{\sqrt{mn(m+n)}} &= \dfrac{Y_{n} - X_{m}}{\sqrt{(m+n)}} \end{align*} …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.