สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

4
Non-transitivity of correlation: ความสัมพันธ์ระหว่างเพศและขนาดของสมองและระหว่างขนาดของสมองกับ IQ แต่ไม่มีความสัมพันธ์กันระหว่างเพศและ IQ
ฉันพบคำอธิบายต่อไปนี้ในบล็อกและฉันต้องการรับข้อมูลเพิ่มเติมเกี่ยวกับการไม่สัมพันธ์ของความสัมพันธ์: เรามีข้อเท็จจริงที่ปฏิเสธไม่ได้ดังต่อไปนี้: โดยเฉลี่ยมีความแตกต่างของปริมาณสมองระหว่างชายและหญิง มีความสัมพันธ์ระหว่าง IQ กับขนาดสมอง ความสัมพันธ์คือ 0.33 และสอดคล้องกับ 10% ของความแปรปรวนของไอคิว จากสถานที่เหล่านี้ 1 และ 2 ดูเหมือนว่าจะมีเหตุผลจากนั้นผู้หญิงโดยเฉลี่ยมีไอคิวต่ำกว่าผู้ชาย แต่มันเป็นความเข้าใจผิด! ในสถิติความสัมพันธ์ไม่ได้เป็นสกรรมกริยา หลักฐานคือคุณเพียงแค่ต้องดูผลลัพธ์ของการทดสอบ IQ และพวกเขาแสดงให้เห็นว่า IQ ของชายและหญิงไม่แตกต่างกันโดยเฉลี่ย ฉันต้องการที่จะเข้าใจความสัมพันธ์ที่ไม่ไวของความลึกนี้สักหน่อย หากความสัมพันธ์ระหว่าง IQ และขนาดสมองเท่ากับ 0.9 (ซึ่งฉันรู้ว่าไม่ใช่ (1)) จะอนุมานหรือไม่ว่าผู้หญิงโดยเฉลี่ยมีไอคิวต่ำกว่าผู้ชาย ได้โปรดฉันไม่ได้อยู่ที่นี่เพื่อพูดคุยเกี่ยวกับ IQ (และข้อ จำกัด ของการทดสอบ), การรังเกียจผู้หญิง, ทัศนคติของผู้หญิง, ความเย่อหยิ่งและอื่น ๆ (2) ฉันแค่ต้องการที่จะเข้าใจเหตุผลเชิงตรรกะที่อยู่เบื้องหลังการเข้าใจผิด (1) ซึ่งฉันรู้ว่ามันไม่ได้เป็น: ยุคมีสมองที่ใหญ่กว่า homo sapiens แต่ไม่ฉลาดขึ้น (2) ฉันเป็นผู้หญิงและโดยรวมฉันไม่คิดว่าตัวเองหรือผู้หญิงคนอื่นฉลาดน้อยกว่าผู้ชายฉันไม่สนใจเกี่ยวกับการทดสอบไอคิวเพราะสิ่งที่นับเป็นคุณค่าของคนและมันไม่ได้ขึ้นอยู่กับ …

2
ตัวแปรสุ่มแบบสม่ำเสมอเป็นผลรวมของตัวแปรสุ่มสองตัว
นำมาจากGrimmet และ Stirzaker : แสดงว่าไม่สามารถเป็นกรณีที่U = X + YU=X+YU=X+Yที่มีการกระจายอย่างสม่ำเสมอบน [0,1] และและมีความเป็นอิสระและกระจายตัวเหมือนกัน คุณไม่ควรสรุปว่า X และ Y เป็นตัวแปรต่อเนื่องคุณUUX XXYYY หลักฐานที่เรียบง่ายโดยขัดแย้งพอเพียงสำหรับกรณีที่ ,ถูกสมมติว่าไม่ต่อเนื่องโดยการโต้เถียงว่าเป็นไปได้เสมอที่จะหาและเช่นนั้นในขณะที่')X XXY YYu uuu ′u′u' P ( U ≤ u + u ′ ) ≥ P ( U ≤ u ) P(U≤u+u′)≥P(U≤u)P(U\leq u+u') \geq P(U\leq u)P ( X + Y ≤ u …

3
ความสอดคล้องเชิงเส้นกำกับที่มีความแปรปรวนเชิงเส้นกำกับที่ไม่ใช่ศูนย์ - มันแสดงถึงอะไร?
ปัญหาเกิดขึ้นก่อนหน้านี้ แต่ฉันต้องการถามคำถามเฉพาะที่จะพยายามล้วงเอาคำตอบที่จะทำให้ชัดเจน (และจำแนก): ใน "Asymptotics ของคนจน" คนหนึ่งรักษาความแตกต่างที่ชัดเจนระหว่าง (a)ลำดับของตัวแปรสุ่มที่รวมความน่าจะเป็นเป็นค่าคงที่ ตรงกันข้ามกับ (b)ลำดับของตัวแปรสุ่มที่รวมความน่าจะเป็นเข้ากับตัวแปรสุ่ม แต่ใน "Asymptotics ของ Wise Man" เราสามารถมีกรณีของ (c)ลำดับของตัวแปรสุ่มที่รวมความน่าจะเป็นเป็นค่าคงที่ในขณะที่รักษาความแปรปรวนที่ไม่ใช่ศูนย์ที่ขีด จำกัด คำถามของฉันคือ (ขโมยจากคำตอบเชิงสำรวจของฉันเองด้านล่าง): เราจะเข้าใจตัวประมาณที่สอดคล้องกันเชิงเส้นกำกับ แต่ก็มีความแปรปรวนที่ไม่ใช่ศูนย์และ จำกัด ได้อย่างไร ความแปรปรวนนี้สะท้อนถึงอะไร? พฤติกรรมของมันแตกต่างจากตัวประมาณ "ปกติ" ที่สอดคล้องกันอย่างไร หัวข้อที่เกี่ยวข้องกับปรากฏการณ์ที่อธิบายไว้ใน (c) (ดูในความคิดเห็นด้วย): ความแตกต่างระหว่างตัวประมาณที่สอดคล้องกันและตัวประมาณที่ไม่เอนเอียงคืออะไร? /stats/120553/convergence-of-an-estimator-with-infinite-variance ทำไมตัวประมาณที่ไม่สอดคล้องกันแบบเชิงเส้นกำกับจึงไม่มีความแปรปรวนที่ไม่มีที่สิ้นสุด เกือบแน่ใจว่าการลู่เข้าและการแปรปรวนที่ จำกัด ไปที่ศูนย์

2
การตีความของ betas เมื่อมีหลายตัวแปรเด็ดขาด
ผมเข้าใจแนวคิดที่ว่าเบต้า 0เป็นค่าเฉลี่ยสำหรับเมื่อตัวแปรเด็ดขาดจะมีค่าเท่ากับ 0 (หรือกลุ่มอ้างอิง) ทำให้การตีความท้ายว่าค่าสัมประสิทธิ์การถดถอยคือความแตกต่างในค่าเฉลี่ยของทั้งสองประเภท ถึงแม้จะมี> 2 ประเภทฉันจะถือว่าแต่ละβอธิบายความแตกต่างระหว่างของประเภทที่ค่าเฉลี่ยและการอ้างอิงβ^0β^0\hat\beta_0β^β^\hat\beta แต่จะเกิดอะไรขึ้นถ้ามีตัวแปรเพิ่มเติมเข้ามาในโมเดลหลายตัวแปร? ตอนนี้การสกัดกั้นหมายความว่าอะไรมันไม่สมเหตุสมผลที่จะเป็นค่าเฉลี่ยสำหรับการอ้างอิงของตัวแปรเด็ดขาดสองอัน ตัวอย่างเช่นหากเพศ (M (ref) / F) และ Race (white (ref) / black) ทั้งคู่อยู่ในแบบจำลอง เป็นβ 0ค่าเฉลี่ยสำหรับผู้ชายสีขาวเท่านั้น? เราตีความความเป็นไปได้อื่น ๆ อย่างไรβ^0β^0\hat\beta_0 ในฐานะที่เป็นข้อความแยกต่างหาก: คำสั่งที่ตรงกันข้ามนั้นทำหน้าที่เป็นวิธีในการตรวจสอบการดัดแปลงเอฟเฟกต์หรือไม่? หรือเพียงแค่เห็นเอฟเฟกต์ ( ) ในระดับที่ต่างกันβ^β^\hat\beta

4
สัญชาตญาณที่อยู่เบื้องหลังความเป็นอิสระของ
ฉันหวังว่าจะมีคนเสนอข้อโต้แย้งว่าทำไมตัวแปรสุ่ม และ , มีการแจกแจงแบบปกติมาตรฐานมีความเป็นอิสระทางสถิติ การพิสูจน์ความจริงนั้นเกิดขึ้นได้อย่างง่ายดายจากเทคนิค MGF แต่ฉันพบว่ามันตอบโต้ได้ง่ายมากY1=X2−X1Y1=X2−X1Y_1=X_2-X_1Y2=X1+X2Y2=X1+X2Y_2=X_1+X_2XiXiX_i ฉันจะขอบคุณสัญชาตญาณที่นี่ถ้ามี ขอบคุณล่วงหน้า. แก้ไข : ห้อยไม่ได้ระบุสถิติการสั่งซื้อ แต่การสังเกต IID จากการกระจายปกติมาตรฐาน

3
Negative-binomial GLM เทียบกับการเปลี่ยนแปลงการบันทึกสำหรับข้อมูลนับ: เพิ่มอัตราความผิดพลาด Type I
คุณบางคนอาจจะอ่านบทความนี้ดี: O'Hara RB, Kotze DJ (2010) อย่าบันทึกข้อมูลการนับการแปลง วิธีการทางนิเวศวิทยาและวิวัฒนาการ 1: 118–122 Klick ในสาขาการวิจัยของฉัน (นิเวศน์วิทยา) เรากำลังจัดการกับการทดลองที่ทำซ้ำแบบไม่ดีและ GLM ไม่ได้ใช้กันอย่างแพร่หลาย ดังนั้นฉันจึงทำการจำลองที่คล้ายกันกับ O'Hara & Kotze (2010) แต่เลียนแบบข้อมูลนิเวศน์วิทยา พลังงานจำลอง : ฉันจำลองข้อมูลจากการออกแบบแบบแฟกทอเรียลด้วยกลุ่มควบคุมหนึ่งกลุ่ม ( ) และกลุ่มการรักษา 5 กลุ่ม ( ) ความอุดมสมบูรณ์ในการรักษา 1 เหมือนกับการควบคุม ( ) ความอุดมสมบูรณ์ในการรักษา 2-5 คือครึ่งหนึ่งของความอุดมสมบูรณ์ในการควบคุม ( \ mu_ {2-5} = 0.5 \ mu_c ) สำหรับแบบจำลองฉันเปลี่ยนขนาดตัวอย่าง …

3
เทคนิคการเพิ่มประสิทธิภาพทำแผนที่กับเทคนิคการสุ่มตัวอย่างหรือไม่?
จากอัลกอริธึมการสุ่มตัวอย่างทั่วไปเราสามารถหาอัลกอริธึมการเพิ่มประสิทธิภาพได้ แท้จริงเพื่อเพิ่มฟังก์ชั่นโดยพลก็พอเพียงที่จะวาดตัวอย่างจากกรัม~ จฉ/ T สำหรับพอขนาดเล็กตัวอย่างเหล่านี้จะตกอยู่ใกล้สูงสุดทั่วโลก (หรือสูงสุดในท้องถิ่นในการปฏิบัติ) ของฟังก์ชันฉf:x→f(x)f:x→f(x)f: \textbf{x} \rightarrow f(\textbf{x})ก.∼ eฉ/ Tก.~อีฉ/Tg \sim e^{f/T}TTTฉฉf โดย "การสุ่มตัวอย่าง" ฉันหมายถึงการวาดภาพตัวอย่างแบบหลอกเทียมจากการแจกแจงให้ฟังก์ชั่นบันทึกความเป็นไปได้ที่รู้จักกันถึงค่าคงที่ ตัวอย่างเช่นการสุ่มตัวอย่าง MCMC การสุ่ม Gibbs การสุ่มตัวอย่าง Beam เป็นต้นโดย "การปรับให้เหมาะสม" ฉันหมายถึงความพยายามในการค้นหาพารามิเตอร์ที่ทำให้ค่าของฟังก์ชั่นที่กำหนดนั้นมีค่าสูงสุด ย้อนกลับเป็นไปได้? จากการวิเคราะห์พฤติกรรมเพื่อหาค่าสูงสุดของฟังก์ชันหรือนิพจน์ combinatorial เราสามารถแยกขั้นตอนการสุ่มตัวอย่างที่มีประสิทธิภาพได้หรือไม่? เช่น HMC ดูเหมือนจะใช้ประโยชน์จากข้อมูลการไล่ระดับสี เราสามารถสร้างขั้นตอนการสุ่มตัวอย่างที่ใช้ประโยชน์จากการประมาณเหมือน BFGS ของ Hessian ได้หรือไม่? (แก้ไข: เห็นได้ชัดว่าใช่: http://papers.nips.cc/paper/4464-quasi-newton-methods-for-markov-chain-monte-carlo.pdf ) เราสามารถใช้ MCTS ในปัญหา combinatorial เราสามารถแปลได้ไหม เข้าสู่ขั้นตอนการสุ่มตัวอย่างหรือไม่ บริบท: ความยากลำบากในการสุ่มตัวอย่างมักจะว่าการกระจายความน่าจะเป็นส่วนใหญ่อยู่ในพื้นที่ขนาดเล็กมาก …

1
การเลือกระหว่างฟังก์ชั่นการสูญเสียสำหรับการจำแนกไบนารี
ฉันทำงานในโดเมนที่มีปัญหาซึ่งผู้คนมักจะรายงานROC-AUCหรือAveP (ความแม่นยำโดยเฉลี่ย) แต่ฉันเพิ่งพบเอกสารที่เพิ่มประสิทธิภาพการเข้าสู่ระบบการสูญเสียแทนในขณะที่คนอื่นยังรายงานบานพับขาดทุน ในขณะที่ฉันเข้าใจว่าการคำนวณของตัวชี้วัดเหล่านี้เป็นอย่างไรฉันมีความยากลำบากในการทำความเข้าใจการแลกเปลี่ยนระหว่างสิ่งเหล่านี้และสิ่งที่ดีสำหรับสิ่งที่แน่นอน เมื่อมาถึง ROC-AUC เทียบความแม่นยำจำหัวข้อนี้กล่าวถึงวิธีการROC-AUC-สูงสุดสามารถมองเห็นได้โดยใช้เกณฑ์การเพิ่มประสิทธิภาพของการสูญเสียที่ penalizes "การจัดอันดับเป็นลบจริงอย่างน้อยมีขนาดใหญ่เป็นบวกที่แท้จริง" (สมมติว่าสูงขึ้น คะแนนสอดคล้องกับผลบวก) นอกจากนี้เธรดอื่นนี้ยังให้การสนทนาที่เป็นประโยชน์ของROC-AUCตรงกันข้ามกับตัวชี้วัดที่แม่นยำ - เรียกคืน แต่สำหรับสิ่งที่ประเภทของปัญหาที่เกิดขึ้นจะเข้าสู่ระบบการสูญเสียเป็นที่ต้องการมากกว่าการพูด, ROC-AUC , AvePหรือ การสูญเสียบานพับ ? ที่สำคัญที่สุดคำถามประเภทใดที่ควรถามเกี่ยวกับปัญหาเมื่อเลือกระหว่างฟังก์ชั่นการสูญเสียเหล่านี้สำหรับการจำแนกแบบไบนารี

3
การอ้างถึงผลลัพธ์ว่า "สำคัญมาก" ผิดหรือไม่?
ทำไมสถิติกีดกันเราจากผลหมายถึงว่า " สูงอย่างมีนัยสำคัญ" เมื่อ -value เป็นอย่างดีดังต่อไปนี้การชุมนุมαpppαα\alphaระดับพื้นดินของ ?0.050.050.05 เป็นความผิดพลาดหรือไม่ที่จะเชื่อใจในผลลัพธ์ที่มีโอกาส 99.9% ที่ไม่ใช่ข้อผิดพลาด Type I ( ) มากกว่าผลลัพธ์ที่ให้โอกาสนั้นเพียง 99% ( p = 0.01)p=0.001p=0.001p=0.001p=0.01p=0.01p=0.01 ) หรือไม่

3
ทำไมสถิติแบบเบย์ไม่เป็นที่นิยมสำหรับการควบคุมกระบวนการทางสถิติ?
ความเข้าใจของฉันเกี่ยวกับการถกเถียงกันอย่างเบยส์ vs บ่อยเป็นสถิติที่บ่อย: มีวัตถุประสงค์ (หรืออ้างว่าเป็น) หรืออย่างน้อยก็ไม่เอนเอียง นักวิจัยที่แตกต่างกันดังนั้นการใช้สมมติฐานที่แตกต่างกันยังคงสามารถรับผลการเปรียบเทียบเชิงปริมาณได้ ในขณะที่สถิติแบบเบย์ อ้างว่าทำการคาดคะเน "ดีกว่า" (เช่นการสูญเสียต่ำกว่าที่คาด) เนื่องจากสามารถใช้ความรู้เดิม (ท่ามกลางเหตุผลอื่น ๆ ) ต้องการตัวเลือก "เฉพาะกิจ" น้อยลงแทนที่ด้วยตัวเลือกก่อนหน้า / แบบจำลองที่ (อย่างน้อยในหลักการ) มีการตีความในโลกแห่งความเป็นจริง ระบุว่าฉันจะคาดหวังว่าสถิติแบบเบย์จะได้รับความนิยมอย่างมากใน SPC: ถ้าฉันเป็นเจ้าของโรงงานที่พยายามควบคุมคุณภาพกระบวนการของฉัน ถ้าฉันสามารถลดได้เพราะฉันมีความรู้ล่วงหน้ามากกว่า / คู่แข่งที่ดีกว่าของฉันดียิ่งขึ้น แต่ในทางปฏิบัติทุกสิ่งที่ฉันได้อ่านเกี่ยวกับ SPC ดูเหมือนจะเป็นประจำอย่างแน่นอน (เช่นไม่มีการแจกแจงก่อนหน้าการประมาณค่าพารามิเตอร์ทั้งหมดตัวเลือก Ad-hoc จำนวนมากเกี่ยวกับขนาดตัวอย่างค่า p ฯลฯ ) ทำไมถึงเป็นอย่างนั้น? ฉันเห็นได้ว่าทำไมสถิติบ่อยครั้งจึงเป็นตัวเลือกที่ดีกว่าในปี 1960 เมื่อ SPC ใช้ปากกาและกระดาษ แต่ทำไมไม่มีใครลองใช้วิธีการอื่นตั้งแต่นั้นมา

1
จะทำให้ข้อมูลขาวขึ้นโดยใช้การวิเคราะห์องค์ประกอบหลักได้อย่างไร
ฉันต้องการแปลงข้อมูลของฉันXX\mathbf Xเพื่อให้ความแปรปรวนเป็นหนึ่งและความแปรปรวนร่วมจะเป็นศูนย์ (เช่นฉันต้องการทำให้ข้อมูลขาวขึ้น) นอกจากนี้ค่าเฉลี่ยควรเป็นศูนย์ ฉันรู้ว่าฉันจะไปถึงที่นั่นด้วยการทำมาตรฐาน Z และการแปลง PCA แต่ฉันควรทำตามลำดับใด ฉันควรเพิ่มว่าประกอบด้วยการเปลี่ยนแปลงไวท์เทนนิ่งควรจะมีรูปแบบ{ข}x↦Wx+bx↦Wx+b\mathbf{x} \mapsto W\mathbf{x} + \mathbf{b} มีวิธีการคล้ายกับ PCA ซึ่งทำการเปลี่ยนแปลงทั้งสองอย่างนี้และให้สูตรของแบบฟอร์มด้านบนหรือไม่

4
การฝึกอบรมแบบซ่อนมาร์คอฟโมเดลการฝึกอบรมหลายครั้ง
ฉันใช้งาน HMM แบบแยกตามบทช่วยสอนนี้ http://cs229.stanford.edu/section/cs229-hmm.pdf บทช่วยสอนนี้และอื่น ๆ พูดถึงการฝึกอบรม HMM ตามลำดับการสังเกตเสมอ จะเกิดอะไรขึ้นเมื่อฉันมีลำดับการฝึกซ้อมหลายครั้ง ฉันควรเรียกใช้พวกมันตามลำดับหรือไม่ อีกทางเลือกหนึ่งคือการเชื่อมต่อลำดับที่หนึ่งและฝึกบนนั้น แต่ฉันจะมีการเปลี่ยนสถานะจากจุดสิ้นสุดของลำดับหนึ่งไปยังจุดเริ่มต้นของลำดับถัดไปซึ่งไม่ใช่ของจริง

2
เหตุใดการเพิ่มประสิทธิภาพส่วนผสมของเสียนโดยตรงแบบคำนวณได้ยาก?
พิจารณาความน่าจะเป็นบันทึกของส่วนผสมของ Gaussians: l(Sn;θ)=∑t=1nlogf(x(t)|θ)=∑t=1nlog{∑i=1kpif(x(t)|μ(i),σ2i)}l(Sn;θ)=∑t=1nlog⁡f(x(t)|θ)=∑t=1nlog⁡{∑i=1kpif(x(t)|μ(i),σi2)}l(S_n; \theta) = \sum^n_{t=1}\log f(x^{(t)}|\theta) = \sum^n_{t=1}\log\left\{\sum^k_{i=1}p_i f(x^{(t)}|\mu^{(i)}, \sigma^2_i)\right\} ฉันสงสัยว่าทำไมมันจึงยากที่จะคำนวณสมการนั้นโดยตรง ฉันกำลังมองหาปรีชาญาณที่ชัดเจนว่าทำไมมันควรจะชัดเจนว่ามันยากหรืออาจเป็นคำอธิบายที่เข้มงวดมากขึ้นว่าทำไมมันยาก ปัญหานี้เป็นปัญหาที่สมบูรณ์หรือไม่หรือเราไม่ทราบวิธีการแก้ปัญหาหรือไม่ นี่คือเหตุผลที่เราใช้อัลกอริทึมEM (การคาดหวังสูงสุด ) หรือไม่ โน้ต: SnSnS_n = ข้อมูลการฝึกอบรม x(t)x(t)x^{(t)} = จุดข้อมูล θθ\theta = ชุดของพารามิเตอร์ที่ระบุ Gaussian, ค่าเฉลี่ย, ค่าเบี่ยงเบนมาตรฐานและความน่าจะเป็นในการสร้างจุดจากแต่ละคลัสเตอร์ / คลาส / Gaussian pipip_i = ความน่าจะเป็นในการสร้างจุดจากคลัสเตอร์ / คลาส / Gaussian i

1
กำลังสองของการแจกแจงแบบปกติที่มีความแปรปรวนเฉพาะ
การกระจายของสแควร์ของตัวแปรสุ่มแบบกระจายที่ปกติด้วยคืออะไร ฉันรู้เป็นอาร์กิวเมนต์ที่ถูกต้องสำหรับเมื่อยกกำลังสองการแจกแจงแบบปกติมาตรฐานแต่สิ่งที่เกี่ยวกับกรณีของความแปรปรวนที่ไม่ใช่หน่วย?X2X2X^2X∼N(0,σ2/4)X∼N(0,σ2/4)X\sim N(0,\sigma^2/4)χ2(1)=Z2χ2(1)=Z2\chi^2(1)=Z^2

9
คำขออ้างอิง: โมเดลเชิงเส้นทั่วไป
ฉันกำลังมองหาหนังสือระดับเบื้องต้นถึงระดับกลางเกี่ยวกับโมเดลเชิงเส้นทั่วไป นอกจากทฤษฎีแล้วฉันจะต้องการให้มันรวมแอพพลิเคชั่นและตัวอย่างใน R หรือภาษาการเขียนโปรแกรมอื่น - ฉันได้ยินว่า SAS เป็นตัวเลือกยอดนิยม ฉันตั้งใจจะศึกษาด้วยตัวเองและมันจะช่วยได้ถ้ามันให้คำตอบกับแบบฝึกหัดของตัวเอง คุณสามารถสมมติว่าฉันได้เรียนหลักสูตรปียาวแบบดั้งเดิมในแคลคูลัสและทฤษฎีความน่าจะเป็น ฉันคุ้นเคยกับพื้นฐานของการวิเคราะห์การถดถอย

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.