สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

4
มีการทดสอบการตั้งค่าตัวแปรที่ละเว้นใน OLS หรือไม่
ฉันทราบเกี่ยวกับการทดสอบการตั้งค่าใหม่ของ Ramsey ซึ่งอาจตรวจพบการพึ่งพาแบบไม่เชิงเส้น อย่างไรก็ตามหากคุณเพิ่งโยนหนึ่งในสัมประสิทธิ์การถดถอย (เพียงแค่การอ้างอิงเชิงเส้น) คุณอาจได้รับอคติขึ้นอยู่กับความสัมพันธ์ เห็นได้ชัดว่านี่ไม่ถูกตรวจพบโดยการทดสอบการรีเซ็ต ฉันไม่พบการทดสอบสำหรับกรณีนี้ แต่คำสั่งนี้: "คุณไม่สามารถทดสอบ OVB ยกเว้นโดยรวมถึงตัวแปรที่อาจตัดทิ้ง" มันอาจเป็นข้อความที่สมเหตุสมผลใช่มั้ย

3
หลักสูตรการออกแบบการทดลองสำหรับนักขุดข้อมูล
ฉันเป็นนักวิทยาศาสตร์คอมพิวเตอร์ที่ทำงานด้านการขุดข้อมูล ไม่มีความลับที่จะบอกว่านักวิทยาศาสตร์คอมพิวเตอร์ค่อนข้างยากจนในการออกแบบและประเมินผลการทดลองอย่างเป็นระบบ - การใช้ค่า p-value และการประเมินความเชื่อมั่นถือว่าเป็นขั้นสูง :) สิ่งที่ฉันอยากรู้ถ้ามีหลักสูตร / วัสดุที่ดีในการสอนนักวิทยาศาสตร์คอมพิวเตอร์เกี่ยวกับการออกแบบการทดลองที่ดี เพื่อทำให้ข้อมูลเฉพาะเจาะจงมากขึ้นฉันจะเพิ่มข้อมูลต่อไปนี้: หลักสูตรนี้ควรมุ่งเน้นไปที่นักศึกษาระดับบัณฑิตศึกษาที่สามารถเข้าใจความเป็นไปได้อย่างสมเหตุสมผล แต่มีพื้นฐานทางสถิติที่ จำกัด หลักสูตรควรเน้นการออกแบบการทดลองใน "การตั้งค่าที่ไม่เป็นธรรมชาติ": กล่าวอีกนัยหนึ่งไม่มีความจริงพื้นฐานทางกายภาพหรือวิธีการควบคุมกระบวนการรวบรวมข้อมูล (เช่นเดียวกับวิชามนุษย์) แน่นอนว่าหลักสูตรที่ดีจะมุ่งเน้นไปที่พื้นฐาน แต่ควรจัดการกับสถานการณ์นี้อย่างมีนัยสำคัญ องค์ประกอบการคำนวณจะเป็นโบนัส แต่ไม่บังคับ เราจัดการกับข้อมูลจำนวนมาก แต่สามารถค้นหาปัญหาการคำนวณด้วยตัวเองหากจำเป็น

3
หมายถึง SD หรือ Median MAD เพื่อสรุปตัวแปรที่เอียงสูงหรือไม่
ฉันกำลังทำงานกับข้อมูลที่เบ้อย่างสูงดังนั้นฉันจึงใช้ค่ามัธยฐานแทนค่าเฉลี่ยเพื่อสรุปแนวโน้มกลาง ฉันต้องการที่จะมีตัวชี้วัดของการกระจายตัวในขณะที่ฉันมักจะเห็นคนรายงานค่าเฉลี่ยเบี่ยงเบนมาตรฐาน±±\pmหรือแบ่งควอไทล์±±\pmเพื่อสรุปแนวโน้มเข้าสู่ส่วนกลางมันก็โอเคที่จะรายงานค่ามัธยฐานแบ่งกระจายสัมบูรณ์ (MAD)±±\pm ? มีปัญหาที่อาจเกิดขึ้นกับวิธีนี้หรือไม่? ฉันจะพบว่าวิธีนี้มีขนาดกะทัดรัดและใช้งานง่ายกว่าการรายงานควอไทล์ที่ต่ำและสูงโดยเฉพาะในตารางขนาดใหญ่ที่เต็มไปด้วยตัวเลข

2
สงสัยว่าแผนภูมิการวิเคราะห์พล็อตถั่วหมายความว่าอย่างไร
หนึ่งตีความและสร้างแผนภูมิถั่วอย่างไร นี่คือตัวอย่างหนึ่งที่นำมาจากWalkes และคณะ 2010 ข้อมูลประเภทใดที่มีประโยชน์มากที่สุด? (ที่มา: biomedcentral.com )

5
ฉันสามารถทดสอบสมมติฐานหาข้อมูลปกติได้หรือไม่
ฉันมีการรวบรวมข้อมูลซึ่ง แต่เดิมฉันคิดว่ามันถูกแจกจ่ายตามปกติ จากนั้นฉันก็ดูมันและตระหนักว่าไม่ใช่เพราะส่วนใหญ่เป็นข้อมูลที่เบ้และฉันก็ทำการทดสอบ shapiro-wilks ด้วย ฉันยังต้องการวิเคราะห์โดยใช้วิธีการทางสถิติและฉันต้องการทดสอบสมมติฐานสำหรับความเบ้ ดังนั้นฉันอยากทราบว่ามีวิธีทดสอบความเป็นปรกติหรือไม่และถ้าเป็นไปได้ห้องสมุดที่ทำแบบทดสอบให้ฉัน

2
การกระจายปัวซองนั้นเสถียรและมีสูตรผกผันสำหรับ MGF หรือไม่?
ก่อนอื่นฉันมีคำถามเกี่ยวกับการกระจายของปัวซองว่า "เสถียร" หรือไม่ ไร้เดียงสามาก (และฉันก็ไม่แน่ใจเกี่ยวกับการแจกแจง "เสถียร") ฉันคำนวณการกระจายตัวเชิงเส้นของ Poisson กระจาย RV's โดยใช้ผลิตภัณฑ์ของ MGF ดูเหมือนว่าฉันจะได้รับปัวซองอีกครั้งโดยมีพารามิเตอร์เท่ากับชุดค่าผสมเชิงเส้นของพารามิเตอร์ของ RV แต่ละตัว ดังนั้นฉันจึงสรุปได้ว่าปัวซองนั้น "เสถียร" ฉันกำลังคิดถึงอะไร ประการที่สองมีสูตรผกผันสำหรับ MGF เช่นเดียวกับฟังก์ชั่นลักษณะหรือไม่?

2
การอ้างอิงสำหรับ ?
ในคำตอบของเขาสำหรับคำถามก่อนหน้านี้@Erik P.ให้นิพจน์ ที่คือส่วนเกินของการแจกแจง อ้างอิงถึงรายการวิกิพีเดียเกี่ยวกับการแจกแจงความแปรปรวนตัวอย่างแต่หน้าวิกิพีเดียบอกว่า "อ้างอิงที่จำเป็น"κVar[s2]=σ4(2n−1+κn),Var[s2]=σ4(2n−1+κn), \mathrm{Var}[s^2]=\sigma^4 \left(\frac{2}{n-1} + \frac{\kappa}{n}\right) \>, κκ\kappa คำถามหลักของฉันคือมีการอ้างอิงสำหรับสูตรนี้หรือไม่? มัน 'เล็กน้อย' ที่จะได้มาและถ้าเป็นเช่นนั้นมันสามารถพบได้ในตำราเรียน? (@Erik P. ไม่พบในสถิติคณิตศาสตร์และการวิเคราะห์ข้อมูลหรือฉันในการอนุมานทางสถิติโดย Casella และ Bergerแม้ว่าหัวข้อจะครอบคลุม มันจะดีถ้ามีการอ้างอิงตำราเรียน แต่มีประโยชน์มากกว่าที่จะมีการอ้างอิงหลัก (the) (คำถามที่เกี่ยวข้องคือ: การแจกแจงความแปรปรวนของตัวอย่างจากการแจกแจงที่ไม่รู้จักคืออะไร ) อัปเดต : @ cardinalชี้ให้เห็นสมการอื่นในmath.SE : โดยที่คือช่วงเวลากลางที่สี่ μ4Var(S2)=μ4n−σ4(n−3)n(n−1)Var(S2)=μ4n−σ4(n−3)n(n−1) \mathrm{Var}(S^2)={\mu_4\over n}-{\sigma^4\,(n-3)\over n\,(n-1)} μ4μ4\mu_4 มีวิธีที่จะจัดเรียงสมการใหม่และแก้ไขทั้งสองหรือสมการในชื่อผิดหรือไม่?

2
ใช้ Adaboost กับ SVM สำหรับการจำแนกประเภท
ฉันรู้ว่าAdaboostพยายามที่จะสร้างลักษณนามที่แข็งแกร่งโดยใช้การรวมกันเชิงเส้นของชุดตัวจําแนกอ่อนแอ แต่ผมได้อ่านเอกสารบางคนบอก AdaBoost และจำแนกการทำงานในความสามัคคี (แม้ว่า SVM เป็นลักษณนามแรง) ในเงื่อนไขบางอย่างและกรณี ฉันไม่สามารถเข้าใจจากมุมมองสถาปัตยกรรมและการเขียนโปรแกรมว่าทำงานร่วมกันได้อย่างไร ฉันได้อ่านรายงานจำนวนมาก (อาจผิดพลาด) ซึ่งไม่ได้อธิบายอย่างชัดเจนว่าพวกเขาทำงานร่วมกันอย่างไร บางคนสามารถแสดงให้เห็นว่าพวกเขาทำงานร่วมกันอย่างไรเพื่อการจำแนกที่มีประสิทธิภาพ? ตัวชี้ไปยังเอกสาร / บทความ / วารสารก็จะได้รับการชื่นชม

2
มีเรื่องแบบนี้ที่ยุติธรรมหรือไม่?
มีเรื่องแบบนี้ที่ยุติธรรมหรือไม่? บนลูกเต๋าที่มีจำนวนจุดที่มีจุด scooped ออกแน่นอนว่าสร้างความแตกต่าง? มีใครทำวิจัยบ้างไหม? ในความเป็นจริงคิดเกี่ยวกับมันทำไมเหรียญพลิกจะยุติธรรม ฟิสิกส์ในแต่ละด้านมีความแตกต่างอย่างสิ้นเชิง
11 dice 

3
ฉันจะค้นหาค่าเบี่ยงเบนมาตรฐานของค่าเบี่ยงเบนมาตรฐานตัวอย่างจากการแจกแจงแบบปกติได้อย่างไร
ยกโทษให้ฉันถ้าฉันพลาดบางสิ่งบางอย่างค่อนข้างชัดเจน ฉันเป็นนักฟิสิกส์ที่มีการแจกแจง (ฮิสโตแกรม) เป็นหลักเกี่ยวกับค่าเฉลี่ยที่ใกล้เคียงกับการแจกแจงแบบปกติ ค่าที่สำคัญสำหรับฉันคือส่วนเบี่ยงเบนมาตรฐานของตัวแปรสุ่มเกาส์นี่ ฉันจะพยายามค้นหาข้อผิดพลาดเกี่ยวกับค่าเบี่ยงเบนมาตรฐานตัวอย่างได้อย่างไร ฉันรู้สึกว่ามันเกี่ยวข้องกับความผิดพลาดในแต่ละ bin ในฮิสโทแกรมดั้งเดิม

1
การเลือกรูปแบบ ABC
มันได้รับการแสดงให้เห็นว่าตัวเลือกรูปแบบ ABC โดยใช้ปัจจัย Bayes ไม่แนะนำให้เนื่องจากการปรากฏตัวของข้อผิดพลาดมาจากการใช้สถิติสรุป บทสรุปในบทความนี้ขึ้นอยู่กับการศึกษาพฤติกรรมของวิธีการที่เป็นที่นิยมสำหรับการประมาณค่าปัจจัยเบย์ (อัลกอริทึม 2) เป็นที่ทราบกันดีว่าปัจจัยของเบย์ไม่ใช่วิธีเดียวในการเลือกแบบจำลอง มีคุณสมบัติอื่น ๆ เช่นประสิทธิภาพการทำนายของแบบจำลองที่อาจเป็นที่สนใจ (เช่นกฎการให้คะแนน ) คำถามของฉันคือ : มีวิธีการที่คล้ายกับอัลกอริทึม 2 สำหรับการประมาณกฎการให้คะแนนหรือปริมาณอื่น ๆ ที่สามารถใช้สำหรับการเลือกรูปแบบในแง่ของประสิทธิภาพการทำนายในบริบทที่มีความซับซ้อนหรือไม่?

2
ตัวพยากรณ์ที่สำคัญไม่ได้มีนัยสำคัญในการถดถอยหลายครั้ง
เมื่อฉันวิเคราะห์ตัวแปรของฉันในแบบจำลองการถดถอยโลจิสติกสองแบบที่แยกกัน Predictor 1: B= 1.049, SE=.352, Exp(B)=2.85, 95% CI=(1.43, 5.69), p=.003 Constant: B=-0.434, SE=.217, Exp(B)=0.65, p=.046 Predictor 2: B= 1.379, SE=.386, Exp(B)=3.97, 95% CI=(1.86, 8.47), p<.001 Constant: B=-0.447, SE=.205, Exp(B)=0.64, p=.029 แต่เมื่อฉันป้อนลงในโมเดลการถดถอยโลจิสติกหลายรายการเดียวฉันจะได้รับ: Predictor 1: B= 0.556, SE=.406, Exp(B)=1.74, 95% CI=(0.79, 3.86), p=.171 Predictor 2: B= 1.094, SE=.436, Exp(B)=2.99, 95% CI=(1.27, …

3
การปรับปรุงชื่อตัวแปรในชุดข้อมูล
ชื่อตัวแปรที่ดีคือ: a) สั้น / ง่ายต่อการพิมพ์ b) จดจำได้ง่าย c) เข้าใจ / สื่อสารได้ ฉันลืมอะไรไปหรือเปล่า ความสอดคล้องเป็นสิ่งที่มองหา วิธีที่ฉันจะกล่าวถึงก็คืออนุสัญญาการตั้งชื่อที่สอดคล้องกันทำให้เกิดคุณสมบัติข้างต้น ความสอดคล้องก่อให้เกิด (b) ความสะดวกในการเรียกคืนและ (c) ความเข้าใจแม้ว่าปัจจัยอื่น ๆ มักจะสำคัญกว่า มีการแลกเปลี่ยนที่ชัดเจนระหว่าง (a) ความยาวชื่อ / ความง่ายในการพิมพ์ (เช่นตัวพิมพ์เล็กทั้งหมด) และ (c) ความเข้าใจ ฉันลงทุนความคิดที่ค่อนข้างยุติธรรมในประเด็นเหล่านี้เพราะมีคนหลายพันคนกำลังใช้ข้อมูลและฉันหวังว่าหลายคนจะใช้รหัสของฉันเพื่อเตรียมข้อมูลและช่วยในการวิเคราะห์บางประเภท ข้อมูลจากการศึกษาระยะยาวของสุขภาพวัยรุ่นแบ่งออกเป็นหลายชุดข้อมูล ขั้นตอนแรกของฉันคือการใช้ตัวแปร 227 ในชุดข้อมูลที่ใช้กันมากที่สุดให้ทำการถอดรหัสใหม่ให้ชื่อที่มีความหมายมากกว่า ชื่อตัวแปรดั้งเดิมคือชื่อ "aid", "s1", "s2" ซึ่งฉันเปลี่ยนชื่อเป็น "aid2", "อายุ" และ "male.is" มีตัวแปรอื่น ๆ อีกนับพันรายการในชุดข้อมูลอื่นซึ่งอาจรวมเข้าด้วยกันขึ้นอยู่กับเป้าหมายของนักวิจัย ตราบใดที่ฉันเปลี่ยนชื่อตัวแปรฉันต้องการทำให้มีประโยชน์มากที่สุด นี่คือปัญหาที่ฉันพิจารณา จนถึงตอนนี้ฉันใช้ตัวพิมพ์เล็กเท่านั้นและหลีกเลี่ยงการใช้เครื่องหมายขีดคั่นหรือขีดล่างใด …

2
การทำนายและช่วงเวลาความอดทน
ฉันมีคำถามสองสามข้อสำหรับการทำนายและช่วงเวลาที่ยอมรับได้ เราเห็นด้วยกับคำจำกัดความของช่วงความอดทนก่อน: เราจะได้รับระดับความเชื่อมั่นพูด 90% เปอร์เซ็นต์ของประชากรที่จะจับพูด 99% และขนาดตัวอย่าง 20 คนการกระจายความน่าจะเป็นเป็นที่รู้จักพูดปกติ เพื่อความสะดวก. ทีนี้, จากตัวเลขสามตัวข้างต้น (90%, 99% และ 20) และความจริงที่ว่าการแจกแจงพื้นฐานเป็นเรื่องปกติ, เราสามารถคำนวณค่าเผื่อได้ ได้รับตัวอย่างมีค่าเฉลี่ยและค่าเบี่ยงเบนมาตรฐานช่วงเวลาความอดทนเป็นKS หากช่วงความอดทนนี้จับ 99% ของประชากรดังนั้นตัวอย่างเรียกว่าสำเร็จ( x 1 , x 2 , … , x 20 ) ˉ x s ˉ x ± k s ( x 1 , x 2 , … , …

3
แทงเลือกวิธีการเปิดของพวกเขาได้อย่างไร
ฉันรู้ว่าผู้รับแทงปรับอัตราต่อรองของพวกเขาเพื่อเพิ่มผลกำไรสูงสุดโดยการคาดการณ์ความน่าจะเป็นของปริมาณเงินที่วางไว้ในทุกผลลัพธ์ แทงเลือกวิธีการเปิดของพวกเขาได้อย่างไร

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.