สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
ประมาณ
เป็นวิธีที่ดีที่สุดที่จะใกล้เคียงกับสำหรับจำนวนเต็มสองจำนวนที่กำหนดเมื่อคุณรู้ว่าหมายถึงแปรปรวนเบ้และโด่งเกินของการกระจายต่อเนื่องและเป็นที่ชัดเจนจากการวัดรูปร่างและ (ไม่ใช่ศูนย์) ที่การประมาณปกติไม่เหมาะสมหรือไม่ม. , n μ σ 2 γ 1 γ 2 X γ 1 γ 2Pr[n≤X≤m]Pr[n≤X≤m]Pr[n \leq X \leq m]m,nm,nm,nμμ\muσ2σ2\sigma^2γ1γ1\gamma_1γ2γ2\gamma_2XXXγ1γ1\gamma_1γ2γ2\gamma_2 ปกติฉันจะใช้การประมาณค่าปกติกับการแก้ไขจำนวนเต็ม ... Pr[(n−½)≤X≤(m+½)]=Pr[(n−½)−μσ≤Z≤(m+½)−μσ]=Φ((m+½)−μσ)−Φ((n−½)−μσ)Pr[(n−½)≤X≤(m+½)]=Pr[(n−½)−μσ≤Z≤(m+½)−μσ]=Φ((m+½)−μσ)−Φ((n−½)−μσ)Pr[(n - \text{½})\leq X \leq (m + \text{½})] = Pr[\frac{(n - \text{½})-\mu}{\sigma}\leq Z \leq \frac{(m + \text{½})-\mu}{\sigma}] = \Phi(\frac{(m + \text{½})-\mu}{\sigma}) - \Phi(\frac{(n - \text{½})-\mu}{\sigma}) ... ถ้าความเบ้และความโด่งเกินเป็น …

6
ไลบรารีสถิติที่มีข้อ จำกัด เป้น
สมมติว่าคุณมีเงิน 200 ดอลลาร์สหรัฐในการสร้างห้องสมุดสถิติขนาดเล็ก (มาก) ตัวเลือกของคุณจะเป็นอย่างไร คุณอาจสมมติว่าจัดส่งฟรีจาก Amazon และข้อความใด ๆ ที่มีให้ได้อย่างอิสระจากอินเทอร์เน็ตเป็นเกมที่ยุติธรรม แต่จะคิดค่าบริการร้อยละ 5 ต่อหน้าเพื่อพิมพ์ (ฉันได้รับแรงบันดาลใจจากการส่งจดหมายจากหนังสือโดเวอร์ แต่ข้อเสนอส่วนใหญ่ของพวกเขาดูเหมือนจะล้าสมัย)

3
ฉันจะสั่งซื้อหรือจัดอันดับชุดของผู้เชี่ยวชาญได้อย่างไร
ฉันมีฐานข้อมูลที่มีผู้เชี่ยวชาญจำนวนมากในสาขา สำหรับผู้เชี่ยวชาญแต่ละคนฉันมีคุณลักษณะ / จุดข้อมูลที่หลากหลายเช่น: จำนวนประสบการณ์ ใบอนุญาต จำนวนบทวิจารณ์ เนื้อหาที่เป็นข้อความของบทวิจารณ์เหล่านั้น ระดับ 5 ดาวจากการรีวิวแต่ละรายการสำหรับปัจจัยหลายประการเช่นความเร็วคุณภาพและอื่น ๆ รางวัลการเข้าร่วมการประชุม ฯลฯ ฉันต้องการให้คะแนนกับผู้เชี่ยวชาญเหล่านี้ว่าคะแนนเต็ม 10 จากความสำคัญของพวกเขา จุดข้อมูลบางส่วนอาจหายไปสำหรับผู้เชี่ยวชาญบางคน ตอนนี้คำถามของฉันคือฉันจะทำอัลกอริธึมแบบนี้ได้อย่างไร? ใครช่วยชี้ให้ฉันดูวรรณกรรมที่เกี่ยวข้องได้บ้าง นอกจากนี้ฉันยังกังวลว่าเช่นเดียวกับการให้คะแนน / รีวิวตัวเลขอาจรวมอยู่ใกล้กับค่าบางอย่าง ตัวอย่างเช่นพวกเขาส่วนใหญ่อาจได้รับคะแนน 8 หรือ 5 มีวิธีการเน้นความแตกต่างของ litle ให้แตกต่างกันมากขึ้นในคะแนนสำหรับคุณลักษณะบางอย่างเท่านั้น การสนทนาอื่น ๆ ที่ฉันคิดว่าอาจเกี่ยวข้อง: ระบบการให้คะแนนแบบเบย์ที่มีหลายหมวดหมู่สำหรับการจัดระดับแต่ละประเภท คุณจะคำนวณอันดับภาพยนตร์ IMDB อย่างไร ลวงตาบวชจากผู้เชี่ยวชาญ อะไรคืออัลกอริทึมการจัดอันดับที่ดีที่สุดที่มีอินพุตเป็นคะแนนขึ้นและลง?
11 rating  valuation 

6
อะไรคือปัญหาที่คุณโปรดปรานสำหรับการแนะนำความน่าจะเป็น
ฉันชอบแนะนำความน่าจะเป็นโดยการพูดคุยกับBoy หรือ GirlหรือBertrand Paradox ปัญหา / เกมอื่น ๆ (สั้น) ให้การแนะนำความน่าจะเป็นที่สร้างแรงจูงใจ? ( หนึ่งคำตอบต่อการตอบกลับโปรด ) ป.ล. นี่คือการแนะนำความน่าจะเป็นที่อ่อนโยน แต่ในความเห็นของฉันมีความเกี่ยวข้องกับการสอนสถิติเนื่องจากอนุญาตให้อภิปรายเพิ่มเติมเกี่ยวกับเหตุการณ์ที่ไม่ต่อเนื่องทฤษฎีบทของเบย์พื้นที่ที่น่าจะเป็น / ที่วัดได้ ฯลฯ
11 teaching 

3
วิธีการตรวจสอบที่หนึ่งคือการศึกษาที่ดีขึ้นเมื่อพวกเขาให้ผลลัพธ์ที่ขัดแย้งกัน?
คุณมักจะเจอเจอกับสื่อต่าง ๆ ที่สรุปผลการวิจัยในทิศทางตรงกันข้าม สิ่งเหล่านี้อาจเกี่ยวข้องกับการทดสอบยาตามใบสั่งแพทย์ใหม่หรือประโยชน์ของสารอาหารที่เฉพาะเจาะจงหรือสิ่งอื่นใดสำหรับเรื่องนั้น เมื่อการศึกษาสองแบบนั้นมาถึงผลลัพธ์ที่ขัดแย้งกันคุณจะบอกได้อย่างไรว่าหนึ่งในสองนั้นใกล้เคียงกับความจริงมากที่สุด

4
ข้อความที่ดีเกี่ยวกับการทดลองทางคลินิก?
ฉันเป็นนักศึกษาสถิติระดับปริญญาตรีที่กำลังมองหาวิธีการวิเคราะห์การทดลองทางคลินิกที่ดี ข้อความควรครอบคลุมพื้นฐานของการออกแบบการทดลองการบล็อกการวิเคราะห์พลังงานการออกแบบละตินสี่เหลี่ยมและการออกแบบการสุ่มกลุ่มในหัวข้ออื่น ๆ ฉันมีความรู้ระดับปริญญาตรีเกี่ยวกับสถิติทางคณิตศาสตร์และการวิเคราะห์จริง แต่ถ้ามีข้อความที่ยอดเยี่ยมที่ต้องใช้สถิติหรือการวิเคราะห์ในระดับที่สูงขึ้นฉันสามารถทำงานได้

1
อะไรคือความแตกต่างระหว่างวัตถุสรุป () และโหลด () สำหรับวัตถุ princomp () ใน R?
รหัสตัวอย่าง: (pc.cr <- princomp(USArrests)) summary(pc.cr) loadings(pc.cr) ## note that blank entries are small but not zero ฉันได้รับผลต่างกันออกไปและฉันไม่แน่ใจว่าฉันเข้าใจความแตกต่างอะไร นี่คือผลลัพธ์: > summary(pc.cr) Importance of components: Comp.1 Comp.2 Comp.3 Comp.4 Standard deviation 82.8908472 14.06956001 6.424204055 2.4578367034 Proportion of Variance 0.9655342 0.02781734 0.005799535 0.0008489079 Cumulative Proportion 0.9655342 0.99335156 0.999151092 1.0000000000 > loadings(pc.cr) ## note …
11 r  pca 

4
การคำนวณขนาดตัวอย่างสำหรับการถดถอยโลจิสติกแบบหลายตัวแปร
หนึ่งจะคำนวณขนาดตัวอย่างที่จำเป็นสำหรับการศึกษาที่กลุ่มของเรื่องจะมีตัวแปรอย่างต่อเนื่องเดียวที่วัดได้ในเวลาของการผ่าตัดแล้วสองปีต่อมาพวกเขาจะถูกจัดประเภทเป็นผลการทำงานหรือผลลัพธ์ที่บกพร่อง เราต้องการดูว่าการวัดนั้นสามารถทำนายผลลัพธ์ที่ไม่ดีได้หรือไม่ ในบางจุดเราอาจต้องการจุดตัดในตัวแปรต่อเนื่องด้านบนซึ่งเราจะพยายามแทรกแซงเพื่อลดความน่าจะเป็นของผลลัพธ์ที่บกพร่อง ความคิดใด ๆ การนำ R ไปใช้ใด ๆ

3
การตรวจสอบความสอดคล้องคืออะไร?
ฉันถูกถามคำถามเช่น "คุณตรวจสอบความสอดคล้องในงานประจำวันของคุณหรือไม่" ระหว่างการสัมภาษณ์ทางโทรศัพท์สำหรับตำแหน่งนักชีวสถิติ ฉันไม่รู้จะตอบยังไง ข้อมูลใด ๆ ที่มีความนิยม
11 validation 

3
สูตรเหล่านี้สำหรับการเปลี่ยน P, LSD, MSD, HSD, CI เพื่อ SE เป็นประมาณการแน่นอนหรือพอง / อนุลักษณ์ของ
พื้นหลัง ฉันกำลังทำการวิเคราะห์เมตาซึ่งรวมถึงข้อมูลที่เผยแพร่ก่อนหน้านี้ บ่อยครั้งที่รายงานความแตกต่างระหว่างการรักษาด้วยค่า P, ความแตกต่างอย่างมีนัยสำคัญน้อยที่สุด (LSD) และสถิติอื่น ๆ แต่ไม่มีการประมาณความแปรปรวนโดยตรง ในบริบทของแบบจำลองที่ฉันใช้ความแปรปรวนสูงเกินไปก็โอเค ปัญหา นี่คือรายการของการแปลงเป็นโดยที่S E = √SESESE (Saville 2003)ที่ฉันกำลังพิจารณาข้อเสนอแนะชื่นชม; ด้านล่างฉันสมมติว่าα=0.05ดังนั้น1- α / 2=0.975 และตัวแปรจะกระจายตามปกติเว้นแต่จะระบุไว้เป็นอย่างอื่น:SE= MSE/ n-------√SE=MSE/nSE=\sqrt{MSE/n} α = 0.05α=0.05\alpha=0.051 -α/2= 0.9751-α/2=0.9751-^{\alpha}/_2=0.975 คำถาม: กำหนด , nและการรักษาหมายถึงˉ X 1และˉ X 2 S E = ˉ X 1 - ˉ X 2PPPnnnX¯1X¯1\bar X_1X¯2X¯2\bar X_2 SE= …

3
การแปรรูปเปลี่ยนความเบ้โดยไม่กระทบต่อ kurtosis?
ฉันอยากรู้อยากเห็นหากมีการเปลี่ยนแปลงที่เปลี่ยนแปลงความลาดเอียงของตัวแปรสุ่มโดยไม่ส่งผลกระทบต่อ kurtosis นี่จะคล้ายกับวิธีการแปลงเลียนแบบของ RV ส่งผลต่อค่าเฉลี่ยและความแปรปรวน แต่ไม่ใช่ความเบ้และความโด่ง (ส่วนหนึ่งเป็นเพราะความเบ้และความโด่งนั้นถูกกำหนดให้เปลี่ยนแปลงอย่างต่อเนื่อง) นี่เป็นปัญหาที่ทราบหรือไม่?

2
ประเมินความสัมพันธ์ (มองเห็น) อย่างรวดเร็วระหว่างข้อมูลหมวดหมู่ที่ได้รับคำสั่งใน R หรือไม่
ฉันกำลังมองหาความสัมพันธ์ระหว่างคำตอบของคำถามต่าง ๆ ในแบบสำรวจ ("อืมลองดูว่าคำตอบของคำถาม 11 มีความสัมพันธ์กับคำถาม 78 หรือไม่" คำตอบทั้งหมดเป็นหมวดหมู่ (ส่วนใหญ่มีตั้งแต่ "ไม่มีความสุขมาก" ถึง "มีความสุขมาก") แต่มีคำตอบไม่กี่ชุด ส่วนใหญ่สามารถพิจารณาลำดับที่ดังนั้นลองพิจารณากรณีนี้ที่นี่ เนื่องจากฉันไม่สามารถเข้าถึงโปรแกรมสถิติเชิงพาณิชย์ได้ฉันต้องใช้ R ฉันลองRattle (แพ็คเกจการขุดข้อมูลฟรีแวร์สำหรับ R ดีมาก) แต่น่าเสียดายที่มันไม่รองรับข้อมูลที่เป็นหมวดหมู่ แฮ็คหนึ่งที่ฉันสามารถใช้ได้คือการนำเข้าในแบบสำรวจที่เขียนโค้ดซึ่งมีตัวเลข (1..5) แทนที่จะเป็น "ไม่มีความสุขมาก" ... "มีความสุข" และปล่อยให้ Rattle เชื่อว่าเป็นข้อมูลตัวเลข ฉันกำลังคิดที่จะพล็อตกระจายและมีขนาดจุดตามสัดส่วนของตัวเลขสำหรับแต่ละคู่ หลังจาก googling ฉันพบhttp://www.r-statistics.com/2010/04/correlation-scatter-plot-matrix-for-ordered-categorical-data/แต่ดูเหมือนว่าซับซ้อนมาก (สำหรับฉัน) ฉันไม่ใช่นักสถิติ (แต่เป็นโปรแกรมเมอร์) แต่มีการอ่านบางอย่างในเรื่องนี้และถ้าฉันเข้าใจอย่างถูกต้องRho ของ Spearmanจะเหมาะสมที่นี่ ดังนั้นคำถามสั้น ๆ สำหรับผู้ที่รีบร้อน: มีวิธีที่จะทำแบบ Rho ของ Spearman ใน Rหรือไม่? …

3
การประมาณค่าเฉลี่ยและ st dev ของเส้นโค้งแบบเกาส์ที่ถูกตัดทอนโดยไม่มีการขัดขวาง
สมมติว่าฉันมีกล่องดำที่สร้างข้อมูลหลังจากการแจกแจงแบบปกติด้วยค่าเฉลี่ย m และส่วนเบี่ยงเบนมาตรฐาน อย่างไรก็ตามสมมติว่าเมื่อใดก็ตามที่มันส่งออกค่า <0 มันจะไม่บันทึกอะไรเลย (ไม่สามารถบอกได้เลยว่ามันเป็นค่าที่ส่งออก) เรามีการแจกแจงแบบเกาส์ที่ถูกตัดทอนโดยไม่มีการขัดขวาง ฉันจะประมาณค่าพารามิเตอร์เหล่านี้ได้อย่างไร

6
การปฏิบัติต่อข้อมูลมาตราส่วน n-point Likert เป็นการทดลอง n จากกระบวนการทวินามหรือไม่?
ฉันไม่เคยชอบวิธีที่ผู้คนมักวิเคราะห์ข้อมูลจากเครื่องชั่ง Likert ราวกับว่าข้อผิดพลาดนั้นเกิดขึ้นอย่างต่อเนื่อง & Gaussian เมื่อมีการคาดการณ์ที่สมเหตุสมผลว่าสมมติฐานเหล่านี้ถูกละเมิดอย่างน้อยที่สุดก็สุดขั้ว คุณคิดอย่างไรกับทางเลือกต่อไปนี้: หากการตอบสนองใช้ค่าในสเกล point ให้ขยายข้อมูลนั้นไปยัง trials ซึ่งมีค่า 1 และที่มีค่า 0 ดังนั้นเราจะทำการตอบสนองบนสเกล Likert เสมือนว่ามัน เป็นการรวมตัวกันอย่างเปิดเผยของชุดการทดลองแบบทวินาม (อันที่จริงจากมุมมองด้านความรู้ความเข้าใจทางวิทยาศาสตร์นี่เป็นแบบจำลองที่น่าสนใจสำหรับกลไกที่เกี่ยวข้องกับการตัดสินใจแบบนี้) ด้วยข้อมูลที่ขยายคุณสามารถใช้โมเดลเอฟเฟกต์แบบผสมระบุผู้ตอบเป็นเอฟเฟกต์แบบสุ่ม (เช่นคำถามเป็นเอฟเฟกต์แบบสุ่มหากคุณมีคำถามหลายข้อ) และใช้ฟังก์ชันลิงค์ทวินามเพื่อระบุการแจกแจงข้อผิดพลาดkkknnnnnnkkkn−kn−kn-k ทุกคนสามารถเห็นการละเมิดข้อสันนิษฐานหรือแง่มุมที่เป็นอันตรายอื่น ๆ

6
หนึ่งในผู้อนุมัติโครงการออยเลอร์ปัญหา 213 (“ Flea Circus”) ได้อย่างไร?
ฉันต้องการแก้ปัญหาProject Euler 213แต่ไม่รู้ว่าจะเริ่มต้นอย่างไรเพราะฉันเป็นคนธรรมดาในสาขาสถิติสังเกตว่าต้องมีคำตอบที่ถูกต้องดังนั้นวิธี Monte Carlo จะไม่ทำงาน คุณช่วยแนะนำหัวข้อสถิติให้ฉันอ่านได้ไหม? โปรดอย่าโพสต์วิธีแก้ปัญหาที่นี่ หมัดละครสัตว์ สี่เหลี่ยมจัตุรัสขนาด 30 × 30 ประกอบด้วย 900 หมัดหมัดแรกหนึ่งหมัดต่อตาราง เมื่อระฆังดังขึ้นหมัดแต่ละตัวจะกระโดดไปที่สี่เหลี่ยมที่อยู่ติดกันโดยการสุ่ม (โดยปกติจะมีความเป็นไปได้ 4 อย่างยกเว้นหมัดที่อยู่บนขอบของตารางหรือที่มุม) จำนวนที่คาดว่าจะเป็นสี่เหลี่ยมที่ว่างหลังจาก 50 ระฆังคืออะไร? ให้คำตอบของคุณถูกปัดเศษเป็นทศนิยมหกตำแหน่ง

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.