สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
ทวินามลบนั้นไม่สามารถแสดงออกได้เหมือนในตระกูลเอ็กซ์โพเนนเชียลหรือไม่ถ้ามี 2 นิรนาม?
ฉันมีการบ้านเพื่อแสดงการกระจายตัวแบบทวินามลบเป็นตระกูลการแจกแจงแบบเลขชี้กำลังเนื่องจากพารามิเตอร์การกระจายตัวเป็นค่าคงที่ที่รู้จัก นี่ค่อนข้างง่าย แต่ฉันสงสัยว่าทำไมพวกเขาถึงต้องการให้เราเก็บพารามิเตอร์นั้นไว้ ฉันพบว่าฉันไม่สามารถหาวิธีที่จะใส่มันในรูปแบบที่ถูกต้องโดยไม่ทราบพารามิเตอร์สองตัว ดูออนไลน์ฉันพบการอ้างสิทธิ์ว่าเป็นไปไม่ได้ อย่างไรก็ตามฉันไม่พบหลักฐานว่านี่เป็นเรื่องจริง ฉันดูเหมือนจะไม่เกิดขึ้นกับตัวเองอย่างใดอย่างหนึ่ง ใครบ้างมีข้อพิสูจน์เรื่องนี้? ตามที่ร้องขอด้านล่างนี้ฉันได้แนบข้อเรียกร้องสองสามข้อ: "ตระกูลการแจกแจงลบแบบทวินามที่มีจำนวนความล้มเหลวคงที่ (aka พารามิเตอร์การหยุดเวลา) r คือตระกูลแบบเอ็กซ์โพเนนเชียลอย่างไรก็ตามเมื่อพารามิเตอร์คงที่ใด ๆ ที่กล่าวถึงข้างต้นได้รับอนุญาตให้เปลี่ยนแปลง " http://en.wikipedia.org/wiki/Exponential_family "การแจกแจงทวินามลบสองพารามิเตอร์ไม่ได้เป็นสมาชิกของตระกูลเอ็กซ์โพเนนเชียล แต่ถ้าเราปฏิบัติต่อพารามิเตอร์การกระจายตัวเป็นค่าคงที่ที่รู้จักกันคงที่แล้วมันก็เป็นสมาชิก" http://www.unc.edu/courses/2006spring/ecol/145/001/docs/lectures/lecture21.htm

1
การถดถอยด้วยขนาดตัวอย่างที่เล็กมาก
ฉันต้องการเรียกใช้การถดถอยด้วยตัวแปรอธิบาย 4 ถึง 5 แต่มีข้อสังเกตเพียง 15 ข้อ ไม่สามารถสันนิษฐานได้ว่าตัวแปรเหล่านี้มีการกระจายโดยทั่วไปมีวิธีการที่ไม่เป็นพารามิเตอร์หรือวิธีการถดถอยที่ถูกต้องอื่น ๆ หรือไม่?

1
การทดสอบการเปลี่ยนรูป: เกณฑ์การเลือกสถิติการทดสอบ
ฉันใช้การทดสอบการเปลี่ยนแปลงอย่างสม่ำเสมอและชอบความเรียบง่ายของมัน ฉันได้เรียนรู้มากที่สุดจากหนังสือ "วิธีการ Resampling" โดย Good ซึ่งผู้แต่งดูเหมือนว่าจะมีความคิดสร้างสรรค์ในการเลือกสถิติการทดสอบของเขาตลอดตัวอย่าง นอกจากนี้โพสต์นี้ให้ความประทับใจว่ามีอิสระอย่างมากในการเลือกสถิติทดสอบ ฉันทำไม่น่าแปลกใจหากมีความต้องการทฤษฎีสถิติทดสอบควรปฏิบัติตาม หรือเราสามารถใช้สถิติใดก็ได้ตราบใดที่มันสมเหตุสมผลและมีอัตราความผิดพลาด Type I / II ที่ดี? ตัวอย่างเช่นเมื่อมีการใช้การทดสอบการเปลี่ยนรูปแทน t-test เนื่องจากประชากรที่ไม่ปกติฉันได้เห็นหลายครั้งที่การทดสอบการเปลี่ยนแปลงทาง p-value ยังคงได้รับจากสถิติ t แม้ว่าไม่จำเป็นต้องผิด แต่ดูเหมือนเป็นทางเลือกแปลก ๆ ที่ให้กำเนิดการกระจายตัวของนักเรียน

1
การประมาณจำนวนลูกโดยการเลือกลูกและทำเครื่องหมายอย่างต่อเนื่อง
ให้บอกว่าฉันมีลูกเอ็นในถุง ในการวาดครั้งแรกของฉันฉันทำเครื่องหมายลูกและแทนที่ในถุง ในการจับครั้งที่สองของฉันหากฉันหยิบลูกบอลที่ทำเครื่องหมายไว้ฉันจะคืนมันลงในกระเป๋า อย่างไรก็ตามหากฉันรับลูกบอลที่ไม่มีการทำเครื่องหมายฉันจะทำเครื่องหมายและส่งกลับไปยังกระเป๋า ฉันทำสิ่งนี้ต่อไปเสมอ จำนวนที่คาดหวังของลูกในถุงที่ได้รับจำนวนการดึงและประวัติของการทำเครื่องหมาย / ไม่ถูกทำเครื่องหมายคืออะไร?

1
วิธีการสำรวจความคิดเห็นส่วนบุคคล
เพื่อนนักสถิติของฉันบอกฉันถึงเทคนิคที่น่าสนใจที่ใช้ในการรับการตอบกลับอย่างซื่อสัตย์จากการสำรวจที่จัดการกับปัญหาที่ละเอียดอ่อน ฉันจำส่วนสำคัญของวิธีการนี้ได้ แต่สงสัยว่ามีใครรู้รายละเอียดบ้างหรือไม่และมีการอ้างอิงที่ใด เรื่องราวคือฟลอริด้าอะ AMA ต้องการประเมินการใช้ยาในหมู่แพทย์ พวกเขาส่งแบบสอบถามพร้อมคนตายหนึ่งคน IIRC คำแนะนำเป็นบางสิ่งบางอย่างตามแนวของ "หมุนตายถ้าคุณเคยเสพยาหรือได้ 6 เขียนลงหก; มิฉะนั้นเขียนลงเลขอะไรก็ตาม" ความคิดที่ว่าถ้ามีคนดึงแบบสอบถามของแพทย์และเห็นหกเขาสามารถบอกว่าเขาไม่ได้ใช้ยาเสพติดเขาเพิ่งเกิดขึ้นหก

2
วิธีการประเมินความดีของความพอดีสำหรับฟังก์ชั่นการเอาตัวรอด
ฉันเป็นนักวิเคราะห์การรอดชีวิตคนใหม่แม้ว่าฉันจะมีความรู้ในการจำแนกและการถดถอย สำหรับการถดถอยเรามีสถิติ MSE และ R กำลังสอง แต่เราจะบอกได้อย่างไรว่าแบบจำลองการเอาชีวิตรอด A นั้นเหนือกว่าแบบจำลองการเอาชีวิตรอด B นอกเหนือจากกราฟฟิค (KM curve) บางชนิด? หากเป็นไปได้โปรดอธิบายความแตกต่างด้วยตัวอย่าง (เช่น rpart package ใน R) คุณจะแสดงให้เห็นได้อย่างไรว่าต้นไม้การอยู่รอดของ CART หนึ่งต้นนั้นดีกว่าต้นไม้การอยู่รอดของ CART อีกต้น สามารถใช้การวัดใดได้บ้าง

4
Minitab มีประโยชน์อย่างไรในโลกแห่งความเป็นจริง? [ปิด]
ปิด คำถามนี้เป็นคำถามความคิดเห็นตาม ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้สามารถตอบข้อเท็จจริงและการอ้างอิงได้โดยแก้ไขโพสต์นี้ ปิดให้บริการใน5 ปีที่ผ่านมา ปัจจุบันฉันเป็นนักเรียนสถิติภายในโปรแกรมที่ดีมาก เราใช้ Minitab สำหรับรายการ / คลาสที่หลากหลาย แต่เนื่องจากปริญญาตรีของฉันสอนฉันสิ่งที่คุณใช้ในโรงเรียนไม่จำเป็นต้องเป็นสิ่งที่ใช้ในโลกแห่งความจริง ฉันมีความรอบรู้กับ C #, python และฉันกำลังเรียนรู้ SAS (เกือบพร้อมที่จะทำการทดสอบการรับรองครั้งแรกสำหรับ SAS) Minitab ใช้อย่างกว้างขวางในการศึกษา / งานจริงหรือไม่? ฉันควรลงทุนเวลามากขึ้นในการเรียนรู้ SAS แทนหรือไม่
9 sas  minitab 

2
จะพิสูจน์ได้อย่างไรว่าข้อสมมติฐานที่หลากหลายนั้นถูกต้อง?
ในการเรียนรู้ของเครื่องมันมักจะสันนิษฐานว่าชุดข้อมูลอยู่บนท่อร่วมที่มีมิติต่ำเรียบ (สมมติฐานของท่อร่วม) แต่มีวิธีใดที่จะพิสูจน์ว่าสมมติว่าเงื่อนไขเป็นที่พอใจแล้วชุดข้อมูลจะถูกสร้างขึ้นโดยประมาณ จากท่อเรียบแบบมิติต่ำ? ตัวอย่างเช่นกำหนดลำดับข้อมูล {X1...Xn}{X1…Xn}\{\mathbf{X}_1 \ldots \mathbf{X}_n\} ที่ไหน Xi∈RdXi∈Rd\mathbf X_i \in \mathbb{R}^d (พูดลำดับของภาพใบหน้าที่มีมุมต่างกัน) และลำดับฉลากที่เกี่ยวข้อง {y1…yn}{y1…yn}\{ y_1 \ldots y_n\} ที่ไหน y1⪯y2…⪯yny1⪯y2…⪯yny_1 \preceq y_2 \ldots \preceq y_n (พูดมุมของลำดับใบหน้า) สมมติว่าเมื่อXiXiX_i และ Xi+1Xi+1X_{i+1} อยู่ใกล้มากป้ายกำกับของพวกเขา yiyiy_i และ yi+1yi+1y_{i+1} อยู่ใกล้มากเราสามารถจินตนาการได้ว่ามันเป็นไปได้ว่า {X1…Xn}{X1…Xn}\{\mathbf{X}_1 \ldots \mathbf{X}_n\}นอนบนหลากหลายมิติ มันเป็นเรื่องจริงเหรอ? ถ้าเป็นเช่นนั้นเราจะพิสูจน์มันได้อย่างไร? หรือเงื่อนไขใดที่จำเป็นต้องมีการจัดลำดับเพื่อให้สมมติฐานที่หลากหลายสามารถพิสูจน์ได้ว่าเป็นจริง

3
ทดสอบเพื่อแยกความแตกต่างเป็นระยะจากข้อมูลเกือบเป็นระยะ
สมมติว่าฉันมีบางฟังก์ชั่นที่ไม่รู้จักโดเมนℝซึ่งผมทราบว่าจะปฏิบัติตามเงื่อนไขที่เหมาะสมบางอย่างเช่นความต่อเนื่อง ฉันรู้ค่าที่แน่นอนของf (เพราะข้อมูลมาจากการจำลอง) ที่จุดสุ่มตัวอย่างบางระยะเท่ากันt_i = t_0 + iΔtด้วยi∈ \ {1, …, n \}ซึ่งฉันคิดว่าเพียงพอที่จะจับภาพทั้งหมด ด้านที่เกี่ยวข้องของfเช่นฉันสามารถสรุปได้ว่ามี extremum ท้องถิ่นมากที่สุดหนึ่งแห่งfในระหว่างจุดสุ่มสองจุด ฉันกำลังมองหาการทดสอบที่บอกฉันว่าข้อมูลของฉันสอดคล้องกับfเป็นระยะอย่างแน่นอนหรือไม่นั่นคือ∃τ: f (t + τ) = f (t) \, ∀ \, tfffRℝℝfffti=t0+iΔtti=t0+iΔtt_i=t_0 + iΔti∈{1,…,n}i∈{1,…,n}i∈\{1,…,n\}fffffffff∃τ:f(t+τ)=f(t)∀t∃τ:f(t+τ)=f(t)∀t∃τ: f(t+τ)=f(t) \,∀\,tด้วยความยาวของช่วงเวลาที่สามารถสะท้อนกลับได้เช่นΔt&lt;τ&lt;n⋅ΔtΔt&lt;τ&lt;n·ΔtΔt < τ < n·Δt (แต่เป็นไปได้ว่าฉันสามารถสร้างข้อ จำกัด ที่แข็งแกร่งกว่านี้ได้ถ้าจำเป็น) จากมุมมองอื่นผมมีข้อมูลx0,…,xnx0,…,xn{x_0, …, x_n}และกำลังมองหาการทดสอบที่ตอบคำถามไม่ว่าจะเป็นฟังก์ชั่นเป็นระยะfff (เงื่อนไขดังกล่าวตอบสนอง) อยู่เช่นว่าf(ti)=xi∀if(ti)=xi∀if(t_i)=x_i ∀ i∀ฉัน จุดสำคัญคืออย่างน้อยfffใกล้เคียงกับช่วงเวลาอย่างมาก (อาจเป็นเช่นf(t):=sin(g(t)⋅t)f(t):=sin⁡(g(t)·t)f(t) := \sin(g(t)·t)หรือf(t):=g(t)⋅sin(t)f(t):=g(t)·sin⁡(t)f(t) …

2
สรุปความยุ่งเหยิงของส่วนของเส้นตรงที่มองเห็นได้
ฉันมีชุดข้อมูลของส่วนของเส้นตรงกำกับหลายล้านชุด ส่วนของเส้นตรงเป็นลำดับ - เป็นตัวแปรภูมิอากาศ (ความร้อนที่เหมาะสม) โดยมีค่าที่สังเกตและจำลองในช่วงเวลาครึ่งชั่วโมง ฉันพยายามค้นหารูปแบบในการจำลองการทำงาน ฉันกำลังดูโครงเรื่องของ Obs เทียบกับค่าการจำลองและการเชื่อมโยงพวกมันเข้ากับส่วนของเส้นตรง (ลูกศรแสดงทิศทางของเวลา) หากฉันพล็อตพวกเขาฉันแค่สับสนเบลอที่ไม่สามารถตีความได้เช่นนี้ นี่เป็นส่วนย่อยของ 10,000 บรรทัดโดยละเอียดและมีความทึบต่ำ: ggplot(d, aes(x=Qh_obs, xend=lead(Qh_obs), y=Qh_sim, yend=lead(Qh_sim))) + geom_segment(size=0.1, alpha=0.2, arrow=arrow(length=unit(2, units='mm'))) dput() ของข้อมูล 700 แถวแรก (ถูก จำกัด โดยความยาวโพสต์): structure( list( Qh_sim = c( 56.401439666748, 33.9568634033203, 16.2147789001465, 0.797790050506592, -3.19529962539673, -10.3250732421875, -11.6082448959351, -21.5074787139893, -21.5963478088379, -21.4389324188232, -19.8912830352783, -18.5908279418945, -19.2523441314697, …

4
การคำนวณความแม่นยำในการพยากรณ์
เรากำลังใช้ STL (การนำไปใช้ R) สำหรับการคาดการณ์ข้อมูลอนุกรมเวลา ทุกวันเราเรียกใช้การคาดการณ์รายวัน เราต้องการเปรียบเทียบค่าพยากรณ์กับค่าจริงและระบุค่าเบี่ยงเบนเฉลี่ย ตัวอย่างเช่นเรารันการคาดการณ์ในวันพรุ่งนี้และได้รับคะแนนการพยากรณ์เราต้องการเปรียบเทียบคะแนนการคาดการณ์เหล่านี้กับข้อมูลจริงที่เราจะได้รับในวันพรุ่งนี้ ฉันทราบว่าการคาดการณ์ค่าและข้อมูลจริงอาจไม่ตรงกับเวลาส่วนใหญ่นั่นคือเหตุผลหนึ่งที่เราต้องการติดตามว่าเรามีความแม่นยำมากแค่ไหนในแต่ละวัน ตอนนี้เราพยายามระบุว่าวิธีใดที่ดีที่สุดในการแก้ปัญหานี้ ตัวชี้ความช่วยเหลือใด ๆ ที่จะได้รับการชื่นชม ฉันดูที่การวัดคำถามความแม่นยำในการคาดการณ์แต่ดูเหมือนว่าจะเกี่ยวข้องกับการเปรียบเทียบแบบจำลองมากกว่าการคำนวณความแม่นยำด้วยค่าจริง ฉันดูการใช้งานฟังก์ชันความแม่นยำใน Rแต่สับสนกับสองคำถาม: 1) มันจะทำงานกับข้อมูลจริงเทียบกับข้อมูลการคาดการณ์หรือไม่เพราะการสอนส่วนใหญ่พูดว่า "ข้อมูลการทดสอบ" กับ "ข้อมูลการคาดการณ์" 2) ดูเหมือนว่าฟังก์ชั่นความแม่นยำที่ออกมานั้นมีอาร์เรย์ของค่ามากกว่า% ของการเบี่ยงเบน

1
การหาเวกเตอร์ cointegration โดยใช้วิธี Johansen
ฉันพยายามเข้าใจวิธี Johansen ให้ดีขึ้นดังนั้นฉันจึงพัฒนาตัวอย่าง 3.1 ที่ได้รับจากหนังสือLikelihood-Based-Inference-Cointegrated-Autoregressive-Econometrics ที่เรามีสามกระบวนการ: X1t=∑i=1tϵ1i+ϵ2tX1t=∑i=1tϵ1i+ϵ2tX_{1t} = \sum_{i=1}^t \epsilon_{1i} + \epsilon_{2t} X2t=α∑i=1tϵ1i+ϵ3tX2t=α∑i=1tϵ1i+ϵ3t X_{2t} = \alpha \sum_{i=1}^t \epsilon_{1i} + \epsilon_{3t} X3t=ϵ4tX3t=ϵ4t X_{3t} = \epsilon_{4t} ดังนั้นเวกเตอร์ cointegration ควรเป็น [a, -1, 0] และ [0, 0 1] แต่เมื่อฉันใช้วิธี Johansen ฉันไม่สามารถรับพวกเขาได้ รหัสที่ฉันพยายามทำมีดังต่อไปนี้: import numpy as np import matplotlib.pyplot as plt import pandas as pd …

4
สามารถใช้การทดสอบ Mann-Whitney สำหรับการเปรียบเทียบหลังเหตุการณ์หลังจาก Kruskal-Wallis ได้หรือไม่?
ฉันมีแบบจำลองที่สัตว์ถูกวางไว้ในสภาพแวดล้อมที่เป็นมิตรและหมดเวลาเพื่อดูว่ามันสามารถอยู่รอดได้นานแค่ไหนโดยใช้วิธีการบางอย่างเพื่อความอยู่รอด มีสามวิธีที่สามารถใช้เพื่อความอยู่รอด ฉันวิ่งสัตว์จำลอง 300 ตัวโดยใช้วิธีการเอาชีวิตรอดในแต่ละครั้ง การจำลองทั้งหมดเกิดขึ้นในสภาพแวดล้อมเดียวกัน แต่มีการสุ่มดังนั้นจึงแตกต่างกันในแต่ละครั้ง ฉันใช้เวลากี่วินาทีที่สัตว์มีชีวิตรอดในการจำลองแต่ละครั้ง ชีวิตที่ยืนยาวนั้นดีกว่า ข้อมูลของฉันมีลักษณะเช่นนี้: Approach 1, Approach 2, Approach 2 45,79,38 48,32,24 85,108,44 ... 300 rows of these ฉันไม่แน่ใจในทุกสิ่งที่ฉันทำหลังจากจุดนี้ดังนั้นให้ฉันรู้ว่าฉันกำลังทำอะไรที่โง่และผิด ฉันพยายามที่จะหาว่ามีความแตกต่างทางสถิติเกี่ยวกับอายุขัยโดยใช้วิธีการเฉพาะ ฉันรันการทดสอบ Shapiro ของแต่ละตัวอย่างและพวกเขากลับมาพร้อมค่า p เล็ก ๆ ดังนั้นฉันจึงเชื่อว่าข้อมูลไม่ได้เป็นมาตรฐาน ข้อมูลในแถวไม่มีความสัมพันธ์ซึ่งกันและกัน การสุ่มเมล็ดที่ใช้ในการจำลองแต่ละครั้งนั้นแตกต่างกัน ด้วยเหตุนี้ฉันจึงเชื่อว่าไม่มีการจับคู่ข้อมูล เนื่องจากข้อมูลไม่ได้ถูกทำให้เป็นมาตรฐาน, ไม่ได้จับคู่และมีตัวอย่างมากกว่าสองตัวอย่างฉันจึงทำการทดสอบ Kruskal Wallis ซึ่งกลับมาด้วยค่า p เท่ากับ 0.048 จากนั้นฉันย้ายไปที่โพสต์เฉพาะกิจโดยเลือก Mann Whitney ในไม่แน่ใจว่า Mann Whitney …

2
จะทำอย่างไรเมื่อ CFA เหมาะสมกับหลายรายการที่ไม่ดี
ฉันไม่แน่ใจว่าจะดำเนินการอย่างไรกับ CFA im นี้ในภาษาลาวา ฉันมีตัวอย่างของผู้เข้าร่วม 172 คน (ฉันรู้ว่าไม่มากนักสำหรับ CFA) และ 28 รายการที่มีเครื่องชั่ง Likert 7 จุดที่ควรโหลดในเจ็ดปัจจัย ฉันทำ CFA ด้วย„ mlm“ - ตัวประเมินผล แต่โมเดลพอดีนั้นแย่มาก (χ2 (df = 329) = 739.36; ดัชนีเปรียบเทียบแบบพอดี (CFI) = .69 รากมาตรฐานที่ได้มาตรฐานหมายถึงส่วนที่เหลือเป็นตาราง (SRMR) = 10 รูตหมายถึงความคลาดเคลื่อนกำลังสองของการประมาณ (RMSEA) =. 09; RMSEA ช่วงความเชื่อมั่น 90% (CI) = [.08, .10] ฉันได้ลองทำสิ่งต่อไปนี้แล้ว: แบบจำลอง bifactor …

1
ทำไมคุณต้องจัดทำรูปแบบตัวอักษรย่อตัวเมื่อคุณได้รับความสนใจ
ฉันยังใหม่กับสถิติเชิงพื้นที่และดูแบบฝึกหัดมากมาย แต่ฉันไม่เข้าใจว่าทำไมคุณต้องจัดทำรูปแบบ Variogram เมื่อคุณ krige ฉันใช้แพ็คเกจ gstat ใน R และนี่คือตัวอย่างที่พวกเขาให้: library(sp) data(meuse) coordinates(meuse) = ~x+y data(meuse.grid) str(meuse.grid) gridded(meuse.grid) = ~x+y m &lt;- vgm(.59, "Sph", 874, .04) print(m) # ordinary kriging: x &lt;- krige(log(zinc)~1, meuse, meuse.grid, model = m) มีใครสามารถอธิบายในสองบรรทัดทำไมคุณต้องจัดหา vgm ก่อน? และคุณจะตั้งค่าพารามิเตอร์ได้อย่างไร ขอบคุณล่วงหน้า! แคสเปอร์
9 spatial 

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.