สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
วางก่อนหน้านี้ในพารามิเตอร์ความเข้มข้นในกระบวนการ Dirichlet
ส่วนใหญ่นี้เป็นพื้นหลังข้ามไปที่สิ้นสุดถ้าคุณรู้อยู่แล้วว่าเพียงพอเกี่ยวกับ Dirichlet ผสมกระบวนการ สมมติว่าฉันกำลังสร้างแบบจำลองข้อมูลบางส่วนที่มาจากส่วนผสมของกระบวนการ Dirichlet คือปล่อยให้และมีเงื่อนไขในถือว่าF∼D(αH)F∼D(αH)F \sim \mathcal D(\alpha H)FFFYi∼iid∫f(y|θ)F(dθ).Yi∼iid∫f(y|θ)F(dθ).Y_i \stackrel {iid}{\sim} \int f(y | \theta) F(d\theta). ที่นี่และเป็นหน่วยวัดพื้นฐานก่อน ปรากฎว่าถ้าสำหรับการสังเกตแต่ละครั้งถ้าฉันรู้ว่าแฝงที่เกี่ยวข้องความน่าจะเป็นของในรุ่นนี้คือโดยที่คือจำนวนค่าที่แตกต่างของ (การวัดแบบสุ่มเป็นแบบแยกส่วนโดยสิ้นเชิง) Escobar และ Westพัฒนารูปแบบต่อไปนี้สำหรับการสุ่มตัวอย่างโดยใช้แกมมาก่อนหน้า; ก่อนอื่นพวกเขาเขียนα>0α>0\alpha > 0αHαH\alpha HYiYiY_iθiθi\theta_iαα\alphaL(α|t)∝αtΓ(α)Γ(α+n)L(α|t)∝αtΓ(α)Γ(α+n)L(\alpha | t) \propto \frac{\alpha^t\Gamma(\alpha)}{\Gamma(\alpha + n)}tttθiθi\theta_iFFFαα\alphaπ(α|t)∝π(α)αtΓ(α)Γ(α+n)∝π(α)αt−1(α+n)B(α+1,n)=π(α)αt−1(α+n)∫10xα(1−x)n−1 dx,π(α|t)∝π(α)αtΓ(α)Γ(α+n)∝π(α)αt−1(α+n)B(α+1,n)=π(α)αt−1(α+n)∫01xα(1−x)n−1 dx, \pi(\alpha | t) \propto \pi(\alpha) \frac{\alpha^t\Gamma(\alpha)}{\Gamma(\alpha + n)} \propto \pi(\alpha)\alpha^{t - 1}(\alpha + n){B(\alpha + …

1
อะไรคือความแตกต่างระหว่างวิธีการของผู้ใช้บ่อยกับการวิเคราะห์อภิมานและวิธีการแบบเบย์
สมมติว่าฉันกำลังทำการวิเคราะห์โดยดูที่มาตรวัดด้านสุขภาพ ฉันสนใจในความแตกต่างของการวัดระหว่างผู้ป่วยกับการควบคุมและความแตกต่างนั้นแตกต่างจาก 0 หรือไม่เคยมีการศึกษามาก่อนในการมองคำถามการวิจัยและการวัดด้านสุขภาพที่เหมือนกัน ในการวิเคราะห์แบบเบย์ของฉันฉันจะสร้างการกระจายก่อนหน้าโดยอิงจากการศึกษาก่อนหน้าซึ่งรวมความแตกต่างเฉลี่ยและข้อผิดพลาดมาตรฐาน โปรดยกโทษให้ฉันถ้านี่เป็นคำถามที่มือใหม่ที่ฉันเพิ่งเรียนรู้สถิติแบบเบย์ แต่ในทางที่ผลลัพธ์จากการวิเคราะห์แบบเบย์ของฉันจะแตกต่างจากผลลัพธ์ที่ฉันจะได้รับโดยใช้การวิเคราะห์ meta-analysis การศึกษาก่อนหน้ากับข้อมูลปัจจุบันของฉัน ?

2
ตำราเรียนเบื้องต้นเกี่ยวกับแบบจำลองที่ไม่ใช่พารามิเตอร์แบบเบส์?
ฉันต้องการปิดหัวของฉันในหัวข้อนี้ แต่การเรียนรู้จากเอกสารและแบบฝึกหัดนั้นยากเพราะมีช่องว่างมากมายที่มักจะถูกเติมในตำราเรียน ถ้ามันเป็นสิ่งสำคัญที่ฉันมีพื้นหลังทางคณิตศาสตร์ที่ค่อนข้างแข็งแกร่งเหมือนที่ฉันทำปริญญาเอกของฉัน ในคณิตศาสตร์ประยุกต์ (CFD จะแม่นยำยิ่งขึ้น)

1
ภายใต้สมมติฐานใดที่วิธีธรรมดากำลังสองน้อยที่สุดให้ตัวประมาณที่มีประสิทธิภาพและไม่เอนเอียง?
เป็นจริงหรือไม่ที่ภายใต้สมมติฐาน Gauss Markov วิธีการกำลังสองน้อยที่สุดแบบธรรมดาให้ตัวประมาณที่มีประสิทธิภาพและไม่เอนเอียง? ดังนั้น: E(ut)=0E(ut)=0E(u_t)=0 เพื่อทุกสิ่ง ttt E(utus)=σ2E(utus)=σ2E(u_tu_s)=\sigma^2 สำหรับt=st=st=s E(utus)=0E(utus)=0E(u_tu_s)=0 สำหรับt≠st≠st\neq s โดยที่เป็นคนตกค้างuuu

3
วิธีการตีความคำศัพท์ในสูตร lm ใน R?
ใน R ถ้าฉันเรียกใช้lm()ฟังก์ชันด้วยวิธีต่อไปนี้: lm.1 = lm(response ~ var1 + var2 + var1 * var2) summary(lm.1) นี้ทำให้ผมรูปแบบเชิงเส้นของตัวแปรตอบสนองด้วยvar1, var2และการมีปฏิสัมพันธ์ระหว่างพวกเขา อย่างไรก็ตามเราจะตีความคำศัพท์การโต้ตอบได้อย่างไร? เอกสารบอกว่านี่คือ "cross" ระหว่างvar1และvar2แต่ไม่ได้ให้คำอธิบายว่า "cross" คืออะไร มันจะมีประโยชน์สำหรับฉันที่จะรู้ว่าตัวเลขที่แน่นอน R คือการคำนวณเพื่อรวมการทำงานร่วมกันระหว่างตัวแปรทั้งสอง
9 r  regression 

1
การแสดงผลลัพธ์จากโมเดลคลาสแฝงหลายตัว
ฉันใช้การวิเคราะห์ชั้นแฝงเพื่อจัดกลุ่มตัวอย่างของการสังเกตตามชุดของตัวแปรไบนารี ฉันใช้ R และแพคเกจ poLCA ใน LCA คุณต้องระบุจำนวนกลุ่มที่คุณต้องการค้นหา ในทางปฏิบัติผู้คนมักใช้โมเดลหลายแบบแต่ละคนระบุจำนวนคลาสที่แตกต่างกันแล้วใช้เกณฑ์ต่าง ๆ เพื่อกำหนดว่าคำอธิบายใดที่ "ดีที่สุด" ของข้อมูล ฉันมักจะพบว่ามันมีประโยชน์มากที่จะมองข้ามแบบจำลองต่างๆเพื่อพยายามทำความเข้าใจว่าการสังเกตที่จำแนกในโมเดลที่มี class = (i) นั้นถูกกระจายโดยโมเดลที่มี class = (i + 1) อย่างไร อย่างน้อยที่สุดบางครั้งคุณสามารถค้นหากลุ่มที่แข็งแกร่งมากซึ่งมีอยู่โดยไม่คำนึงถึงจำนวนคลาสในโมเดล ฉันต้องการวิธีสร้างกราฟความสัมพันธ์เหล่านี้เพื่อสื่อสารผลลัพธ์ที่ซับซ้อนเหล่านี้ในเอกสารและเพื่อนร่วมงานที่ไม่ได้มุ่งเน้นเชิงสถิติได้ง่ายขึ้น ฉันคิดว่านี่เป็นเรื่องง่ายมากที่จะทำใน R โดยใช้แพ็คเกจกราฟิกเครือข่ายแบบง่าย ๆ แต่ฉันก็ไม่รู้เหมือนกัน ใครช่วยกรุณาชี้ฉันในทิศทางที่ถูกต้อง ด้านล่างเป็นรหัสในการทำซ้ำชุดข้อมูลตัวอย่าง เวกเตอร์ xi แต่ละอันแสดงถึงการจำแนก 100 การสังเกตการณ์ในแบบจำลองที่มีคลาสที่เป็นไปได้ ฉันต้องการกราฟวิธีการสังเกต (แถว) ย้ายจากชั้นหนึ่งไปอีกชั้นข้ามคอลัมน์ x1 <- sample(1:1, 100, replace=T) x2 <- sample(1:2, 100, …

2
ความสับสนที่เกี่ยวข้องกับการฟื้นฟูข้อมูล
ฉันพยายามเรียนรู้รูปแบบการถดถอยเชิงเส้น อย่างไรก็ตามฉันมีความสับสนเกี่ยวกับการทำให้ข้อมูลกลับสู่ปกติ ฉันปรับมาตรฐานคุณลักษณะ / ตัวทำนายให้เป็นศูนย์ค่าเฉลี่ยและความแปรปรวนของหน่วย ฉันต้องทำเช่นเดียวกันกับเป้าหมายหรือไม่ ถ้าเป็นเช่นนั้นทำไม

3
สถิติการทดสอบในการทดสอบที่แน่นอนของฟิชเชอร์คืออะไร?
สำหรับตารางฉุกเฉินแบบ 2 คูณ 2 บางคนกล่าวว่าการทดสอบที่แน่นอนของ Fisherใช้การนับX1 , 1X1,1X_{1,1} ในเซลล์ (1,1) ในตารางเป็นสถิติการทดสอบและภายใต้สมมติฐานว่าง X1 , 1X1,1X_{1,1} จะมีการแจกแจง hypergeometric บางคนบอกว่าสถิติการทดสอบของมันคือ |X1 , 1- μ ||X1,1−μ| |X_{1,1} - \mu| ที่ไหน μμ\muคือค่าเฉลี่ยของการแจกแจงไฮเพอร์เมตริกซ์ (ดังที่ได้กล่าวไว้แล้ว) ภายใต้ null นอกจากนี้ยังกล่าวว่าค่า p ถูกกำหนดโดยยึดตามตารางของการแจกแจงแบบไฮเปอร์เมตริกซ์ ฉันสงสัยว่ามีเหตุผลบางอย่างที่จะลบค่าเฉลี่ยแล้วก็ใช้ค่าสัมบูรณ์หรือไม่?|X1 , 1- μ ||X1,1−μ||X_{1,1} - \mu| ไม่มีการแจกแจงไฮเปอร์มิติมิติภายใต้ค่าว่าง

2
ทฤษฎีบทเกาส์ - มาร์คอฟ: BLUE และ OLS
ฉันกำลังอ่านทฤษฎีบท Guass-Markov ในวิกิพีเดียและฉันหวังว่าจะมีคนช่วยฉันหาประเด็นหลักของทฤษฎีบทนี้ เราคิดรูปแบบเชิงเส้นในรูปแบบเมทริกซ์จะได้รับโดย: และเรากำลังมองหาสีฟ้า\Y= Xβ+ ηy=Xβ+η y = X\beta +\eta βˆβ^ \widehat\beta ตามสิ่งนี้ฉันจะติดป้าย "ส่วนที่เหลือ" และ ข้อผิดพลาด " (คือตรงกันข้ามกับการใช้งานในหน้า Gauss-Markov)η= y- Xβη=y−Xβ\eta = y - X\betaε =βˆ- βε=β^−β\varepsilon = \widehat\beta - \beta OLS (หุ้นสามัญอย่างน้อยสี่เหลี่ยม) ประมาณการอาจจะมาเป็น argmin ของ 2| | ที่เหลือ ||22= | | η||22||residual||22=||η||22||\text{residual}||_2^2 = ||\eta||_2^2 ตอนนี้ให้แทนโอเปอเรเตอร์ความคาดหวัง เพื่อความเข้าใจของฉันสิ่งที่ทฤษฎีเกาส์ - มาร์คอฟบอกเราคือว่าถ้าและแล้วอาร์มินทั้งหมด …

1
ผลรวมของสี่เหลี่ยมจัตุรัส Type III
ผมมีรูปแบบการถดถอยเชิงเส้นกับหนึ่งเด็ดขาดตัวแปร(ชายและหญิง) และเป็นหนึ่งในตัวแปรอย่างต่อเนื่องBAAABBB options(contrasts=c("contr.sum","contr.poly"))ฉันจะตั้งค่ารหัสความแตกต่างในการวิจัยกับ และตอนนี้ผมมีเงินก้อนประเภทที่สามของสี่เหลี่ยมสำหรับ, , และการมีปฏิสัมพันธ์ของพวกเขา (A: B) ด้วยAAABBBdrop1(model, .~., test="F") สิ่งที่ฉันติดอยู่กับเป็นวิธีผลรวมของสี่เหลี่ยมที่มีการคำนวณสำหรับBฉันBBBsum((predicted y of the full model - predicted y of the reduced model)^2)คิดว่ามันเป็น y~A+A:Bลดรูปแบบจะมีลักษณะ แต่เมื่อฉันใช้predict(y~A+A:B)R จะส่งคืนค่าที่คาดการณ์ซึ่งเหมือนกับค่าแบบจำลองที่ทำนายไว้ทั้งหมด ดังนั้นผลบวกของกำลังสองจะเป็น 0 (สำหรับผลบวกของกำลังสองของฉันใช้รูปแบบที่ลดลงของซึ่งเหมือนกับ)AAAy~B+A:By~A:B นี่คือตัวอย่างรหัสสำหรับข้อมูลที่สร้างแบบสุ่ม: A<-as.factor(rep(c("male","female"), each=5)) set.seed(1) B<-runif(10) set.seed(5) y<-runif(10) model<-lm(y~A+B+A:B) options(contrasts = c("contr.sum","contr.poly")) #type3 sums of squares drop1(model, .~., test="F") #or same …

2
Mann-Whitney สมมติฐานว่างภายใต้ความแปรปรวนไม่เท่ากัน
ฉันแค่อยากรู้เกี่ยวกับสมมติฐานว่างของการทดสอบ Mann-Whitney U ฉันมักจะเห็นว่ามันระบุว่าสมมติฐานว่างคือว่าประชากรสองคนมีการแจกแจงเท่ากัน แต่ฉันกำลังคิดว่า - ถ้าฉันมีประชากรปกติสองคนที่มีค่าเฉลี่ยเท่ากัน แต่มีความแปรปรวนไม่เท่ากันการทดสอบ Mann-Whitney คงไม่สามารถตรวจจับความแตกต่างนี้ได้ ฉันได้เห็นด้วยเช่นกันว่าด้วยสมมติฐานว่างของการทดสอบแมนน์ - วิทนีย์คือหรือความน่าจะเป็นที่จะสังเกตจากประชากรหนึ่ง ( X ) เกินกว่าการสังเกตจากประชากรที่สอง ( Y ) การยกเว้นความสัมพันธ์) เท่ากับ 0.5 สิ่งนี้ดูเหมือนจะสมเหตุสมผลมากกว่า แต่ก็ไม่เทียบเท่ากับสมมติฐานว่างแรกที่ฉันกล่าวไว้Pr(X>Y)=0.5Pr(X>Y)=0.5\Pr(X>Y)=0.5XXXYYY ฉันหวังว่าจะได้รับความช่วยเหลือเล็กน้อยจากการแก้ปัญหานี้ ขอบคุณ!

1
ความหมายของ p-value ของตัวแปรตัวแบบการถดถอยโลจิสติก
ดังนั้นฉันจึงทำงานกับแบบจำลองการถดถอยโลจิสติกในอาร์แม้ว่าฉันจะยังใหม่กับสถิติฉันรู้สึกว่าฉันมีความเข้าใจเล็กน้อยเกี่ยวกับแบบจำลองการถดถอยในตอนนี้ แต่ยังมีบางสิ่งที่รบกวนฉัน: เมื่อมองไปที่รูปภาพที่เชื่อมโยงคุณจะเห็นสรุป R พิมพ์สำหรับรุ่นตัวอย่างที่ฉันสร้างขึ้น รูปแบบการพยายามที่จะคาดการณ์ว่าอีเมลในชุดข้อมูลที่จะได้รับการ refound หรือไม่ (ตัวแปรไบนารีisRefound) และชุดข้อมูลที่มีสองตัวแปรที่เกี่ยวข้องอย่างใกล้ชิดกับisRefoundคือnext24และnext7days- เหล่านี้เป็นยังไบนารีและบอกได้ว่า mail จะได้รับการคลิกในครั้งต่อไป 24 ชั่วโมง / 7 วันถัดจากจุดปัจจุบันในบันทึก ค่า p สูงควรระบุว่าผลกระทบที่ตัวแปรนี้มีต่อการทำนายแบบจำลองนั้นค่อนข้างสุ่มใช่ไหม? จากนี้ฉันไม่เข้าใจว่าทำไมความแม่นยำของแบบจำลองการคาดการณ์จึงลดลงต่ำกว่า 10% เมื่อตัวแปรสองตัวนี้ไม่ได้อยู่ในสูตรการคำนวณ หากตัวแปรเหล่านี้แสดงความสำคัญต่ำทำไมการลบออกจากแบบจำลองมีผลกระทบอย่างมาก ขอแสดงความนับถือและขอขอบคุณล่วงหน้า Rickyfox แก้ไข: ครั้งแรกที่ฉันลบเฉพาะ next24 ซึ่งควรให้ผลกระทบต่ำเพราะ coef มันค่อนข้างเล็ก ตามที่คาดไว้มีการเปลี่ยนแปลงเล็กน้อย - ไม่ต้องอัปโหลดรูปภาพสำหรับสิ่งนั้น การลบรุ่นถัดไป 7 วันมีผลกระทบอย่างมากต่อโมเดล: AIC 200k ขึ้นไปความแม่นยำลดลงถึง 16% และเรียกคืนได้ถึง 73%

2
พยากรณ์ ARIMA กับฤดูกาลและแนวโน้มผลลัพธ์แปลก
ขณะที่ฉันกำลังก้าวสู่การพยากรณ์ด้วยโมเดล ARIMA ฉันพยายามเข้าใจว่าฉันสามารถปรับปรุงการคาดการณ์ตามแบบของ ARIMA ให้สอดคล้องกับฤดูกาลและดริฟท์ได้อย่างไร ข้อมูลของฉันเป็นอนุกรมเวลาต่อไปนี้ (มากกว่า 3 ปีที่มีแนวโน้มที่ชัดเจนขึ้นและฤดูกาลที่มองเห็นได้ซึ่งดูเหมือนว่าจะไม่สนับสนุนโดยระบบอัตโนมัติที่ความล่าช้า 12, 24, 36 ??) > bal2sum3years.ts Jan Feb Mar Apr May Jun Jul Aug 2010 2540346 2139440 2218652 2176167 2287778 1861061 2000102 2560729 2011 3119573 2704986 2594432 2362869 2509506 2434504 2680088 2689888 2012 3619060 3204588 2800260 2973428 2737696 2744716 3043868 2867416 …

1
EFA สนับสนุนปัจจัยหนึ่งอย่างชัดเจนการวัดมีความสอดคล้องกันภายใน แต่ CFA นั้นเหมาะสมหรือไม่
ฉันกำลังสำรวจคุณสมบัติไซโครเมทของการวัดรายงานตนเอง 10 ข้อ ฉันมีประมาณ 400 รายในสองตัวอย่างอิสระ รายการจะแล้วเสร็จในสเกล Likert 4 จุด EFA สนับสนุนการแก้ปัญหาปัจจัยเดียวอย่างชัดเจน (เช่นค่าเริ่มต้นแรกที่มากกว่า 6 ค่าอื่น ๆ ทั้งหมดต่ำกว่า 1) และค่าอัลฟาของ Cronbach นั้นดี (เช่น. 90) ไม่มีรายการใดที่มีความสัมพันธ์กับผลรวมรายการต่ำ เดิมทีฉันต้องการทำ CFA (EFA เป็นเพียงการติดตามหลังจากที่ฉันเห็น CFA ไม่ดี) ทดสอบแบบจำลองปัจจัยเดียว สำหรับความประหลาดใจของฉันแบบสำหรับรุ่นนั้นค่อนข้างแย่: CFI=.91 TLI=.88 RMSEA=.13 ยิ่งไปกว่านั้นการโหลดสำหรับแต่ละรายการค่อนข้างดี (.65+) ผิดปกติSRMR=.05ซึ่งเป็นที่ยอมรับ / ดี ดัชนีการปรับเปลี่ยนแนะนำให้ฉันเชื่อมโยงข้อผิดพลาดทั่วทุกที่ หากมีเหตุผลที่ชัดเจนในการทำเช่น (บางรายการมีถ้อยคำที่คล้ายกันมาก) ฉันจะทำเช่นนี้; แม้กระนั้นมาตรการทั้งหมดจะถูกพูดในทำนองเดียวกันและความสัมพันธ์ข้อผิดพลาดทั้งหมดจะแปลกและเจ็บปวด ฉันไม่เคยเห็นกรณีเช่นนี้ มาตรการดังกล่าวมีความสอดคล้องกันภายในและประกอบด้วยปัจจัยหนึ่งใน EFA อย่างชัดเจน แต่แสดงให้เห็นถึงความพอดีใน …

1
กำหนดจำนวนที่ตั้งที่ไม่รู้จักในโลกแห่งความจริงจากรายงานที่อิงกับ GPS
ผมทำงานเกี่ยวกับซอฟแวร์บางอย่างที่ควรตรวจสอบสถานที่โลกแห่งความจริง (fe กล้องความเร็ว) จากหลายรายงานจีพีเอสตาม ผู้ใช้จะขับรถเมื่อรายงานตำแหน่งดังนั้นรายงานจะไม่ถูกต้องมาก เพื่อแก้ปัญหานั้นฉันต้องจัดกลุ่มรายงานเกี่ยวกับสถานที่เดียวกันและคำนวณค่าเฉลี่ย คำถามของฉันเป็นเรื่องเกี่ยวกับวิธีการจัดกลุ่มรายงานเหล่านั้น ฉันอ่านเกี่ยวกับอัลกอริทึมการคาดหวัง - สูงสุดและการจัดกลุ่ม k-meanแต่เท่าที่ฉันเข้าใจฉันจะต้องกำหนดจำนวนสถานที่จริงล่วงหน้า มีอัลกอริธึมอื่น ๆ ซึ่งไม่ต้องการจำนวนตำแหน่งจริงแน่นอน แต่ใช้เงื่อนไขขอบ (แทนระยะทางน้อยที่สุด) แทน รายงานมีเส้นแวง , ละติจูดและความถูกต้อง (เมตร) ไม่มีชื่อหรือสิ่งอื่นใดที่สามารถใช้เพื่อระบุรายการที่ซ้ำกันได้ อุปสรรคอีกประการหนึ่งอาจเป็นเรื่องธรรมดาที่จะมีเพียงรายงานเดียวสำหรับที่ตั้งจริง ทำให้แยกความแตกต่างค่าผิดพลาดกับข้อมูลที่ดีได้ยาก

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.