สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
จะทดสอบการกระจายตัวมากเกินไปใน Poisson GLMM ด้วย lmer () ใน R ได้อย่างไร
ฉันมีรูปแบบดังต่อไปนี้: > model1<-lmer(aph.remain~sMFS1+sAG1+sSHDI1+sbare+season+crop +(1|landscape),family=poisson) ... และนี่คือผลลัพธ์สรุป > summary(model1) Generalized linear mixed model fit by the Laplace approximation Formula: aph.remain ~ sMFS1 + sAG1 + sSHDI1 + sbare + season + crop + (1 | landscape) AIC BIC logLik deviance 4057 4088 -2019 4039 Random effects: Groups Name Variance Std.Dev. landscape …

2
การกระจายตัวของสารตกค้างที่คาดหวังในตัวแบบเชิงเส้นทั่วไปคืออะไร
ฉันกำลังแสดงโมเดลเชิงเส้นทั่วไปที่ฉันต้องระบุครอบครัวที่แตกต่างจากครอบครัวปกติ การกระจายของสารตกค้างที่คาดหวังคืออะไร? ตัวอย่างเช่นส่วนที่เหลือควรกระจายตามปกติ?

3
ความน่าจะเป็นของ Naive Bayes: ฉันควรนับจำนวนคำสองเท่าหรือไม่
ฉันทำต้นแบบของ Naive Bayes bag model และฉันมีคำถามเกี่ยวกับการคำนวณความน่าจะเป็นของคุณลักษณะ สมมติว่าฉันมีสองคลาสฉันจะใช้สแปมและไม่ใช่สแปมเพราะนั่นคือสิ่งที่ทุกคนใช้ และขอยกคำว่า "ไวอากร้า" เป็นตัวอย่าง ฉันมี 10 อีเมลในชุดการฝึกอบรมของฉัน 5 สแปมและ 5 ไม่ใช่สแปม "viagra" ปรากฏในเอกสารสแปมทั้ง 5 ฉบับ หนึ่งในเอกสารการฝึกอบรมปรากฏขึ้น 3 ครั้ง (นี่คือสิ่งที่คำถามของฉันเป็นเรื่องเกี่ยวกับ) ดังนั้นนั่นจึงเป็นลักษณะที่ปรากฏ 7 ประการในจดหมายขยะทั้งหมด ในชุดฝึกอบรมที่ไม่ใช่สแปมจะปรากฏขึ้น 1 ครั้ง หากฉันต้องการประมาณ p (viagra | spam) เพียง: p (viagra | spam) = 5 เอกสารสแปมประกอบด้วย viagra / 5 เอกสารสแปมทั้งหมด = 1 …

5
แพ็คเกจการเลือกคุณสมบัติใน R ซึ่งทำได้ทั้งการถดถอยและการจัดหมวดหมู่
ล็อคแล้ว คำถามและคำตอบของคำถามนี้ถูกล็อคเนื่องจากคำถามอยู่นอกหัวข้อ แต่มีความสำคัญทางประวัติศาสตร์ ขณะนี้ไม่ยอมรับคำตอบหรือการโต้ตอบใหม่ ฉันยังใหม่กับอาร์มากฉันกำลังเรียนรู้การเรียนรู้ของเครื่องตอนนี้ ขอโทษถ้าคำถามนี้ดูเหมือนจะเป็นพื้นฐานมาก ฉันพยายามค้นหาแพ็คเกจการเลือกคุณสมบัติที่ดีใน R. ฉันผ่านแพ็คเกจ Boruta มันเป็นแพ็คเกจที่ดี แต่ฉันอ่านว่ามันมีประโยชน์สำหรับการจัดหมวดหมู่เท่านั้น ฉันต้องการใช้การเลือกคุณสมบัติใน R สำหรับงานการถดถอย ฉันอ่านเอกสารกำกับชุด Caret แต่สำหรับระดับของฉันมันยากที่จะเข้าใจ คนใดคนหนึ่งได้โปรดชี้ให้ฉันไปสอนที่ดีหรือรายการแพคเกจที่ดีหรือแพคเกจที่ใช้บ่อยที่สุดใน R สำหรับการเลือกคุณสมบัติ ความช่วยเหลือใด ๆ ที่จะได้รับการชื่นชม ขอบคุณล่วงหน้า.

5
เวทมนตร์หมายเลข 20 คืออะไร?
ฉันมีการอ้างอิงที่แนะนำให้พิจารณาขนาดตัวอย่างขั้นต่ำ 20 สำหรับการกระจายข้อมูลที่เหมาะสม มีความรู้สึกในเรื่องนี้หรือไม่? ขอบคุณ

2
ความแตกต่างในค่า p รายงานระหว่าง lm และ aov ใน R
อะไรอธิบายถึงความแตกต่างของค่า p ในค่าต่อไปนี้aovและการlmโทร? ความแตกต่างนั้นเกิดจากการคำนวณผลรวมจำนวนสแควร์ประเภทต่างๆหรือไม่ set.seed(10) data=rnorm(12) f1=rep(c(1,2),6) f2=c(rep(1,6),rep(2,6)) summary(aov(data~f1*f2)) summary(lm(data~f1*f2))$coeff

3
Mundlak ใช้เอฟเฟกต์คงที่สำหรับการถดถอยโลจิสติกกับหุ่นหรือไม่
ฉันมีชุดข้อมูลที่มี 8000 คลัสเตอร์และการสังเกต 4 ล้านครั้ง น่าเสียดายที่ซอฟต์แวร์สถิติของฉัน Stata ทำงานค่อนข้างช้าเมื่อใช้ฟังก์ชันข้อมูลพาเนลสำหรับการถดถอยโลจิสติก: xtlogitแม้มีตัวอย่าง 10% อย่างไรก็ตามเมื่อใช้logitผลลัพธ์ฟังก์ชั่นที่ไม่ใช่แผงเซลล์ปรากฏเร็วกว่ามาก ดังนั้นฉันจึงอาจได้รับประโยชน์จากการใช้logitข้อมูลที่ถูกแก้ไขซึ่งมีผลกระทบคงที่ ฉันเชื่อว่ากระบวนการนี้มีชื่อว่า "Mundlak fixed effects procedure" (Mundlak, Y. 1978. การรวมกลุ่มของ Time-Series และข้อมูลข้ามส่วน Econometrica, 46 (1), 69-85) ฉันพบคำอธิบายที่เข้าใจง่ายของขั้นตอนนี้ในบทความโดยAntonakis, J. , Bendahan, S. , Jacquart, P. , & Lalive, R. (2010) ในการอ้างเหตุผล: การตรวจสอบและคำแนะนำ ความเป็นผู้นำรายไตรมาส, 21 (6) 1086-1120 ฉันพูด: วิธีหนึ่งในการแก้ไขปัญหาของเอฟเฟกต์ที่ถูกตัดออกและยังรวมถึงตัวแปรระดับ 2 คือการรวมวิธีการคลัสเตอร์ของทุกระดับ …

2
พล็อต QQ ไม่ตรงกับฮิสโตแกรม
ฉันมีฮิสโตแกรมความหนาแน่นของเคอร์เนลและการกระจายผลตอบแทนทางการเงินแบบปกติที่ติดตั้งไว้ซึ่งเปลี่ยนเป็นความสูญเสีย (สัญญาณเปลี่ยน) และพล็อต QQ ปกติของข้อมูลเหล่านี้: พล็อต QQ แสดงให้เห็นชัดเจนว่าก้อยไม่ได้ติดตั้งอย่างถูกต้อง แต่ถ้าฉันดูฮิสโตแกรมและการกระจายแบบปกติที่ติดตั้ง (สีฟ้า) แม้ค่ารอบ 0.0 จะไม่ถูกต้อง ดังนั้นพล็อต QQ แสดงให้เห็นว่ามีเพียงหางที่ไม่เหมาะสม แต่เห็นได้ชัดว่าการกระจายทั้งหมดไม่ได้ติดตั้งอย่างถูกต้อง ทำไมสิ่งนี้ถึงไม่ปรากฏในพล็อต QQ?

3
ROC โค้งข้ามเส้นทแยงมุม
ฉันใช้ตัวจําแนกไบนารีในขณะนี้ เมื่อฉันพล็อตเส้นโค้ง ROC ฉันได้รับการยกที่ดีในตอนแรกมันเปลี่ยนทิศทางและข้ามเส้นทแยงมุมจากนั้นกลับขึ้นแน่นอนทำให้เส้นโค้งเป็นรูปตัว S เอียง สิ่งที่สามารถตีความ / อธิบายถึงผลกระทบนี้? ขอบคุณ
12 roc 

3
การทำนายข้อมูลนับด้วยฟอเรสต์แบบสุ่ม
ป่าสุ่มสามารถถูกฝึกให้ทำนายข้อมูลนับได้อย่างเหมาะสมหรือไม่? สิ่งนี้จะดำเนินการอย่างไร ฉันมีค่าค่อนข้างหลากหลายดังนั้นการจัดหมวดหมู่จึงไม่สมเหตุสมผล ถ้าฉันจะใช้การถดถอยฉันจะตัดทอนผลลัพธ์หรือไม่? ฉันหลงทางไปแล้ว ความคิดใด ๆ

3
กลยุทธ์สำหรับการปรับฟังก์ชั่นที่ไม่ใช่เชิงเส้นอย่างเหมาะสม
สำหรับการวิเคราะห์ข้อมูลจากการทดลองด้านชีวฟิสิกส์ตอนนี้ฉันกำลังพยายามทำเส้นโค้งที่เหมาะสมกับตัวแบบที่ไม่ใช่เชิงเส้น ฟังก์ชั่นโมเดลดูเหมือนจะเป็น: y=ax+bx−1/2y=ax+bx−1/2y = ax + bx^{-1/2} ที่นี่โดยเฉพาะอย่างยิ่งคุณค่าของเป็นที่น่าสนใจอย่างยิ่งbbb พล็อตสำหรับฟังก์ชั่นนี้: (โปรดทราบว่าฟังก์ชั่นแบบจำลองนั้นมีพื้นฐานมาจากคำอธิบายทางคณิตศาสตร์อย่างละเอียดของระบบและดูเหมือนว่าจะทำงานได้ดีมาก --- เป็นเพียงแค่อุปกรณ์อัตโนมัติเท่านั้นที่มีความยุ่งยาก) แน่นอนฟังก์ชั่นแบบจำลองนั้นมีปัญหา: กลยุทธ์ที่เหมาะสมที่ฉันได้ลองมาจนถึงตอนนี้ล้มเหลวเนื่องจากเส้นกำกับที่คมชัดที่โดยเฉพาะกับข้อมูลที่มีเสียงดังx=0x=0x=0 ความเข้าใจของฉันของปัญหาที่นี่เป็นที่เรียบง่ายอย่างน้อยสี่เหลี่ยมกระชับ (ผมเคยเล่นกับทั้งเชิงเส้นและการถดถอยที่ไม่ใช่เชิงเส้นใน MATLAB; ส่วนใหญ่ Levenberg-Marquardt) เป็นมากไวต่อสิ้นสุดแนวตั้งเพราะข้อผิดพลาดเล็ก ๆ ใน x จะขยายอย่างมหาศาล . ใครช่วยชี้ให้ฉันเห็นกลยุทธ์ที่เหมาะสมที่สามารถแก้ไขได้? ฉันมีความรู้พื้นฐานเกี่ยวกับสถิติ แต่ก็ยังค่อนข้าง จำกัด ฉันกระตือรือร้นที่จะเรียนรู้ถ้าเพียง แต่ฉันรู้ว่าจะเริ่มมองหาที่ไหน :) ขอบคุณมากสำหรับคำแนะนำของคุณ! แก้ไขการขออภัยโทษจากที่ลืมพูดถึงข้อผิดพลาด เสียงรบกวนที่สำคัญเพียงอย่างเดียวคือในและมันเป็นสารเติมแต่งxxx แก้ไข 2ข้อมูลเพิ่มเติมบางอย่างเกี่ยวกับพื้นหลังของคำถามนี้ กราฟด้านบนเป็นแบบจำลองพฤติกรรมการยืดของโพลีเมอร์ @whuber ชี้ให้เห็นในความคิดเห็นคุณจะต้องเพื่อให้ได้กราฟดังด้านบนb≈−200ab≈−200ab \approx -200 a สำหรับวิธีที่ผู้คนปรับโค้งนี้จนถึงจุดนี้: ดูเหมือนว่าคนทั่วไปจะตัดเส้นกำกับแนวดิ่งจนกว่าพวกเขาจะเจอแบบที่ดี ตัวเลือกการตัดออกยังคงเป็นกฎเกณฑ์ทำให้กระบวนการที่เหมาะสมไม่น่าเชื่อถือและไม่สามารถพิสูจน์ได้ แก้ไขกราฟ3 และ 4คงที่

1
กระทบยอดสัญลักษณ์สำหรับโมเดลผสม
ฉันคุ้นเคยกับสัญกรณ์เช่น: β0j=β0+ujyij=β0+βixij+uj+eij=β0j+βixij+eijyij=β0+βixij+uj+eij=β0j+βixij+eij\begin{align} y_{ij} &= \beta_0 + \beta_i x_{ij} + u_j + e_{ij}\\ &= \beta_{0j} + \beta_i x_{ij} + e_{ij} \end{align} โดยที่และβ0j=β0+ujβ0j=β0+uj\beta_{0j}=\beta_{0}+u_j yij=β0+β1xij+u0j+u1jxij+eij=β0j+β1jxij+eijyij=β0+β1xij+u0j+u1jxij+eij=β0j+β1jxij+eij\begin{align} y_{ij} &= \beta_0 + \beta_1 x_{ij} + u_{0j} + u_{1j} x_{ij} + e_{ij} \\ &= \beta_{0j} + \beta_{1j} x_{ij} + e_{ij} \end{align} โดยที่และ β 1 j = β …


2
ปัญหาในการเปรียบเทียบแบบจำลอง GLM ที่มีฟังก์ชั่นลิงก์แตกต่างกัน
ด้วยชุดโควารีและชุดการกระจายเดียวกันฉันจะเปรียบเทียบรุ่นที่มีฟังก์ชั่นลิงค์ต่างกันได้อย่างไร ฉันคิดว่าคำตอบที่ถูกต้องคือ "AIC / BIC" แต่ฉันไม่แน่ใจ 100% เป็นไปได้ไหมที่จะมีรุ่นที่ซ้อนกันหากมีลิงค์อื่นอยู่?

1
หากการแข่งขันเทนนิสเป็นชุดใหญ่เดี่ยวเกมจะมีความแม่นยำเท่ากันกี่เกม?
เทนนิสมีระบบการให้คะแนนสามระดับที่แปลกประหลาดและฉันสงสัยว่ามันจะมีประโยชน์ทางสถิติใด ๆ จากมุมมองของการแข่งขันเป็นการทดลองเพื่อกำหนดผู้เล่นที่ดีกว่า สำหรับผู้ที่ไม่คุ้นเคยในกฎปกติเกมจะได้คะแนนแรกถึง 4 คะแนนตราบใดที่คุณมีผู้นำ 2 คะแนน (เช่นถ้าเป็น 4-2 คุณชนะ แต่ 4-3 คุณต้องมี 1 คะแนนมากขึ้นและเก็บไว้ ดำเนินต่อไปจนกว่าผู้เล่นหนึ่งคนจะไปข้างหน้า 2 คน) เซตคือชุดของเกมและเซตแรกชนะถึง 6 อีกครั้งต้องชนะด้วย 2 ยกเว้นเวลานี้เกมไทเบรก - เบรกแบบพิเศษจะเล่นแทนการพกพา (ยกเว้นชุดสุดท้ายของวิมเบิลดันเป็นต้น .. ) การแข่งขันจะได้รับรางวัลแรกถึง 2 หรือ 3 ชุดขึ้นอยู่กับการแข่งขัน ตอนนี้เทนนิสก็แปลกในเกมที่ไม่เป็นธรรม สำหรับจุดใดก็ตามเซิร์ฟเวอร์มีข้อได้เปรียบอย่างมากดังนั้นในแต่ละเกมเซิร์ฟเวอร์จะสลับกัน ในเกมไทเบรกเกอร์การเสิร์ฟเสิร์ฟจะเปลี่ยนหลังจากทุกแต้มและเป็นแต้มแรกถึง 7 แต้มอีกครั้งด้วยคะแนน 2 แต้ม ให้คิดว่าผู้เล่นที่มีความน่าจะเป็นในการชนะจุดบนของพวกเขาทำหน้าที่ของและเมื่อได้รับp_rp rpspsp_sprprp_r คำถามคือสิ่งนี้สมมติว่าเรา A) เพิ่งเล่นเทนนิสในการแข่งขัน "ดีที่สุดของเกม N" จำนวนเกมที่จะให้ความแม่นยำเช่นเดียวกับปกติดีที่สุดของ 5 …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.