สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
ช่วยตีความการนับข้อมูล GLMM โดยใช้ lme4 glmer และ glmer.nb - ทวินามลบกับปัวซอง
ฉันมีคำถามบางอย่างเกี่ยวกับข้อกำหนดและการตีความของ GLMM มี 3 คำถามที่แน่นอนทางสถิติและอีก 2 คำถามเกี่ยวกับอาร์ฉันกำลังโพสต์ที่นี่เพราะท้ายที่สุดฉันคิดว่าปัญหาคือการตีความผลลัพธ์ของ GLMM ฉันกำลังพยายามที่จะติดตั้ง GLMM ฉันใช้ข้อมูลการสำรวจสำมะโนประชากรสหรัฐจากฐานข้อมูลระบบทางเดินยาว ข้อสังเกตของฉันคือการสำรวจสำมะโนประชากร ตัวแปรตามของฉันคือจำนวนหน่วยที่พักอาศัยที่ว่างและฉันสนใจในความสัมพันธ์ระหว่างตำแหน่งว่างและตัวแปรทางเศรษฐกิจและสังคม ตัวอย่างที่นี่นั้นง่ายเพียงแค่ใช้เอฟเฟ็กต์คงที่สองตัวเลือก: เปอร์เซ็นต์ของประชากรที่ไม่ใช่คนผิวขาว ฉันต้องการรวมเอฟเฟกต์แบบซ้อนสองแบบไว้ด้วยกัน: ผืนผ้าภายในทศวรรษและทศวรรษเช่น (ทศวรรษ / ผืน) ฉันกำลังพิจารณาแบบสุ่มเหล่านี้ในความพยายามที่จะควบคุมพื้นที่ (เช่นระหว่างผืน) และชั่วขณะ (เช่นระหว่างทศวรรษ) autocorrelation อย่างไรก็ตามฉันสนใจทศวรรษที่ผ่านมาเป็นผลกระทบคงที่ดังนั้นฉันจึงรวมมันเป็นปัจจัยคงที่เช่นกัน เนื่องจากตัวแปรอิสระของฉันคือตัวแปรนับจำนวนเต็มที่ไม่เป็นลบฉันจึงพยายามใส่ปัวซองและลบทวินาม GLMM ฉันใช้บันทึกของหน่วยที่อยู่อาศัยทั้งหมดเพื่อชดเชย ซึ่งหมายความว่าค่าสัมประสิทธิ์ถูกตีความว่าเป็นผลกระทบต่ออัตราตำแหน่งที่ว่างไม่ใช่จำนวนบ้านที่ว่างทั้งหมด ฉันกำลังมีผลสำหรับ Poisson และลบทวินาม GLMM ประมาณโดยใช้ glmer และ glmer.nb จากlme4 การตีความค่าสัมประสิทธิ์ทำให้ฉันรู้สึกว่าขึ้นอยู่กับความรู้ของฉันของข้อมูลและพื้นที่การศึกษา ถ้าคุณต้องการให้ข้อมูลและสคริปต์พวกเขาอยู่ในของฉันGithub สคริปต์นี้มีการสืบสวนเชิงพรรณนามากกว่าที่ฉันเคยทำก่อนสร้างแบบจำลอง นี่คือผลลัพธ์ของฉัน: โมเดลปัวซอง Generalized linear mixed model fit by …

1
เราสามารถสรุปได้จากที่เป็นอิสระหรือไม่?
เราไม่สามารถดูตัวอย่างhttps://en.wikipedia.org/wiki/Subindependence สำหรับตัวอย่างที่น่าสนใจ แต่คำถามที่แท้จริงคือ: มีวิธีที่จะเสริมสร้างสภาพเพื่อให้ความเป็นอิสระดังต่อไปนี้? ตัวอย่างเช่นมีชุดของฟังก์ชั่นดังนั้นถ้าสำหรับทั้งหมดจึงเป็นอิสระต่อไปนี้? และชุดฟังก์ชั่นดังกล่าวต้องใหญ่ขนาดไหนไม่มีที่สิ้นสุด?g1,…,gng1,…,gng_1, \dotsc, g_nEgi(X)gj(Y)=Egi(X)Egj(Y)E⁡gi(X)gj(Y)=E⁡gi(X)E⁡gj(Y)\E g_i(X) g_j(Y) =\E g_i(X) \E g_j(Y)i,ji,ji,j และนอกจากนี้มีการอ้างอิงที่ดีที่ปฏิบัติต่อคำถามนี้หรือไม่?

1
เหตุใดช่วงเวลาที่น่าเชื่อถือของเบย์ในการถดถอยพหุนามนี้จึงเอนเอียงในขณะที่ช่วงความเชื่อมั่นนั้นถูกต้อง
พิจารณาพล็อตด้านล่างที่ฉันจำลองข้อมูลดังนี้ เราดูผลลัพธ์แบบไบนารีซึ่งความน่าจะเป็นที่แท้จริงที่จะเป็น 1 ถูกระบุด้วยเส้นสีดำ ความสัมพันธ์การทำงานระหว่าง covariateและคือพหุนามลำดับที่ 3 ที่มีลิงค์โลจิสติก (ดังนั้นจึงไม่ใช่เชิงเส้นในสองทาง)Yo b sYโอขsy_{obs}xxxp (Yo b s= 1 | x )พี(Yโอขs=1|x)p(y_{obs}=1 | x) เส้นสีเขียวคือการถดถอยโลจิสติก GLM โดยที่ถูกนำมาใช้เป็นพหุนามลำดับที่ 3 เส้นสีเขียวประคือช่วงความมั่นใจ 95% รอบการคาดการณ์โดยที่สัมประสิทธิ์การถดถอยที่พอดี ฉันใช้และสำหรับสิ่งนี้xxxp (Yo b s= 1 | x ,β^)พี(Yโอขs=1|x,β^)p(y_{obs}=1 | x, \hat{\beta})β^β^\hat{\beta}R glmpredict.glm บรรทัด pruple เป็นค่าเฉลี่ยของช่วงหลังที่น่าเชื่อถือ 95% สำหรับของแบบจำลองการถดถอยโลจิสติกแบบเบย์โดยใช้เครื่องแบบก่อนหน้า ฉันใช้แพคเกจพร้อมฟังก์ชั่นสำหรับสิ่งนี้ (การตั้งค่าให้ความรู้เบื้องต้นที่ไม่เหมือนกันมาก่อน)p (Yo b s= 1 …

2
หากฉันต้องการมีโอกาส 95% ที่วัตถุน้อยกว่า 1% ผิดฉันต้องมีตัวอย่างจำนวนเท่าใด
ฉันต้องแน่ใจว่าแผนผังเว็บไซต์ XML ของฉันมีขยะน้อยกว่า (ลิงก์เสีย) รายการ URL นั้นอยู่ในหลักแสนและแม้ว่าจะเป็นไปได้ที่จะทดสอบพวกเขาทั้งหมด 1 ต่อ 1 ฉันไม่ต้องการด้วยเหตุผลหลายประการ:1 %1%1\% 1 - Saved bandwidth 2 - Faster traffic for real clients 3 - Less noise in visitor statistics (because my test would count as a visit) 5 - I could go on... ดังนั้นฉันคิดว่าการสุ่มเซตย่อยเพียงพอแล้วปัญหาคือฉันไม่รู้ความน่าจะเป็น มีฟังก์ชั่นง่าย ๆ ที่ฉันสามารถใช้ได้หรือไม่? หากช่วยได้เราสามารถสมมติให้มีข้อมูลเบื้องต้นเกี่ยวกับความน่าจะเป็นของลิงก์ที่จะใช้งานไม่ได้ สมมติว่าข้ามการรันจะมีค่าสำหรับการเชื่อมโยงที่กำหนดใด …

1
Adaptive GAM ทำให้เรียบเป็น mgcv
หนังสือของ Simon Wood เกี่ยวกับ GAMs และแพ็คเกจ R ที่เกี่ยวข้อง mgcv นั้นมีทั้งรายละเอียดสูงและให้ข้อมูลเมื่อพูดถึงทฤษฎี GAM และการปรับโมเดลให้เหมาะสมกับข้อมูลจริงและจำลอง สำหรับสมูทต์ 1D นั้นไม่ต้องกังวลมากนักประหยัดสำหรับการตัดสินใจว่าจะใช้ฟังก์ชั่นแบบวัฏจักรเทียบกับแบบปรับตัวได้หรือไม่ซึ่งสามารถให้ผลการทำนายที่แตกต่างกันมากเมื่อเทียบกับลูกบาศก์, แผ่นบางและ P-spline กรณีที่ปรับตัวได้เกมหลายเกมมีการติดตั้งไปยังภูมิภาคต่างๆตามแนวโค้ง เท่าที่ฉันสามารถบอกได้ว่าฐานวงจรเป็นเรื่องธรรมดาในการสร้างแบบจำลองอนุกรมเวลาในขณะที่การปรับให้เรียบแบบปรับได้นั้นควรได้รับการพิจารณาเมื่อข้อมูลมีความหลากหลายมากเมื่อเทียบกับตัวแปรตอบสนอง แม้กระนั้นการปรับตัวให้ราบรื่นควรใช้ "เท่าที่จำเป็นและด้วยความระมัดระวัง" ฉันได้รับการตรวจสอบเกมมาระยะหนึ่งแล้วและเมื่อถามคำถามการวิจัยของฉันฉันพบว่าตัวเองเปลี่ยนใจได้มากเมื่อพูดถึงเรื่องการใช้งานที่ราบรื่น mgcv มี 17 smooths ที่แตกต่างกันให้เลือก (โดยการนับของฉัน) ฉันได้พิจารณาทั้งลูกบาศก์และ P-spline ให้เรียบ คำถามของฉันคือ : เมื่อใดควรพิจารณาความราบรื่นในการปรับตัวเมื่อพิจารณาจากคู่ที่ไม่ได้ปรับตัวถ้าเป้าหมายท้ายที่สุดคือการใช้ GAMs ที่พอดีเพื่อการคาดการณ์? สำหรับวัตถุประสงค์ของฉันฉันกำลังยึดติดกับเกณฑ์ความราบรื่น GCV เริ่มต้นแม้ว่ามันจะมีแนวโน้มที่จะไม่ราบรื่น วรรณกรรมกำลังเติบโตขึ้นใน GAMs เชิงนิเวศน์ประยุกต์ แต่ฉันยังไม่เจอการศึกษาที่ใช้การปรับตัวที่ราบรื่น คำแนะนำใด ๆ ที่ชื่นชม
9 r  mgcv 

2
GAMM ที่มีข้อมูลที่ไม่เป็นศูนย์
เป็นไปได้หรือไม่ที่จะพอดีกับ GAMM (โมเดลผสมแบบผสมทั่วไป) สำหรับข้อมูลที่ไม่พองในศูนย์ใน R? ถ้าไม่เป็นไปได้หรือไม่ที่จะพอดีกับ GAM (โมเดลเสริมทั่วไป) สำหรับข้อมูลที่ไม่มีการขยายศูนย์ด้วยการแจกแจงแบบทวินามลบหรือกึ่งปัวซองเสมือนใน R? (ฉันพบCOZIGAM :: zigamและmgcv: ziPสำหรับการแจกแจงปัวซอง)

2
ความสัมพันธ์ที่ตีพิมพ์ส่วนใหญ่ในสังคมศาสตร์ไม่น่าไว้วางใจและจะต้องทำอย่างไร [ปิด]
ปิด คำถามนี้เป็นคำถามความคิดเห็นตาม ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้สามารถตอบข้อเท็จจริงและการอ้างอิงได้โดยแก้ไขโพสต์นี้ ปิดให้บริการใน2 ปีที่ผ่านมา แม้จะมีความสำคัญ แต่ smacking ของ "gotcha" ความพยายาม -istic โดยบุคคลที่จะเปิดเผยการปฏิบัติของวารสารล่ามากขึ้นและภัยคุกคาม looms พื้นฐานในร่มเงาของการวิจัยด้านวิทยาศาสตร์สังคม ( แม้ว่าจะมีปัญหาอย่างแน่นอนหลายตัวที่นักวิจัยต้องอยู่ ) เพื่อให้ได้ตรงไปยังจุดที่เป็นไปตามมุมมองหนึ่งที่เราอาจจะไม่สามารถที่จะไว้วางใจค่าสัมประสิทธิ์สหสัมพันธ์ที่ได้มาจากกลุ่มตัวอย่างที่มีขนาดเล็กกว่า 250 หนึ่งจะยากที่จะหาการทดสอบมากขึ้นอาศัยการอนุมานทิศทางและความแข็งแกร่งของการเชื่อมโยงระหว่างกับการวัดในสังคมศาสตร์กว่าค่าสัมประสิทธิ์สหสัมพันธ์ที่เชื่อถือได้ อย่างไรก็ตามจะไม่ถูกกดทับอย่างหนักเพื่อค้นหารายงานที่มีการตรวจสอบโดยเพื่อนโดยอ้างว่ามีความสัมพันธ์ที่ดีระหว่างสองโครงสร้างตามค่าสัมประสิทธิ์สหสัมพันธ์ซึ่งคำนวณจากข้อมูลที่มีน้อยกว่า 250 ราย จากวิกฤตการจำลองแบบในปัจจุบันที่เผชิญกับสังคมศาสตร์ (ดูลิงค์ที่สองด้านบน) เราจะดูรายงานนี้อย่างไรเกี่ยวกับการรักษาเสถียรภาพของค่าสัมประสิทธิ์สหสัมพันธ์ในตัวอย่างขนาดใหญ่เท่านั้น (อย่างน้อยตามมาตรฐานสาขาสังคมศาสตร์) มันเป็นอีกรอยร้าวในกำแพงของการวิจัยทางสังคมศาสตร์ที่ผ่านการตรวจสอบโดยเพื่อนหรือมันเป็นเรื่องเล็กน้อยที่ได้รับการนำเสนอมากเกินไปหรือไม่? เนื่องจากไม่มีคำตอบที่ถูกต้องสำหรับคำถามนี้ฉันหวังว่าจะสร้างเธรดที่ทรัพยากรเกี่ยวกับคำถามนี้สามารถใช้ร่วมกันพิจารณาอย่างรอบคอบและถกเถียงกัน (แน่นอนและสุภาพด้วยความเคารพ)

2
กำลังตรวจสอบความแตกต่างระหว่างประชากร
บอกว่าเรามีตัวอย่างจากประชากรสองกลุ่ม A: และA Bสมมติว่าประชากรเหล่านี้ทำจากบุคคลและเราเลือกที่จะอธิบายบุคคลในแง่ของคุณสมบัติ คุณสมบัติบางอย่างเหล่านี้มีการจัดหมวดหมู่ (เช่นพวกเขาขับรถไปทำงานหรือไม่) และบางส่วนเป็นตัวเลข (เช่นความสูง) ขอเรียกคุณสมบัติเหล่านี้:X_n เรารวบรวมคุณลักษณะเหล่านี้หลายร้อยรายการ (เช่น n = 200) สมมติว่าใช้งานง่ายโดยไม่มีข้อผิดพลาดหรือเสียงรบกวนในทุกคนX1...XnX1...XnX_1 \ldots X_n เราตั้งสมมติฐานว่าประชากรสองคนนั้นแตกต่างกัน เป้าหมายของเราคือการตอบคำถามสองข้อต่อไปนี้: จริง ๆ แล้วพวกเขาแตกต่างกันอย่างมีนัยสำคัญ? อะไรคือความแตกต่างระหว่างพวกเขา? วิธีการเช่นต้นไม้ตัดสินใจ (เช่นป่าสุ่ม) และการวิเคราะห์การถดถอยเชิงเส้นสามารถช่วยได้ ตัวอย่างเช่นเราสามารถดูความสำคัญของคุณลักษณะในป่าสุ่มหรือสัมประสิทธิ์ที่เหมาะสมในการถดถอยเชิงเส้นเพื่อทำความเข้าใจกับสิ่งที่อาจแยกแยะกลุ่มเหล่านี้และสำรวจความสัมพันธ์ระหว่างคุณลักษณะและประชากร ก่อนที่ฉันจะไปตามเส้นทางนี้ฉันต้องการเข้าใจตัวเลือกของฉันที่นี่สิ่งที่ดีและทันสมัยกับการปฏิบัติที่ไม่ดี โปรดทราบว่าเป้าหมายของฉันไม่ใช่การคาดการณ์ต่อการทดสอบและการค้นหาความแตกต่างที่สำคัญระหว่างกลุ่ม อะไรคือหลักการในการแก้ไขปัญหานี้ ต่อไปนี้เป็นข้อกังวลของฉัน: วิธีการเช่นการวิเคราะห์การถดถอยเชิงเส้นอาจไม่ตอบอย่างเต็มที่ (2) ใช่ไหม? เช่นความพอดีสามารถช่วยค้นหาความแตกต่างบางอย่าง แต่ไม่ใช่ความแตกต่างที่สำคัญทั้งหมด ตัวอย่างเช่นความหลากหลายหลายระดับอาจทำให้เราไม่สามารถค้นหาคุณลักษณะทั้งหมดที่แตกต่างกันในแต่ละกลุ่ม (อย่างน้อยก็ในรูปแบบเดียว) ด้วยเหตุผลเดียวกันฉันคาดหวังว่า ANOVA จะไม่สามารถให้คำตอบเต็ม (2) ได้เช่นกัน ยังไม่ชัดเจนว่าวิธีการคาดการณ์จะตอบได้อย่างไร (1) ตัวอย่างเช่นฟังก์ชั่นการสูญเสียการจำแนกประเภท / การทำนายใดที่เราควรลด และเราจะทดสอบได้อย่างไรว่ากลุ่มแตกต่างกันอย่างมีนัยสำคัญเมื่อเรามีความเหมาะสมหรือไม่? ในที่สุดฉันกังวลว่าคำตอบที่ฉันได้รับ …

4
ทำไมความจริงที่ว่า 1 มัธยฐานต่ำกว่าค่ามัธยฐานอื่นหมายความว่าส่วนใหญ่ในกลุ่ม 1 ต่ำกว่าในกลุ่มที่ 2 มากที่สุด?
ฉันเชื่อว่ากล่องสี่เหลี่ยมด้านล่างอาจตีความได้ว่า "ผู้ชายส่วนใหญ่เร็วกว่าผู้หญิงส่วนใหญ่" (ในชุดข้อมูลนี้) ส่วนใหญ่เป็นเพราะเวลาเฉลี่ยของผู้ชายต่ำกว่าเวลาเฉลี่ยของผู้หญิง แต่หลักสูตร EdX สำหรับแบบทดสอบ R และสถิติบอกฉันว่าไม่ถูกต้อง โปรดช่วยฉันเข้าใจว่าทำไมปรีชาของฉันไม่ถูกต้อง นี่คือคำถาม: ลองพิจารณาตัวอย่างของนักสำเร็จจากนิวยอร์กซิตี้มาราธอนในปี 2002 ชุดข้อมูลนี้สามารถพบได้ในแพคเกจ UsingR โหลดไลบรารีจากนั้นโหลดชุดข้อมูล nym.2002 library(dplyr) data(nym.2002, package="UsingR") ใช้บ็อกซ์พล็อตและฮิสโทแกรมเพื่อเปรียบเทียบเวลาสิ้นสุดของชายและหญิง ข้อใดต่อไปนี้อธิบายความแตกต่างได้ดีที่สุด เพศชายและเพศหญิงมีการกระจายตัวเหมือนกัน ผู้ชายส่วนใหญ่เร็วกว่าผู้หญิงส่วนใหญ่ ตัวผู้และตัวเมียมีการแจกแจงเบ้คล้ายกันกับแบบก่อนหน้านี้, 20 นาทีเปลี่ยนไปทางซ้าย การแจกแจงทั้งสองแบบจะกระจายตามปกติโดยมีความแตกต่างในค่าเฉลี่ยประมาณ 30 นาที ที่นี่เวลา NYC มาราธอนสำหรับชายและหญิงเป็น quantiles, histograms และ boxplots: # Men's time quantile 0% 25% 50% 75% 100% 147.3333 226.1333 256.0167 290.6375 …

1
ทำไมในละตินกำลังสองแถวการรักษาและคอลัมน์จึงถูกกล่าวว่าเป็นมุมฉาก
ฉันเคยได้ยิน "orthogonal" ในพื้นที่ของรูปทรงเรขาคณิตเสมอ (โปรดทราบว่าฉันไม่ใช่เจ้าของภาษาอังกฤษ) ฉันไม่เข้าใจสิ่งต่อไปนี้สำหรับสี่เหลี่ยมละติน (คำพูดจากหนังสือข้อความ): ทุกการรักษา (ABCD) จะปรากฏขึ้นหนึ่งครั้งในแต่ละแถว ดังนั้นการรักษาและแถวเป็นมุมฉาก ... แถวและคอลัมน์เป็นมุมฉากกับการรักษา 12341ABคD2BคDA3คDAB4DABค12341ABCD2BCDA3CDAB4DABC\begin{matrix}\,&1&2&3&4\\1&A&B&C&D\\2&B&C&D&A\\3&C&D&A&B\\4&D&A&B&C\end{matrix} orthogonality มีความหมายอะไรที่นี่?

1
ค่า P และหลักการความน่าจะเป็น
คำถามนี้ขึ้นมาในชั้นเรียน: ถ้าเราใช้ P-ค่าในการประเมินสมมติฐานในการทดลองซึ่งเป็นส่วนหนึ่งของความน่าจะเป็นหลักการที่เราไม่เชื่อฟัง: พอเพียงหรือconditionality ? สัญชาตญาณของฉันจะบอกว่าพอเพียงตั้งแต่คำนวณ p-value อาศัยอยู่กับผลการสังเกตการทดลองและพอเพียงดูเหมือนว่าจะจัดการกับข้อสังเกตอื่น ๆ ที่อยู่ในการทดลองเดียวในขณะที่conditionalityดูเหมือนว่าจะจัดการมากขึ้นด้วยการทดลองที่แตกต่างกัน

2
โค้ง Kaplan-Meier ดูเหมือนจะพูดอย่างอื่นนอกเหนือจากการถดถอย Cox
ใน R ฉันทำการวิเคราะห์ข้อมูลการอยู่รอดของผู้ป่วยมะเร็ง ฉันได้อ่านสิ่งที่มีประโยชน์มากเกี่ยวกับการวิเคราะห์การอยู่รอดใน CrossValidated และที่อื่น ๆ และคิดว่าฉันเข้าใจวิธีตีความผลการถดถอยของ Cox อย่างไรก็ตามผลหนึ่งยังคงบักฉัน ... ฉันกำลังเปรียบเทียบความอยู่รอดกับเพศ เส้นโค้ง Kaplan-Meier เป็นที่โปรดปรานอย่างชัดเจนของผู้ป่วยเพศหญิง (ฉันได้ตรวจสอบหลายครั้งว่าตำนานที่ฉันเพิ่มเข้ามานั้นถูกต้องผู้ป่วยที่มีชีวิตรอดสูงสุด 4856 วันเป็นผู้หญิงจริง ๆ ): และการถดถอยของ Cox ก็จะกลับมา: Call: coxph(formula = survival ~ gender, data = Clinical) n= 348, number of events= 154 coef exp(coef) se(coef) z Pr(>|z|) gendermale -0.3707 0.6903 0.1758 -2.109 0.035 * …

1
การวิเคราะห์เชิงหน้าที่และพื้นที่ฮิลแบร์ตมีประโยชน์ในการเรียนรู้ของเครื่องหรือไม่ ถ้าเป็นเช่นนั้นได้อย่างไร
ฉันสงสัยว่าช่องว่างของฮิลแบร์ตและการวิเคราะห์การทำงานมีประโยชน์ต่อการเรียนรู้ของเครื่องอย่างไร ฉันคิดว่าการเรียนรู้ของเครื่องเป็นการผสมผสานระหว่างสถิติวิทยาการคอมพิวเตอร์และการเพิ่มประสิทธิภาพ การวิเคราะห์การทำงานมีความสัมพันธ์กับสิ่งนั้นอย่างไร

2
ย้อนกลับปัญหาวันเกิดที่มีการชนกันหลายครั้ง
สมมติว่าคุณมีปีเอเลี่ยนที่มีความยาวไม่ทราบเอ็นถ้าคุณมีตัวอย่างแบบสุ่มของเอเลี่ยนที่กล่าวมาและบางส่วนแบ่งวันเกิดคุณสามารถใช้ข้อมูลนี้เพื่อประเมินความยาวของปีได้หรือไม่? ตัวอย่างเช่นในตัวอย่าง 100 คุณอาจมีสองสาม (เช่นวันเกิดสองวันที่แต่ละแบ่งปันโดยมนุษย์ต่างดาวสามคน) และห้าคู่และแปดสิบสี่ตันเดี่ยว ในการประมาณ N ต่ำสุดที่แน่นอนคือ 91 และสูงสุดไม่ จำกัด แต่ฉันจะหาค่าที่คาดหวังที่เหมาะสมได้อย่างไร สมมติฐานรวมถึงสิ่งต่าง ๆ เช่น "วันเกิดทั้งหมดมีโอกาสเท่ากัน" ต่างจากคำถามอื่นที่ตอบไว้ที่นี่มีการชนกันในห้อง ปีใดที่ยาวนานพอจะมีความเป็นไปได้สูงที่จะไม่มีการชนกันของห้องมนุษย์ต่างดาว แต่ปีที่ยาวมาก ๆ จะมีอัตราต่อรองที่ต่ำเมื่อเกิดการชนใด ๆ และปีสั้น ๆ จะมีอัตราต่อรองที่ต่ำของการชนกันเล็กน้อยดังนั้นจึงจัดให้มีช่วง

2
การกระจายความน่าจะเป็นของผลรวมสุ่มของตัวแปรที่ไม่ใช่ของ iid Bernoulli คืออะไร
ฉันพยายามค้นหาการกระจายความน่าจะเป็นของผลรวมของตัวแปรสุ่มจำนวนหนึ่งที่ไม่ได้กระจายตัวแบบเดียวกัน นี่คือตัวอย่าง: จอห์นทำงานที่ศูนย์บริการลูกค้า เขารับสายที่มีปัญหาและพยายามแก้ปัญหา สิ่งที่เขาไม่สามารถแก้ไขได้เขาจะส่งต่อไปยังหัวหน้าของเขา สมมติว่าจำนวนการโทรที่เขาได้รับในหนึ่งวันเป็นไปตามการแจกแจงปัวซองด้วยค่าเฉลี่ยμμ\mu. ความยากลำบากของแต่ละปัญหาแตกต่างกันไปจากสิ่งที่เรียบง่าย (ซึ่งเขาสามารถจัดการได้อย่างแน่นอน) กับคำถามที่พิเศษมากซึ่งเขาไม่รู้วิธีแก้ปัญหา สมมติว่าความน่าจะเป็นที่เขาจะสามารถแก้ปัญหาi -th ตามการแจกแจงแบบเบต้าพร้อมพารามิเตอร์และและเป็นอิสระจากปัญหาก่อนหน้านี้ จำนวนการโทรติดต่อที่เขาแก้ไขในแต่ละวันคือเท่าไหร่?pipip_iαα\alphaββ\beta เป็นทางการมากขึ้นฉันมี: Y=I(N>0)∑Ni=0XiY=I(N>0)∑i=0NXiY = I(N > 0)\sum_{i = 0}^{N} X_i สำหรับ i=0,1,2,...,Ni=0,1,2,...,Ni = 0, 1, 2, ..., N ที่ ,และN∼Poisson(μ)N∼Poisson(μ)N \sim \mathrm{Poisson}(\mu)(Xi|pi)∼Bernoulli(pi)(Xi|pi)∼Bernoulli(pi)(X_i | p_i) \sim \mathrm{Bernoulli}(p_i)pi∼Beta(α,β)pi∼Beta(α,β)p_i \sim \mathrm{Beta}(\alpha, \beta) โปรดทราบว่าสำหรับตอนนี้ฉันยินดีที่จะสมมติว่า XiXiX_iเป็นอิสระ ฉันก็ยอมรับว่าพารามิเตอร์μ,αμ,α\mu, \alpha และ ββ\beta ไม่ส่งผลกระทบซึ่งกันและกันแม้ว่าในตัวอย่างจริงของเรื่องนี้เมื่อใด μμ\mu มีขนาดใหญ่พารามิเตอร์ …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.