สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
เมทริกซ์ความแปรปรวนร่วมซีโมติกคืออะไร?
มันเป็นความจริงไหมที่เมทริกซ์ความแปรปรวนร่วมซีโมติกเท่ากับเมทริกซ์ความแปรปรวนร่วมของการประมาณค่าพารามิเตอร์? ถ้าไม่มันคืออะไร อะไรคือความแตกต่างระหว่างเมทริกซ์ความแปรปรวนร่วมกับเมทริกซ์ความแปรปรวนร่วมแบบเชิงซ้อนในกรณีนั้น? ขอบคุณล่วงหน้า!

2
การสุ่มตัวอย่างจากมาร์คอฟคือ "ดีที่สุด" สำหรับการสุ่มตัวอย่าง Monte Carlo หรือไม่ มีรูปแบบทางเลือกอื่น ๆ หรือไม่?
มาร์คอฟเชนมอนติคาร์โลเป็นวิธีการที่อิงตามเชนมาร์คอฟที่ช่วยให้เราได้รับตัวอย่าง (ในการตั้งค่ามอนติคาร์โล) จากการแจกแจงที่ไม่ได้มาตรฐานซึ่งเราไม่สามารถวาดตัวอย่างได้โดยตรง คำถามของฉันคือเหตุผลที่ห่วงโซ่มาร์คอฟเป็น "สุดยอด" สำหรับการสุ่มตัวอย่าง Monte Carlo คำถามอื่นอาจมีวิธีอื่นเช่นโซ่มาร์คอฟที่สามารถใช้สำหรับการสุ่มตัวอย่าง Monte Carlo ได้หรือไม่? ฉันรู้ (อย่างน้อยก็จากการดูวรรณกรรม) ว่า MCMC มีรากฐานทางทฤษฎีที่ลึก (ในแง่ของเงื่อนไขเช่น (a) เป็นระยะ, ความสม่ำเสมอและรายละเอียดที่สมดุล) แต่สงสัยว่ามีรูปแบบ / วิธีการที่น่าจะเป็นสำหรับ Monte การสุ่มตัวอย่าง Carlo คล้ายกับโซ่มาร์คอฟ กรุณาแนะนำฉันถ้าฉันได้สับสนบางส่วนของคำถาม (หรือถ้ามันดูเหมือนสับสนโดยสิ้นเชิง)

1
ความพอเพียงหรือไม่เพียงพอ
พิจารณาตัวอย่างที่สุ่มที่มี IID ตัวแปรสุ่มที่(0,1) ตรวจสอบว่า เป็นสถิติที่เพียงพอสำหรับหรือไม่{X1,X2,X3}{X1,X2,X3}\{X_1,X_2,X_3\}XiXiX_iBernoulli(p)Bernoulli(p)Bernoulli(p)p∈(0,1)p∈(0,1)p\in(0,1)T(X)=X1+2X2+X3T(X)=X1+2X2+X3T(X)=X_1+2X_2+X_3ppp ประการแรกเราจะหาการกระจายสำหรับอย่างไร หรือมันควรจะถูกแยกย่อยเป็นแล้วสิ่งนี้จะติดตามหรือไม่ ฉันคิดว่าไม่ใช่เพราะทราบว่าตัวแปรทั้งหมดไม่ได้เป็นอิสระที่นี่(X1+2X2+X3)(X1+2X2+X3)(X_1+2X_2+X_3)X1+X2+X2+X3X1+X2+X2+X3X_1+X_2+X_2+X_3Bin(4,p)Bin(4,p)Bin(4,p) อีกทางหนึ่งถ้าฉันใช้เงื่อนไขการแยกตัวประกอบโดยเพียงพิจารณา PMF ร่วมของดังนั้นโดยที่(x)(X1,X2,X3)(X1,X2,X3)(X_1,X_2,X_3)f(X1,X2,X3)=px1+x2+x3(1−p)3−(x1+x2+x3)=[pt(x)(1−p)3−t(x)]p−x2(1−p)x2f(X1,X2,X3)=px1+x2+x3(1−p)3−(x1+x2+x3)=[pt(x)(1−p)3−t(x)]p−x2(1−p)x2f(X_1,X_2,X_3)=p^{x_1+x_2+x_3}(1-p)^{3-(x_1+x_2+x_3)}=[p^{t(x)}(1-p)^{3-t(x)}]p^{-x_2}(1-p)^{x_2}t(x)=x1+2x2+x3t(x)=x1+2x2+x3t(x)=x_1+2x_2+x_3 นี่แสดงว่าไม่เพียงพอTTT แต่ถ้าฉันต้องการทำตามคำจำกัดความและต้องการใช้เพื่อตรวจสอบว่าอัตราส่วนนี้เป็นอิสระจากหรือไม่ แล้วฉันจะต้องรู้ว่าการกระจายของกรัมแล้วอะไรคือการกระจายตัวของ ?f(X|p)g(T(X)|p)f(X|p)g(T(X)|p)\dfrac{f(X|p)}{g(T(X)|p)}pppgggT(X)=X1+2X2+X3T(X)=X1+2X2+X3T(X)=X_1+2X_2+X_3

2
ตัวกำหนดข้อมูลเมทริกซ์ฟิชเชอร์สำหรับแบบจำลองที่มีพารามิเตอร์มากเกินไป
พิจารณาตัวแปรสุ่ม Bernoulliพร้อมพารามิเตอร์ (ความน่าจะเป็นของความสำเร็จ) ฟังก์ชันโอกาสและข้อมูลฟิชเชอร์ ( เมทริกซ์คูณ ) คือ:X∈{0,1}X∈{0,1}X\in\{0,1\}θθ\theta1×11×11 \times 1 L1(θ;X)I1(θ)=p(X|θ)=θX(1−θ)1−X=detI1(θ)=1θ(1−θ)L1(θ;X)=p(X|θ)=θX(1−θ)1−XI1(θ)=detI1(θ)=1θ(1−θ) \begin{align} \mathcal{L}_1(\theta;X) &= p(\left.X\right|\theta) = \theta^{X}(1-\theta)^{1-X} \\ \mathcal{I}_1(\theta) &= \det \mathcal{I}_1(\theta) = \frac{1}{\theta(1-\theta)} \end{align} ตอนนี้พิจารณาเป็น "มากกว่าแปร" รุ่นที่มีสองพารามิเตอร์: ความน่าจะเป็นของความสำเร็จθ1θ1\theta_1และความน่าจะเป็นของความล้มเหลว\θ0θ0\theta_0(โปรดทราบว่าθ1+θ0=1θ1+θ0=1\theta_1+\theta_0=1และข้อ จำกัด นี้บอกเป็นนัยว่าหนึ่งในพารามิเตอร์นั้นซ้ำซ้อน) ในกรณีนี้ฟังก์ชันโอกาสและเมทริกซ์ข้อมูลฟิชเชอร์ (FIM) คือ: L2(θ1,θ0;X)I2(θ1,θ0)detI2(θ)=p(X|θ1,θ0)=θX1θ1−X0=(1θ1001θ0)=1θ1θ0=1θ1(1−θ1)L2(θ1,θ0;X)=p(X|θ1,θ0)=θ1Xθ01−XI2(θ1,θ0)=(1θ1001θ0)detI2(θ)=1θ1θ0=1θ1(1−θ1) \begin{align} \mathcal{L}_2(\theta_1,\theta_0;X) &= p(\left.X\right|\theta_1,\theta_0) = \theta_1^{X}\theta_0^{1-X} \\ \mathcal{I}_2(\theta_1,\theta_0) &= \left( \begin{matrix} \frac{1}{\theta_1} & 0 \\ …

1
แบบจำลองเชิงเส้นทั่วไปเทียบกับแบบจำลอง Timseries สำหรับการพยากรณ์
อะไรคือความแตกต่างในการใช้แบบจำลองเชิงเส้นทั่วไปเช่นการกำหนดความเกี่ยวข้องอัตโนมัติ (ARD) และการถดถอยแบบริดจ์กับแบบจำลองอนุกรมเวลาเช่น Box-Jenkins (ARIMA) หรือการทำให้เรียบแบบเอกซ์โพเนนเชียลสำหรับการคาดการณ์ มีกฎของหัวแม่มือในการใช้ GLM และเมื่อใช้ Time Series หรือไม่

1
คือ
ในการทดสอบสมมติฐานทางสถิติสมมติฐานว่างมักจะอยู่ในรูปของ (อย่างน้อยในหนังสือที่ฉันอ่าน): หรือ H0H0H_0H0:H0:θ =θ0θ ≤θ0H0:θ=θ0H0:θ≤θ0 \begin{align*} H_0:&\theta=\theta_0\\ H_0:&\theta\le\theta_0 \end{align*} H0:θ1≤ θ ≤θ2H0:θ1≤θ≤θ2 H_0:\theta_1\le\theta\le\theta_2 เป็นเพียงแบบแผนที่ชุดในถูกปิดหรือไม่ หรือมีเหตุผลอื่นใดอีกบ้าง?H0H0H_0

3
มีความเทียบเท่าปกติกับความเบ้และ Kurtosis?
อะไรจะเทียบเท่าปกติกับความเบ้ที่จะมีหน่วยเดียวกับข้อมูล? ในทำนองเดียวกันสิ่งที่จะเทียบเท่าปกติ Kurtosis? จะเป็นการดีที่ฟังก์ชั่นเหล่านี้ควรเป็นเชิงเส้นที่มีความเคารพต่อข้อมูลที่มีความหมายว่าถ้าสังเกตทั้งหมดจะถูกคูณด้วยปัจจัยที่ส่งผลปกติเบ้และความโด่งจะคูณด้วยปัจจัยเดียวกันn nประโยชน์ของการมีการเทียบเท่าปกติดังกล่าวจะสามารถซ้อนทับพวกเขาด้านบนของพล็อตกล่องและมัสสุมาตรฐาน

2
ฉันจะสร้างแบบจำลองการโต้ตอบระหว่างตัวแปรอธิบายได้อย่างไรเมื่อหนึ่งในนั้นอาจมีสมการกำลังสองและลูกบาศก์?
ฉันหวังเป็นอย่างยิ่งว่าฉันจะได้ใช้คำถามนี้ในลักษณะที่สามารถตอบได้อย่างชัดเจน - หากไม่ได้โปรดแจ้งให้เราทราบและฉันจะลองอีกครั้ง! ฉันควรเดาด้วยว่าฉันจะใช้ R สำหรับการวิเคราะห์เหล่านี้ ฉันมีหลายมาตรการplant performance (Ys)ที่ฉันสงสัยว่าได้รับอิทธิพลจากสี่รักษาผม imposed-- และflower thinning (X1), fertilization (X2), leaf clipping (X3) biased flower thinning (X4)สำหรับ Ys ที่เป็นไปได้ทั้งหมด N มีอย่างน้อย 242 ดังนั้นขนาดตัวอย่างของฉันจึงใหญ่ แผนการทั้งหมดถูกทำให้ผอมบางหรือไม่ แต่แต่ละแปลงก็ต้องมีหนึ่ง (และเพียงหนึ่ง) ของการรักษาอีกสาม (หรือไม่ - มีแผนการควบคุมด้วย) แนวคิดของการออกแบบนี้คือการทดสอบว่าอีกสามวิธีการรักษามีความสามารถในการ "กำบัง" หรือ "การเสริมสร้าง" ผลของการทำให้ผอมบาง ดังนั้นด้วยการออกแบบการรักษาทั้งสามหลัง (X2-X4) จึงไม่สามารถโต้ตอบกันได้เพราะพวกเขาไม่ได้ถูกข้าม แต่พวกเขาแต่ละคนสามารถโต้ตอบกับการทำให้ผอมบางของดอกไม้ - และพวกเขาอาจทำ สมมติฐานที่ชัดเจนของฉันคือ 1) การทำให้ผอมบางดอกจะมีนัยสำคัญและ 2) …

1
อ้างอิงสำหรับเรื่องราวเกี่ยวกับการสุ่มตัวอย่างจากสมุดโทรศัพท์
ฉันได้พูดคุยกับใครบางคนในวันนี้เกี่ยวกับการสุ่มตัวอย่างและจดจำเรื่องราวเกี่ยวกับนักสถิติบางคนที่ได้รับการยอมรับอย่างดีแนะนำการสุ่มตัวอย่างอย่างเป็นระบบจากสมุดโทรศัพท์ในกรณีทางกฎหมายโดยเฉพาะ ฉันจำได้ว่าเรื่องราวจะเป็นเหมือนผู้พิพากษาในศาลที่พูดอะไรบางอย่างกับเขาเช่น "ฉันไม่รู้อะไรมากเกี่ยวกับสถิติ แต่ฉันรู้ว่าการสุ่มตัวอย่างทุกชื่อที่ 100 ไม่ถูกต้อง" แล้วเขาก็ต้องอธิบายให้ผู้พิพากษาทราบว่า จริง ๆ แล้วเขาแนะนำว่า มีใครรู้บ้างว่าเรื่องราวนั้นมาจากไหนหรือถ้าฉันจำได้ถูกต้อง? ฉันต้องการฟื้นฟูความทรงจำของบริบท รู้สึกเหมือนสิ่งที่ฉันอ่านในบันทึกความทรงจำของ Mosteller แต่ตรวจสอบแล้วและไม่พบที่นั่น นอกจากนี้บางคนในแผนกของเรากล่าวว่าฟังดูคุ้นเคยและคิดว่ามันอาจเป็น Cochran และบางคนจำจอร์จคอบบ์เล่าเรื่องคล้ายกัน แต่ก็ไม่ได้ช่วยในการค้นหาของฉัน

2
มีวิธีที่ฉลาด / ชาญฉลาดในการทำความเข้าใจตัวตนถดถอยเชิงเส้นนี้สำหรับหลาย ๆ
ในการถดถอยเชิงเส้นฉันได้พบผลลัพธ์ที่น่ายินดีว่าถ้าเราพอดีกับแบบจำลอง E[Y]=β1X1+β2X2+c,E[Y]=β1X1+β2X2+c,E[Y] = \beta_1 X_1 + \beta_2 X_2 + c, แล้วถ้าเราสร้างมาตรฐานและศูนย์ ,และข้อมูลYYYX1X1X_1X2X2X_2 R2=Cor(Y,X1)β1+Cor(Y,X2)β2.R2=Cor(Y,X1)β1+Cor(Y,X2)β2.R^2 = \mathrm{Cor}(Y,X_1) \beta_1 + \mathrm{Cor}(Y, X_2) \beta_2. สิ่งนี้ทำให้ฉันรู้สึกเหมือนเป็นตัวแปร 2 รุ่นของสำหรับการถดถอยซึ่งเป็นที่ชื่นชอบR2=Cor(Y,X)2R2=Cor(Y,X)2R^2 = \mathrm{Cor}(Y,X)^2y=mx+cy=mx+cy=mx+c แต่ข้อพิสูจน์เดียวที่ฉันรู้ไม่ได้อยู่ในเชิงสร้างสรรค์หรือลึกซึ้ง (ดูด้านล่าง) และยังมองมันรู้สึกว่าควรเข้าใจได้ง่าย ตัวอย่างความคิด: และพารามิเตอร์ให้เรา 'สัดส่วนของและβ1β1\beta_1β2β2\beta_2X1X1X_1X2X2X_2ในYYYและดังนั้นเราจึงได้สัดส่วนตามความสัมพันธ์ของพวกเขา ... ββ\betas มีความสัมพันธ์บางส่วน R2R2R^2 คือความสัมพันธ์หลายกำลังสอง ... ความสัมพันธ์คูณด้วยความสัมพันธ์บางส่วน ... ถ้าเราปรับมุมฉากก่อนจากนั้น ββ\betaจะเป็น Cov/VarCov/Var\mathrm{Cov}/\mathrm{Var}... ผลลัพธ์นี้มีความหมายทางเรขาคณิตหรือไม่? ดูเหมือนว่าไม่มีหัวข้อใดที่จะนำพาฉันไปได้ทุกที่ ทุกคนสามารถให้คำอธิบายที่ชัดเจนเกี่ยวกับวิธีการเข้าใจผลลัพธ์นี้ หลักฐานไม่น่าพอใจ R2=SSregSSTot=SSregN=⟨(β1X1+β2X2)2⟩=⟨β21X21⟩+⟨β22X22⟩+2⟨β1β2X1X2⟩R2=SSregSSTot=SSregN=⟨(β1X1+β2X2)2⟩=⟨β12X12⟩+⟨β22X22⟩+2⟨β1β2X1X2⟩\begin{equation} R^2 = \frac{SS_{reg}}{SS_{Tot}} …

3
การตรวจจับความผิดปกติของอนุกรมเวลาด้วย Python
ฉันต้องใช้การตรวจจับความผิดปกติกับชุดข้อมูลอนุกรมเวลาหลายชุด ฉันไม่เคยทำแบบนี้มาก่อนและหวังว่าจะได้รับคำแนะนำ ฉันพอใจกับ python ดังนั้นฉันจึงชอบที่จะใช้งานโซลูชันนี้ (ส่วนใหญ่โค้ดของฉันคือ python สำหรับส่วนอื่น ๆ ของงานของฉัน) คำอธิบายของข้อมูล: เป็นข้อมูลอนุกรมเวลารายเดือนที่เพิ่งเริ่มเก็บในช่วง 2 ปีที่ผ่านมาหรือมากกว่านั้น (เช่นช่วงเวลา 24-36 เท่านั้น) โดยพื้นฐานแล้วมีตัวชี้วัดหลายตัวที่ถูกตรวจสอบเป็นรายเดือนสำหรับลูกค้าหลายราย time_period client metric score 01-2013 client1 metric1 100 02-2013 client1 metric1 119 01-2013 client2 metric1 50 02-2013 client2 metric2 500 ... นี่คือสิ่งที่ฉันกำลังคิด: ดึงข้อมูลลงใน dataframe (pandas) จากนั้นคำนวณค่าเฉลี่ย 6 เดือนสำหรับลูกค้า / คู่เมตริกแต่ละราย หากค่าของช่วงเวลาปัจจุบันเกินขีด จำกัด …

1
จากการระบุถึงการประมาณ
ฉันกำลังอ่านชิ้นส่วนของ Pearl (Pearl, 2009, 2nd edition) เกี่ยวกับสาเหตุและการดิ้นรนเพื่อสร้างการเชื่อมโยงระหว่างการระบุแบบไม่มีพารามิเตอร์ของแบบจำลองและการประมาณค่าจริง น่าเสียดายที่ Pearl ตัวเองเงียบมากในหัวข้อนี้ เพื่อให้ตัวอย่างผมมีรูปแบบที่เรียบง่ายในใจมีเส้นทางสาเหตุ,และปัจจัยรบกวนที่มีผลต่อตัวแปรทั้งหมด ,และY นอกจากนี้และเกี่ยวข้องกันโดยไม่มีใครสังเกตอิทธิพล,Y ตามกฎของการคำนวณแคลคูลัสตอนนี้ฉันรู้ว่าการแจกแจงความน่าจะเป็นหลังการแทรกแซง (ไม่ต่อเนื่อง) มอบให้โดย:x→z→yx→z→yx \rightarrow z \rightarrow yw→xw→xw \rightarrow xw→zw→zw \rightarrow zw→yw→yw \rightarrow yxxxyyyx←→yx←→yx \leftarrow \rightarrow y P(y∣do(x))=∑w,z[P(z∣w,x)P(w)∑x[P(y∣w,x,z)P(x∣w)]].P(y∣do(x))=∑w,z[P(z∣w,x)P(w)∑x[P(y∣w,x,z)P(x∣w)]]. P(y \mid do(x)) = \sum_{w,z}\bigl[P(z\mid w,x)P(w)\sum_{x}\bigl[P(y\mid w,x,z)P(x\mid w)\bigr]\bigr]. ฉันรู้ว่าฉันสามารถประเมินปริมาณนี้ได้อย่างไร (ไม่ใช่แบบพารามิเตอร์หรือโดยการแนะนำสมมติฐานแบบพารามิเตอร์) โดยเฉพาะอย่างยิ่งในกรณีที่wwwเป็นชุดของตัวแปรที่รบกวนหลายตัวและปริมาณของดอกเบี้ยจะต่อเนื่อง เพื่อประเมินการกระจายการแทรกแซงล่วงหน้าของข้อมูลที่ดูเหมือนจะเป็นไปไม่ได้ในกรณีนี้ มีใครรู้บ้างว่ามีแอปพลิเคชันของวิธีการของ Pearl ที่จัดการกับปัญหาเหล่านี้หรือไม่? ฉันจะมีความสุขมากสำหรับตัวชี้

2
แปลงการแจกแจงปัวซองเป็นการแจกแจงแบบปกติ
ฉันมีพื้นฐานด้านวิทยาศาสตร์คอมพิวเตอร์เป็นหลัก แต่ตอนนี้ฉันพยายามสอนตัวเองเกี่ยวกับสถิติพื้นฐาน ฉันมีข้อมูลบางอย่างที่ฉันคิดว่ามีการแจกแจงแบบปัวซอง ฉันมีสองคำถาม: นี่คือการแจกแจงปัวซองหรือไม่ ประการที่สองเป็นไปได้ไหมที่จะแปลงเป็นการแจกแจงแบบปกติ ความช่วยเหลือใด ๆ ที่จะได้รับการชื่นชม ขอบคุณมาก

2
วิธีการตีความแปลง ACF และ PACF
ฉันแค่ต้องการตรวจสอบว่าฉันกำลังตีความแปลง ACF และ PACF อย่างถูกต้อง: ข้อมูลสอดคล้องกับข้อผิดพลาดที่เกิดขึ้นระหว่างจุดข้อมูลจริงและการประมาณการที่สร้างขึ้นโดยใช้แบบจำลอง AR (1) ฉันดูคำตอบที่นี่: ประมาณค่าสัมประสิทธิ์ ARMA ผ่านการตรวจ ACF และ PACF หลังจากอ่านแล้วดูเหมือนว่าข้อผิดพลาดนั้นไม่ได้มีความสัมพันธ์กันโดยอัตโนมัต แต่ฉันแค่อยากจะแน่ใจว่าข้อกังวลของฉันคือ: 1. ) ข้อผิดพลาดแรกอยู่ที่ขอบเขต (เมื่อเป็นกรณีนี้ฉันควรยอมรับหรือปฏิเสธว่ามีความสัมพันธ์กันโดยอัตโนมัติที่ล่าช้า 1) 2. ) เส้นแสดงช่วงความมั่นใจ 95% และกำหนดว่ามีความล่าช้า 116 ครั้งที่ฉันคาดหวังไม่เกิน (0.05 * 116 = 5.8 ซึ่งฉันปัดขึ้นเป็น 6) 6 ความล่าช้าจะเกินขอบเขต สำหรับ ACF เป็นกรณีนี้ แต่สำหรับ PACF มีข้อยกเว้นประมาณ 10 ข้อ หากคุณรวมสิ่งเหล่านี้ไว้ที่ชายแดนมันจะเป็น 14 หรือไม่? สิ่งนี้ยังบ่งบอกว่าไม่มีความสัมพันธ์อัตโนมัติหรือไม่ …

1
ตัวประมาณที่ไม่เอนเอียงพร้อมความแปรปรวนขั้นต่ำสำหรับ
ให้เป็นตัวอย่าง feom สุ่มกระจายสำหรับ&lt;1 กล่าวคือX1,...,XnX1,...,Xn X_1, ...,X_nGeometric(θ)Geometric(θ)Geometric(\theta)0&lt;θ&lt;10&lt;θ&lt;10<\theta<1 pθ(x)=θ(1−θ)x−1I{1,2,...}(x)pθ(x)=θ(1−θ)x−1I{1,2,...}(x)p_{\theta}(x)=\theta(1-\theta)^{x-1} I_{\{1,2,...\}}(x) ค้นหาตัวประมาณค่าที่เป็นกลางพร้อมค่าความแปรปรวนขั้นต่ำสำหรับg(θ)=1θg(θ)=1θg(\theta)=\frac{1}{\theta} ความพยายามของฉัน: ตั้งแต่การกระจายทางเรขาคณิตจากครอบครัวชี้แจงสถิติเสร็จสมบูรณ์และเพียงพอสำหรับ\นอกจากนี้หากเป็นตัวประมาณสำหรับมันจะไม่เอนเอียง ดังนั้นโดยทฤษฎีบท Rao-Blackwell และทฤษฎีบท Lehmann-Schefféทฤษฎีบท เป็นตัวประมาณที่เรากำลังมองหา∑Xi∑Xi\sum X_i θθ \thetaT(X)=X1T(X)=X1T(X)=X_1g(θ)g(θ)g(\theta)W(X)=E[X1|∑Xi]W(X)=E[X1|∑Xi]W(X) = E[X_1|\sum X_i] เรามีดังต่อไปนี้: W(X)=∑ti=1iP(X1=i|∑Xi=t)=∑ti=1iP(∑i≥2Xi=t−i)P(X1=i)P(∑i≥1Xi=t)W(X)=∑i=1tiP(X1=i|∑Xi=t)=∑i=1tiP(∑i≥2Xi=t−i)P(X1=i)P(∑i≥1Xi=t)W(X) = \sum_{i=1}^t i\, P(X_1=i|\sum X_i =t) = \sum_{i=1}^t i\, \frac{P(\sum_{i \geq 2} X_i =t-i)P(X_1=i)}{P(\sum_{i \geq 1}X_i =t)} เนื่องจากตัวแปรเป็น iid เรขาคณิตการกระจายผลรวมนั้นมีทั้งแบบทวินามลบ แต่ฉันกำลังมีปัญหาในการประมาณค่าสัมประสิทธิ์ทวินามและให้คำตอบสุดท้ายด้วยแบบฟอร์มที่ดีกว่าถ้าเป็นไปได้ฉันจะดีใจถ้าฉันได้รับความช่วยเหลือ ขอบคุณ! แก้ไข:ฉันไม่คิดว่าพวกคุณเข้าใจความสงสัยของฉัน:ฉันคิดว่าฉันทำทุกขั้นตอนที่ถูกต้องอาจจะลืมฟังก์ชั่นตัวบ่งชี้บางอย่างเท่านั้น นี่คือสิ่งที่ฉันทำ: ...=∑i=1ti(t−i−1n−2)θn−i(1−θ)t−i−n+1θ(1−θ)i−1(t−1n−1)θn(1−θ)t−n=∑i=1ti(t−i−1n−2)(t−1n−1)...=∑i=1ti(t−i−1n−2)θn−i(1−θ)t−i−n+1θ(1−θ)i−1(t−1n−1)θn(1−θ)t−n=∑i=1ti(t−i−1n−2)(t−1n−1)...=\sum_{i=1}^ti\frac{\binom{t-i-1}{n-2}\theta^{n-i}(1-\theta)^{t-i-n+1} \theta(1-\theta)^{i-1}}{\binom{t-1}{n-1}\theta^n(1-\theta)^{t-n}}=\sum_{i=1}^t …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.