สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
การสุ่มตัวอย่างกิ๊บส์สำหรับโมเดลไอซิง
คำถามการบ้าน: พิจารณาโมเดลไอซิ่ง 1-d ให้x_d) คือ -1 หรือ +1x=(x1,...xd)x=(x1,...xd)x = (x_1,...x_d)xixix_i π(x)∝e∑39i=1xixi+1π(x)∝e∑i=139xixi+1\pi(x) \propto e^{\sum_{i=1}^{39}x_ix_{i+1}} ออกแบบกิ๊บส์เป็นตัวอย่างขั้นตอนวิธีการในการสร้างตัวอย่างประมาณจากการกระจายเป้าหมาย(x)π(x)π(x)\pi(x) ความพยายามของฉัน: สุ่มเลือกค่า (ทั้ง -1 หรือ 1) เพื่อเติมเต็มเวกเตอร์{40}) ดังนั้นบางที1) ดังนั้นนี่คือ 0x=(x1,...x40)x=(x1,...x40)x = (x_1,...x_{40})x=(−1,−1,1,1,1,−1,1,1,...,1)x=(−1,−1,1,1,1,−1,1,1,...,1)x = (-1, -1, 1, 1, 1, -1, 1, 1,...,1)x0x0x^0 ดังนั้นตอนนี้เราต้องดำเนินการต่อและทำซ้ำครั้งแรก เราต้องวาด 40 x ที่แตกต่างกันสำหรับแยกกัน ดังนั้น...x1x1x^1 วาดจากx11x11x_1^1π(x1|x02,...,x040)π(x1|x20,...,x400)\pi(x_1 | x_2^0,...,x_{40}^0) วาดจากx12x21x_2^1π(x2|x11,x03,...,x040)π(x2|x11,x30,...,x400)\pi(x_2 | x_1^1, x_3^0,...,x_{40}^0) วาดจากx13x31x_3^1π(x3|x11,x12,x04,...,x040)π(x3|x11,x21,x40,...,x400)\pi(x_3 | …

1
ทดสอบว่าสัมประสิทธิ์การถดถอยสองตัวนั้นแตกต่างกันอย่างมีนัยสำคัญ (ในอุดมคติ R)
หากนี่เป็นคำถามที่ซ้ำกันโปรดชี้ไปที่วิธีที่ถูกต้อง แต่คำถามที่คล้ายกันที่ฉันพบที่นี่ยังไม่ได้คล้ายกันเพียงพอ สมมติว่าฉันประเมินโมเดลY= α + βX+ uY=α+βX+ยูY=\alpha + \beta X + u และพบว่า 0 แต่มันกลับกลายเป็นว่าX = X 1 + X 2และฉันสงสัยว่า∂ Y / ∂ X 1 ≠ ∂ Y / ∂ X 2และโดยเฉพาะอย่างยิ่งที่∂ Y / ∂ X 1 > ∂ Y / ∂ X 2 ดังนั้นฉันจึงประเมินโมเดลY = α + β …

1
ตัวแปรเครื่องมือจัดการกับอคติการเลือกอย่างไร
ฉันสงสัยว่าตัวแปรเครื่องมือจัดการอคติการเลือกอย่างไรในการถดถอย นี่คือตัวอย่างที่ฉันกำลังพูดถึง: ในเศรษฐมิติที่ไม่เป็นอันตรายส่วนใหญ่ผู้เขียนอภิปรายเกี่ยวกับการถดถอย IV ที่เกี่ยวข้องกับการรับราชการทหารและรายได้ในภายหลัง คำถามคือ "การรับราชการในกองทัพเพิ่มหรือลดรายได้ในอนาคตหรือไม่" พวกเขาสำรวจคำถามนี้ในบริบทของสงครามเวียดนาม ฉันเข้าใจว่าการรับราชการทหารไม่สามารถสุ่มมอบหมายได้และนี่เป็นปัญหาสำหรับการอนุมานเชิงสาเหตุ ในการแก้ไขปัญหานี้ผู้วิจัยใช้ร่างเกณฑ์ (เช่นใน "หมายเลขร่างของคุณเรียกว่า") เป็นเครื่องมือสำหรับการรับราชการทหารที่แท้จริง ที่ทำให้ความรู้สึก: ร่างเวียดนามสุ่มมอบหมายคนอเมริกันหนุ่มทหาร (ในทางทฤษฎี - ไม่ว่านาวิกเสิร์ฟจริงสัมผัสกับคำถามของฉัน) เงื่อนไข IV อื่น ๆ ของเราดูแข็งแกร่ง: การมีสิทธิ์เข้าร่วมร่างและการเกณฑ์ทหารที่แท้จริงนั้นมีความสัมพันธ์กันในทางบวก นี่คือคำถามของฉัน ดูเหมือนว่าคุณจะได้รับอคติในการเลือกตนเอง: บางทีเด็ก ๆ ที่ร่ำรวยขึ้นอาจออกจากการรับใช้ในเวียดนามแม้ว่าจะมีการเรียกหมายเลขร่าง (ถ้าไม่ใช่อย่างนั้นจริง ๆ ลองทำเพื่อคำถามของฉัน) หากการเลือกตนเองนี้สร้างอคติเชิงระบบภายในตัวอย่างของเราตัวแปรเครื่องมือของเราจะจัดการอคตินี้อย่างไร เราต้อง จำกัด ขอบเขตการอนุมานของเราให้แคบลงหรือไม่ "ประเภทของคนที่ไม่สามารถหลบหนีจากร่างได้" หรือ IV ก็กอบกู้บางส่วนของการอนุมานของเรา? หากใครสามารถอธิบายวิธีการทำงานนี้ฉันจะขอบคุณมาก

1
ค่าเฉลี่ยและความแปรปรวนมีอยู่เสมอสำหรับการแจกแจงแบบครอบครัวชี้แจงหรือไม่?
สมมติว่าตัวแปรสเกลาร์แบบสุ่มเป็นของตระกูลเอ็กซ์โพเนนเชียลที่มีพารามิเตอร์แบบเวกเตอร์พร้อม pdfXXX fX(x|θ)=h(x)exp(∑i=1sηi(θ)Ti(x)−A(θ))fX(x|θ)=h(x)exp⁡(∑i=1sηi(θ)Ti(x)−A(θ)) f_X(x|\boldsymbol \theta) = h(x) \exp\left(\sum_{i=1}^s \eta_i({\boldsymbol \theta}) T_i(x) - A({\boldsymbol \theta}) \right) โดยที่θ=(θ1,θ2,⋯,θs)Tθ=(θ1,θ2,⋯,θs)T{\boldsymbol \theta} = \left(\theta_1, \theta_2, \cdots, \theta_s \right )^Tเป็นเวกเตอร์พารามิเตอร์และT(x)=(T1(x),T2(x),⋯,Ts(x))TT(x)=(T1(x),T2(x),⋯,Ts(x))T\mathbf{T}(x)= \left(T_1(x), T_2(x), \cdots,T_s(x) \right)^Tเป็นสถิติที่เพียงพอร่วม สามารถแสดงให้เห็นว่าค่าเฉลี่ยและความแปรปรวนสำหรับแต่ละTi(x)Ti(x)T_i(x)มีอยู่ อย่างไรก็ตามค่าเฉลี่ยและความแปรปรวนสำหรับXXX (เช่นE(X)E(X)E(X)และVar(X)Var(X)Var(X) ) มีอยู่เสมอเช่นกัน? ถ้าไม่มีมีตัวอย่างของการแจกแจงแบบครอบครัวแทนของรูปแบบนี้ซึ่งไม่มีค่าเฉลี่ยและตัวแปรอยู่หรือไม่? ขอบคุณ.

2
ตรวจสอบความถูกต้องของการทดสอบเว็บ / b ด้วยการเรียกใช้การทดสอบอีกครั้ง - สิ่งนี้ถูกต้องหรือไม่
การสัมมนาทางเว็บในวันอื่น ๆ โดย บริษัท ทดสอบ a / b มีผู้อยู่อาศัย "นักวิทยาศาสตร์ข้อมูล" ของพวกเขาอธิบายว่าคุณควรตรวจสอบความถูกต้องของผลลัพธ์ของคุณโดยทำการทดสอบอีกครั้ง สถานที่ตั้งคือถ้าคุณเลือกความมั่นใจ 95% มีโอกาส 5% (1/20) ของการบวกผิด หากคุณเรียกใช้การทดสอบอีกครั้งด้วยข้อ จำกัด เดียวกันตอนนี้มี 1/400 (ฉันสมมติว่าพวกเขาระบุว่าเป็น 0.05 ^ 2 = 1/400) นี่เป็นคำสั่งที่ถูกต้องหรือไม่? (กล่าวคือ "รันสองครั้งความสำคัญทางสถิติทั้งสองชนะ = ความน่าจะเป็นที่ผิดพลาด 1/400 บวก")? เป็นวิธีที่ดีกว่าหรือไม่ที่จะเพิ่มระดับนัยสำคัญของคุณ? จากมุมมองทางธุรกิจสิ่งที่ฉันกังวลคือการเรียกใช้การทดสอบอีกครั้งคุณกำลังเปิดเผยผู้ใช้มากขึ้นไปยังหน้าเว็บที่ด้อยกว่า (การรักษา) และทำให้ยอดขายที่อาจเกิดขึ้นลดลง

3
สามารถใช้เทคนิคการทำให้เป็นมาตรฐานในแบบจำลองเอฟเฟกต์แบบสุ่มได้หรือไม่?
โดยเทคนิคการทำให้เป็นปกติฉันหมายถึง lasso, ridge regression, elastic net และอื่น ๆ พิจารณารูปแบบการคาดการณ์เกี่ยวกับข้อมูลการดูแลสุขภาพที่มีข้อมูลด้านประชากรศาสตร์และข้อมูลการวินิจฉัยที่คาดการณ์ระยะเวลาการเข้าพักผู้ป่วยใน สำหรับบุคคลบางคนมีการสังเกต LOS หลายครั้ง (กล่าวคือมากกว่าหนึ่งตอนของ IP) ในช่วงระยะเวลาพื้นฐานที่สัมพันธ์กัน มันสมเหตุสมผลหรือไม่ที่จะสร้างตัวอย่างเช่นโมเดลการทำนายด้วยเน็ตยืดหยุ่นซึ่งมีคำศัพท์สุ่มดักจับผลกระทบสำหรับแต่ละคน?

3
ปรับโมเดลหลายระดับให้เหมาะสมกับข้อมูลการสำรวจที่ซับซ้อนใน R
ฉันกำลังมองหาคำแนะนำเกี่ยวกับวิธีการวิเคราะห์ข้อมูลการสำรวจที่ซับซ้อนด้วยโมเดลหลายระดับในอาร์ฉันใช้surveyแพคเกจน้ำหนักเพื่อความน่าจะเป็นที่ไม่เท่ากันของการเลือกในแบบจำลองระดับเดียว แต่แพ็คเกจนี้ไม่มีฟังก์ชันสำหรับการสร้างแบบหลายระดับ lme4แพคเกจเป็นที่ดีสำหรับการสร้างแบบจำลองหลายระดับ แต่มีไม่ได้เป็นวิธีที่ฉันรู้ที่จะรวมน้ำหนักในระดับที่แตกต่างกันของการจัดกลุ่ม Asparouhov (2006)สร้างปัญหา: แบบหลายระดับมักถูกใช้เพื่อวิเคราะห์ข้อมูลจากการออกแบบการสุ่มตัวอย่างแบบกลุ่ม การออกแบบการสุ่มตัวอย่างดังกล่าวมักจะใช้ความน่าจะเป็นที่ไม่เท่ากันของการเลือกในระดับคลัสเตอร์และระดับบุคคล น้ำหนักตัวอย่างจะถูกกำหนดในหนึ่งหรือทั้งสองระดับเพื่อสะท้อนความน่าจะเป็นเหล่านี้ หากน้ำหนักการสุ่มตัวอย่างถูกเพิกเฉยไม่ว่าในระดับใดการประมาณค่าพารามิเตอร์สามารถลำเอียงอย่างมาก แนวทางหนึ่งสำหรับแบบจำลองสองระดับคือตัวประมาณความน่าจะเป็นแบบหลอกหลายระดับ (MPML) ที่ใช้ใน MPLUS ( Asparouhov et al,? ) Carle (2009)ตรวจสอบแพ็คเกจซอฟต์แวร์ที่สำคัญและให้คำแนะนำเล็กน้อยเกี่ยวกับวิธีดำเนินการต่อ: ในการดำเนินการ MLM อย่างเหมาะสมกับข้อมูลการสำรวจที่ซับซ้อนและตุ้มน้ำหนักการออกแบบนักวิเคราะห์จำเป็นต้องใช้ซอฟต์แวร์ที่สามารถรวมน้ำหนักที่ปรับสัดส่วนไว้นอกโปรแกรม ปัจจุบันโปรแกรมซอฟต์แวร์ MLM ที่สำคัญสามโปรแกรมอนุญาตสิ่งนี้: Mplus (5.2), MLwiN (2.02) และ GLLAMM น่าเสียดายที่ HLM และ SAS ไม่สามารถทำได้ West และ Galecki (2013)ให้ความเห็นที่อัปเดตมากกว่าเดิมและฉันจะเสนอราคาข้อความที่เกี่ยวข้องตามความยาว: ในบางครั้งนักวิเคราะห์ต้องการปรับ LMM ให้เหมาะกับการสำรวจชุดข้อมูลที่รวบรวมจากตัวอย่างด้วยการออกแบบที่ซับซ้อน (ดู Heeringa et al, 2010, …

3
อัตราส่วนของการกระจายตัวสม่ำเสมอและปกติคืออะไร?
ให้ติดตามการกระจายตัวแบบสม่ำเสมอและติดตามการกระจายตัวแบบปกติ สิ่งที่สามารถจะกล่าวเกี่ยวกับ ? มีการกระจายสำหรับมันหรือไม่?Y XXXXYYYXYXY\frac X Y ฉันพบอัตราส่วนของสองบรรทัดฐานที่มีค่าเฉลี่ยเป็นศูนย์คือโคชี

2
เป็นวิธีที่ดีที่สุดในการมองเห็นผลกระทบของหมวดหมู่และความชุกของพวกเขาในการถดถอยโลจิสติกคืออะไร?
ฉันต้องนำเสนอข้อมูลเกี่ยวกับตัวทำนายหลักของการลงคะแนนของผู้สมัครโดยใช้ข้อมูลการสำรวจความคิดเห็นสาธารณะ ฉันใช้การถดถอยโลจิสติกโดยใช้ตัวแปรทั้งหมดที่ฉันสนใจ แต่ฉันไม่สามารถหาวิธีที่ดีในการนำเสนอข้อมูลนี้ ลูกค้าของฉันไม่สนใจขนาดของเอฟเฟกต์เท่านั้น แต่เกี่ยวกับการโต้ตอบระหว่างขนาดของเอฟเฟกต์และขนาดของประชากรด้วยคุณลักษณะดังกล่าว ฉันจะจัดการกับสิ่งนั้นในกราฟได้อย่างไร ข้อเสนอแนะใด ๆ นี่คือตัวอย่าง: ของเพศตัวแปร (ชาย = 1) เมื่อตัวแปรตามคือโหวต / ไม่ได้อยู่ในผู้สมัครคือ 2.3 ซึ่งเป็นจำนวนมากหลังจากถูก exponentiated และถือว่าเป็นอัตราส่วนราคาต่อรองหรือความน่าจะเป็น อย่างไรก็ตามสังคมที่ดำเนินการสำรวจนี้มีเพียงผู้ชาย 30% ดังนั้นแม้ว่ามนุษย์จะสนับสนุนผู้สมัครคนนี้ค่อนข้างมาก แต่ตัวเลขของพวกเขาไม่มีความสำคัญสำหรับผู้สมัครที่พยายามชนะการเลือกตั้งที่สำคัญββ\beta

1
การกระจายตัวของอัตราส่วนของตัวแปรสุ่มไคสแควร์แบบพึ่งพา
สมมติว่าโดยที่เป็นอิสระX=X1+X2+⋯+XnX=X1+X2+⋯+Xn X = X_1 + X_2+\cdots+ X_n Xi∼N(0,σ2)Xi∼N(0,σ2)X_i \sim N(0,\sigma^2) คำถามของฉันคือการกระจายอะไรบ้าง Z=X2X21+X22+⋯+X2nZ=X2X12+X22+⋯+Xn2 Z = \frac{X^2}{X_1^2 + X_2^2 + \cdots + X_n^2} ทำตาม? ฉันรู้จากที่นี่ว่าอัตราส่วนของตัวแปรสุ่มไคสแควร์สองตัวแสดงเป็นตามการแจกแจงแบบเบต้า ผมคิดว่านี้จะถือว่าเป็นอิสระระหว่างและYในกรณีของฉันตัวส่วนของมีส่วนประกอบของกำลังสองWW+YWW+Y\frac{W}{W + Y}WWWYYYZZZXXX ฉันคิดว่าต้องติดตามความผันแปรของการกระจายเบต้า แต่ฉันไม่แน่ใจ และถ้าสมมติฐานนี้ถูกต้องฉันก็ไม่รู้จะพิสูจน์มันได้อย่างไรZZZ

1
มีฟังก์ชั่นลิงก์แบบ canonical อยู่เสมอสำหรับ Generalized Linear Model (GLM) หรือไม่?
ใน GLM สมมติว่าสเกลาร์และθสำหรับการแจกแจงต้นแบบด้วย pdf f Y ( y | θ , τ ) = h ( y , τ ) exp ( θ y - A ( θ )YYYθθ\theta ก็สามารถที่จะแสดงให้เห็นว่าμ=E(Y)='(θ) ถ้าฟังก์ชันลิงก์g(⋅)สอดคล้องกับสิ่งต่อไปนี้g(μ)=θ=X′βโดยที่X′βคือตัวทำนายเชิงเส้นจากนั้นg(⋅)เรียกว่าฟังก์ชันลิงก์แบบบัญญัติสำหรับรุ่นนี้ฉY( y| θ , τ) = h ( y, τ)ประสบการณ์( θ y- A ( θ )d( τ))ฉY(Y|θ,τ)=ชั่วโมง(Y,τ)ประสบการณ์⁡(θY-A(θ)d(τ))f_Y(y | \theta, \tau) …

3
ช่วงความเชื่อมั่นสำหรับความถูกต้องของการจำแนกประเภทที่ผ่านการตรวจสอบความถูกต้อง
ฉันกำลังทำงานกับปัญหาการจัดหมวดหมู่ที่คำนวณความคล้ายคลึงกันระหว่างภาพเอ็กซเรย์อินพุตสองภาพ หากภาพเป็นของคนคนเดียวกัน (ป้ายกำกับของ 'ขวา') ระบบจะคำนวณตัวชี้วัดที่สูงกว่า ภาพอินพุตของคนสองคนที่แตกต่างกัน (ป้ายกำกับของ 'ผิด') จะส่งผลให้เมตริกต่ำลง ฉันใช้การตรวจสอบความถูกต้องข้าม 10 ชั้นแบบแบ่งชั้นเพื่อคำนวณความน่าจะเป็นการแยกประเภท ขนาดตัวอย่างปัจจุบันของฉันอยู่ที่ประมาณ 40 แมตช์ที่ถูกต้องและ 80 แมตช์ที่ไม่ถูกต้องที่แต่ละดาต้าพอยน์เป็นเมตริกที่คำนวณได้ ฉันได้รับความน่าจะเป็นการแยกประเภทที่ 0.00 แต่ฉันต้องการการวิเคราะห์ช่วงความเชื่อมั่น / ข้อผิดพลาดบางอย่างเกี่ยวกับเรื่องนี้ ฉันมองหาการใช้ช่วงความมั่นใจในสัดส่วนทวินาม (ซึ่งฉันจะใช้ผลลัพธ์ของการตรวจสอบข้ามว่าเป็นการติดฉลากที่ถูกต้องหรือการติดฉลากที่ไม่ถูกต้องสำหรับจำนวนความสำเร็จของฉัน) อย่างไรก็ตามหนึ่งในสมมติฐานที่อยู่เบื้องหลังการวิเคราะห์ทวินามคือความน่าจะเป็นที่เหมือนกันของความสำเร็จสำหรับการทดลองแต่ละครั้งและฉันไม่แน่ใจว่าวิธีการจำแนกประเภทของ 'ถูกต้อง' หรือ 'ผิด' ในการตรวจสอบไขว้นั้น ความน่าจะเป็นเหมือนกันของความสำเร็จ การวิเคราะห์อื่น ๆ ที่ฉันคิดได้คือทำซ้ำการตรวจสอบความถูกต้องข้าม X ครั้งและคำนวณค่าเฉลี่ย / ส่วนเบี่ยงเบนมาตรฐานของข้อผิดพลาดการจัดหมวดหมู่ แต่ฉันไม่แน่ใจว่าสิ่งนี้เหมาะสมหรือไม่เพราะฉันจะนำข้อมูลจาก ขนาดตัวอย่างค่อนข้างเล็กหลายครั้ง ความคิดใด ๆ ฉันใช้ MATLAB สำหรับการวิเคราะห์ทั้งหมดของฉันและฉันมีกล่องเครื่องมือสถิติ จะขอบคุณความช่วยเหลือใด ๆ และทั้งหมด!

1
การตีความทางเรขาคณิตของการประมาณความน่าจะเป็นสูงสุด
ฉันกำลังอ่านหนังสือปัญหาการระบุตัวตนในเศรษฐมิติโดยแฟรงคลินเอ็มฟิชเชอร์และสับสนโดยส่วนที่เขาแสดงให้เห็นถึงตัวตนโดยแสดงให้เห็นถึงฟังก์ชั่นความน่าจะเป็น ปัญหาสามารถทำให้ง่ายขึ้นเป็น: สำหรับการถดถอยที่U ~ ฉัน ผม d N ( 0 , σ 2 I ) , aและbเป็นพารามิเตอร์ สมมติว่าYมีสัมประสิทธิ์คซึ่งเท่ากับเอกภาพ จากนั้นฟังก์ชันความน่าจะเป็นในพื้นที่ของc , a , b จะมีสันตามแนวรังสีที่สอดคล้องกับเวกเตอร์ของพารามิเตอร์ที่แท้จริงและสเกลาร์คูณของมันY= a + Xb + uY=a+Xข+ยูY=a+Xb+uU ~ ฉัน ผม d. ยังไม่มีข้อความ( 0 , σ2ผม)ยู~ผม.ผม.d.ยังไม่มีข้อความ(0,σ2ผม)u \sim i.i.d. N(0,\sigma^2I)aaaขขbYYYคคcc , a , bค,a,ขc, a,b. เมื่อพิจารณาเฉพาะสถานที่ที่กำหนดโดยฟังก์ชันความน่าจะเป็นจะมีค่าสูงสุดเฉพาะ ณ จุดที่รังสีตัดผ่านระนาบนั้นc = 1ค=1c=1 …

1
โมเดลชายขอบกับโมเดลสุ่มเอฟเฟกต์ - วิธีการเลือกระหว่างพวกเขา? คำแนะนำสำหรับคนธรรมดา
ในการค้นหาข้อมูลเกี่ยวกับตัวแบบขอบและตัวแบบสุ่มเอฟเฟกต์และวิธีการเลือกระหว่างพวกเขาฉันได้พบข้อมูลบางอย่าง แต่มันเป็นคำอธิบายเชิงนามธรรมทางคณิตศาสตร์มากขึ้นหรือน้อยลง (เช่นตัวอย่างที่นี่: https: //stats.stackexchange .com / a / 68753/38080 ) ที่ไหนสักแห่งที่ฉันพบว่ามีการสังเกตความแตกต่างอย่างมากระหว่างการประมาณค่าพารามิเตอร์ระหว่างสองวิธี / โมเดล ( http://www.biomedcentral.com/1471-2288/2/15/ ) อย่างไรก็ตามสิ่งที่ตรงกันข้ามถูกเขียนโดย Zuur et al . (2009, p. 116; http://link.springer.com/book/10.1007%2F978-0-387-87458-6) รุ่น Marginal (generalized การประเมินวิธีการสม) นำพารามิเตอร์ของประชากรเฉลี่ยในขณะที่ผลจากการสุ่มผลรุ่น (ทั่วไปเชิงเส้นรูปแบบผสม) นำเข้าผลสุ่มบัญชี - เรื่อง (Verbeke et al, 2010, หน้า 49-52.. http: / /link.springer.com/chapter/10.1007/0-387-28980-1_16 ) ฉันต้องการที่จะเห็นคำอธิบายเหมือนคนธรรมดาของแบบจำลองเหล่านี้ที่แสดงในตัวอย่างบางส่วน (ในชีวิตจริง) ในภาษาที่คุ้นเคยกับนักสถิติและนักคณิตศาสตร์ที่ไม่ใช่นักคณิตศาสตร์ ในรายละเอียดฉันต้องการทราบ: ควรใช้โมเดลร่อแร่และควรใช้โมเดลสุ่มเอฟเฟกต์เมื่อใด …

2
การคาดหวังนั้นเหมือนกับค่าเฉลี่ยหรือไม่
ฉันกำลังทำ ML ที่มหาวิทยาลัยของฉันและอาจารย์พูดถึงคำว่า Expectation (E) ในขณะที่เขาพยายามอธิบายบางอย่างเกี่ยวกับกระบวนการแบบเกาส์ แต่จากวิธีที่เขาอธิบายฉันเข้าใจว่า E นั้นเหมือนกับค่าเฉลี่ยμ ฉันเข้าใจถูกมั้ย ถ้าเหมือนกันคุณรู้หรือไม่ว่าทำไมจึงใช้สัญลักษณ์ทั้งสอง ฉันก็เห็นว่า E สามารถใช้เป็นฟังก์ชั่นเช่น E ( ) แต่ฉันไม่เห็นว่าสำหรับμx2x2x^2 ใครสามารถช่วยฉันเข้าใจความแตกต่างระหว่างทั้งสองได้ดีกว่ากัน?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.