สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
การเชื่อมต่อแบบปรับตัวคืออะไร?
คำถามพื้นฐานของฉันคืออะไร copula แบบปรับได้คืออะไร ฉันมีสไลด์จากงานนำเสนอ (โชคไม่ดีที่ฉันไม่สามารถขอให้ผู้เขียนสไลด์) เกี่ยวกับ Copulae ที่ปรับตัวได้และฉันไม่ได้รับสิ่งนี้หมายถึงการตอบสนอง สิ่งนี้ดีสำหรับอะไร? นี่คือสไลด์: จากนั้นสไลด์จะดำเนินการทดสอบจุดเปลี่ยน ฉันสงสัยว่ามันเกี่ยวข้องกับอะไรและทำไมฉันจึงต้องการสิ่งนี้ในการเชื่อมโยงกับ copulae? สไลด์จบลงด้วยพล็อตพารามิเตอร์โดยประมาณแบบปรับตัวได้: ดูเหมือนว่าจะแสดงว่าการประมาณการของฉันล่าช้า การตีความอื่นใดความเห็นก็ดีมาก!

3
ผลรวมของตัวแปรสุ่มของ Rademacher
ให้เป็นตัวแปรสุ่มอิสระที่รับค่าหรือโดยมีความน่าจะเป็น 0.5 แต่ละตัว พิจารณาผลรวมy_j ฉันต้องการที่จะผูกไว้บนน่าจะเป็นt) ขอบเขตที่ดีที่สุดที่ฉันมีตอนนี้คือโดยที่cคือค่าคงที่สากล นี่คือความสำเร็จโดยการจำกัดความน่าจะเป็นที่ต่ำกว่า(| x_1 + \ จุด + x_n | &lt;\ sqrt {t})และPr (| y_1 + \ จุด + y_n | &lt;\ sqrt {t})โดยการประยุกต์ใช้ขอบเขต Chernoff ง่าย ๆ ฉันหวังว่าจะได้รับสิ่งที่ดีกว่าขอบเขตนี้อย่างมากหรือไม่ อย่างน้อยฉันก็จะได้รับx1…xa,y1…ybx1…xa,y1…ybx_1 \ldots x_a,y_1 \ldots y_b+1+1+1−1−1-1S=∑i,jxi×yjS=∑i,jxi×yjS = \sum_{i,j} x_i\times y_jP(|S|&gt;t)P(|S|&gt;t)P(|S| > t)2e−ctmax(a,b)2e−ctmax(a,b)2e^{-\frac{ct}{\max(a,b)}}cccPr(|x1+⋯+xn|&lt;t√)Pr(|x1+⋯+xn|&lt;t)Pr(|x_1 + \dots + x_n|<\sqrt{t})Pr(|y1+⋯+yn|&lt;t√)Pr(|y1+⋯+yn|&lt;t)Pr(|y_1 + \dots + …

1
คำถามเกี่ยวกับน้ำหนักถ่วงแปรปรวน
สมมติว่าเราต้องการที่จะทำให้การอนุมานในสำนึกสังเกตของตัวแปรสุ่มซึ่งกระจายตามปกติที่มีค่าเฉลี่ยและความแปรปรวน\สมมติว่ามีเป็นอีกหนึ่งตัวแปรสุ่ม (ซึ่งก่อให้เกิดการสังเกตในทำนองเดียวกันเราจะเรียก ) ที่มีการกระจายตามปกติที่มีค่าเฉลี่ยและความแปรปรวน\LetจะแปรปรวนของและYxxxx~x~\tilde xμxμx\mu_xσ2xσx2\sigma^2_xY~y~\tilde yYyyμYμy\mu_yσ2Yσy2\sigma^2_yσx yσxy\sigma_{xy}x~x~\tilde xY~y~\tilde y ตอนนี้สมมติว่าเราสังเกตเห็นสัญญาณบน , โดยที่และสัญญาณบน , ที่2) สมมติว่าและมีความเป็นอิสระxxxa = x +ยู~,a=x+u~,\begin{align}a=x+\tilde u,\end{align}ยู~∼ N( 0 ,φ2x)u~∼N(0,ϕx2)\tilde u\sim\mathcal{N}(0,\phi_x^2)Yyyb = y+โวลต์~,b=y+v~,\begin{align}b=y+\tilde v,\end{align}โวลต์~∼ N( 0 ,φ2Y)v~∼N(0,ϕy2)\tilde v\sim\mathcal{N}(0,\phi_y^2)ยู~u~\tilde uโวลต์~v~\tilde v การกระจายตัวของมีเงื่อนไขบนและคืออะไร?xxxaaaขbb สิ่งที่ฉันรู้จนถึงตอนนี้: การใช้น้ำหนักผกผัน - แปรปรวน, และ E (x|a ) =1σ2xμx+1φ2xa1σ2x+1φ2x,E(x|a)=1σx2μx+1ϕx2a1σx2+1ϕx2,\begin{align}\mathbb{E}(x\,|\,a)=\frac{\frac{1}{\sigma_x^2}\mu_x+\frac{1}{\phi_x^2}a}{\frac{1}{\sigma_x^2}+\frac{1}{\phi_x^2}},\end{align}V ar(x|a ) =11σ2x+1φ2x.Var(x|a)=11σx2+1ϕx2.\begin{align} \mathbb{V}\text{ar}(x\,|\,a)=\frac{1}{\frac{1}{\sigma_x^2}+\frac{1}{\phi_x^2}}. \end{align} ตั้งแต่และจะวาดร่วมกันควรนำข้อมูลบางอย่างเกี่ยวกับxนอกเหนือจากการตระหนักถึงสิ่งนี้ฉันติดอยู่ ความช่วยเหลือใด ๆ …

1
แนวคิดที่ไม่ซ้ำ (?) สำหรับการคาดการณ์ยอดขาย
ฉันกำลังพัฒนาโมเดลเพื่อทำนายยอดขายรวมของผลิตภัณฑ์ ฉันมีข้อมูลการจองประมาณปีครึ่งดังนั้นฉันสามารถทำการวิเคราะห์อนุกรมเวลาได้ อย่างไรก็ตามฉันยังมีข้อมูลจำนวนมากเกี่ยวกับ 'โอกาส' (การขายที่เป็นไปได้) ที่ปิดหรือสูญหาย 'โอกาส' จะถูกดำเนินการไปตามขั้นตอนต่างๆของไปป์ไลน์จนกว่าจะปิดหรือสูญหาย พวกเขายังมีข้อมูลที่เกี่ยวข้องเกี่ยวกับผู้ซื้อที่คาดหวังพนักงานขายประวัติปฏิสัมพันธ์อุตสาหกรรมขนาดการจองโดยประมาณเป็นต้น เป้าหมายของฉันคือการทำนายการจองทั้งหมดในที่สุด แต่ฉันต้องการข้อมูลทั้งหมดเกี่ยวกับ 'โอกาส' ปัจจุบันซึ่งเป็น 'สาเหตุที่แท้จริง' ของการจอง หนึ่งความคิดที่ฉันมีคือการใช้สองรุ่นที่แตกต่างกันดังนี้: ใช้ 'โอกาส' ทางประวัติศาสตร์เพื่อสร้างแบบจำลองที่ทำนายการจองที่เกิดขึ้นจาก 'โอกาส' ของแต่ละบุคคล (ฉันอาจใช้ฟอเรสต์แบบสุ่มหรือแม้แต่การถดถอยเชิงเส้นแบบเก่าธรรมดาสำหรับขั้นตอนนี้) ใช้แบบจำลองจาก 1 เพื่อทำนายการจอง 'โอกาส' โดยประมาณทั้งหมดในขณะนี้จากนั้นรวมการประมาณการเหล่านั้นตามเดือน 'โอกาส' ที่ถูกสร้างขึ้น ใช้โมเดลอนุกรมเวลา (อาจเป็น ARIMA) โดยใช้ข้อมูลอนุกรมเวลาย้อนหลังรายเดือน 1.5 ปีและทำนาย (โดยใช้โมเดลจาก 1) การจองทั้งหมดสำหรับ 'โอกาส' ทั้งหมดที่สร้างขึ้นในเดือนนั้น ได้รับจะมีความล่าช้าในโอกาสเหล่านั้นที่เปลี่ยนไปเป็นการจองจริง แต่โมเดลอนุกรมเวลาควรสามารถจัดการกับความล่าช้าได้ เสียงนี้เป็นอย่างไร ฉันได้อ่านหนังสือตามเวลาและทำนายยอดขายเป็นจำนวนมากและจากสิ่งที่ฉันสามารถบอกได้ว่านี่เป็นวิธีที่ไม่เหมือนใคร ดังนั้นฉันขอขอบคุณข้อเสนอแนะใด ๆ จริงๆ!

1
กฎการใช้การจำลองแบบ Monte Carlo ของค่า p สำหรับการทดสอบไคสแควร์
ฉันต้องการเข้าใจการใช้การจำลอง Monte Carlo ในchisq.test()ฟังก์ชันใน R ฉันมีตัวแปรเชิงคุณภาพซึ่งมี 128 ระดับ / คลาส ขนาดตัวอย่างของฉันคือ 26 (ฉันไม่สามารถสุ่มตัวอย่าง "บุคคล" เพิ่มเติมได้) เห็นได้ชัดว่าฉันจะมีบางระดับที่มี 0 "บุคคล" แต่ความจริงก็คือฉันมีชั้นเรียนจำนวนน้อยมากจากจำนวน 127 ที่เป็นไปได้ ตามที่ฉันได้ยินมาว่าการใช้การทดสอบแบบไคสแควร์เราควรมีอย่างน้อย 5 คนในแต่ละระดับ (ฉันไม่เข้าใจเหตุผลอย่างสมบูรณ์) ฉันคิดว่าฉันต้องใช้simulate.p.valueตัวเลือกในการใช้การจำลอง Monte Carlo เพื่อประเมินการกระจายตัว และคำนวณค่า p หากไม่มีการจำลองมอนติคาร์โล R จะให้ค่า p กับ&lt; 1e-16ฉัน ด้วยการจำลอง Monte Carlo มันทำให้ฉัน p-value 4e-5ที่ ฉันพยายามคำนวณ p-value ด้วยเวกเตอร์ 26 อันและ 101 ศูนย์และด้วยการจำลอง …

1
การรวมระบบ Monte Carlo สำหรับฟังก์ชั่นที่ไม่รวมสี่เหลี่ยมจตุรัส
ฉันหวังว่านี่เป็นสถานที่ที่เหมาะสมที่จะถามถ้าไม่ลังเลที่จะย้ายไปยังฟอรัมที่เหมาะสมยิ่งขึ้น ฉันสงสัยอยู่พักหนึ่งแล้วว่าจะรักษาฟังก์ชั่นที่ไม่รวมสแควร์ด้วย Monte Carlo Integration ได้อย่างไร ฉันรู้ว่า MC ยังคงให้การประเมินที่เหมาะสม แต่ข้อผิดพลาดนั้นไม่สามารถเกิดขึ้นจริงได้ (ฟังก์ชั่นต่างกันอย่างไร) มา จำกัด เราไว้แค่มิติเดียว การบูรณาการ Monte Carlo หมายความว่าเราประมาณค่าอินทิกรัล I=∫10dxf(x)I=∫01dxf(x) I = \int_0^1 \mathrm{d}x \, f(x) ใช้ประมาณการ E=1N∑i=1Nf(xi)E=1N∑i=1Nf(xi) E = \frac{1}{N} \sum_{i=1}^N f(x_i) กับคะแนนสุ่มกระจายอย่างสม่ำเสมอ กฎหมายจำนวนมากทำให้แน่ใจว่าฉัน ความแปรปรวนตัวอย่างxi∈[0,1]xi∈[0,1]x_i \in [0,1]E≈IE≈IE \approx I S2=1N−1∑i=1N(f(xi)−E)2S2=1N−1∑i=1N(f(xi)−E)2 S^2 = \frac{1}{N-1} \sum_{i=1}^N (f (x_i) - E)^2 ใกล้เคียงกับความแปรปรวนของการกระจายที่เกิดจากFอย่างไรก็ตามถ้าไม่ได้เป็นสี่เหลี่ยมจัตุรัสเช่นอินทิกรัลของฟังก์ชันกำลังสอง diverges …

1
การแก้ไขฟูริเยร์ / ตรีโกณมิติ
พื้นหลัง ในกระดาษจาก Epstein (1991): ในการรับค่า climatological รายวันจากค่าเฉลี่ยรายเดือนสูตรและอัลกอริทึมสำหรับการคำนวณการแก้ไขฟูริเยร์สำหรับค่าระยะและแม้กระทั่งระยะจะได้รับ ในกระดาษเป้าหมายคือการได้รับค่ารายวันจากวิธีการรายเดือนโดยการแก้ไข กล่าวโดยสรุปคือสันนิษฐานว่าค่ารายวันที่ไม่รู้จักสามารถถูกแสดงด้วยผลรวมของส่วนประกอบฮาร์มอนิก: ในกระดาษ (เวลา) แสดงเป็นเดือนy(t)=a0+∑j[ajcos(2πjt/12)+bjsin(2πjt/12)]y(t)=a0+∑j[ajcos⁡(2πjt/12)+bjsin⁡(2πjt/12)] y(t) = a_{0} + \sum_{j}\left[a_{j}\,\cos(2\pi jt/12)+b_{j}\,\sin(2\pi jt/12)\right] ttt หลังจากเบี่ยงเบนไปบางส่วนก็แสดงให้เห็นว่าสามารถคำนวณเงื่อนไขได้โดย: โดยที่แทนค่าเฉลี่ยรายเดือนและเดือนa0ajbja6b6=∑TYT/12=[(πj/12)/sin(πj/12)]×∑T[YTcos(2πjT/12)/6] j=1,…,5=[(πj/12)/sin(πj/12)]×∑T[YTsin(2πjT/12)/6] j=1,…,5=[(πj/12)/sin(πj/12)]×∑T[YTcos(πT)/12]=0a0=∑TYT/12aj=[(πj/12)/sin⁡(πj/12)]×∑T[YTcos⁡(2πjT/12)/6] j=1,…,5bj=[(πj/12)/sin⁡(πj/12)]×∑T[YTsin⁡(2πjT/12)/6] j=1,…,5a6=[(πj/12)/sin⁡(πj/12)]×∑T[YTcos⁡(πT)/12]b6=0 \begin{align} a_{0} &= \sum_{T}Y_{T}/12 \\ a_{j} &= \left[ (\pi j/12)/\sin(\pi j/12)\right] \times \sum_{T}\left[Y_{T}\,\cos(2\pi jT/12)/6 \right]~~~~~~~j=1,\ldots, 5 \\ b_{j} &= \left[ (\pi j/12)/\sin(\pi j/12)\right] \times …

2
การค้นหาความแปรปรวนของตัวประมาณค่าสำหรับโอกาสสูงสุดสำหรับการแจกแจงปัวซง
ถ้า K1, … ,KnK1,…,KnK_1, \dots, K_n คือการกระจาย iid Poisson พร้อมพารามิเตอร์ ββ\beta ฉันได้ทำงานแล้วว่าการประเมินความเป็นไปได้สูงสุด β^(k1, … ,kn) =1nΣi = 1nkผมβ^(k1,…,kn)=1n∑i=1nki\hat\beta (k_1, \dots, k_n) = \frac{1}{n} \sum_{i=1}^n k_i สำหรับข้อมูล k1, … ,knk1,…,knk_1, \dots, k_n. ดังนั้นเราสามารถกำหนดตัวประมาณที่สอดคล้องกันได้ T=1nΣi = 1nKผม.T=1n∑i=1nKi.T = \frac{1}{n} \sum_{i=1}^n K_i . คำถามของฉันคือคุณจะคำนวณความแปรปรวนของเครื่องมือประมาณนี้อย่างไร โดยเฉพาะอย่างยิ่งเช่นกัน KผมKiK_i ติดตามการแจกแจงปัวซองด้วยพารามิเตอร์ ββ\beta ฉันรู้ว่าจากคุณสมบัติของปัวซองว่าการกระจายตัว Σni = 1Kผม∑i=1nKi\sum_{i=1}^n K_i …

1
การทำนายด้วย randomForest (R) เมื่ออินพุตบางตัวมีค่าขาดหายไป (NA)
ฉันมีrandomForestรูปแบบการจำแนกที่ดีซึ่งฉันต้องการใช้ในแอปพลิเคชันที่ทำนายคลาสของเคสใหม่ กรณีใหม่มีค่าที่ขาดหายไปอย่างหลีกเลี่ยงไม่ได้ การทำนายจะไม่ทำงานเช่นนี้สำหรับ NAs ฉันจะทำสิ่งนี้ได้อย่างไร data(iris) # create first the new case with missing values na.row&lt;-45 na.col&lt;-c(3,5) case.na&lt;-iris[na.row,] case.na[,na.col]&lt;-NA iris.rf &lt;- randomForest(Species ~ ., data=iris[-na.row,]) # print(iris.rf) myrf.pred &lt;- predict(iris.rf, case.na[-5], type="response") myrf.pred [1] &lt;NA&gt; ฉันพยายามmissForestแล้ว ฉันรวมข้อมูลดั้งเดิมและเคสใหม่แล้วเขย่าด้วยmissForestและรับค่าที่เป็นนัยสำหรับ NAs ในเคสใหม่ของฉัน การคำนวณที่หนักเกินไป data.imp &lt;- missForest(data.with.na) แต่ต้องมีวิธีการใช้ rf-model เพื่อทำนายกรณีใหม่ที่มีค่าหายไปใช่ไหม?

1
การใช้เครื่องมือการประมวลผลข้อความ / ภาษาธรรมชาติสำหรับเศรษฐมิติ
ฉันไม่แน่ใจว่าคำถามนี้เหมาะสมอย่างยิ่งหรือไม่โปรดลบ ฉันเป็นนักเรียนที่จบการศึกษาด้านเศรษฐศาสตร์ สำหรับโครงการที่ตรวจสอบปัญหาในการประกันสังคมฉันสามารถเข้าถึงรายงานกรณีการบริหาร (&gt; 200k) จำนวนมากซึ่งจัดการกับการประเมินสิทธิ์ รายงานเหล่านี้อาจเชื่อมโยงกับข้อมูลการดูแลส่วนบุคคล ฉันต้องการดึงข้อมูลจากรายงานเหล่านี้ที่สามารถนำมาใช้ในการวิเคราะห์เชิงปริมาณและการค้นหาคำหลัก / regex ง่าย ๆ โดยใช้grep/ awketc การประมวลผลภาษาธรรมชาติมีประโยชน์อย่างไรสำหรับสิ่งนี้ อะไรคือวิธีการขุดข้อความที่มีประโยชน์อื่น ๆ จากสิ่งที่ฉันเข้าใจว่านี่เป็นเขตข้อมูลขนาดใหญ่และส่วนใหญ่มีรายงานบางส่วนที่จะต้องถูกเปลี่ยนเป็นใช้เป็นคลังข้อมูล มันคุ้มค่าที่จะลงทุนสักระยะเพื่อทำความคุ้นเคยกับวรรณกรรมและวิธีการหรือไม่? มันจะมีประโยชน์และมีสิ่งที่คล้ายกันเคยทำมาก่อนหรือไม่ มันคุ้มค่าหรือไม่ในแง่ของรางวัลเช่นฉันสามารถดึงข้อมูลที่เป็นประโยชน์โดยใช้ NLP สำหรับการศึกษาเชิงประจักษ์ทางเศรษฐศาสตร์ได้หรือไม่? อาจมีการระดมทุนเพื่อจ้างคนอ่านและเตรียมรายงานบางส่วน นี่เป็นโครงการขนาดใหญ่และมีความเป็นไปได้ที่จะใช้เงินทุนเพิ่มเติม ฉันสามารถให้รายละเอียดเพิ่มเติมเกี่ยวกับหัวข้อหากจำเป็นอย่างเคร่งครัด ความซับซ้อนที่อาจเกิดขึ้นคือภาษาเยอรมันไม่ใช่ภาษาอังกฤษ เกี่ยวกับคุณวุฒิส่วนใหญ่ฉันได้รับการฝึกฝนด้านเศรษฐมิติและมีความรู้เกี่ยวกับสถิติการคำนวณในระดับHastie et al หนังสือ ฉันรู้จัก Python, R, Stata และอาจคุ้นเคยกับ Matlab อย่างรวดเร็ว ให้ห้องสมุดฉันคิดว่าหลามเป็นเครื่องมือของการเลือกนี้ ไม่มีการฝึกอบรมในวิธีการเชิงคุณภาพถ้ามันเกี่ยวข้อง แต่ฉันรู้ว่ามีบางคนที่ฉันสามารถติดต่อได้ ฉันดีใจที่ได้รับข้อมูลใด ๆ เกี่ยวกับเรื่องนี้เช่นถ้านี่อาจเป็นประโยชน์ถ้าเป็นเช่นนั้นสถานที่ที่จะเริ่มอ่านและเครื่องมือใดที่ควรให้ความสำคัญเป็นพิเศษ

1
CCA ระหว่างสองชุดข้อมูลที่เหมือนกันเทียบเท่ากับ PCA ในชุดข้อมูลนี้หรือไม่
การอ่านวิกิพีเดียเกี่ยวกับการวิเคราะห์สหสัมพันธ์แคนนอน (CCA) สำหรับเวกเตอร์สุ่มสองตัวและYฉันสงสัยว่าองค์ประกอบหลัก anslysis (PCA) เหมือนกับ CCA เมื่อX = Yหรือไม่XXXYYYX=YX=YX=Y

2
ข้อผิดพลาดมาตรฐานของความลาดชันในการถดถอยเชิงเส้นแบบชิ้นเดียวพร้อมกับเบรกพอยต์ที่รู้จัก
สถานการณ์ ฉันมีชุดข้อมูลที่มีขึ้นหนึ่งและเป็นหนึ่งในตัวแปรอิสระxฉันต้องการที่จะพอดีกับค่อย่างต่อเนื่องถดถอยเชิงเส้นกับที่รู้จักกัน / จุดพักคงเกิดขึ้นใน{k}) เบรกพอยต์เป็นที่รู้จักโดยไม่มีความแน่นอนดังนั้นฉันไม่ต้องการที่จะประเมินพวกมัน จากนั้นฉันก็พอดีกับการถดถอย (OLS) ของรูปแบบ y_ {i} = \ beta_ {0} + \ beta_ {1} x_ {i} + \ beta_ {2} \ operatorname {max} (x_ {i} -a_ { 1}, 0) + \ beta_ {3} \ operatorname {max} (x_ {i} -a_ {2}, 0) + \ ldots + \ …

4
(การโต้ตอบ) MCMC สำหรับรูปหลังด้านหลัง
ฉันพยายามที่จะสุ่มตัวอย่างจากผู้โพสต์ด้านหลังที่มีหลายโหมดโดยเฉพาะอย่างยิ่งที่ไกลจากกันโดยใช้ MCMC ปรากฏว่าในกรณีส่วนใหญ่เฉพาะหนึ่งในโหมดเหล่านี้เท่านั้นที่มี 95% hpd ที่ฉันกำลังมองหา ฉันพยายามที่จะใช้โซลูชั่นตามการจำลองอารมณ์ แต่สิ่งนี้ไม่ได้ผลลัพธ์ที่น่าพอใจในทางปฏิบัติที่เกิดขึ้นจาก "ช่วงการจับภาพ" หนึ่งไปยังอีกที่หนึ่งคือค่าใช้จ่ายสูง สำหรับฉันแล้วดูเหมือนว่าโซลูชันที่มีประสิทธิภาพมากขึ้นจะใช้ MCMC ง่าย ๆ หลายจุดจากจุดเริ่มต้นที่แตกต่างกันและดำดิ่งลงสู่โซลูชันที่โดดเด่นด้วยการทำให้ MCMC โต้ตอบ คุณรู้หรือไม่ว่ามีวิธีที่เหมาะสมในการนำแนวคิดดังกล่าวไปใช้หรือไม่ หมายเหตุ: ฉันพบว่ากระดาษhttp://lccc.eecs.berkeley.edu/Papers/dmcmc_short.pdf (กระจายมาร์คอฟโซ่มอนติคาร์โลลอเรนซ์เมอเรย์) ที่ดูใกล้เคียงกับสิ่งที่ฉันกำลังมองหา แต่ฉันไม่เข้าใจการออกแบบ ของฟังก์ชั่นR_iRผมRiR_i [แก้ไข]:การขาดคำตอบดูเหมือนจะบ่งบอกว่าไม่มีทางออกที่ชัดเจนสำหรับปัญหาเริ่มต้นของฉัน (ทำให้การสุ่มตัวอย่าง MCMC หลายครั้งจากการกระจายเป้าหมายเดียวกันจากจุดเริ่มต้นที่แตกต่างกันมีปฏิสัมพันธ์ซึ่งกันและกัน) มันเป็นเรื่องจริงเหรอ? ทำไมมันซับซ้อนจัง ขอบคุณ

2
ตัวประเมิน MCMC ที่แข็งแกร่งของความเป็นไปได้ที่จะเกิดขึ้น?
ฉันพยายามคำนวณความเป็นไปได้เล็กน้อยสำหรับแบบจำลองทางสถิติด้วยวิธีมอนติคาร์โล: ฉ( x ) = ∫ฉ( x ∣ θ ) π( θ )dθฉ(x)=∫ฉ(x|θ)π(θ)dθf(x) = \int f(x\mid\theta) \pi(\theta)\, d\theta ความเป็นไปได้มีความประพฤติดี - ราบรื่นเว้าเข้าสู่ระบบ - แต่มิติสูง ฉันได้ลองการสุ่มตัวอย่างที่สำคัญ แต่ผลลัพธ์นั้นไม่น่าสนใจและขึ้นอยู่กับข้อเสนอที่ฉันใช้ ฉันพิจารณาทำมิลโตเนียนมอนติคาร์โลสั้น ๆ เพื่อคำนวณตัวอย่างหลังสมมติว่ามีชุดเครื่องแบบมาก่อนθθ\thetaและการใช้ค่าเฉลี่ยฮาร์โมนิจนกระทั่งผมเห็นนี้ บทเรียนที่ได้เรียนรู้ค่าเฉลี่ยฮาร์มอนิกสามารถมีความแปรปรวนไม่สิ้นสุด มีตัวประมาณ MCMC ทางเลือกที่เกือบจะง่าย แต่มีความแปรปรวนที่มีพฤติกรรมดีหรือไม่?

2
ช่วยฉันให้พอดีกับการถดถอยหลายครั้งแบบไม่เป็นเชิงเส้นที่ท้าทายความพยายามก่อนหน้านี้ทั้งหมด
แก้ไข: ตั้งแต่การทำโพสต์นี้ผมได้ตามมาด้วยการโพสต์เพิ่มเติมที่นี่ บทสรุปของข้อความด้านล่าง: ฉันกำลังทำงานกับแบบจำลองและได้ลองถดถอยเชิงเส้นการแปลงบ็อกซ์คอคส์และ GAM แต่ยังไม่คืบหน้ามากนัก ใช้ตอนRนี้ฉันกำลังทำงานกับแบบจำลองเพื่อทำนายความสำเร็จของผู้เล่นเบสบอลลีกในระดับเมเจอร์ลีก (MLB) ตัวแปรน่ารังเกียจอาชีพชนะเหนือทดแทน (oWAR) เป็นพร็อกซี่สำหรับความสำเร็จในระดับเอ็มและเป็นวัดที่เป็นผลรวมของผลงานที่น่ารังเกียจสำหรับการเล่นผู้เล่นที่มีส่วนเกี่ยวข้องในช่วงอาชีพของเขาทุกคน (รายละเอียดที่นี่ - http : //www.fangraphs.com/library/misc/war/) ตัวแปรอิสระคือคะแนนความไม่พอใจเล็กน้อยในลีกที่มีคะแนน z สำหรับสถิติที่คิดว่าเป็นตัวทำนายที่สำคัญของความสำเร็จในระดับเมเจอร์ลีกรวมถึงอายุ (ผู้เล่นที่ประสบความสำเร็จมากกว่าในวัยเยาว์มีแนวโน้มที่จะเป็นกลุ่มเป้าหมายที่ดีกว่า) ], อัตราการเดิน [BBrate] และการผลิตที่ปรับปรุงแล้ว (การวัดทั่วโลกของการผลิตที่น่ารังเกียจ) นอกจากนี้เนื่องจากมีลีกย่อยหลายระดับฉันจึงได้รวมตัวแปรจำลองสำหรับระดับการเล่นของลีกย่อย (Double A, High A, Low A, Rookie และ Short Season กับ Triple A [ระดับสูงสุดก่อนลีกใหญ่]] เป็นตัวแปรอ้างอิง]) หมายเหตุ: ฉันได้ปรับขนาด WAR ใหม่ให้เป็นตัวแปรที่เปลี่ยนจาก 0 เป็น 1 ตัวแปร scatterplot …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.