สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
คุณสามารถเปรียบเทียบค่า AIC ได้หรือไม่หากโมเดลนั้นใช้ชุดข้อมูลเดียวกัน
ฉันกำลังทำการพยากรณ์ใน R โดยใช้แพ็คเกจการพยากรณ์ของ Rob Hyndman กระดาษที่อยู่ในแพคเกจที่สามารถพบได้ที่นี่ ในกระดาษหลังจากอธิบายอัลกอริทึมการพยากรณ์อัตโนมัติผู้เขียนใช้อัลกอริทึมในชุดข้อมูลเดียวกัน อย่างไรก็ตามหลังจากการประเมินทั้งการทำให้เรียบแบบเอ็กซ์โปเนนเชียลและแบบจำลอง ARIMA พวกเขาสร้างข้อความที่ฉันไม่เข้าใจ (หน้า 17): โปรดทราบว่าเกณฑ์ข้อมูลไม่สามารถเปรียบเทียบกันได้ ฉันคิดว่าข้อดีของการใช้ AIC สำหรับการเลือกแบบจำลองคือเราสามารถเปรียบเทียบค่า AIC จากแบบจำลองที่แตกต่างกันได้ตราบใดที่มีการประมาณโดยใช้ชุดข้อมูลเดียวกัน สิ่งนี้ไม่ถูกต้องหรือ เรื่องนี้เป็นเรื่องที่น่าสนใจเป็นพิเศษสำหรับฉันในขณะที่ฉันกำลังวางแผนในการรวมการคาดการณ์จากคลาสรุ่นต่างๆ (เช่นการทำให้เรียบแบบเอกซ์โพเนนเชียลและ ARIMA) โดยใช้ที่เรียกว่าน้ำหนัก Akaike (ดู Burnham and Anderson, 2002) อ้างอิง Burnham, KP, & Anderson, DR (2002) การเลือกรูปแบบและการอนุมานหลายรูปแบบ: วิธีการเชิงทฤษฎีและสารสนเทศ Springer Verlag

3
ทางเลือกสำหรับการแปรปรวนแบบทางเดียว ANOVA
ฉันต้องการเปรียบเทียบค่าเฉลี่ยในสามกลุ่มที่มีขนาดเท่ากัน (ขนาดตัวอย่างที่เท่ากันคือเล็ก 21) วิธีการของแต่ละกลุ่มมีการกระจายตามปกติ แต่ความแปรปรวนของพวกเขาไม่เท่ากัน (ผ่านการทดสอบของ Levene) การเปลี่ยนแปลงเป็นเส้นทางที่ดีที่สุดในสถานการณ์นี้หรือไม่? ฉันควรพิจารณาสิ่งอื่นก่อนไหม?

3
อันดับโดยรวมจากรายการหลายอันดับ
ฉันได้อ่านวรรณกรรมมากมายที่มีออนไลน์รวมถึงฟอรัมนี้โดยไม่มีโชคและหวังว่าใครบางคนสามารถช่วยปัญหาทางสถิติที่ฉันเผชิญอยู่ในขณะนี้: ฉันมีข้อมูลอันดับ 5 รายการโดยแต่ละรายการประกอบด้วย 10 รายการที่จัดอันดับจากตำแหน่ง 1 (ดีที่สุด) ถึงตำแหน่ง 10 (แย่ที่สุด) เพื่อความเป็นบริบท 10 รายการในแต่ละรายการจะเหมือนกัน แต่ในการจัดอันดับที่แตกต่างกันเนื่องจากเทคนิคที่ใช้ในการตัดสินใจอันดับของพวกเขาแตกต่างกัน ข้อมูลตัวอย่าง: List 1 List 2 List 3 ... etc Item 1 Ranked 1 Ranked 2 Ranked 1 Item 2 Ranked 3 Ranked 1 Ranked 2 Item 3 Ranked 2 Ranked 3 Ranked 3 ... etc …

1
ทำความเข้าใจกับ MCMC และอัลกอริทึม Metropolis-Hastings
ในช่วงไม่กี่วันที่ผ่านมาฉันพยายามเข้าใจว่า Markov Chain Monte Carlo (MCMC) ทำงานอย่างไร โดยเฉพาะฉันพยายามทำความเข้าใจและใช้อัลกอริทึม Metropolis-Hastings จนถึงตอนนี้ฉันคิดว่าฉันมีความเข้าใจโดยรวมเกี่ยวกับอัลกอริทึม แต่มีบางสิ่งที่ยังไม่ชัดเจนสำหรับฉัน ฉันต้องการใช้ MCMC เพื่อให้พอดีกับบางรุ่นของข้อมูล ด้วยเหตุนี้ฉันจะอธิบายความเข้าใจของฉันเกี่ยวกับอัลกอริทึม Metropolis-Hastings สำหรับปรับเส้นตรงให้กับข้อมูลที่สังเกตได้ :f(x)=axf(x)=axf(x)=axDDD 1) ตรวจเดาการเริ่มต้นสำหรับ ตั้งค่านี้เป็นปัจจุบันของเรา( ) เพิ่มตอนท้ายของ Markov Chain ( ) ด้วยaaaaaaaaaa0a0a_0aaaCCC 2) ทำซ้ำขั้นตอนการร้องหลายครั้ง 3) ประเมินโอกาสในปัจจุบัน ( ) ให้และDL0L0{\cal L_0}a0a0a_0DDD 4) เสนอใหม่( ) โดยการสุ่มตัวอย่างจากการกระจายปกติกับและ\สำหรับตอนนี้คงที่aaaa1a1a_1μ=a0μ=a0\mu=a_0σ=stepsizeσ=stepsize\sigma=stepsizestepsizestepsizestepsize 5) ประเมินโอกาสใหม่ ( ) ให้และD a 1 DL1L1{\cal L_1}a1a1a_1DDD 6) …

1
หลายระดับของการถดถอยเชิงเส้นแบบอิสระ
องศาอิสระในการถดถอยหลายครั้งเท่ากับโดยที่kคือจำนวนของตัวแปรยังไม่มีข้อความ- k - 1N−k−1N-k-1kkk ไม่ได้แก่ ตัวแปรการตอบสนอง (เช่นY )? ตัวอย่างเช่นในโมเดลY = B 0 + B 1 X 1 + B 2 X 2แล้วk = 3 (เช่น 1 df แต่ละรายการสำหรับY , X 1 , & X 2 ) หรือไม่kkkYYYY=B0+B1X1+B2X2Y=B0+B1X1+B2X2Y = B_0 + B_1X_1 + B_2X_2k=3k=3k = 3YYYX1X1X_1X2X2X_2

3
คะแนนระยะทางแบบยุคลิดและความคล้ายคลึงกัน
ฉันแค่ทำงานกับหนังสือ Collective Intelligence (โดย Toby Segaran) และเจอคะแนนระยะทางแบบยุคลิด ในหนังสือเล่มนี้แสดงให้เห็นว่าผู้เขียนวิธีการคำนวณความคล้ายคลึงกันระหว่างสองอาร์เรย์คำแนะนำ (เช่น )คะแนน ×คนภาพยนตร์ ↦)person×movie↦score)\textrm{person} \times \textrm{movie} \mapsto \textrm{score}) เขาคำนวณระยะทางแบบยุคลิดสำหรับคนสองคนและp 2โดย d ( p 1 , p 2 ) = √พี1p1p_1พี2p2p_2d( หน้า1, p2) = ∑ฉัน∈ รายการ ( sพี1- sพี2)2-------------√d(p1,p2)=∑i ∈ item(sp1−sp2)2d(p_1, p_2) = \sqrt{\sum_{i~\in~\textrm{item}} (s_{p_1} - s_{p_2})^2} เรื่องนี้ทำให้ฉันรู้สึกอย่างสมบูรณ์ สิ่งที่ฉันไม่เข้าใจจริงๆคือเหตุผลที่เขาคำนวณตอนท้ายต่อไปนี้เพื่อให้ได้ "ความคล้ายคลึงกันตามระยะทาง": 11 + d( …

2
ทางเลือกการกระจายเชิงประจักษ์
เงินรางวัล: เงินรางวัลเต็มจำนวนจะมอบให้กับผู้ที่ให้การอ้างอิงถึงเอกสารเผยแพร่ใด ๆ ที่ใช้หรือกล่าวถึงตัวประมาณF~F~\tilde{F}ด้านล่าง แรงจูงใจ: ส่วนนี้อาจไม่สำคัญสำหรับคุณและฉันสงสัยว่ามันจะไม่ช่วยให้คุณได้รับรางวัล แต่เนื่องจากมีคนถามเกี่ยวกับแรงจูงใจนี่คือสิ่งที่ฉันกำลังทำอยู่ ฉันกำลังทำงานกับปัญหาทฤษฎีกราฟเชิงสถิติ มาตรฐานวัตถุหนาแน่นกราฟ จำกัดW:[0,1]2→[0,1]W:[0,1]2→[0,1]W : [0,1]^2 \to [0,1]เป็นฟังก์ชันสมมาตรในแง่ที่ว่าW(u,v)=W(v,u)W(u,v)=W(v,u)W(u,v) = W(v,u) ) การสุ่มตัวอย่างกราฟบนnnnจุดยอดสามารถคิดได้ว่าเป็นการสุ่มตัวอย่างnnnค่าเครื่องแบบในช่วงหน่วย ( UiUiU_iสำหรับi=1,…,ni=1,…,ni = 1, \dots, n) แล้วน่าจะเป็นของขอบนั้น(i,j)(i,j)(i,j)เป็นW(Ui,Uj)W(Ui,Uj)W(U_i, U_j) ) ให้ถ้อยคำเมทริกซ์ที่เกิดจะเรียกว่าAAA WWW∬ W > 0 f A f f f ∑ A Wf=W/∬Wf=W/∬Wf = W / \iint W∬W>0∬W>0\iint W > 0fffAAAfffffffff∑A∑A\sum AWWW แต่น่าเสียดายที่วิธีการที่ผมพบว่าการแสดงความสอดคล้องเมื่อเราได้ลิ้มลองจากการจัดจำหน่ายที่มีความหนาแน่นฉวิธีสร้างนั้นต้องการให้ฉันสุ่มตารางคะแนน …

1
เอนโทรปีต่าง ๆ
เอนโทรปีความแตกต่างของเกาส์ RV เป็น ) สิ่งนี้ขึ้นอยู่กับσซึ่งเป็นค่าเบี่ยงเบนมาตรฐานเข้าสู่ระบบ2( σ2 πอี---√)log2⁡(σ2πe)\log_2(\sigma \sqrt{2\pi e})σσ\sigma ถ้าเราทำให้ตัวแปรสุ่มเป็นมาตรฐานเพื่อให้มันมีความแปรปรวนของหน่วย สำหรับฉันนี่คือการตอบโต้ที่ใช้งานง่ายเพราะ Kolmogorov ความซับซ้อนของค่าคงที่ normalizing ควรมีขนาดเล็กมากเมื่อเทียบกับการลดลงของเอนโทรปี หนึ่งสามารถประดิษฐ์ตัวถอดรหัสที่แบ่ง / ทวีคูณด้วยค่าคงที่ normalizing เพื่อกู้คืนชุดข้อมูลใด ๆ ที่สร้างขึ้นโดยตัวแปรสุ่มนี้ ความเข้าใจของฉันอาจจะปิด คุณช่วยชี้จุดบกพร่องของฉันได้ไหม

2
ความคาดหวังตามเงื่อนไขของตัวแปรสุ่มแบบเลขชี้กำลัง
สำหรับตัวแปรสุ่ม ( ) ฉันรู้สึกว่าสัญชาตญาณ\ mathbb {E} [X | X> x]ควรจะเท่ากับx + \ mathbb {E} [x]ตั้งแต่ความจำโดยคุณสมบัติการกระจายของx | x> xเป็นเช่นเดียวกับที่ของxแต่ขยับตัวไปทางขวาโดยxX∼Exp(λ)X∼Exp(λ)X\sim \text{Exp}(\lambda)E[X]=1λE[X]=1λ\mathbb{E}[X] = \frac{1}{\lambda}E[X|X>x]E[X|X>x]\mathbb{E}[X|X > x]x+E[X]x+E[X]x + \mathbb{E}[X]X|X>xX|X>xX|X > xXXXxxx อย่างไรก็ตามฉันกำลังดิ้นรนที่จะใช้คุณสมบัติที่ไม่มีหน่วยความจำเพื่อให้การพิสูจน์ที่เป็นรูปธรรม ความช่วยเหลือใด ๆ ที่ชื่นชมมาก ขอบคุณ

1
จะสร้างกราฟผู้รอดชีวิตที่คาดการณ์ไว้จากแบบจำลองที่อ่อนแอได้อย่างไร (โดยใช้ R coxph)
ฉันต้องการคำนวณฟังก์ชั่นผู้รอดชีวิตที่คาดการณ์ไว้สำหรับโมเดลอันตรายตามสัดส่วนของ Cox ด้วยเงื่อนไขที่อ่อนแอ [ใช้แพ็คเกจการอยู่รอด] ปรากฏว่าเมื่อเงื่อนไขที่อ่อนแออยู่ในแบบจำลองฟังก์ชันการรอดชีวิตที่คาดการณ์ไม่สามารถคำนวณได้ ## Example require(survival) data(rats) ## Create fake weight set.seed(90989) rats$weight<-runif(nrow(rats),0.2,0.9) ## Cox model with gamma frailty on litter fit <- coxph(Surv(time, status) ~ rx+weight+frailty(litter,dist="gamma"), data = rats) ## Compute survival curve from the cox model for rx=0 and weight=0.5 kg plot(survfit(fit, newdata=data.frame(rx=0,weight=0.5)),xlab = "time", ylab="Survival") …

1
อะไรคือความแตกต่างระหว่างการวิเคราะห์การอยู่รอดและการถดถอยปัวซอง?
ฉันกำลังทำงานกับปัญหาการทำนายการปั่นแบบดั้งเดิมโดยใช้จำนวนการเข้าชมของผู้ใช้ที่กำหนดให้กับไซต์หนึ่งและฉันคิดว่า Poisson Regression เป็นเครื่องมือที่เหมาะสมสำหรับการสร้างแบบจำลองการมีส่วนร่วมในอนาคตของผู้ใช้นั้น เมื่อนั้นฉันเจอหนังสือเกี่ยวกับการวิเคราะห์การอยู่รอดและการจำลองแบบอันตรายและฉันไม่รู้ว่าเทคนิคใดดีที่สุด ฉันไม่ต้องการทำการค้นคว้าทั้งสองหัวข้อในเวลาเดียวกันดังนั้นสิ่งที่ดีที่สุดสำหรับการสร้างแบบจำลองการมีส่วนร่วมของผู้ใช้โดยใช้ข้อมูลในอดีตและข้อมูลประชากร

1
เปรียบเทียบเส้นโค้งการอยู่รอดสองเส้นสำหรับข้อมูลที่จับคู่
ฉันต้องการเปรียบเทียบสองวิธีที่แตกต่างกันในการตรวจจับการเปลี่ยนแปลงสถานะในการวิเคราะห์การรอดชีวิต มีการติดตามกลุ่มวิชาเป็นเวลานาน (หลายปี) และใช้วิธีการตรวจสอบสองวิธีเพื่อตรวจสอบว่ามีการเปลี่ยนแปลงสถานะหรือไม่ วิธีหนึ่งใช้ในการตรวจสอบแต่ละวิชาปีละสองครั้งและใช้วิธีที่สองเพื่อตรวจสอบแต่ละวิชาปีละครั้ง คำถามคือถ้าทั้งสองวิธีต่างกันอย่างเป็นระบบในความสามารถในการตรวจจับการเปลี่ยนแปลงสถานะ การทดสอบที่ฉันคิดว่าเป็นการทดสอบระดับล็อกเพื่อดูว่าเส้นโค้ง Kaplan-Meier ของทั้งสองวิธีนั้นแตกต่างกันหรือไม่ ฉันสงสัยว่ามันเป็นปัญหาหรือไม่ที่เส้นโค้งการอยู่รอดเป็น“ คู่” (เช่นใช้สองวิธีในวิชาเดียวกัน) เมื่อทำการทดสอบระดับบันทึก มันเป็นการละเมิดสมมติฐานในการทดสอบ log-rank หรืออาจเป็นเพียงการทดสอบที่ไม่มีประสิทธิภาพเพราะมันไม่ได้อธิบายว่าเส้นโค้งทั้งสองนั้นเกี่ยวข้องกันหรือไม่ ไม่มีใครมีข้อเสนอแนะสำหรับการวิเคราะห์ทางเลือกที่ทำบัญชีสำหรับการพึ่งพาอาศัยอยู่ในการสังเกต? บางทีนี่อาจไม่ใช่ปัญหาบางทีฉันอาจจะคิดมากไป ฉันไม่ทราบว่าเวลาที่แท้จริงของการเปลี่ยนแปลงสถานะเพียงจุดเวลาเมื่อวิธีการตรวจพบการเปลี่ยนแปลงสถานะ หนึ่งคิดว่าฉันต้องตั้งเวลาการเอาตัวรอดให้เป็นจุดกึ่งกลางของช่วงเวลาระหว่างการตรวจสอบครั้งล่าสุดเมื่อไม่ได้ตรวจพบการเปลี่ยนสถานะและการตรวจสอบเมื่อตรวจพบการเปลี่ยนสถานะ ที่สามารถชดเชยข้อเสียของวิธีการที่ใช้สำหรับการตรวจสอบวิชาเพียงปีละครั้งในทางตรงกันข้ามกับวิธีการที่ใช้สองครั้งต่อปี จากนั้นสร้างเส้นโค้งการอยู่รอดจากข้อมูลเหล่านี้

3
เครื่องจักร Boltzmann ที่ จำกัด สำหรับการถดถอย
ผมติดตามคำถามที่ผมถามก่อนหน้านี้เมื่อRBMs ฉันเห็นวรรณกรรมจำนวนมากที่อธิบายถึงพวกเขา แต่ไม่มีใครพูดถึงการถดถอยได้ (ไม่ใช่การจำแนกด้วยข้อมูลที่มีป้ายกำกับ) ฉันรู้สึกว่ามันใช้สำหรับข้อมูลที่ไม่มีป้ายกำกับเท่านั้น มีทรัพยากรใดบ้างสำหรับจัดการกับการถดถอย หรือมันง่ายเหมือนการเพิ่มเลเยอร์อื่นที่ด้านบนของเลเยอร์ที่ซ่อนอยู่และรันอัลกอริทึมซีดีขึ้นและลง? ขอบคุณมากล่วงหน้า

3
การนำบ่วงบาศแบบไม่ลบไปใช้ใน R
ฉันกำลังมองหาโอเพนซอร์สหรือห้องสมุดที่มีอยู่ที่ฉันสามารถใช้ได้ เท่าที่ฉันบอกแพคเกจ glmnet ไม่สามารถขยายได้อย่างง่ายดายเพื่อครอบคลุมกรณีที่ไม่ใช่เชิงลบ ฉันอาจจะผิดคนที่มีความคิดใด ๆ ชื่นชมมาก โดยไม่เป็นลบฉันหมายความว่าสัมประสิทธิ์ทั้งหมดถูก จำกัด ให้เป็นบวก (> 0)
13 r  lasso 

4
อนุกรมเวลาที่ต่างกันก่อน Arima หรือภายใน Arima
มันจะดีกว่าที่จะแตกต่างชุด (สมมติว่ามันต้องการ) ก่อนที่จะใช้ Arima หรือดีกว่าที่จะใช้พารามิเตอร์ d ภายใน Arima? ฉันรู้สึกประหลาดใจที่ความแตกต่างของค่าที่ติดตั้งนั้นขึ้นอยู่กับเส้นทางที่ถ่ายด้วยแบบจำลองและข้อมูลเดียวกัน หรือฉันกำลังทำอะไรผิดพลาด? install.packages("forecast") library(forecast) wineindT<-window(wineind, start=c(1987,1), end=c(1994,8)) wineindT_diff <-diff(wineindT) #coefficients and other measures are similar modA<-Arima(wineindT,order=c(1,1,0)) summary(modA) modB<-Arima(wineindT_diff,order=c(1,0,0)) summary(modB) #fitted values from modA A<-forecast.Arima(modA,1)$fitted #fitted from modB, setting initial value to the first value in the original series B<-diffinv(forecast.Arima(modB,1)$fitted,xi=wineindT[1]) plot(A, col="red") lines(B, …
13 r  time-series  arima 

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.