สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
จุดแปรปรวนคืออะไร?
ในขณะที่อ่านองค์ประกอบของการเรียนรู้ทางสถิติฉันพบคำว่า "ความแปรปรวนแบบชี้จุด" หลายครั้ง แม้ว่าฉันจะมีความคิดที่คลุมเครือเกี่ยวกับความหมายของสิ่งที่อาจเป็นไปได้ แต่ฉันก็รู้สึกซาบซึ้งที่ได้รู้ มันถูกกำหนดอย่างไร? มันได้มาอย่างไร
10 variance 

1
การตีความค่าสัมประสิทธิ์ของการโต้ตอบระหว่างตัวแปรเด็ดขาดและตัวแปรต่อเนื่อง
ฉันมีคำถามเกี่ยวกับการตีความค่าสัมประสิทธิ์ของการโต้ตอบระหว่างตัวแปรแบบต่อเนื่องและหมวดหมู่ นี่คือแบบจำลองของฉัน: model_glm3=glm(cog~lg_hag+race+pdg+sex+as.factor(educa)+(lg_hag:as.factor(educa)), data=base_708) Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 21.4836 2.0698 10.380 < 2e-16 *** lg_hag 8.5691 3.7688 2.274 0.02334 * raceblack -8.4715 1.7482 -4.846 1.61e-06 *** racemexican -3.0483 1.7073 -1.785 0.07469 . racemulti/other -4.6002 2.3098 -1.992 0.04687 * pdg 2.8038 0.4268 6.570 1.10e-10 *** sexfemale 4.5691 …

3
มีขีด จำกัด สูงสุดของจำนวนช่วงเวลาในฮิสโตแกรมหรือไม่?
ฉันได้อ่านหลายบทความและเนื้อหาจากหนังสือที่อธิบายถึงวิธีการเลือกที่ดีจำนวนของช่วง (ถังขยะ) สำหรับ histogram ของชุดข้อมูล แต่ฉันสงสัยว่าถ้ามีความยากสูงสุดจำนวนช่วงเวลาที่อยู่กับจำนวนของคะแนนใน ชุดข้อมูลหรือเกณฑ์อื่น ๆ ความเป็นมา:เหตุผลที่ฉันถามคือฉันพยายามเขียนซอฟต์แวร์ตามขั้นตอนจากรายงานการวิจัย ขั้นตอนหนึ่งในกระบวนการนี้คือการสร้างฮิสโตแกรมหลาย ๆ อันจากชุดข้อมูลจากนั้นเลือกความละเอียดที่เหมาะสมที่สุดตามฟังก์ชั่นลักษณะ (กำหนดโดยผู้เขียนบทความ) ปัญหาของฉันคือผู้เขียนไม่ได้กล่าวถึงขอบเขตบนสำหรับช่วงเวลาที่จะทดสอบ (ฉันมีหลายร้อยชุดข้อมูลในการวิเคราะห์และแต่ละคนสามารถมีความแตกต่างกัน "ที่ดีที่สุด" จำนวนของถังขยะ. นอกจากนี้มันเป็นสิ่งสำคัญที่ดีที่สุดจำนวนถังขยะจะถูกเลือกเพื่อให้ตนเองดูที่ผลลัพธ์และการเลือกที่ดีจะไม่ งาน.) การกำหนดจำนวนช่วงเวลาสูงสุดเพียงเพื่อให้เป็นจำนวนคะแนนในชุดข้อมูลเป็นแนวทางที่ดีหรือมีเกณฑ์อื่น ๆ ที่มักใช้ในสถิติหรือไม่

2
REML vs ML stepAIC
ฉันรู้สึกท่วมท้นหลังจากพยายามขุดลงไปในวรรณคดีว่าจะใช้การวิเคราะห์แบบผสมของฉันได้อย่างไรหลังจากใช้ AIC เพื่อเลือกแบบจำลองหรือแบบจำลองที่ดีที่สุด ฉันไม่คิดว่าข้อมูลของฉันมีความซับซ้อน แต่ฉันกำลังมองหาการยืนยันว่าสิ่งที่ฉันทำถูกต้องแล้วแนะนำวิธีดำเนินการต่อ ฉันไม่แน่ใจว่าควรใช้ lme หรือ lmer หรือไม่ถ้าใช้อย่างใดอย่างหนึ่งควรใช้ REML หรือ ML ฉันมีคุณค่าในการเลือกและฉันต้องการรู้ว่า covariates ที่ดีที่สุดมีอิทธิพลต่อคุณค่านั้นและอนุญาตให้มีการคาดการณ์ นี่คือตัวอย่างข้อมูลและโค้ดสำหรับการทดสอบที่ฉันใช้: ID=as.character(rep(1:5,3)) season=c("s","w","w","s","s","s","s","w","w","w","s","w","s","w","w") time=c("n","d","d","n","d","d","n","n","n","n","n","n","d","d","d") repro=as.character(rep(1:3,5)) risk=runif(15, min=0, max=1.1) comp1=rnorm(15, mean = 0, sd = 1) mydata=data.frame(ID, season, time, repro, risk, comp1) c1.mod1<-lmer(comp1~1+(1|ID),REML=T,data=mydata) c1.mod2<-lmer(comp1~risk+(1|ID),REML=T,data=mydata) c1.mod3<-lmer(comp1~season+(1|ID),REML=T,data=mydata) c1.mod4<-lmer(comp1~repro+(1|ID),REML=T,data=mydata) c1.mod5<-lmer(comp1~time+(1|ID),REML=T,data=mydata) c1.mod6<-lmer(comp1~season+repro+time+(1|ID),REML=T,data=mydata) c1.mod7<-lmer(comp1~risk+season+season*time+(1|ID),REML=T,data=mydata) ฉันมีโมเดล 19 รุ่นที่สำรวจข้อมูลนี้ด้วยชุดค่าผสมที่หลากหลายและมีเงื่อนไขการโต้ตอบ 2 ทาง แต่จะใช้ …

3
Winbugs และ MCMC อื่น ๆ โดยไม่มีข้อมูลสำหรับการเผยแพร่ก่อนหน้า
จะเกิดอะไรขึ้นเมื่อคุณไม่มีแนวคิดเกี่ยวกับการกระจายพารามิเตอร์ เราควรใช้วิธีใด เวลาส่วนใหญ่ของเรามุ่งไปที่ขีดล่างหากตัวแปรบางตัวมีอิทธิพลเหนือการมีอยู่ / ไม่มีชนิดที่แน่นอนและตัวแปรนั้นได้รับการยอมรับหรือไม่ตามความสำคัญของตัวแปร ซึ่งหมายความว่าส่วนใหญ่เราไม่ได้คิดเกี่ยวกับการแจกแจงแบบ expetcted พารามิเตอร์ควรมี มันถูกต้องหรือไม่ที่จะสมมติว่าพารามิเตอร์ทั้งหมดเป็นไปตามการแจกแจงปกติเมื่อทุกอย่างที่ฉันรู้คือว่า b1, b2, b3 และ b4 ควรแตกต่างกันระหว่าง -2 ถึง 2 และ b0 สามารถแตกต่างกันระหว่าง -5 และ 5? model { # N observations for (i in 1:N) { species[i] ~ dbern(p[i]) logit(p[i]) <- b0 + b1*var1[i] + b2*var2[i] + b3*var3[i] + b4*var4[i] } # …
10 r  bayesian  mcmc  bugs  winbugs 

5
เป็นไปได้หรือไม่ที่จะพอดีกับแบบจำลอง Bayesian ก่อนจากนั้นจึงเริ่มลดระดับ Priors?
เมื่อทำสถิติบ่อยครั้งจะมีรายการไม่ต้องเสียเงินจำนวนมากเช่นการดูผลการทดสอบทางสถิติก่อนตัดสินใจรวบรวมข้อมูลเพิ่มเติม ฉันสงสัยว่าโดยทั่วไปหากมีรายการ no-nos ที่คล้ายกันสำหรับวิธีการที่เกี่ยวข้องในสถิติแบบเบย์และโดยเฉพาะอย่างยิ่งว่าต่อไปนี้เป็นหนึ่งในนั้นหรือไม่ เมื่อไม่นานมานี้ฉันได้ตระหนักว่าสำหรับบางรุ่นที่ฉันทำเหมาะสมขั้นตอนของฉันคือการปรับแบบจำลองให้พร้อมกับนักบวชที่มีข้อมูลเพื่อดูว่ามันทำงานหรือระเบิดได้หรือไม่ ดัดแปลงโมเดลใหม่ แรงจูงใจของฉันสำหรับเรื่องนี้เกี่ยวข้องกับความจริงที่ว่าฉันเขียนแบบจำลองเหล่านี้ใน JAGS / Stan และในใจของฉันฉันได้ปฏิบัติต่อมันเหมือนงานเขียนโปรแกรมมากกว่าสถิติ ดังนั้นฉันจะทำการวิ่งครั้งแรกเรียงลำดับของเสื้อผ้าเพื่อที่จะมาบรรจบกันอย่างรวดเร็วโดยใช้นักบวชที่มีข้อมูลทำให้ง่ายต่อการตรวจจับข้อผิดพลาดในแบบจำลองที่ฉันเขียน จากนั้นหลังจากแก้ไขจุดบกพร่องในแบบจำลองแล้วฉันปรับโฉมใหม่ด้วยนักบวชที่ไม่มีข้อมูลหรือมีข้อมูลน้อย คำถามของฉันคือฉันกำลังทำผิดกฎบางอย่างกับกระบวนการนี้หรือไม่ ตัวอย่างเช่นเพื่อให้ข้อสรุปของฉันถูกต้องและเพื่อหลีกเลี่ยงการใช้ประโยชน์จากองศาอิสระของนักวิจัยฉันต้องผูกมัดให้กับนักบวชที่เฉพาะเจาะจงก่อนที่จะเริ่มปรับรูปแบบใด ๆ

2
การตรวจสอบข้าม GAM เพื่อทดสอบข้อผิดพลาดการทำนาย
คำถามของฉันเกี่ยวกับเกมในแพ็คเกจ mgcv R เนื่องจากขนาดตัวอย่างเล็กฉันต้องการตรวจสอบข้อผิดพลาดการทำนายโดยใช้การตรวจสอบความถูกต้องแบบลาก่อน มันสมเหตุสมผลหรือไม่ ฉันมีแพคเกจหรือรหัสที่ฉันสามารถทำได้หรือไม่? errorest()ฟังก์ชั่นในIPREDแพคเกจไม่ทำงาน ชุดข้อมูลการทดสอบอย่างง่ายคือ: library(mgcv) set.seed(0) dat <- gamSim(1,n=400,dist="normal",scale=2) b<-gam(y~s(x0)+s(x1)+s(x2)+s(x3),data=dat) summary(b) pred <- predict(b, type="response") ขอบคุณมากสำหรับความช่วยเหลือของคุณ!
10 r  cross-validation  gam  mgcv 

1
การคำนวณช่วงเวลาการทำนายเมื่อใช้การตรวจสอบความถูกต้องข้าม
การประมาณค่าเบี่ยงเบนมาตรฐานคำนวณโดย: sN=1N∑Ni=1(xi−x¯¯¯)2−−−−−−−−−−−−−√.sN=1N∑i=1N(xi−x¯)2. s_N = \sqrt{\frac{1}{N} \sum_{i=1}^N (x_i - \overline{x})^2}. ( http://en.wikipedia.org/wiki/Standard_deviation#Sample_standard_deviation ) สำหรับการทำนายความถูกต้องตัวอย่างจากการตรวจสอบความถูกต้องไขว้ 10 เท่า ฉันกังวลว่าความแม่นยำในการทำนายที่คำนวณระหว่างแต่ละครั้งนั้นขึ้นอยู่กับชุดการฝึกอบรมที่ทับซ้อนกันอย่างมาก (แม้ว่าชุดการทำนายจะเป็นอิสระ) แหล่งข้อมูลใด ๆ ที่กล่าวถึงนี้จะเป็นประโยชน์อย่างมาก

4
ความแปรปรวนของตัวต้านทานแบบขนาน
สมมติว่าคุณมีชุดตัวต้านทาน R ซึ่งทั้งหมดจะถูกกระจายด้วยค่าเฉลี่ยμและความแปรปรวนσ พิจารณาส่วนของวงจรที่มีเลย์เอาต์ต่อไปนี้: (r) || (r + r) || (R + R + R) ความต้านทานเท่ากันของแต่ละส่วนคือ r, 2r และ 3r ความแปรปรวนของแต่ละส่วนก็จะσ2σ2σ^2 , 2σ22σ22σ^2 , 3σ23σ23σ^2 2 ความแตกต่างในความต้านทานของวงจรทั้งหมดคืออะไร? หลังจากการสุ่มตัวอย่างหลายล้านจุดที่เราพบว่าความแปรปรวนอยู่ที่ประมาณ.10286σ2.10286σ2.10286\sigma^2 2 เราจะมาถึงข้อสรุปนี้ได้อย่างไร แก้ไข: ค่าความต้านทานจะถือว่าได้รับการกระจายตามปกติกับบางต้านทาน R ค่าเฉลี่ยและความแปรปรวนσ2σ2σ^2 2

1
จำนวนส่วนประกอบที่เหมาะสมที่สุดในส่วนผสมของเกาส์เซียน
ดังนั้นการได้รับ "ความคิด" ของจำนวนที่ดีที่สุดของกลุ่มใน k- หมายถึงเป็นเอกสารที่ดี ฉันพบบทความเกี่ยวกับการทำเช่นนี้ในการผสมแบบเกาส์ แต่ไม่แน่ใจว่าฉันเชื่อมั่นในมันไม่เข้าใจดีนัก มี ... วิธีที่อ่อนโยนกว่าในการทำเช่นนี้?

3
วิธีการค้นหาความคล้ายคลึงกันระหว่างอนุกรมเวลา?
ในตัวอย่างต่อไปนี้ผมมีกรอบข้อมูลซึ่งประกอบด้วยอนุกรมเวลาของการวัดอุณหภูมิของน้ำบันทึกที่ 5 ระดับความลึกในมหาสมุทรที่แต่ละค่าในTempสอดคล้องกับวันที่และความลึกในDateTimeDepth set.seed(1) Temp <- rnorm(43800,sd=20) AirT <- rnorm(8760,sd=20) Depth <- c(1:5) DateTime = seq(from=as.POSIXct("2010-01-01 00:00"), to=as.POSIXct("2010-12-31 23:00"), length=8760) Time <- as.POSIXct(DateTime, format = "%Y-%m-%d %H:%M") DatT <- data.frame(Temp) ## bind together FinalDat <- cbind(DatT, Date = rep(Time,5)) FinalDat <- cbind(FinalDat, AirT = rep(AirT, 5), Depth = rep(Depth, each …

3
ช่วงที่เป็นไปได้ของ
สมมติว่าเป็นอนุกรมเวลาสามชุด ,และX1X1X_1X2X2X_2YYY เล่นการถดถอยเชิงเส้นสามัญ ~ ( ) เราได้รับU สามัญถดถอยเชิงเส้น ~รับV สมมติว่าYYYX1X1X_1Y=bX1+b0+ϵY=bX1+b0+ϵY = b X_1 + b_0 + \epsilonR2=UR2=UR^2 = UYYYX2X2X_2R2=VR2=VR^2 = VU&lt;VU&lt;VU < V ค่าต่ำสุดและสูงสุดที่เป็นไปได้ของจากการถดถอยคือ ~ ( )R2R2R^2YYYX1+X2X1+X2X_1 + X_2Y=b1X1+b2X2+b0+ϵY=b1X1+b2X2+b0+ϵY = b_1 X_1 + b_2 X_2 + b_0 + \epsilon ฉันเชื่อว่าค่าต่ำสุดควรเป็น + ค่าเล็กเนื่องจากการเพิ่มตัวแปรใหม่จะเพิ่มเสมอ แต่ฉันไม่ทราบวิธีการหาจำนวนค่าเล็ก ๆ นี้และฉันไม่รู้วิธีหาช่วงสูงสุด .R2R2R^2VVVR2R2R^2

2
หมายถึงข้อผิดพลาดมาตรฐาน 2.04? วิธีการที่แตกต่างกันอย่างมีนัยสำคัญเมื่อช่วงความเชื่อมั่นที่ทับซ้อนกันกันอย่างแพร่หลาย?
ภาพด้านล่างเป็นจากบทความนี้ในวิทยาศาสตร์ทางจิตวิทยา เพื่อนร่วมงานชี้ให้เห็นสิ่งผิดปกติสองอย่างเกี่ยวกับเรื่องนี้: ตามคำบรรยายภาพแถบข้อผิดพลาดแสดง "ข้อผิดพลาดมาตรฐาน± 2.04, ช่วงความมั่นใจ 95%" ฉันเคยเห็นเพียง± 1.96 SE ใช้สำหรับ 95% CI และฉันไม่พบอะไรเกี่ยวกับ 2.04 SE ที่ถูกใช้เพื่อวัตถุประสงค์ใด ๆ 2.04 SE มีความหมายที่ยอมรับบ้างไหม? ข้อความระบุว่าการเปรียบเทียบแบบคู่ตามแผนพบว่ามีความแตกต่างอย่างมีนัยสำคัญสำหรับขนาดเฉลี่ยเริ่มต้นในข้อผิดพลาดเทียบกับการทดลองที่คาดการณ์ได้ถูกต้อง (t (30) = 2.51, p &lt;.01) และข้อผิดพลาดเทียบกับ &lt;.01) (การทดสอบ F ของรถโดยสารก็มีนัยสำคัญเช่นกันที่ p &lt;.05) อย่างไรก็ตามกราฟแสดงแถบข้อผิดพลาดสำหรับทั้งสามเงื่อนไขซ้อนกันอย่างมาก หากช่วงเวลา± 2.04 SE ทับกันค่าจะแตกต่างอย่างมีนัยสำคัญที่ p &lt;.05 อย่างไร การทับซ้อนมีขนาดใหญ่พอที่ฉันสมมติว่าช่วงเวลา± 1.96 SE ยังทับซ้อนกัน

1
จะรับการทำนายสำหรับตัวแปรเฉพาะใน WinBUGS ได้อย่างไร
ฉันเป็นผู้ใช้ใหม่ของ WinBUGS และมีคำถามหนึ่งข้อสำหรับความช่วยเหลือของคุณ หลังจากใช้รหัสต่อไปนี้ผมได้ค่าพารามิเตอร์ของbeta0ผ่านbeta4(สถิติ, ความหนาแน่น) แต่ผมไม่ทราบว่าจะได้รับการคาดการณ์ของมูลค่าสุดท้ายของhซึ่งผมตั้งค่าให้NAกับรูปแบบในรหัส ทุกคนสามารถให้คำแนะนำแก่ฉันได้หรือไม่? คำแนะนำใด ๆ ที่จะได้รับการชื่นชมอย่างมาก model { for(i in 1: N) { CF01[i] ~ dnorm(0, 20) CF02[i] ~ dnorm(0, 1) h[i] ~ dpois (lambda [i]) log(lambda [i]) &lt;- beta0 + beta1*CF03[i] + beta2*CF02[i] + beta3*CF01[i] + beta4*IND[i] } beta0 ~ dnorm(0.0, 1.0E-6) beta1 ~ dnorm(0.0, …

2
การถดถอยแบบเกาส์กระบวนการสำหรับชุดข้อมูลมิติสูง
แค่อยากจะดูว่าใครมีประสบการณ์ใด ๆ ที่ใช้การถดถอยแบบเกาส์กระบวนการ (GPR) กับชุดข้อมูลมิติสูง ฉันกำลังดูวิธีการ GPR แบบกระจัดกระจายบางอย่าง (เช่นแบบ spse pseudo-inputs GPR) เพื่อดูว่าอะไรสามารถใช้งานได้กับชุดข้อมูลมิติสูงที่การเลือกคุณสมบัติเป็นส่วนหนึ่งของกระบวนการเลือกพารามิเตอร์ ข้อเสนอแนะใด ๆ เกี่ยวกับเอกสาร / รหัส / หรือวิธีการต่างๆที่จะลองแน่นอนชื่นชม ขอบคุณ

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.