สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
ฉันจะสร้างพล็อตที่คล้ายกับที่สร้างโดย plot.bugs และ plot.jags จาก mcmc.list ได้อย่างไร [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามดังนั้นจึงเป็นหัวข้อสำหรับการตรวจสอบข้าม ปิดให้บริการใน2 ปีที่ผ่านมา R ดูเหมือนว่าจะสามารถที่จะมีความสุขเอาท์พุทแปลงสรุปจากbugsและjagsวัตถุที่สร้างขึ้นโดยฟังก์ชั่นR2WinBUGS :: ข้อบกพร่องและR2jags: Jags อย่างไรก็ตามฉันใช้rjagsแพ็คเกจ เมื่อฉันพยายามพล็อตผลลัพธ์ของฟังก์ชันrjags::coda.samplesโดยใช้R2WinBUGS::plot.mcmc.listผลลัพธ์คือพล็อตการวินิจฉัย (ความหนาแน่นของพารามิเตอร์, อนุกรมเวลาของโซ่, ความสัมพันธ์อัตโนมัติ) สำหรับแต่ละพารามิเตอร์ ด้านล่างนี้คือประเภทของพล็อตที่ผมอยากจะผลิตจากกวดวิชาแอนดรูว์เกลแมนของ"วิ่ง WinBuugs และ OpenBugs จาก R" plot.pugsเหล่านี้ถูกผลิตโดยใช้ ปัญหาคือว่าplot.bugsใช้bugsวัตถุเป็นอาร์กิวเมนต์ในขณะที่ใช้เวลาการส่งออกของplot.mcmc.listcoda.samples นี่คือตัวอย่าง (จากcoda.samples): library(rjags) data(LINE) LINE$recompile() LINE.out <- coda.samples(LINE, c("alpha","beta","sigma"), n.iter=1000) plot(LINE.out) สิ่งที่ฉันต้องการก็คือ วิธีสร้างพล็อตสรุปสรุปแบบหน้าเดียวที่คล้ายกับข้อมูลที่คล้ายกับที่สร้างโดย plot.bugs ฟังก์ชั่นที่จะแปลงLINE.outเป็นวัตถุบั๊กหรือ

4
วิธีปรับให้พอดีกับแบบจำลองสำหรับอนุกรมเวลาที่มีค่าผิดปกติ
ฉันได้ติดตั้งแบบจำลอง ARIMA (5,1,2) โดยใช้auto.arima()ฟังก์ชั่นใน R และโดยลำดับการค้นหาเราสามารถพูดได้ว่านี่ไม่ใช่แบบจำลองที่ดีที่สุดในการคาดการณ์ หากมีค่าผิดปกติอยู่ในชุดข้อมูลวิธีการใดที่จะพอดีกับแบบจำลองกับข้อมูลดังกล่าว

1
โมเดลความเป็นอันตรายตามสัดส่วนของค็อกซ์และการตีความค่าสัมประสิทธิ์เมื่อมีปฏิกิริยาต่อผู้ป่วยมากขึ้น
นี่คือสรุปเอาท์พุทของ Coxph-model ที่ฉันใช้ (I ใช้ R และผลลัพธ์ขึ้นอยู่กับรุ่นสุดท้ายที่ดีที่สุดนั่นคือตัวแปรอธิบายที่สำคัญทั้งหมดและการโต้ตอบของพวกเขารวมอยู่ด้วย): coxph(formula = Y ~ LT + Food + Temp2 + LT:Food + LT:Temp2 + Food:Temp2 + LT:Food:Temp2) # Y<-Surv(Time,Status==1) n = 555 coef exp(coef) se(coef) z Pr(>|z|) LT 9.302e+02 Inf 2.822e+02 3.297 0.000979 *** Food 3.397e+03 Inf 1.023e+03 3.321 0.000896 *** Temp2 5.016e+03 …

1
ปัญหาเกี่ยวกับการศึกษาแบบจำลองของคำอธิบายการทดลองซ้ำในช่วงความมั่นใจ 95% - ฉันจะไปไหนผิด
ฉันกำลังพยายามเขียนสคริปต์ R เพื่อจำลองการตีความการทดลองซ้ำในช่วงความมั่นใจ 95% ฉันพบว่ามันประเมินค่าสัดส่วนของจำนวนครั้งที่ค่าของประชากรที่แท้จริงของสัดส่วนนั้นอยู่ใน 95% CI ของกลุ่มตัวอย่าง ไม่แตกต่างกันมาก - ประมาณ 96% เทียบกับ 95% แต่นี่ก็สนใจฉันอยู่ดี ฟังก์ชั่นของฉันจะรับตัวอย่างsamp_nจากการกระจาย Bernoulli กับความน่าจะเป็นpop_pและจากนั้นคำนวณช่วงความเชื่อมั่น 95% มีการใช้แก้ไขความต่อเนื่องหรือมากกว่าตรงกับprop.test() binom.test()มันจะส่งกลับ 1 ถ้าสัดส่วนประชากรที่แท้จริงpop_pมีอยู่ใน 95% CI ฉันได้เขียนฟังก์ชันที่สองซึ่งหนึ่งที่ใช้prop.test()และหนึ่งซึ่งใช้binom.test()และมีผลลัพธ์ที่คล้ายกันกับทั้ง: in_conf_int_normal <- function(pop_p = 0.3, samp_n = 1000, correct = T){ ## uses normal approximation to calculate confidence interval ## returns 1 if the …

1
การสร้างแบบจำลองแนวโน้มเชิงพื้นที่โดยการถดถอยด้วย
ฉันวางแผนที่จะรวมพิกัดเป็น covariates ในสมการถดถอยเพื่อปรับสำหรับแนวโน้มเชิงพื้นที่ที่มีอยู่ในข้อมูล หลังจากนั้นฉันต้องการทดสอบเศษที่เหลือจากความสัมพันธ์เชิงพื้นที่ในรูปแบบสุ่ม ฉันมีคำถามหลายข้อ: ฉันควรทำการถดถอยเชิงเส้นซึ่งตัวแปรอิสระเพียงอย่างเดียวคือพิกัดและจากนั้นทดสอบส่วนที่เหลือในการเปลี่ยนแปลงเชิงพื้นที่สัมพันธ์หรือฉันควรจะรวมพิกัดไม่เพียงเป็น covariates แต่ยังรวมถึงตัวแปรอื่น ๆ แล้วทดสอบส่วนที่เหลือด้วยxxxYYy หากฉันคาดว่าจะมีแนวโน้มเป็นกำลังสองแล้วรวมไม่เพียงแต่ยัง ,และแต่แล้วบางส่วนของพวกเขา (และ ) มีค่าสูงกว่า threshold - ฉันควรแยกตัวแปรเหล่านั้นที่มีค่าสูงกว่าว่าไม่สำคัญหรือไม่? ฉันจะตีความแนวโน้มได้อย่างไรว่ามันไม่ได้เป็นกำลังสองอีกต่อไปแล้ว?x , yx,Yx,yx yxYxyx2x2x^2Y2Y2y^2x yxYxyY2Y2y^2พีพีpพีพีp ฉันเดาว่าฉันควรจะรักษาพิกัดและเป็น covariates อื่น ๆ และทดสอบพวกเขาในการมีความสัมพันธ์เชิงเส้นกับตัวแปรตามโดยการสร้างแปลงที่เหลือบางส่วน ... แต่เมื่อฉันเปลี่ยนพวกเขา (ถ้าพวกเขาต้องการการแปลง) ที่จะไม่ เป็นแนวโน้มแบบนั้นอีกต่อไป (โดยเฉพาะถ้าฉันรวม ,และสำหรับแนวโน้มกำลังสอง) มันอาจแสดงให้เห็นว่าเช่นต้องการการแปลงในขณะที่xxxYYyx yxYxyx2x2x^2Y2Y2y^2x2x2x^2xxxไม่ได้หรืออย่างนั้น? ฉันจะตอบสนองอย่างไรในสถานการณ์เหล่านี้? ขอบคุณ.

1
ทำไมการแนะนำของเอฟเฟกต์ความชันแบบสุ่มทำให้ SE ของความชันเพิ่มขึ้น
ฉันพยายามวิเคราะห์ผลกระทบของปีต่อตัวแปร logInd สำหรับกลุ่มบุคคลโดยเฉพาะ (ฉันมี 3 กลุ่ม) โมเดลที่ง่ายที่สุด: > fix1 = lm(logInd ~ 0 + Group + Year:Group, data = mydata) > summary(fix1) Call: lm(formula = logInd ~ 0 + Group + Year:Group, data = mydata) Residuals: Min 1Q Median 3Q Max -5.5835 -0.3543 -0.0024 0.3944 4.7294 Coefficients: Estimate Std. Error …

3
วิธีการทดสอบ / พิสูจน์ข้อมูลเป็นศูนย์ที่สูงเกินจริง?
ฉันมีปัญหาที่ฉันคิดว่าควรจะง่าย แต่ไม่สามารถเข้าใจได้ ฉันกำลังดูการผสมเกสรของเมล็ดฉันมีพืช (n = 36) ดอกไม้ที่อยู่ในกลุ่มฉันลองกลุ่มดอกไม้ 3 กลุ่มจากแต่ละต้นและฝัก 6 เมล็ดจากแต่ละกลุ่ม (18 ฝักทั้งหมดจากแต่ละต้น) ฝักสามารถมีได้ระหว่าง 0 ถึงมากที่สุด 4 เมล็ดเรณู ดังนั้นข้อมูลจะถูกนับด้วยขอบเขตบน ฉันกำลังหาค่าเฉลี่ยของเมล็ดประมาณ 10% ของเรณู แต่ที่ใดก็ได้ระหว่าง 1 - 30% ในพืชที่กำหนดดังนั้นมากกว่าข้อมูลที่กระจัดกระจายและแน่นอนว่ามีคลัสเตอร์ที่หายไป 4 ต้นใน 3 พืชดังนั้นจึงไม่สมมาตรอย่างสมบูรณ์ . คำถามที่ฉันถามคือถ้าข้อมูลนี้สนับสนุนความคิดที่โรงงานนี้ต้องการการถ่ายละอองเรณูสำหรับชุดเมล็ด ฉันพบว่าการกระจายของจำนวนเมล็ดในฝักดูเหมือนจะมีมากกว่า 0 ฝักเรณู (6-9 ฝักจาก 16) และอื่น ๆ 3 และ 4 พอดเรณูเมล็ด (2-4 สำหรับแต่ละ) กว่าจะ จะคาดหวังถ้าเมล็ดในประชากรเป็นเพียงการผสมเกสรแบบสุ่ม โดยพื้นฐานแล้วฉันคิดว่านี่เป็นตัวอย่างแบบคลาสสิกสำหรับข้อมูลที่สูงเกินจริงศูนย์แมลงตัวแรกทำอย่างใดอย่างหนึ่งหรือไม่ได้เยี่ยมชมดอกไม้เลย …


1
มันสำคัญแค่ไหนที่คุณสุ่มตัวอย่างประชากร
ฉันมีถังผสมที่มีลูกหินจำนวนนับไม่ถ้วน มีหินอ่อนจำนวนไม่ จำกัด ในถัง แต่มีเพียงบางสายพันธุ์ที่ไม่ทราบ แต่มี จำกัด: ไม่เป็นที่รู้จักและสำหรับ , การวาดรูปหินอ่อน -type อาจมีแนวโน้มมากกว่าการวาดรูปหินอ่อน -typeV= {โวลต์1,โวลต์2,โวลต์3, . . . ,โวลต์k}V={v1,v2,v3,...,vk}\mathcal{V} = \{v_{1},v_{2},v_{3},...,v_{k}\} kkkฉัน≠ ji≠ji\neq jโวลต์ผมviv_iโวลต์Jvjv_j ในการทดสอบเครื่องจะสุ่มตัวอย่าง vat โดยใช้โพรซีเดอร์ที่ไม่รู้จัก เครื่องรายงานชุดอธิบายพันธุ์หินอ่อนจากตัวอย่าง: XXXQ≤ kq≤kq\leq kX⊆ V;| X| =qX⊆V;|X|=q X \subseteq \mathcal{V}; \quad |X|=q การทดลองของการทดลองนี้มีการทำซ้ำ (ได้รับการแก้ไขผ่านการทดลอง) และเราได้รับลำดับของส่วนย่อยของ ,dots)QqqVV\mathcal{V}(X1,X2, … )(X1,X2,…)(X_1,X_2,\dots) สิ่งอื่น ๆ ที่เรารู้คือ: การทดลองมีความเป็นอิสระและเหมือนกัน เครื่องรายงานด้านบนพันธุ์เกิดขึ้นบ่อยที่สุดในกลุ่มตัวอย่างQqq เราไม่รู้แน่ชัดว่าตัวอย่างเครื่องหินอ่อนเป็นอย่างไร …

2
ฉันจะประมาณช่วงความมั่นใจ 95% โดยใช้การทำโปรไฟล์สำหรับพารามิเตอร์ที่ประเมินได้โดยการเพิ่มฟังก์ชั่นบันทึกความเป็นไปได้โดยใช้ optimize ใน R ได้อย่างไร
ฉันจะประมาณช่วงความมั่นใจ 95% โดยใช้การทำโปรไฟล์สำหรับพารามิเตอร์ที่ประเมินได้โดยการเพิ่มฟังก์ชั่นบันทึกความเป็นไปได้โดยใช้ optimize ใน R ได้อย่างไร ฉันรู้ว่าฉันสามารถประเมินเมทริกซ์ความแปรปรวนร่วมแบบไม่มีสัญญาณได้โดยการสลับเฮสเซียนแต่ฉันกังวลว่าข้อมูลของฉันไม่ตรงตามสมมติฐานที่จำเป็นสำหรับวิธีการนี้ที่จะถูกต้อง ฉันต้องการประเมินช่วงความมั่นใจโดยใช้วิธีอื่น วิธีความน่าจะเป็นของโปรไฟล์มีความเหมาะสมตามที่กล่าวไว้ในStryhn และ Christensenและในหนังสือ MASS Venables และ Ripley ของ§8.4, pp. 220-221? ถ้ามีมีแพ็คเกจใดบ้างที่สามารถช่วยฉันทำสิ่งนี้ใน R หรือไม่? ถ้าไม่เช่นนั้นรหัสหลอกสำหรับวิธีการดังกล่าวจะเป็นอย่างไร

1
วิธีการรับข้อผิดพลาดมาตรฐานจากการถดถอยของการนับข้อมูลที่มีค่าศูนย์สูงเกินศูนย์จะทำอย่างไร [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามดังนั้นจึงเป็นหัวข้อสำหรับการตรวจสอบข้าม ปิดให้บริการใน2 ปีที่ผ่านมา รหัสต่อไปนี้ PredictNew <- predict (glm.fit, newdata = Predict, X1 =X1, Y1= Y1, type = "response", se.fit = TRUE) สร้าง 3 คอลัมน์data.frame--PredictNew, ค่าติดตั้ง, ข้อผิดพลาดมาตรฐานและคำที่เหลือขนาด สมบูรณ์แบบ ... อย่างไรก็ตามการใช้โมเดลที่มีzeroinfl {pscl}: PredictNew <- predict (zeroinfl.fit, newdata = Predict, X1 =X1, Y1= Y1, type = "response", se.fit = …

1
การจำลองการแจกแจง
ฉันกำลังทำงานที่ได้รับมอบหมายการวางแผนกำลังการผลิตและฉันได้อ่านหนังสือบางเล่ม นี่เป็นเรื่องเกี่ยวกับการแจกแจงโดยเฉพาะ ฉันใช้อาร์ อะไรคือวิธีที่แนะนำในการระบุว่าการกระจายข้อมูลของฉันคืออะไร? มีวิธีการทางสถิติเพื่อระบุหรือไม่ ฉันมีแผนภาพนี้ มีวิธีการจำลองสถานการณ์อย่างไรบ้างเมื่อใช้ R ที่นี่ฉันต้องการสร้างข้อมูลสำหรับการแจกแจงบางอย่างเช่นเลขชี้กำลัง r-java เป็นแนวทางที่ถูกต้องหรือไม่หากฉันต้องการรวมเข้ากับ Java? มีวิธีใดที่จะทำนายผลของการกระจาย (การใช้งาน CPU และอื่น ๆ ) ที่จะมีเมื่อฉันส่งข้อมูลไปยังการแจกจ่ายเฉพาะ? การส่งข้อมูลบางอย่างมีความแตกต่างกันอย่างไร? โปรดพิจารณาสิ่งเหล่านี้เป็นคำถามของผู้เริ่มต้น มีหนังสือหรือเนื้อหาที่เกี่ยวข้องกับการจำลองประเภทนี้หรือไม่? หมายเหตุ แผนภาพคือจากจุดสิ้นสุดของกระดาษhttp://people.stern.nyu.edu/adamodar/pdfiles/papers/probabilistic.pdf ความดีของเทคนิคฟิตฉันได้เจอ การประเมินความดีพอดี ไคสแควร์ Kolmogorov-Smirnov, ความหนาแน่นของสถิติ Anderson-Darling, cdf, PP และ QQ แปลง ฉันไม่แน่ใจว่าการตีความหรือขั้นตอนต่อไปควรทำอย่างไรหากพบว่าการแจกแจงของฉันเป็นแบบปกติหรือแบบเลขยกกำลังเป็นต้นฉันต้องทำอย่างไร คาดการณ์? หวังว่าคำถามนี้ชัดเจน ความล่าช้าของเอ็กซ์โปเนนเชียลจะชักนำให้เกิดความผันผวนของคิวตามหนังสือการวางแผนกำลังการผลิตของฉันโดย Neil Gunther ดังนั้นฉันรู้ว่าจุดหนึ่ง

1
ค่าบันทึกที่คาดหวังของการแจกแจงแบบเอ็กซ์โพเนนเชียลที่ไม่ใช่ศูนย์
สมมติว่าไม่กระจายกลางชี้แจงกับสถานที่ตั้งของและอัตรา\จากนั้นคืออะไรXXXkkkλλ\lambdaE(log(X))E(log⁡(X))E(\log(X)) ฉันรู้ว่าสำหรับคำตอบคือ- \ log (\ lambda) - \ gammaโดยที่\ gammaเป็นค่าคงที่ออยเลอร์ - มาเชอร์โรนี่ สิ่งที่เกี่ยวกับเมื่อk> 0 ?k=0k=0k=0−log(λ)−γ−log⁡(λ)−γ-\log(\lambda) - \gammaγγ\gammak>0k>0k > 0

2
ความสับสนเกี่ยวกับ kriging
ฉันอ่านบทความวิกิพีเดียที่เกี่ยวข้องกับการดึงดูด ฉันไม่เข้าใจตอนที่มันบอกว่า Kriging คำนวณตัวประมาณค่าแบบเส้นตรง Z^(x0)Z^(x0)\hat Z (x_0)ของ Z(x0)Z(x0)Z(x_0)เช่นนั้นความแปรปรวน kriging ของจะลดลงด้วยสภาพที่เป็นกลาง ฉันไม่ได้รับมาและวิธีลดความแปรปรวน ข้อเสนอแนะใด ๆ พิเศษฉันไม่ได้รับส่วนที่ใช้ลดลงภายใต้เงื่อนไขที่เป็นกลาง ฉันคิดว่ามันควรจะเป็น E [Z '(x0) -Z (x0)] แทน E [Z' (x) -Z (x)] ใช่ไหม 'เทียบเท่ากับหมวกในบทความ wiki นอกจากนี้ฉันไม่เข้าใจว่าข้อผิดพลาดเกิดขึ้นได้อย่างไร

2
ความสัมพันธ์ที่สำคัญในแต่ละกลุ่ม แต่ไม่สำคัญกว่าทั้งหมด?
สมมติว่าเราทดสอบความสัมพันธ์เพียร์สันระหว่างตัวแปรและอยู่ในกลุ่มและBเป็นไปได้ไหมที่ความสัมพันธ์จะมีนัยสำคัญในแต่ละและแต่ไม่สำคัญเมื่อรวมข้อมูลจากทั้งสองกลุ่มเข้าด้วยกัน? ในกรณีนี้คุณช่วยกรุณาอธิบายให้ฟังหน่อยได้ไหมxxxyyyAAABBB(x,y)(x,y)(x,y)AAABBB

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.