สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
การรักษาระดับตัวแปรเด็ดขาด 'ไม่ทราบ / ปฏิเสธ'
ฉันกำลังสร้างแบบจำลองการทำนายโรคเบาหวานโดยใช้การถดถอยโลจิสติก ชุดข้อมูลที่ใช้คือ ระบบเฝ้าระวังปัจจัยเสี่ยง (BRFSS)ของศูนย์ควบคุมโรค (CDC) หนึ่งในตัวแปรอิสระคือความดันโลหิตสูง มันเป็นหมวดหมู่ที่มีระดับต่อไปนี้ 'ใช่', 'ไม่', 'ไม่ทราบ / ปฏิเสธ' ฉันควรลบแถวเหล่านั้นด้วย 'ไม่ทราบ / ปฏิเสธ' ในขณะที่สร้างแบบจำลองหรือไม่ มีความแตกต่างอะไรในการรักษาหรือลบแถวเหล่านั้นออกจากแบบจำลอง

4
วิธีการทดสอบไคสแควร์หลังการทดสอบหลายตารางในตาราง 2 X 3
ชุดข้อมูลของฉันประกอบด้วยการเสียชีวิตโดยรวมหรือการอยู่รอดของสิ่งมีชีวิตที่ไซต์สามประเภททั้งฝั่งกลางและกลาง ตัวเลขในตารางด้านล่างแสดงถึงจำนวนเว็บไซต์ 100% Mortality 100% Survival Inshore 30 31 Midchannel 10 20 Offshore 1 10 ฉันต้องการทราบว่า # ของเว็บไซต์ที่มีอัตราการตาย 100% มีความสำคัญตามประเภทของไซต์หรือไม่ ถ้าฉันใช้ไคสแควร์ 2 x 3 ฉันจะได้ผลลัพธ์ที่สำคัญ มีการเปรียบเทียบแบบคู่หลังที่ฉันสามารถเรียกใช้หรือฉันควรใช้ ANOVA จิสติกส์หรือการถดถอยด้วยการแจกแจงแบบทวินามหรือไม่ ขอบคุณ!

2
นัยสำคัญทางสถิติของการเปลี่ยนแปลงเมื่อเวลาผ่านไปในรายการ Likert 5 จุด
บริบท: ฉันมีชุดข้อมูลสองชุดจากแบบสอบถามเดียวกันที่ใช้งานเกินสองปี คำถามแต่ละข้อวัดโดยใช้สเกล 5-Likert Q1: รูปแบบการเข้ารหัส ในขณะนี้ฉันได้เขียนคำตอบของฉันในช่วง [0, 1] โดยมี 0 ความหมาย "คำตอบเชิงลบมากที่สุด", 1 ความหมาย "คำตอบเชิงบวกมากที่สุด" และคำตอบอื่น ๆ เว้นระยะเท่ากัน รูปแบบการเข้ารหัส "ดีที่สุด" คืออะไรที่จะใช้สำหรับมาตราส่วน Likert ฉันรู้ว่านี่อาจเป็นเรื่องส่วนตัว Q2: ความสำคัญตลอดหลายปีที่ผ่านมา วิธีที่ดีที่สุดในการพิจารณาว่ามีการเปลี่ยนแปลงอย่างมีนัยสำคัญทางสถิติในช่วงสองปีคืออะไร? นั่นคือการดูผลลัพธ์สำหรับคำถามที่ 1 สำหรับแต่ละปีฉันจะบอกได้อย่างไรว่าความแตกต่างระหว่างผลลัพธ์ 2011 กับผลลัพธ์ 2010 นั้นมีนัยสำคัญทางสถิติหรือไม่ ฉันได้รับความทรงจำที่คลุมเครือเกี่ยวกับการใช้แบบทดสอบ t ของนักเรียนที่นี่ แต่ฉันไม่แน่ใจ

4
โซลูชันการวิเคราะห์การประมาณค่าสัมประสิทธิ์การถดถอยเชิงเส้น
ฉันพยายามที่จะเข้าใจสัญลักษณ์ของเมทริกซ์และทำงานกับเวกเตอร์และเมทริกซ์ ตอนนี้ฉันต้องการที่จะเข้าใจว่าเวกเตอร์ของการประมาณค่าสัมประสิทธิ์ในการคำนวณหลายถดถอยβ^β^\hat{\beta} สมการพื้นฐานดูเหมือนจะเป็น ddβ(y−Xβ)′(y−Xβ)=0.ddβ(y−Xβ)′(y−Xβ)=0. \frac{d}{d\boldsymbol{\beta}} (\boldsymbol{y}-\boldsymbol{X\beta})'(\boldsymbol{y}-\boldsymbol{X\beta}) = 0 \>. ตอนนี้ฉันจะแก้ปัญหาสำหรับ vector ββ\betaที่นี่ได้อย่างไร แก้ไข : เดี๋ยวก่อนฉันติดอยู่ ฉันมาที่นี่แล้วและไม่รู้จะทำอย่างไรต่อ: ddβ⎛⎝⎜(y1y2⋮yn)−⎛⎝⎜11⋮1x11x21xn1x12x22xn2………x1px2p⋮xnp⎞⎠⎟⎛⎝⎜β0β1⋮βp⎞⎠⎟⎞⎠⎟′⎛⎝⎜(y1y2⋮yn)−⎛⎝⎜11⋮1x11x21xn1x12x22xn2………x1px2p⋮xnp⎞⎠⎟⎛⎝⎜β0β1⋮βp⎞⎠⎟⎞⎠⎟ddβ((y1y2⋮yn)−(1x11x12…x1p1x21x22…x2p⋮⋮1xn1xn2…xnp)(β0β1⋮βp))′((y1y2⋮yn)−(1x11x12…x1p1x21x22…x2p⋮⋮1xn1xn2…xnp)(β0β1⋮βp)) \frac{d}{d{\beta}} \left( \left(\begin{smallmatrix} y_1 \\ y_2 \\ \vdots \\ y_n \end{smallmatrix}\right) - \left(\begin{smallmatrix} 1 & x_{11} & x_{12} & \dots & x_{1p} \\ 1 & x_{21} & x_{22} & \dots & x_{2p} \\ …

4
จะคำนวณช่วงความมั่นใจสำหรับอัตราส่วนคี่รวมในการวิเคราะห์อภิมานได้อย่างไร
ฉันมีสองชุดข้อมูลจากการศึกษาความสัมพันธ์ของจีโนมกว้าง ข้อมูลเท่านั้นที่มีคืออัตราส่วนคี่และช่วงความมั่นใจ (95%) สำหรับแต่ละ SNP ฉันต้องการสร้างพล็อตป่าเปรียบเทียบสองอัตราต่อรอง แต่ฉันไม่สามารถหาวิธีในการคำนวณช่วงความเชื่อมั่นที่รวมกันเพื่อให้เห็นภาพผลสรุป ฉันใช้โปรแกรมPLINKเพื่อทำการวิเคราะห์เมตาโดยใช้เอฟเฟกต์คงที่ แต่โปรแกรมไม่ได้แสดงช่วงความมั่นใจเหล่านี้ ฉันจะคำนวณช่วงความมั่นใจได้อย่างไร ข้อมูลที่มีคือ: อัตราส่วนที่แปลกสำหรับการศึกษาแต่ละครั้ง ช่วงความมั่นใจ 95% และ ข้อผิดพลาดมาตรฐาน

2
ความเป็นไปได้ที่เจ้ามือรับแทงจะเสียราคาต่อรองในเกมฟุตบอลเป็นเท่าไหร่?
ทีมฟุตบอลอังกฤษเล่นชุดของการแข่งขันกับฝ่ายตรงข้ามที่แตกต่างกันของความสามารถที่แตกต่างกัน เจ้ามือรับแทงนำเสนอราคาต่อรองสำหรับการแข่งขันแต่ละนัดไม่ว่าจะเป็นการชนะในบ้านการชนะหรือการเสมอ ส่วนที่ผ่านฤดูกาลทีมได้เล่นแมทช์และดึงของพวกเขาซึ่งเกินความคาดหมายจากโอกาสnnnkkk ความน่าจะเป็นที่เจ้ามือรับแทงคือการกำหนดราคาที่ไม่ถูกต้องในการแข่งขันเหล่านี้ไม่ใช่แค่โชคร้าย? หากเจ้ามือรับแทงยังคงราคาของการแข่งขันที่เหลืออยู่ของทีมในลักษณะที่คล้ายกันและฉันเดิมพัน$1$1\$1ว่าแต่ละคนจะเสมอกันผลตอบแทนที่ฉันคาดหวังคืออะไร?

1
มี ARMA ที่เทียบเท่ากับอันดับสหสัมพันธ์หรือไม่
ฉันกำลังดูข้อมูลเชิงเส้นที่ไม่มากซึ่งโมเดลของ ARMA / ARIMA ทำงานได้ไม่ดี แม้ว่าฉันจะเห็นความสัมพันธ์อัตโนมัติบางอย่างและฉันหวังว่าจะได้ผลลัพธ์ที่ดีกว่าสำหรับการไม่เกี่ยวข้องกันโดยอัตโนมัติเชิงเส้น 1 / มี PACF ที่เทียบเท่ากับอันดับสหสัมพันธ์หรือไม่ (ใน R?) 2 / มีแบบจำลอง ARMA ที่เทียบเท่าสำหรับความสัมพันธ์เชิงเส้น / อันดับ (ใน R หรือไม่)

2
หนึ่งจะนำการตรวจสอบข้ามไปใช้อย่างเหมาะสมในบริบทของการเลือกพารามิเตอร์การเรียนรู้สำหรับเครื่องเวกเตอร์สนับสนุนได้อย่างไร
แพคเกจ libsvm ที่ยอดเยี่ยมมีอินเทอร์เฟซหลามและไฟล์ "easy.py" ที่ค้นหาพารามิเตอร์การเรียนรู้ (ค่าใช้จ่าย & แกมม่า) โดยอัตโนมัติซึ่งเพิ่มความแม่นยำของลักษณนามสูงสุด ภายในชุดพารามิเตอร์การเรียนรู้ของผู้สมัครที่ได้รับความแม่นยำถูกดำเนินการโดยการตรวจสอบข้าม แต่ฉันรู้สึกว่าสิ่งนี้ทำลายวัตถุประสงค์ของการตรวจสอบข้าม นั่นคือตราบเท่าที่พารามิเตอร์การเรียนรู้สามารถเลือกได้ด้วยวิธีการที่อาจทำให้เกิดข้อมูลมากเกินไปฉันรู้สึกว่าวิธีการที่เหมาะสมกว่านั้นคือการใช้การตรวจสอบข้ามในระดับการค้นหา: ทำการค้นหา บนชุดข้อมูลการฝึกอบรมจากนั้นประเมินความถูกต้องสูงสุดของ SVM ซึ่งเป็นผลมาจากพารามิเตอร์การเรียนรู้ที่ได้รับการคัดเลือกในที่สุดโดยการประเมินภายในชุดข้อมูลการทดสอบแยกต่างหาก หรือฉันกำลังพลาดบางสิ่งที่นี่

1
ใน R ฉันจะอ้างอิง \ lookup ใน cdf ของตารางการแจกแจงแบบปกติมาตรฐานได้อย่างไร
ล็อคแล้ว คำถามและคำตอบของคำถามนี้ถูกล็อคเนื่องจากคำถามอยู่นอกหัวข้อ แต่มีความสำคัญทางประวัติศาสตร์ ขณะนี้ไม่ยอมรับคำตอบหรือการโต้ตอบใหม่ ฉันสมมติว่า R มีสิ่งนี้ในตัว ฉันจะอ้างอิงได้อย่างไร

3
ผิดหรือไม่ที่จะกระวนกระวายใจก่อนที่จะทำการทดสอบ Wilcoxon?
ฉันเขียนสคริปต์ทดสอบข้อมูลโดยใช้wilcox.testแต่เมื่อฉันได้ผลลัพธ์ผลลัพธ์ค่า p ทั้งหมดที่เท่ากับ 1 ฉันอ่านในบางเว็บไซต์ที่คุณสามารถใช้ jitter ก่อนทดสอบข้อมูล (เพื่อหลีกเลี่ยงความสัมพันธ์ตามที่กล่าวไว้) ฉันทำสิ่งนี้และตอนนี้ฉันมีผลลัพธ์ที่ยอมรับได้ การทำเช่นนี้ผิดหรือเปล่า? test<- function(column,datacol){ library(ggplot2) t=read.table("data.txt", stringsAsFactors=FALSE) uni=unique(c(t$V9)) for (xp in uni) { for(yp in uni) { testx <- subset(t, V9==xp) testy <- subset(t, V9==yp) zz <- wilcox.test(testx[[datacol]],jitter(testy[[datacol]])) p.value <- zz$p.value } } } นี่คือผลลัพธ์ของ dput(head(t)) structure(list(V1 = c(0.268912, 0.314681, 0.347078, 0.286945, …
9 r  nonparametric  ties 

1
มีวิธีง่ายๆในการรวมสองรุ่น glm ใน R หรือไม่?
glm()ฉันมีสองรูปแบบการถดถอยโลจิสติกในการวิจัยที่ทำด้วย พวกเขาทั้งสองใช้ตัวแปรเดียวกัน แต่ทำโดยใช้ชุดย่อยที่แตกต่างกันของเมทริกซ์ มีวิธีง่ายๆในการรับแบบจำลองเฉลี่ยซึ่งให้ค่าสัมประสิทธิ์แล้วใช้กับฟังก์ชันทำนาย () หรือไม่ [ขออภัยถ้าคำถามประเภทนี้ควรโพสต์บนเว็บไซต์การเขียนโปรแกรมแจ้งให้เราทราบและฉันจะโพสต์ที่นั่น] ขอบคุณ

1
มีชื่อสำหรับ bootstrapping ประเภทนี้หรือไม่?
พิจารณาการทดสอบกับผู้เข้าร่วมหลายคนแต่ละคนวัดหลายครั้งในสองเงื่อนไข รูปแบบเอฟเฟกต์แบบผสมสามารถกำหนดได้ (ใช้ไวยากรณ์lme4 ) เป็น: fit = lmer( formula = measure ~ (1|participant) + condition ) ตอนนี้บอกว่าฉันต้องการสร้างช่วงความมั่นใจบูตสแตรปสำหรับการคาดการณ์ของรุ่นนี้ ฉันคิดว่าฉันคิดวิธีที่ง่ายและมีประสิทธิภาพในการคำนวณและฉันแน่ใจว่าฉันไม่ใช่คนแรกที่คิด แต่ฉันมีปัญหาในการค้นหาสิ่งพิมพ์ก่อนหน้าใด ๆ ที่อธิบายวิธีการนี้ นี่มันคือ: พอดีกับรุ่น (ตามด้านบน) เรียกสิ่งนี้ว่า "แบบจำลองดั้งเดิม" รับการทำนายจากแบบจำลองต้นฉบับเรียกว่า "การคาดการณ์ดั้งเดิม" เหล่านี้ รับส่วนที่เหลือจากรูปแบบดั้งเดิมที่เชื่อมโยงกับการตอบสนองแต่ละครั้งจากผู้เข้าร่วมแต่ละคน resample the residual, สุ่มตัวอย่างผู้เข้าร่วมที่มีการแทนที่ พอดีกับโมเดลเอฟเฟกต์แบบเชิงเส้นที่มีข้อผิดพลาดแบบเกาส์กับส่วนที่เหลือเรียกสิ่งนี้ว่า "โมเดลชั่วคราว" คำนวณการทำนายจากตัวแบบชั่วคราวสำหรับแต่ละเงื่อนไข (การคาดการณ์เหล่านี้จะใกล้เคียงกับศูนย์มาก) เรียกสิ่งเหล่านี้ว่า "การทำนายระหว่างกาล" เพิ่มการคาดการณ์ระหว่างกาลลงในการคาดการณ์ดั้งเดิมเรียกผลการค้นหา "resample ทำนาย" ทำซ้ำขั้นตอนที่ 4 ถึง 7 หลาย ๆ ครั้งสร้างการกระจายการคาดการณ์ตัวอย่างสำหรับแต่ละเงื่อนไขซึ่งครั้งหนึ่งสามารถคำนวณ …

1
วิธีสร้างควอดรัตสำหรับกระบวนการจุดที่แตกต่างกันอย่างมากในความถี่?
ฉันต้องการทำการวิเคราะห์การนับควอดเรตในกระบวนการจุดต่าง ๆ (หรือกระบวนการจุดหนึ่งที่ทำเครื่องหมายไว้) เพื่อใช้เทคนิคการลดมิติข้อมูลบางอย่าง เครื่องหมายดังกล่าวไม่ได้มีการกระจายเหมือนกันเช่นเครื่องหมายบางอันปรากฏค่อนข้างบ่อยและบางเครื่องหมายค่อนข้างหายาก ดังนั้นฉันไม่สามารถแบ่งพื้นที่ 2D ของฉันในตารางปกติได้เพราะเครื่องหมายที่บ่อยขึ้นจะ "เอาชนะ" พื้นที่ที่มีความถี่น้อยกว่า ดังนั้นฉันจึงพยายามที่จะสร้างกริดของฉันเพื่อให้แต่ละเซลล์มีจุด N มากที่สุดในนั้น (เพื่อทำเช่นนั้นฉันเพียงแค่แบ่งแต่ละเซลล์ออกเป็นสี่เซลล์ขนาดเล็ก (และขนาดเท่ากัน) ซ้ำจนกระทั่งไม่มีเซลล์ใดมีคะแนน N มากกว่า มัน). คุณคิดอย่างไรกับเทคนิค "การทำให้เป็นมาตรฐาน" นี้? มีวิธีมาตรฐานในการทำสิ่งเหล่านี้หรือไม่?

3
สเปียร์แมนหรือเพียร์สันมีความสัมพันธ์กับสเกล Likert ซึ่งอาจมีการละเมิดความเป็นเชิงเส้นและ homoscedasticity
ฉันต้องการเรียกใช้สหสัมพันธ์กับการวัดจำนวนหนึ่งที่ใช้เครื่องชั่ง Likert เมื่อมองไปที่ scatterplots ดูเหมือนว่าสมมติฐานของ linearity และ homoscedasticity อาจถูกละเมิด ระบุว่าดูเหมือนจะมีการถกเถียงกันเกี่ยวกับการจัดระดับลำดับตามช่วงเวลาฉันควรจะเล่นให้ปลอดภัยและใช้ Rho ของ Spearman มากกว่า Pearson's r? มีการอ้างอิงที่ฉันสามารถอ้างอิงถ้าฉันไปกับ Rho Spearman ของ?

1
ฟังก์ชั่นที่ไม่ต่อเนื่อง: ครอบคลุมช่วงความมั่นใจหรือไม่
จะคำนวณการครอบคลุมช่วงเวลาแบบไม่ต่อเนื่องได้อย่างไร? สิ่งที่ฉันรู้วิธีการทำ: ถ้าฉันมีแบบจำลองต่อเนื่องฉันสามารถกำหนดช่วงความมั่นใจ 95% สำหรับค่าที่คาดการณ์ของฉันแต่ละค่าจากนั้นดูความถี่ที่ค่าจริงอยู่ในช่วงความมั่นใจ ฉันอาจพบว่ามีเพียง 88% ของช่วงเวลาที่ช่วงความมั่นใจ 95% ของฉันครอบคลุมค่าจริง สิ่งที่ฉันไม่รู้จะทำอย่างไร: ฉันจะทำสิ่งนี้อย่างไรกับแบบจำลองที่ไม่ต่อเนื่องเช่นปัวซองหรือแกมม่าปัวซอง? สิ่งที่ฉันมีสำหรับรุ่นนี้มีดังต่อไปนี้ทำการสังเกตเพียงครั้งเดียว (จากกว่า 100,000 แผนฉันจะสร้าง :) การสังเกต #: (โดยพลการ) ค่าที่คาดการณ์: 1.5 ความน่าจะเป็นที่คาดการณ์ไว้คือ 0: .223 ความน่าจะเป็นที่คาดการณ์ไว้ 1: .335 ความน่าจะเป็นที่คาดการณ์ไว้ที่ 2: .251 ความน่าจะเป็นที่คาดการณ์ไว้ 3: .126 ความน่าจะเป็นที่คาดการณ์ไว้ที่ 4: .048 ความน่าจะเป็นที่คาดการณ์ไว้ที่ 5: .014 [และ 5 หรือมากกว่านั้นคือ. 019] ... ( ฯลฯ ) ความน่าจะเป็นที่คาดการณ์ไว้ที่ 100 …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.