สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
การวิเคราะห์พลังงานเพื่อการวิเคราะห์การเอาชีวิตรอด
ถ้าฉันสมมุติว่าลายเซ็นของยีนจะระบุตัวตนที่มีความเสี่ยงต่ำของการเกิดซ้ำนั่นคือลดลง 0.5 (อัตราส่วนอันตราย 0.5) อัตราการเกิดเหตุการณ์ใน 20% ของประชากรและฉันตั้งใจจะใช้ตัวอย่างจากการศึกษาแบบย้อนหลัง ขนาดตัวอย่างจะต้องมีการปรับสำหรับตัวเลขที่ไม่เท่ากันในสองกลุ่มสมมติฐาน? ตัวอย่างเช่นการใช้ Collett, D: Modeling Data Survival ในการวิจัยทางการแพทย์, Second Edition - 2nd Edition 2003 จำนวนทั้งหมดของเหตุการณ์ที่ต้องการ, d, สามารถพบได้โดยใช้, d=(Zα/2+Zβ/2)2p1p2(θR)2d=(Zα/2+Zβ/2)2p1p2(θR)2\begin{equation} d = \frac{(Z_{\alpha/2} + Z_{\beta/2})^2}{p_1 p_2 (\theta R)^2} \end{equation} โดยที่และเป็นจุดสูงสุดและตอนบนตามลำดับของการแจกแจงแบบปกติมาตรฐานZα/2Zα/2Z_{\alpha/2}Zβ/2Zβ/2Z_{\beta/2}α/2α/2\alpha/2β/2β/2\beta/2 สำหรับค่าเฉพาะ p1=0.20p1=0.20p_1 = 0.20 p2=1−p1p2=1−p1p_2 = 1 - p_1 θR=−0.693θR=−0.693\theta R = -0.693 α=0.05α=0.05\alpha = …

3
วิธีการสร้างคะแนนการกระจายอย่างสม่ำเสมอในลูกบอลหน่วย 3 มิติ?
ฉันได้โพสต์คำถามก่อนหน้านี้มีความเกี่ยวข้อง แต่ฉันคิดว่ามันจะดีกว่าที่จะเริ่มหัวข้ออื่น เวลานี้ฉันสงสัยว่าจะสร้างจุดกระจายอย่างสม่ำเสมอภายใน 3 มิติหน่วยทรงกลมได้อย่างไรและจะตรวจสอบการกระจายตัวด้วยสายตาและสถิติได้อย่างไร ฉันไม่เห็นกลยุทธ์ที่โพสต์มีการโอนโดยตรงกับสถานการณ์นี้

1
รูตหมายความว่าสแควร์เทียบกับค่าเบี่ยงเบนสัมบูรณ์เฉลี่ย?
ทั้งRoot Mean Squareและค่าเบี่ยงเบนสัมบูรณ์โดยเฉลี่ยดูเหมือนว่าการวัดขนาดของความแปรปรวน (โดยเฉพาะอย่างยิ่งเมื่อตัวแปรเป็นทั้ง + ve และ -ve) กฎของหัวแม่มือที่จะเลือกหนึ่งของพวกเขามากกว่าที่อื่นคืออะไร?

2
ใช้การถดถอยปัวซองสำหรับข้อมูลอย่างต่อเนื่อง?
การแจกแจงปัวซงสามารถใช้ในการวิเคราะห์ข้อมูลแบบต่อเนื่องและข้อมูลแบบแยก ฉันมีชุดข้อมูลสองสามชุดที่ตัวแปรตอบสนองต่อเนื่อง แต่มีลักษณะคล้ายกับการแจกแจงปัวซองแทนการแจกแจงแบบปกติ อย่างไรก็ตามการแจกแจงปัวซงเป็นการกระจายแบบไม่ต่อเนื่องและมักเกี่ยวข้องกับตัวเลขหรือจำนวน

1
การทำนายกระบวนการหน่วยความจำระยะยาว
ฉันกำลังทำงานกับกระบวนการสองสถานะด้วยxเสื้อxtx_tใน{ 1 , - 1 }{1,−1}\{1, -1\}สำหรับt = 1 , 2 , ...t=1,2,…t = 1, 2, \ldots ฟังก์ชั่น autocorrelation เป็นตัวบ่งชี้ของกระบวนการที่มีหน่วยความจำยาวนั่นคือมันแสดงการสลายตัวของกฎกำลังไฟฟ้าที่มีเลขชี้กำลัง <1 คุณสามารถจำลองชุดที่คล้ายกันใน R ด้วย: > library(fArma) > x<-fgnSim(10000,H=0.8) > x<-sign(x) > acf(x) คำถามของฉัน: มีวิธีบัญญัติมาตรฐานหรือไม่ที่จะทำนายค่าถัดไปในซีรีส์ที่ได้รับมาจากฟังก์ชั่น วิธีหนึ่งในการทำนายก็คือใช้ x^( t ) = x ( t - 1 )x^(t)=x(t−1)\hat{x}(t) = x(t-1) ซึ่งมีอัตราการจำแนกประเภทโดยที่คือความสัมพันธ์แบบอัตโนมัติ -1 แต่ฉันรู้สึกว่ามันต้องเป็นไปได้ที่จะทำได้ดีขึ้นโดยคำนึงถึงโครงสร้างหน่วยความจำระยะยาวρ( …

2
การทำนายล่วงหน้า 1 ขั้นตอนด้วยแพ็คเกจ Dynlm R
ฉันพอดีกับโมเดลที่มีตัวแปรอิสระหลายตัวซึ่งหนึ่งในนั้นก็คือความล่าช้าของตัวแปรตามโดยใช้แพ็คเกจ dynlm สมมติว่าฉันมีการคาดการณ์ล่วงหน้า 1 ขั้นตอนสำหรับตัวแปรอิสระของฉันฉันจะรับการคาดการณ์ล่วงหน้า 1 ขั้นตอนสำหรับตัวแปรตามของฉันได้อย่างไร นี่คือตัวอย่าง: library(dynlm) y<-arima.sim(model=list(ar=c(.9)),n=10) #Create AR(1) dependant variable A<-rnorm(10) #Create independant variables B<-rnorm(10) C<-rnorm(10) y<-y+.5*A+.2*B-.3*C #Add relationship to independant variables data=cbind(y,A,B,C) #Fit linear model model<-dynlm(y~A+B+C+L(y,1),data=data) #Forecast A<-c(A,rnorm(1)) #Assume we already have 1-step forecasts for A,B,C B<-c(B,rnorm(1)) C<-c(C,rnorm(1)) y=window(y,end=end(y)+c(1,0),extend=TRUE) newdata<-cbind(y,A,B,C) predict(model,newdata) และนี่คือตัวอย่างการใช้แพคเกจ dyn ซึ่งใช้งานได้ library(dyn) …

6
ทำนายค่าหลังจากเรียกใช้ฟังก์ชัน mlogit ใน R
นี่คือสิ่งที่ฉันต้องการทำ แต่ดูเหมือนจะไม่มีpredictวิธีสำหรับ mlogit ความคิดใด ๆ library(mlogit) data("Fishing", package = "mlogit") Fish <- mlogit.data(Fishing, varying = c(2:9), shape = "wide", choice = "mode") Fish_fit<-Fish[-1,] Fish_test<-Fish[1,] m <- mlogit(mode ~price+ catch | income, data = Fish_fit) predict(m,newdata=Fish_test)

3
การตีความค่า p- ที่ผลิตโดยการทดสอบของ Levene หรือ Bartlett เพื่อความสม่ำเสมอของความแปรปรวน
ฉันใช้การทดสอบของ Levene และ Bartlett ในกลุ่มข้อมูลจากการทดลองของฉันเพื่อยืนยันว่าฉันไม่ได้ละเมิดสมมติฐานของ ANOVA เกี่ยวกับความสม่ำเสมอของความแปรปรวน ฉันต้องการตรวจสอบกับพวกคุณว่าฉันไม่ได้ตั้งสมมติฐานผิดถ้าคุณไม่รังเกียจ: D ค่า p ที่ส่งคืนโดยการทดสอบทั้งสองอย่างนั้นคือความน่าจะเป็นที่ข้อมูลของฉันถ้ามันถูกสร้างขึ้นอีกครั้งโดยใช้ผลต่างที่เท่ากันก็จะเหมือนกัน ดังนั้นโดยใช้การทดสอบเหล่านั้นเพื่อที่จะสามารถพูดได้ว่าฉันไม่ได้ละเมิดข้อสันนิษฐานของ ANOVA เรื่องความเหมือนกันของความแปรปรวนฉันจะต้องใช้ค่า p ที่สูงกว่าระดับอัลฟ่าที่เลือก (พูด 0.05) เช่นด้วยข้อมูลที่ฉันใช้อยู่การทดสอบของ Bartlett จะส่งคืน p = 0.57 ในขณะที่การทดสอบของ Levene (พวกเขาเรียกมันว่าการทดสอบประเภท Brown-Forsythe Levene) ให้ ap = 0.95 นั่นหมายความว่าไม่ว่าฉันจะใช้การทดสอบแบบใดฉันสามารถพูดได้ว่าข้อมูลที่ฉันได้ตรงตามสมมติฐาน ฉันกำลังทำผิดพลาดหรือไม่? ขอบคุณ

4
จะนำเสนอผลกำไรในรูปแบบต่าง ๆ ที่อธิบายได้อย่างไรเนื่องจากสหสัมพันธ์ของ Y และ X เป็นอย่างไร?
ฉันกำลังค้นหาวิธี (มองเห็น) อธิบายความสัมพันธ์เชิงเส้นอย่างง่ายกับนักเรียนปีแรก วิธีการมองภาพแบบดั้งเดิมคือการให้พล็อตกระจาย Y ~ X ที่มีเส้นถดถอยตรง เมื่อเร็ว ๆ นี้ฉันมาด้วยความคิดที่จะขยายกราฟิกประเภทนี้โดยการเพิ่มพล็อตอีก 3 ภาพทิ้งฉันไว้กับ: พล็อตกระจายของ y ~ 1 จากนั้น y ~ x, ที่เหลือ (y ~ x) ~ x และสุดท้าย ของที่เหลือ (y ~ x) ~ 1 (อยู่กึ่งกลางค่ากลาง) นี่คือตัวอย่างของการสร้างภาพข้อมูล: และรหัส R เพื่อผลิตมัน: set.seed(345) x <- runif(50) * 10 y <- x +rnorm(50) layout(matrix(c(1,2,2,2,2,3 …

5
การวัดการถดถอยของค่าเฉลี่ยในการกดปุ่มในการวิ่งกลับบ้าน
ทุกคนที่ติดตามเบสบอลมีโอกาสได้ยินเกี่ยวกับการแสดง MVP นอกสมัยของ Jose Bautista ของโตรอนโต ในสี่ปีก่อนหน้านี้เขามีการวิ่งกลับบ้าน 15 ครั้งต่อฤดูกาล ปีที่แล้วเขาตี 54 ได้มีผู้เล่นมากกว่า 12 คนในประวัติศาสตร์เบสบอล ในปี 2010 เขาได้รับเงิน 2.4 ล้านและเขาขอให้ทีม 10.5 ล้านคนในปี 2011 พวกเขาเสนอเงิน 7.6 ล้าน หากเขาสามารถทำซ้ำได้ในปี 2554 เขาจะมีมูลค่าทั้งสองอย่างง่ายดาย แต่โอกาสของเขาคือการทำซ้ำ? เราจะคาดหวังได้ยากแค่ไหนที่เขาจะถดถอย เราคาดหวังว่าการแสดงของเขาจะเกิดขึ้นได้เท่าไหร่เพราะโอกาส? เราคาดหวังได้อย่างไรว่ายอดรวม 2010 ที่ปรับแล้วของเขาการถดถอยจะเป็นอย่างไร ฉันจะทำงานออกมาได้อย่างไร ฉันได้เล่นกับฐานข้อมูลเบสบอล Lahman และบีบเคียวรีที่ส่งคืนผลรวมการวิ่งกลับบ้านสำหรับผู้เล่นทั้งหมดในห้าฤดูกาลก่อนหน้านี้ซึ่งมีค้างคาวอย่างน้อย 50 ตัวต่อฤดูกาล ตารางมีลักษณะเช่นนี้ (สังเกตเห็น Jose Bautista ในแถวที่ 10) first last hr_2006 hr_2007 …
11 r  regression  modeling 

2
หนึ่งพล็อตจะต่อเนื่องโดยการโต้ตอบอย่างต่อเนื่องใน ggplot2 ได้อย่างไร
สมมติว่าฉันมีข้อมูล: x1 <- rnorm(100,2,10) x2 <- rnorm(100,2,10) y <- x1+x2+x1*x2+rnorm(100,1,2) dat <- data.frame(y=y,x1=x1,x2=x2) res <- lm(y~x1*x2,data=dat) summary(res) ฉันต้องการพล็อตแบบต่อเนื่องโดยการโต้ตอบแบบต่อเนื่องเช่นที่ x1 อยู่บนแกน X และ x2 แทนด้วย 3 เส้นเส้นหนึ่งซึ่งแทน x2 ที่ Z-score เป็น 0 หนึ่งที่ Z-+1 ที่ +1 Z-score ที่ -1 โดยแต่ละบรรทัดจะมีสีแยกกันและติดป้ายกำกับ ฉันจะทำสิ่งนี้โดยใช้ ggplot2 ได้อย่างไร ตัวอย่างเช่นอาจมีลักษณะเช่นนี้ (แต่แน่นอนว่ามีเส้นสีต่างกันแทนที่จะเป็นประเภทเส้นต่างกัน):

5
การทดสอบสมมติฐานเชิงบรรทัดฐานสำหรับมาตรการ anova ซ้ำแล้วซ้ำอีก? (ใน R)
ดังนั้นสมมติว่ามีจุดหนึ่งในการทดสอบเกณฑ์ปกติของโนวา (ดู1และ2 ) มันสามารถทดสอบใน R ได้อย่างไร? ฉันคาดหวังว่าจะทำสิ่งที่ชอบ: ## From Venables and Ripley (2002) p.165. utils::data(npk, package="MASS") npk.aovE <- aov(yield ~ N*P*K + Error(block), npk) residuals(npk.aovE) qqnorm(residuals(npk.aov)) ซึ่งไม่ได้ผลเนื่องจาก "ส่วนที่เหลือ" ไม่มีวิธี (หรือคาดการณ์สำหรับเรื่องนั้น) สำหรับกรณีของมาตรการโนวาซ้ำ ๆ ดังนั้นสิ่งที่ควรทำในกรณีนี้? สามารถดึงสารตกค้างจากแบบจำลองแบบเดียวกันโดยไม่มีเงื่อนไขข้อผิดพลาดได้หรือไม่? ฉันไม่คุ้นเคยกับวรรณกรรมเพียงพอที่จะรู้ว่าสิ่งนี้ถูกต้องหรือไม่ขอบคุณล่วงหน้าสำหรับคำแนะนำใด ๆ

2
ตรวจจับการเปลี่ยนแปลงในอนุกรมเวลา
ฉันเจอรูปภาพของต้นแบบแอปพลิเคชันที่พบการเปลี่ยนแปลงที่สำคัญ ("แนวโน้ม" - ไม่ใช่ spikes / outliers) ในข้อมูลการจราจร: ฉันต้องการเขียนโปรแกรม (Java หรือเป็นทางเลือก R) ที่สามารถทำเช่นเดียวกัน - แต่เนื่องจากทักษะทางสถิติของฉันค่อนข้างจะเป็นสนิมฉันจึงต้องขุดลงในหัวข้อนี้อีกครั้ง ฉันควรใช้วิธีการ / อัลกอริทึม / การวิจัยอย่างไร

2
ฉันสามารถคาดเดาสิ่งใดได้บ้างด้วยตัวจําแนกเบส์ไร้เดียงสา?
ฉันเป็นผู้เริ่มต้นสู่สถิติ (ใช้เวลาเพียงหนึ่งหลักสูตรวิทยาลัย) แต่ฉันมีพื้นหลังในการเขียนโปรแกรม ฉันเพิ่งเริ่มเล่นกับห้องสมุดลักษณนามของ Bayesian สำหรับ Ruby และฉันกำลังมองหาแนวคิดสำหรับสิ่งต่าง ๆ ที่จะวิเคราะห์ ตอนนี้ฉันกำลังยุ่งกับหมวดหมู่ทวีต แต่คุณมีความคิดใด ๆ ที่สำคัญฉันจะเรียนรู้เกี่ยวกับประเภทของข้อมูลที่ให้ยืมเพื่อการจำแนก Bayesian ที่ไร้เดียงสาได้อย่างไร ขอบคุณ

4
MANOVA และความสัมพันธ์ระหว่างตัวแปรตาม: แข็งแรงแค่ไหน?
ตัวแปรตามใน MANOVA ไม่ควร "มีความสัมพันธ์มากเกินไป" แต่ความสัมพันธ์มีความแข็งแกร่งแค่ไหน มันจะน่าสนใจที่จะได้รับความคิดเห็นของผู้คนในเรื่องนี้ ตัวอย่างเช่นคุณจะดำเนินการกับ MANOVA ในสถานการณ์ต่อไปนี้หรือไม่? Y1 และ Y2 มีความสัมพันธ์กับและr=0.3r=0.3r=0.3p&lt;0.005p&lt;0.005p<0.005 Y1 และ Y2 มีความสัมพันธ์กับและr=0.7r=0.7r=0.7p=0.049p=0.049p=0.049 ปรับปรุง ตัวแทนบางคนเสนอราคาเพื่อตอบสนองต่อ @onestop: "MANOVA ทำงานได้ดีในสถานการณ์ที่มีความสัมพันธ์ในระดับปานกลางระหว่าง DVs" (หมายเหตุหลักสูตรจาก San Francisco State Uni) "ตัวแปรตามมีความสัมพันธ์ซึ่งเหมาะสมกับ Manova" (ไพรเมอร์สหรัฐอเมริกา EPA Stats) "ตัวแปรตามควรเกี่ยวข้องกับแนวคิดและควรมีความสัมพันธ์กับตัวแปรอื่นในระดับต่ำถึงปานกลาง" (หมายเหตุหลักสูตรจากมหาวิทยาลัย Northern Arizona) "DVs มีความสัมพันธ์กันจากประมาณ. 3 ถึง. 0.7 มีสิทธิ์" (Maxwell 2001, วารสารจิตวิทยาผู้บริโภค) nb ฉันไม่ได้อ้างถึงข้อสันนิษฐานว่าสัมพันธภาพระหว่าง Y1 และ …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.