สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
แนะนำแบบจำลองสำหรับการถดถอยแบบค็อกซ์ที่มีตัวแปรตามเวลา
ฉันกำลังสร้างแบบจำลองผลกระทบของการตั้งครรภ์ต่อผลลัพธ์ของโรค (ตายแล้ว) ประมาณ 40% ของผู้ป่วยตั้งครรภ์หลังจากการวินิจฉัย - แต่ในเวลาต่างกัน จนถึงตอนนี้ฉันได้ทำการแปลง KM แสดงผลการป้องกันที่ชัดเจนของการตั้งครรภ์ต่อการอยู่รอดและรูปแบบคอคส์ทั่วไป - อย่างไรก็ตามสิ่งเหล่านี้ได้รับการสร้างแบบจำลองโดยใช้ตัวแปรการตั้งครรภ์แบบแบ่งขั้วคู่เท่านั้นและสมมติว่า ตั้งแต่เวลามัธยฐานถึงการตั้งครรภ์คือ 4 ปีจากการวินิจฉัย แบบจำลองชนิดใดที่จะดูดซับผลกระทบของการตั้งครรภ์หลายครั้ง ณ เวลาต่าง ๆ หลังการวินิจฉัย? มันจะถูกต้องหรือไม่ที่จะสร้างแบบจำลองการตั้งครรภ์ที่มีปฏิสัมพันธ์กับเวลา (ซึ่งจะต้องมีการสร้างข้อมูลที่ร้ายแรง - ซอฟต์แวร์อัตโนมัติใด ๆ ที่สามารถช่วยสิ่งนี้ได้) หรือมีกลยุทธ์การสร้างแบบจำลองที่เป็นที่นิยมสำหรับปัญหาเหล่านี้ กลยุทธ์การวางแผนที่ต้องการสำหรับปัญหาเหล่านี้คืออะไร
10 survival 

2
“ เศษตกค้างที่นักเรียนเป็นนักเรียนภายใน” มีข้อดีอะไรบ้างเหนือสิ่งตกค้างที่ประเมินโดยประมาณในแง่ของการวินิจฉัยดาต้าพอยท์ที่มีอิทธิพล
เหตุผลที่ฉันถามนี้เพราะดูเหมือนว่าเศษที่เหลือเป็นนักเรียนภายในดูเหมือนจะมีรูปแบบเดียวกับของเหลือใช้โดยประมาณ มันจะดีถ้ามีคนเสนอคำอธิบาย
10 residuals 

3
การเชื่อมโยงระหว่างวิธีเช่นการจับคู่และการควบคุมสถิติสำหรับตัวแปรคืออะไร?
บ่อยครั้งในบทความวิจัยที่คุณอ่านนักวิจัยได้ควบคุมตัวแปรบางอย่าง สิ่งนี้สามารถทำได้โดยวิธีการต่าง ๆ เช่นการจับคู่การบล็อก ฯลฯ แต่ฉันคิดเสมอว่าการควบคุมตัวแปรนั้นเป็นสิ่งที่ทำในเชิงสถิติโดยการวัดตัวแปรหลายอย่างที่อาจมีอิทธิพลและทำการวิเคราะห์เชิงสถิติเกี่ยวกับตัวแปรเหล่านั้นซึ่งสามารถทำได้ทั้งในการทดลองจริงและเสมือนจริง ตัวอย่างเช่นคุณจะมีแบบสำรวจหรือแบบทดสอบอื่นที่คุณวัดตัวแปรอิสระและตัวแปรที่อาจทำให้สับสนและทำการวิเคราะห์บางอย่าง เป็นไปได้ที่จะควบคุมตัวแปรในการทดลองเสมือนหรือไม่? การเชื่อมโยงระหว่างวิธีเช่นการจับคู่และการควบคุมสถิติสำหรับตัวแปรคืออะไร?

1
ด้วยชุดของจุดในพื้นที่สองมิติหนึ่งฟังก์ชันการตัดสินใจออกแบบสำหรับ SVM ได้อย่างไร
ใครสามารถอธิบายฉันได้ว่าคน ๆ หนึ่งจะออกแบบฟังก์ชันการตัดสินใจ SVM ได้อย่างไร หรือชี้ให้ฉันไปที่ทรัพยากรที่กล่าวถึงตัวอย่างที่เป็นรูปธรรม แก้ไข สำหรับตัวอย่างด้านล่างฉันจะเห็นว่าสมการX2=1.5X2=1.5X_2 = 1.5แยกชั้นเรียนด้วยระยะขอบสูงสุด แต่ฉันจะปรับน้ำหนักและเขียนสมการสำหรับไฮเปอร์เพลนในรูปแบบต่อไปนี้ได้อย่างไร H1:w0+w1x1+w2x2≥1H2:w0+w1x1+w2x2≤−1forYi=+1forYi=−1.H1:w0+w1x1+w2x2≥1forYi=+1H2:w0+w1x1+w2x2≤−1forYi=−1.\begin{array}{ll} H_1 : w_0+w_1x_1+w_2x_2 \ge 1 & \text{for}\; Y_i = +1 \\ H_2 : w_0+w_1x_1+w_2x_2 \le -1 & \text{for}\; Y_i = -1.\end{array} ฉันพยายามทำให้ทฤษฎีพื้นฐานถูกต้องในพื้นที่ 2 มิติ (เพราะมองเห็นได้ง่ายกว่า) ก่อนที่ฉันจะคิดถึงมิติที่สูงขึ้น ฉันได้แก้ปัญหาสำหรับสิ่งนี้แล้วใครบางคนได้โปรดยืนยันว่าสิ่งนี้ถูกต้องหรือไม่? น้ำหนักเวกเตอร์คือ (0, -2) และ W_0 คือ 3 H1:3+0x1−2x2≥1H2:3+0x1−2x2≤−1forYi=+1forYi=−1.H1:3+0x1−2x2≥1forYi=+1H2:3+0x1−2x2≤−1forYi=−1.\begin{array}{ll} H_1 : 3+0x_1-2x_2 …
10 svm 

1
จะตีความค่าสัมประสิทธิ์ของตัวแบบผสมหลายตัวแปรใน lme4 โดยไม่มีการสกัดกั้นโดยรวมได้อย่างไร?
ฉันพยายามที่จะพอดีกับหลายตัวแปร (เช่นการตอบสนองหลาย) Rรูปแบบผสม นอกเหนือจากASReml-rและSabreRแพคเกจ (ซึ่งต้องใช้ซอฟต์แวร์ภายนอก) MCMCglmmดูเหมือนว่านี้เป็นเพียงที่เป็นไปได้ใน ในกระดาษที่มาพร้อมกับMCMCglmmแพคเกจ (pp.6) Jarrod Hadfield อธิบายกระบวนการของการปรับแบบจำลองให้เหมือนกับการปรับรูปแบบการตอบสนองของตัวแปรหลายตัวให้เป็นตัวแปรรูปแบบยาวหนึ่งตัวจากนั้นหยุดการสกัดกั้นโดยรวม ความเข้าใจของฉันคือการระงับการสกัดกั้นการเปลี่ยนแปลงการตีความค่าสัมประสิทธิ์สำหรับแต่ละระดับของตัวแปรตอบกลับให้เป็นค่าเฉลี่ยสำหรับระดับนั้น จากที่กล่าวมาจึงเป็นไปได้lme4หรือไม่ที่จะใช้โมเดลผสมหลายตัวแปรโดยใช้? ตัวอย่างเช่น: data(mtcars) library(reshape2) mtcars <- melt(mtcars, measure.vars = c("drat", "mpg", "hp")) library(lme4) m1 <- lmer(value ~ -1 + variable:gear + variable:carb + (1 | factor(carb)), data = mtcars) summary(m1) # Linear mixed model fit by REML # …

3
เมื่อใดควรใช้ข้อผิดพลาดมาตรฐานที่มีประสิทธิภาพในการถดถอยปัวซอง?
ฉันใช้แบบจำลองการถดถอยปัวซงสำหรับการนับข้อมูลและสงสัยว่ามีเหตุผลที่จะไม่ใช้ข้อผิดพลาดมาตรฐานที่แข็งแกร่งสำหรับการประมาณค่าพารามิเตอร์หรือไม่ ฉันกังวลเป็นพิเศษเนื่องจากบางส่วนของประมาณการที่ไม่มีความแข็งแกร่งไม่สำคัญ (เช่น p = 0.13) แต่ด้วยความแข็งแกร่งนั้นมีนัยสำคัญ (p <0.01) ใน SAS สามารถใช้คำสั่งซ้ำในproc genmod(เช่น, repeated subject=patid;) ฉันใช้http://www.ats.ucla.edu/stat/sas/dae/poissonreg.htmเป็นตัวอย่างที่อ้างอิงบทความโดย Cameron และ Trivedi (2009) เพื่อสนับสนุนการใช้ข้อผิดพลาดมาตรฐานที่มีประสิทธิภาพ

2
โมเดลลำดับชั้นสำหรับการเปรียบเทียบหลายรายการ - บริบทผลลัพธ์หลายรายการ
ฉันเพิ่งได้รับการอ่านของเจลแมนทำไมเรา (ปกติ) ไม่ต้องกังวลกับการเปรียบเทียบหลาย ๆครั้ง โดยเฉพาะอย่างยิ่งในส่วน "ผลลัพธ์ที่หลากหลายและความท้าทายอื่น ๆ "กล่าวถึงการใช้แบบจำลองลำดับชั้นสำหรับสถานการณ์เมื่อมีมาตรการที่เกี่ยวข้องหลายรายการจากบุคคล / หน่วยเดียวกันในเวลาและเงื่อนไขที่แตกต่างกัน ดูเหมือนว่าจะมีคุณสมบัติที่ต้องการจำนวนมาก ฉันเข้าใจว่านี่ไม่จำเป็นต้องเป็นสิ่งที่เบย์ ใครบางคนสามารถแสดงให้ฉันเห็นวิธีการสร้างโมเดลหลายตัวแปรหลายระดับอย่างถูกต้องโดยใช้ rjags และ / หรือ lmer (JAGS และ BUGS ปกติควรจะดีเช่นกัน ผลลัพธ์ที่ตรงกันข้าม ประเภทของสถานการณ์ที่ฉันต้องการให้แบบจำลองนั้นสะท้อนให้เห็นในข้อมูลของเล่นด้านล่าง (หลายตัวแปร, การวัดซ้ำ): set.seed(69) id <- factor(rep(1:20, 2)) # subject identifier dv1 <- c(rnorm(20), rnorm(20, 0.8, 0.3)) # dependent variable 1 data for 2 conditions dv2 <- …

2
ฉันสามารถใช้ bootstrapping ได้หรือไม่
ขณะนี้ฉันกำลังทำงานกับการประมาณมวลชีวภาพโดยใช้ภาพถ่ายดาวเทียม ฉันจะกำหนดพื้นหลังของคำถามของฉันอย่างรวดเร็วแล้วอธิบายคำถามเชิงสถิติที่ฉันกำลังทำอยู่ พื้นหลัง ปัญหา ฉันพยายามประเมินมวลชีวภาพของพื้นที่ในฝรั่งเศส คำตอบของฉันคือความหนาแน่นปริมาตรไม้ไอน้ำ (เป็น ) ซึ่งมากหรือน้อยตามสัดส่วนของชีวมวล (ขึ้นอยู่กับความหนาแน่นของไม้ ... )m3/ham3/ham^3/ha ตัวแปรอิสระที่ฉันมีคือดัชนีพืชพรรณที่ได้จากการสะท้อนกลับที่วัดได้ในพื้นที่นี้ (ดาวเทียมที่ใช้ในการศึกษาคือ MODIS สำหรับผู้ที่รู้ว่ามัน) ดัชนีเหล่านี้เป็นตัวอย่าง NDVI, EVI ฯลฯ ฉันมีแผนที่ของดัชนีและความละเอียดของแผนที่คือ 250m มีความสัมพันธ์ที่แข็งแกร่งระหว่างดัชนีเหล่านี้กับปริมาณในป่าชนิดเดียวกัน (ชีวนิเวศและภูมิอากาศ) ดังนั้นฉันจึงพยายามที่จะลดความหนาแน่นของปริมาณเทียบกับตัวบ่งชี้เหล่านี้ (อันที่จริงเวลาของพวกเขา) ในแปลงสินค้าคงคลังที่ฉันรู้ปริมาณ สินค้าคงเหลือป่าไม้ ปริมาณในแปลงเหล่านี้ประมาณด้วยวิธีการสุ่มตัวอย่างต่อไปนี้: โหนดสินค้าคงคลังจะถูกวางในตารางปกติที่ครอบคลุมพื้นที่ พล็อตเชื่อมต่อกับแต่ละโหนดและกระบวนการสินค้าคงคลัง (ชนิดต้นไม้ปริมาณความสูงของหลังคาเป็นต้น) เกิดขึ้นในพล็อตนี้ แน่นอนฉันสนใจเฉพาะพล็อตสินค้าคงคลังและค่าดัชนีพืชพรรณของฉันคือค่าของพิกเซลที่มีพล็อต กระบวนการสินค้าคงคลังในพล็อตมีดังต่อไปนี้: วัดต้นไม้ที่มีเส้นผ่านศูนย์กลาง> 37.5 ซม. ในวงกลมรัศมี 15 ม วัดต้นไม้ที่มีเส้นผ่านศูนย์กลาง> 22.5 ซม. ในวงกลมรัศมี 9 ม วัดต้นไม้ที่มีเส้นผ่านศูนย์กลาง> 7.5 ซม. …
10 bootstrap 

2
ฉันจะสร้างแบบจำลองสัดส่วนด้วย BUGS / JAGS / STAN ได้อย่างไร
ฉันกำลังพยายามสร้างแบบจำลองที่การตอบสนองเป็นสัดส่วน (อันที่จริงแล้วมันคือส่วนแบ่งของคะแนนโหวตที่บุคคลได้รับจากการเลือกตั้ง) การกระจายของมันไม่ปกติดังนั้นฉันตัดสินใจที่จะจำลองด้วยการแจกแจงแบบเบต้า ฉันยังมีผู้ทำนายหลายคน อย่างไรก็ตามฉันไม่รู้วิธีเขียนใน BUGS / JAGS / STAN (JAGS จะเป็นตัวเลือกที่ดีที่สุดของฉัน แต่มันก็ไม่สำคัญอะไร) ปัญหาของฉันคือฉันสร้างผลรวมของพารามิเตอร์โดยตัวทำนาย แต่แล้วฉันจะทำอย่างไรกับมัน? รหัสจะเป็นแบบนี้ (ในรูปแบบของ JAGS) แต่ฉันไม่รู้วิธี "ลิงก์" y_hatและyพารามิเตอร์ for (i in 1:n) { y[i] ~ dbeta(alpha, beta) y_hat[i] <- a + b * x[i] } ( y_hatเป็นเพียงผลคูณของพารามิเตอร์และตัวทำนายดังนั้นความสัมพันธ์ที่กำหนดขึ้นได้aและbเป็นสัมประสิทธิ์ที่ฉันพยายามประเมินxเป็นตัวทำนาย) ขอบคุณสำหรับคำแนะนำของคุณ!

2
เหตุใดการแจกแจงจึงมีความสำคัญ
นี่อาจเป็นไปได้ว่าเป็นคำถามที่งี่เง่าที่สุดที่เคยถามในฟอรัมนี้ แต่หลังจากได้รับเสียงและคำตอบที่มีความหมายกับคำถามก่อนหน้านี้ฉันคิดว่าฉันจะทำให้โชคดีขึ้นอีกครั้ง ฉันสับสนมากในบางครั้งเกี่ยวกับความสำคัญของการแจกแจงเชิงสถิติโดยเฉพาะอย่างยิ่งเมื่อพวกเขาเกี่ยวข้องกับผลตอบแทนของสินทรัพย์และโดยเฉพาะอย่างยิ่งในการจัดสรรสินทรัพย์ คำถามที่เฉพาะเจาะจงของฉันคือ: สมมติว่าฉันมีข้อมูลผลตอบแทนรายเดือน S&P เป็นเวลา 20 ปีทำไมฉันต้องสมมติการกระจายบางประเภท (เช่นเที่ยวบินปกติ / เที่ยวบิน Johnson / Levy เป็นต้น) สำหรับการตัดสินใจจัดสรรสินทรัพย์เมื่อฉันสามารถ เพิ่งตัดสินใจจัดสรรสินทรัพย์ตามข้อมูลย้อนหลังที่ฉันมีกับฉัน

1
ข้อเสนอแนะการทดสอบทางสถิติ
ฉันต้องการค้นหาการทดสอบทางสถิติที่เหมาะสม (การทดสอบอัตราส่วนความน่าจะเป็น, การทดสอบที) และอื่น ๆ ต่อไปนี้: ขอเป็นตัวอย่าง IID ของเวกเตอร์สุ่ม( X ; Y )และสมมติว่า( Y X ) ~ N [ ( μ 1 μ 2 ) , ( 1 0.5 0.5 1 ) ] สมมติฐานคือ: H 0 = μ 1 + μ{ Xผม; Yผม}ni = 1{Xผม;Yผม}ผม=1n\{X_i;Y_i\}^n_{i=1}( X; Y)(X;Y)(X;Y)( YX)(YX)\bigl( \begin{smallmatrix} Y\\ …

2
เป็นไปได้หรือไม่ที่จะมีตัวแปรที่ทำหน้าที่เป็นทั้งตัวปรับแต่งเอฟเฟกต์และ Confounder
เป็นไปได้หรือไม่ที่จะมีตัวแปรที่ทำหน้าที่เป็นทั้งตัวปรับเอฟเฟกต์ (การวัด) และตัวรบกวนสำหรับคู่ของความสัมพันธ์ผลลัพธ์ความเสี่ยงที่กำหนด ฉันยังไม่แน่ใจในความแตกต่างเล็กน้อย ฉันได้ดูสัญกรณ์กราฟิกเพื่อช่วยให้ฉันเข้าใจความแตกต่าง แต่ความแตกต่างของสัญกรณ์นั้นทำให้สับสน คำอธิบายกราฟิก / ภาพของทั้งสองและเมื่อพวกเขาอาจทับซ้อนกันจะเป็นประโยชน์

1
วิธีการจัดการกับความตายในการวิเคราะห์การอยู่รอดปลอดโรค?
ถ้าฉันมีข้อมูลการรอดชีวิตปลอดโรค (นิยามว่าโรคนั้นได้รับการวินิจฉัยหรือไม่พร้อมกับเวลาของเหตุการณ์หรือการสูญเสียในการติดตาม) และข้อมูลการรอดชีวิตโดยรวมฉันจะจัดการกับความตายที่เกิดขึ้นได้อย่างไร เหตุการณ์โรค? มีการเซ็นเซอร์เหล่านี้หรือไม่หรือฉันควรแยกผู้ป่วยดังกล่าวออกจากการวิเคราะห์ความอยู่รอดปลอดโรค (dfs)? ฉันวางแผนที่จะเรียกใช้การวิเคราะห์ dfs สำหรับโรคบางชนิดแยกต่างหาก

3
การวิเคราะห์พลังงานสำหรับข้อมูลทวินามเมื่อสมมติฐานว่างคือ
ฉันต้องการทำการวิเคราะห์พลังงานสำหรับตัวอย่างเดียวจากข้อมูลทวินามด้วย , กับโดยที่คือสัดส่วนของความสำเร็จในประชากร ถ้าฉันสามารถใช้การประมาณแบบปกติกับทวินามหรือทดสอบ แต่ด้วยทั้งคู่จะล้มเหลว ฉันชอบที่จะรู้ว่าหากมีวิธีการวิเคราะห์นี้ ฉันขอขอบคุณข้อเสนอแนะความคิดเห็นหรือการอ้างอิงใด ๆ ขอบคุณมาก!H 1 : p = 0.001 p 0 &lt; p &lt; 1 χ 2 p = 0H0:p=0H0:p=0H_0: p = 0H1:p=0.001H1:p=0.001H_1: p = 0.001ppp0&lt;p&lt;10&lt;p&lt;10 < p <1χ2χ2\chi^2p=0p=0p =0

1
ทำไม Anova () และ drop1 () จึงให้คำตอบที่แตกต่างกันสำหรับ GLMM
ฉันมีแบบฟอร์ม GLMM: lmer(present? ~ factor1 + factor2 + continuous + factor1*continuous + (1 | factor3), family=binomial) เมื่อฉันใช้drop1(model, test="Chi")ฉันได้รับผลลัพธ์ที่แตกต่างกว่าถ้าผมใช้จากแพคเกจรถหรือAnova(model, type="III") summary(model)สองหลังนี้ให้คำตอบเดียวกัน จากการใช้ข้อมูลที่ประดิษฐ์ขึ้นมาฉันพบว่าทั้งสองวิธีปกติไม่แตกต่างกัน พวกเขาให้คำตอบเดียวกันสำหรับแบบจำลองเชิงเส้นที่มีความสมดุลแบบจำลองเชิงเส้นที่ไม่สมดุล (ซึ่งไม่เท่ากันในกลุ่มต่าง ๆ ) และสำหรับแบบจำลองเชิงเส้นที่สมดุลแบบทั่วไป ดังนั้นจึงปรากฏว่าเฉพาะในกรณีที่มีการรวมปัจจัยแบบสุ่มเข้าด้วยกัน ทำไมจึงมีความคลาดเคลื่อนระหว่างสองวิธีนี้? เมื่อใช้ GLMM ควรAnova()หรือdrop1()จะใช้งานอย่างไร ความแตกต่างระหว่างสองสิ่งนี้ค่อนข้างเล็กน้อยอย่างน้อยสำหรับข้อมูลของฉัน มันมีความสำคัญต่อการใช้งานหรือไม่?
10 r  anova  glmm  r  mixed-model  bootstrap  sample-size  cross-validation  roc  auc  sampling  stratification  random-allocation  logistic  stata  interpretation  proportion  r  regression  multiple-regression  linear-model  lm  r  cross-validation  cart  rpart  logistic  generalized-linear-model  econometrics  experiment-design  causality  instrumental-variables  random-allocation  predictive-models  data-mining  estimation  contingency-tables  epidemiology  standard-deviation  mean  ancova  psychology  statistical-significance  cross-validation  synthetic-data  poisson-distribution  negative-binomial  bioinformatics  sequence-analysis  distributions  binomial  classification  k-means  distance  unsupervised-learning  euclidean  correlation  chi-squared  spearman-rho  forecasting  excel  exponential-smoothing  binomial  sample-size  r  change-point  wilcoxon-signed-rank  ranks  clustering  matlab  covariance  covariance-matrix  normal-distribution  simulation  random-generation  bivariate  standardization  confounding  z-statistic  forecasting  arima  minitab  poisson-distribution  negative-binomial  poisson-regression  overdispersion  probability  self-study  markov-process  estimation  maximum-likelihood  classification  pca  group-differences  chi-squared  survival  missing-data  contingency-tables  anova  proportion 

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.