สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
จะรับผลการทดสอบ Tukey HSD หลังการทดสอบในตารางที่แสดงคู่ที่จัดกลุ่มได้อย่างไร
ฉันชอบที่จะทำการทดสอบหลัง TukeyHSD หลังจาก Anova สองทางของฉันกับ R เพื่อรับตารางที่มีคู่ที่เรียงลำดับซึ่งจัดกลุ่มตามความแตกต่างที่สำคัญ (ขออภัยเกี่ยวกับถ้อยคำฉันยังใหม่กับสถิติ) ฉันต้องการที่จะมีอะไรเช่นนี้: ดังนั้นจัดกลุ่มด้วยดาวหรือตัวอักษร ความคิดใด ๆ ฉันทดสอบฟังก์ชั่นHSD.test()จากagricolaeแพ็คเกจ แต่ดูเหมือนว่ามันไม่ได้จัดการกับตารางแบบสองทาง

1
ช่วยฉันเข้าใจค่าในค่า Bayesian glm
ฉันกำลังพยายามที่จะใช้ logit คชกรรมกับข้อมูลที่นี่ ฉันใช้bayesglm()ในarmแพ็คเกจใน R การเข้ารหัสนั้นตรงไปตรงมามากพอ: df = read.csv("http://dl.dropbox.com/u/1791181/bayesglm.csv", header=T) library(arm) model = bayesglm(PASS ~ SEX + HIGH, family=binomial(link="logit"), data=df) summary(model) ให้เอาต์พุตต่อไปนี้: Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 0.10381 0.10240 1.014 0.311 SEXMale 0.02408 0.09363 0.257 0.797 HIGH -0.27503 0.03562 -7.721 1.15e-14 *** --- Signif. codes: 0 ‘***’ …
13 r  bayesian  p-value 

1
การคาดการณ์โดยใช้ glmnet ใน R
ฉันกำลังพยายามสร้างแบบจำลองข้อมูลโดยใช้glmnetแพคเกจในอาร์สมมติว่าฉันมีข้อมูลต่อไปนี้ training_x <- data.frame(variable1 = c(1, 2, 3, 2, 3), variable2 = c(1, 2, 3, 4, 5)) y <- c(1, 2, 3, 4, 5) (นี่คือการทำให้เข้าใจง่ายข้อมูลของฉันมีความซับซ้อนมากขึ้น) จากนั้นฉันใช้รหัสต่อไปนี้เพื่อสร้างโมเดล glmnet x <- as.matrix(training_x) library(glmnet) GLMnet_model_1 <- glmnet(x, y, family="gaussian", alpha=0.755, nlambda=1000, standardize=FALSE, maxit=100000) ฉันกำลังใช้standardize=FALSEเพราะข้อมูลในชีวิตจริงของฉันได้มาตรฐานแล้ว จากนั้นฉันต้องการทำนายชุดข้อมูลใหม่ สมมติว่าข้อมูลใหม่ของฉันคือ: newdata <- as.matrix(data.frame(variable1 = c(2, 2, 1, …
13 r  glmnet 


1
คำตอบการสอบสถิติตลก [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้เป็นไปตามหัวข้อสำหรับการตรวจสอบข้าม ปิดให้บริการใน7 ปีที่ผ่านมา การแก้ไขการสอบอาจเป็นงานที่น่าเบื่อที่สุดของครู แต่มันอาจเป็นเรื่องสนุกสำหรับเราที่จะรวบรวมคำตอบการสอบสถิติตลก ๆ หนึ่งรายการต่อคำตอบ
13 teaching  humor 

4
การเริ่มต้น K-หมายถึงศูนย์โดยวิธีการของชุดย่อยแบบสุ่มของชุดข้อมูลหรือไม่
ถ้าฉันมีชุดข้อมูลที่แน่นอนมันจะฉลาดแค่ไหนที่จะเริ่มต้นศูนย์คลัสเตอร์โดยใช้วิธีการสุ่มตัวอย่างของชุดข้อมูลนั้น 5 clustersตัวอย่างเช่นสมมติว่าผมต้องการ ฉัน5 random samplesพูดsize=20%ของชุดข้อมูลเดิม จากนั้นฉันจะใช้ค่าเฉลี่ยของตัวอย่างสุ่มทั้ง 5 เหล่านี้แล้วใช้ค่าเฉลี่ยเหล่านั้นเป็นศูนย์คลัสเตอร์เริ่มต้น 5 ศูนย์ของฉันได้หรือไม่ ฉันไม่รู้ว่าฉันอ่านตรงไหน แต่อยากรู้ว่าพวกคุณคิดอย่างไรกับแนวคิดนี้ UPDATE:โปรดดูหัวข้อนี้การเริ่มต้น K-หมายถึงการจัดกลุ่ม: วิธีการที่มีอยู่คืออะไร? สำหรับการสนทนาทั่วไปเกี่ยวกับวิธีการเริ่มต้นต่างๆ

1
ใช้วิธีการทั่วไปของช่วงเวลา (GMM) ในการคำนวณพารามิเตอร์การถดถอยโลจิสติก
ฉันต้องการคำนวณค่าสัมประสิทธิ์การถดถอยที่คล้ายกับการถดถอยแบบลอจิสติก (จริง ๆ แล้วการถดถอยแบบโลจิสติกที่มีสัมประสิทธิ์อื่น: เมื่อได้รับ ) ฉันคิดว่าจะใช้ GMM เพื่อคำนวณค่าสัมประสิทธิ์ แต่ฉันไม่แน่ใจว่าควรใช้เงื่อนไขใดในขณะนี้AA1 + e- ( b0+ b1x1+ b2x2+ … ),A1+e−(b0+b1x1+b2x2+…), \frac{A}{1 + e^{- (b_0 + b_1 x_1 + b_2 x_2 + \ldots)}},AAA มีใครช่วยฉันได้บ้าง ขอบคุณ!

1
กฎหมายจำนวนมากล้มเหลวเมื่อใด
คำถามก็คือสิ่งที่ระบุไว้ในชื่อเรื่อง: เมื่อไหร่กฎหมายจำนวนมากล้มเหลว? สิ่งที่ฉันหมายถึงคือในกรณีใดความถี่ของเหตุการณ์ที่ไม่น่าจะเป็นไปได้ทางทฤษฎี?

3
วารสารที่ดีและมีอิสระสำหรับการติดตามการพัฒนาล่าสุดในการเรียนรู้ของเครื่องคืออะไร
อย่าลังเลที่จะแทนที่ 'วารสาร' สำหรับพอร์ทัลความรู้ที่มีประโยชน์อื่น ๆ ฉันสนใจที่จะจับตาดูการพัฒนาใหม่ในการเรียนรู้ของเครื่องด้วยมุมมองของการใช้งานจริง ฉันไม่ใช่นักวิชาการที่ต้องการเผยแพร่ผลงานของตัวเอง (อย่างน้อยไม่ได้อยู่ในสาขานี้) แต่ฉันต้องการที่จะตระหนักถึงอัลกอริทึมหรือลูกเล่นใหม่ ๆ ที่อาจเป็นประโยชน์ในระดับปฏิบัติ ข้อแม้เดียวก็คือว่าการดำเนินการวารสาร / การประชุมหรือสิ่งที่จะต้องมีอยู่อย่างอิสระโดยไม่ต้องสมัครสมาชิก

2
การถดถอยเชิงเส้นเมื่อคุณรู้จักไม่ใช่โดยตรง
สมมติว่า YXβ=YXβ=YX\beta =Y เราไม่ทราบว่าตรงเพียงความสัมพันธ์กับแต่ละทำนาย YYYYXtYXtYX^\mathrm{t}Y วิธีแก้ปัญหาสแควร์สน้อย (OLS) สามัญคือและไม่มีปัญหาβ=(XtX)−1XtYβ=(XtX)−1XtY\beta=(X^\mathrm{t} X)^{-1} X^\mathrm{t}Y แต่สมมติว่าอยู่ใกล้เอกพจน์ (multicollinearity) และคุณต้องประเมินพารามิเตอร์สันเขาที่ดีที่สุด ทุกวิธีที่ดูเหมือนว่าจะต้องมีค่าที่แน่นอนของYXtXXtXX^\mathrm{t}XYYY มีวิธีการอื่นเมื่อมีเพียงเป็นที่รู้จักกัน?XtYXtYX^\mathrm{t}Y

6
ฟอเรสต์แบบสุ่ม: จะจัดการระดับปัจจัยใหม่ในชุดทดสอบอย่างไร
ฉันกำลังพยายามทำนายโดยใช้โมเดลฟอเรสต์แบบสุ่มในอาร์ อย่างไรก็ตามฉันได้รับข้อผิดพลาดเนื่องจากปัจจัยบางอย่างมีค่าแตกต่างกันในชุดทดสอบมากกว่าในชุดฝึกอบรม ตัวอย่างเช่นปัจจัยCat_2มีค่า34, 68, 76ฯลฯ ในชุดทดสอบที่ไม่ปรากฏในชุดฝึกอบรม น่าเสียดายที่ฉันไม่สามารถควบคุมชุดทดสอบ ... ฉันต้องใช้มันตามที่เป็นอยู่ as.numeric()วิธีแก้ปัญหาเดียวของฉันคือการแปลงปัจจัยที่มีปัญหากลับไปเป็นค่าตัวเลขที่ใช้ มันใช้งานได้แต่ฉันไม่พอใจมากเนื่องจากค่าเหล่านี้เป็นรหัสที่ไม่มีความรู้สึกเชิงตัวเลข ... คุณคิดว่าจะมีวิธีแก้ไขปัญหาอื่นหรือไม่เพื่อลดค่าใหม่จากชุดทดสอบ แต่ไม่มีการลบค่าปัจจัยอื่น ๆ ทั้งหมด (เช่นค่าการบอกกล่าว1, 2, 14, 32ฯลฯ ) ซึ่งมีทั้งในการฝึกอบรมและการทดสอบและมีข้อมูลที่อาจเป็นประโยชน์สำหรับการคาดการณ์

3
ความเข้าใจในแนวคิดเกี่ยวกับความคลาดเคลื่อนของรูตเฉลี่ยและความเบี่ยงเบนเฉลี่ยของอคติ
ฉันต้องการทำความเข้าใจแนวคิดเกี่ยวกับ Root Mean Squared Error (RMSE) และ Mean Bias Deviation (MBD) จากการคำนวณมาตรการเหล่านี้สำหรับการเปรียบเทียบข้อมูลของฉันเองฉันมักจะงงงวยที่จะพบว่า RMSE สูง (เช่น 100 กิโลกรัม) ในขณะที่ MBD ต่ำ (เช่นน้อยกว่า 1%) โดยเฉพาะอย่างยิ่งฉันกำลังมองหาการอ้างอิง (ไม่ใช่ออนไลน์) ที่แสดงรายการและกล่าวถึงคณิตศาสตร์ของมาตรการเหล่านี้ วิธีใดที่ยอมรับกันโดยทั่วไปในการคำนวณการวัดทั้งสองนี้และฉันจะรายงานได้อย่างไรในรายงานบทความวารสาร มันจะมีประโยชน์มากในบริบทของโพสต์นี้ที่จะมีชุดข้อมูล "ของเล่น" ที่สามารถใช้เพื่ออธิบายการคำนวณของทั้งสองมาตรการ ตัวอย่างเช่นสมมติว่าฉันกำลังค้นหามวล (เป็นกิโลกรัม) ของ 200 วิดเจ็ตที่ผลิตโดยสายการประกอบ ฉันยังมีแบบจำลองทางคณิตศาสตร์ที่จะพยายามทำนายมวลของวิดเจ็ตเหล่านี้ โมเดลไม่จำเป็นต้องเป็นแบบประจักษ์พยานและสามารถใช้แบบจำลองได้ ฉันคำนวณ RMSE และ MBD ระหว่างการวัดจริงกับโมเดลโดยพบว่า RMSE คือ 100 กิโลกรัมและ MBD คือ 1% สิ่งนี้หมายความว่าอะไรเกี่ยวกับแนวคิดและฉันจะตีความผลลัพธ์นี้ได้อย่างไร ตอนนี้สมมติว่าฉันพบจากผลลัพธ์ของการทดสอบนี้ว่า …

2
จะแปลงข้อมูลลำดับจากแบบสอบถามเป็นข้อมูลช่วงเวลาที่เหมาะสมได้อย่างไร
มีวิธีการที่ตรงไปตรงมาในการแปลงข้อมูลระดับลำดับเป็นระดับช่วงเวลา (เช่นเดียวกับที่มีสำหรับการทำรอบทางอื่น ๆ )? และสามารถใช้งานได้ใน Excel หรือ SPSS? มีข้อมูลพูดว่า: 10 คำถามเกี่ยวกับระดับลำดับ (กล่าวว่าขนาด 0-5 ที่ 0 = "ไม่ได้เลย", 5 = "ตลอดเวลา") ฉันต้องการที่จะเปลี่ยนพวกเขาเพื่อให้พวกเขาสามารถได้รับการปฏิบัติที่เหมาะสม ข้อมูลระดับช่วงเวลาสำหรับจุดประสงค์ในการทดสอบพารามิเตอร์ (การแจกแจงแบบปกติการทดสอบแบบไม่อิงพารามิเตอร์จากคำถาม) จะขอบคุณอย่างยิ่งสำหรับคำตอบ!

3
Kolmogorov-Smirnov สองมิติ
ฉันต้องการเรียกใช้การทดสอบ Kolmogorov-Smironov สองมิติเพื่อพิจารณาว่าการแจกแจงสองมิตินั้นเหมาะกับการอ้างอิงหรือไม่ มีแพ็คเกจหรือแอพพลิเคชั่นที่ฉันสามารถใช้ในแบบตรงไปตรงมาได้ไหม? หรือมีอัลกอริทึมที่แตกต่างกันซึ่งเป็นที่ต้องการ ฉันมีความรู้ทางสถิติขั้นพื้นฐาน

2
การทดสอบชิ้นอะไรคืออะไร?
ในการตอบคำถามเกี่ยวกับการเลือกรูปแบบในการปรากฏตัวของพหุ , แฟรงก์ Harrell แนะนำ : วางตัวแปรทั้งหมดในแบบจำลอง แต่ไม่ทดสอบผลของตัวแปรเดียวที่ปรับสำหรับผลกระทบของตัวแปรที่แข่งขันกัน ... การทดสอบกลุ่มของตัวแปรที่แข่งขันกันนั้นมีประสิทธิภาพเพราะตัวแปร collinear รวมเข้าด้วยกันในการทดสอบความสัมพันธ์แบบอิสระหลายระดับโดยรวม แข่งขันกับแต่ละอื่น ๆ เช่นเมื่อคุณทดสอบตัวแปรแต่ละรายการ การทดสอบชิ้นอะไรคืออะไร? คุณสามารถยกตัวอย่างการใช้งานของพวกเขาได้rหรือไม่?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.