สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
คัดค้านการสุ่ม
ในการทดลองทางคลินิก - มุมมองวิธีการ , Steven Piantadosi เขียน (ch.13, p. 334): ในบทที่ 2 ฉันสังเกตเห็นการคัดค้านการสุ่มโดย Abel และ Koch (1997) และ Urbach (1993) และชี้ให้เห็นคุณค่าของการศึกษาข้อกังวลและข้อผิดพลาดที่น่าจะเกิดขึ้น พวกเขาปฏิเสธการสุ่มเป็น หมายถึงการตรวจสอบการทดสอบทางสถิติบางอย่าง พื้นฐานสำหรับการอนุมานสาเหตุ การอำนวยความสะดวกในการกำบังและ วิธีการสมดุลกลุ่มเปรียบเทียบ ตามฉัน (1) - (4) เป็นประโยชน์ของการสุ่ม ดังนั้นทำไมAbel, KochและUrbachปฏิเสธการสุ่มบนพื้นฐานของข้อโต้แย้งเหล่านั้น?

1
การพิสูจน์ลำดับลดลง (สนับสนุนโดยการพล็อตเป็นจำนวนมาก)
คำถามมากมายที่ฉันโพสต์ใน SE ในเดือนที่ผ่านมามีเป้าหมายเพื่อช่วยฉันแก้ปัญหานี้โดยเฉพาะ ตอบคำถามทุกข้อแล้ว แต่ฉันก็ยังหาวิธีแก้ไม่ได้ ดังนั้นฉันคิดว่าฉันควรถามปัญหาที่ฉันพยายามแก้ไขโดยตรง ให้โดยที่ , , (จำนวนเต็ม) และทุกตัวเป็น cdf ส่วนเกิน 1)Xn∼FnXn∼FnX_n \sim F_nFn=(1−(1−Fn−1)c)cFn=(1−(1−Fn−1)c)cF_n = (1-(1-F_{n-1})^c)^cF0=xF0=xF_0 = xc≥2c≥2c\geq 2FnFnF_n(0,1)(0,1)(0,1) ฉันต้องการพิสูจน์ว่าลดลงด้วยสำหรับทุกc (หรือแม้กระทั่งสำหรับcใด ๆ)! ฉันสามารถแสดงให้เห็นว่าF_nแปรสภาพเป็นมวล Dirac ที่ทางออกที่ไม่ซ้ำกับ x_c = (1- (1-x) ^ c) ^ c) สำหรับc = 2 , x_2 = (3- \ sqrt {5}) / 2 \ ประมาณ 0.38 …

1
vcovHC, vcovHAC, NeweyWest - ใช้ฟังก์ชั่นใด?
ฉันกำลังพยายามอัปเดตโมเดลตาม LM ของฉันเพื่อรับข้อผิดพลาดและการทดสอบมาตรฐานที่ถูกต้อง ฉันสับสนจริง ๆ ว่าเมทริกซ์ VC ที่จะใช้ sandwichแพคเกจราคาพิเศษvcovHC, และvcovHAC NeweyWestในขณะที่อดีตเพียงบัญชี heteroskedasticity สองหลังบัญชีทั้งความสัมพันธ์ต่อเนื่องและ heteroskedasticity กระนั้นเอกสารไม่ได้บอกอะไรมากมายเกี่ยวกับความแตกต่างระหว่างสองอันหลัง (อย่างน้อยฉันก็ไม่เข้าใจ) เมื่อมองไปที่ฟังก์ชั่นของตัวเองฉันรู้ว่า NeweyWest โทรหา vcovHAC จริงๆ สังเกตุผลลัพธ์coeftest(mymodel, vcov. = vcovHAC)และcoeftest(mymodel, vcov. = NeweyWest)แตกต่างอย่างบ้าคลั่ง แม้ว่าvcovHACจะค่อนข้างใกล้เคียงกับผลลัพธ์ที่ไร้เดียงสา แต่การใช้ NeweyWest สัมประสิทธิ์ทั้งหมดจะเปลี่ยนไปเล็กน้อย (การทดสอบใกล้เคียงกับ 1)

1
ตัวกรองคาลมานกับเส้นโค้งที่ราบเรียบ
ถาม: ข้อมูลใดที่เหมาะสมที่จะใช้การสร้างแบบจำลองพื้นที่รัฐและตัวกรองคาลมานแทนที่จะเป็นเส้นโค้งที่ราบเรียบและในทางกลับกัน มีความสัมพันธ์ที่เท่าเทียมกันระหว่างสองคนนี้หรือไม่? ฉันพยายามทำความเข้าใจในระดับสูงว่าวิธีการเหล่านี้เข้ากันได้อย่างไร ฉันเรียกดูผ่านห์นสโตนใหม่ของการประมาณค่าแบบเกาส์: ลำดับและ multiresolution รุ่น มันน่าประหลาดใจที่ไม่มีใครกล่าวถึงโมเดลพื้นที่รัฐและตัวกรองคาลมาน ทำไมจะไม่อยู่ในนั้น? นั่นเป็นเครื่องมือมาตรฐานที่สุดสำหรับปัญหาเหล่านี้ใช่ไหม แทนที่จะมุ่งความสนใจไปที่เส้นโค้งและเวฟเล็ต ตอนนี้ฉันสับสนมาก

1
เราสามารถเปรียบเทียบความสัมพันธ์ระหว่างกลุ่มโดยการเปรียบเทียบความชันถดถอยได้หรือไม่?
ในคำถามนี้พวกเขาถามวิธีเปรียบเทียบ Pearson r สำหรับกลุ่มอิสระสองกลุ่ม (เช่นเพศชายและหญิง) ตอบและแสดงความคิดเห็นแนะนำสองวิธี: ใช้สูตรที่รู้จักกันดีของฟิชเชอร์โดยใช้ "z-tranformation" ของ r; ใช้การเปรียบเทียบความชัน (สัมประสิทธิ์การถดถอย) หลังสามารถทำได้อย่างง่ายดายเพียงแค่ผ่านโมเดลเชิงเส้นอิ่มตัว: Y= a + b X+ c G + dXGY=a+bX+cG+dXGY = a + bX + cG + dXGที่ไหน XXX และ YYY เป็นตัวแปรที่มีความสัมพันธ์และ GGGเป็นตัวแปรดัมมี่ (0 vs 1) ที่ระบุถึงสองกลุ่ม ขนาดของddd (ค่าสัมประสิทธิ์การโต้ตอบ) คือความแตกต่างของสัมประสิทธิ์ bbb หลังจากรูปแบบ Y=a+bXY=a+bXY = a + bX ดำเนินการในสองกลุ่มเป็นรายบุคคลและ …

3
การถดถอยเชิงเส้นกับปัจจัยใน R
ฉันพยายามที่จะเข้าใจว่าปัจจัยการทำงานในอาร์ว่ากันว่าฉันต้องการที่จะเรียกใช้การถดถอยโดยใช้ข้อมูลตัวอย่างบางอย่างใน R: > data(CO2) > colnames(CO2) [1] "Plant" "Type" "Treatment" "conc" "uptake" > levels(CO2$Type) [1] "Quebec" "Mississippi" > levels(CO2$Treatment) [1] "nonchilled" "chilled" > lm(uptake ~ Type + Treatment, data = CO2) Call: lm(formula = uptake ~ Type + Treatment, data = CO2) Coefficients: (Intercept) TypeMississippi Treatmentchilled 36.97 -12.66 -6.86 ฉันเข้าใจว่าTypeMississippiและTreatmentchilledได้รับการปฏิบัติเหมือนเป็นบูลีน: …

3
วิธีทดสอบสมมติฐานว่าสหสัมพันธ์เท่ากับค่าที่กำหนดโดยใช้ R อย่างไร
มีฟังก์ชั่นในการทดสอบสมมติฐานว่าสหสัมพันธ์ของเวกเตอร์สองตัวมีค่าเท่ากับตัวเลขที่กำหนดหรือไม่พูดว่า 0.75? การใช้ cor.test ฉันสามารถทดสอบ cor = 0 และฉันเห็นได้ว่า 0.75 อยู่ในช่วงความมั่นใจหรือไม่ แต่มีฟังก์ชั่นในการคำนวณค่า p สำหรับ cor = 0.75 หรือไม่? x <- rnorm(10) y <- x+rnorm(10) cor.test(x, y)
10 r  correlation 

2
"ปฏิเสธการอนุมาน" คืออะไรและจะใช้เพื่อเพิ่มความแม่นยำของแบบจำลองได้อย่างไร
ใครช่วยอธิบายรายละเอียดได้: การปฏิเสธการอนุมานหมายความว่าอย่างไร จะใช้เพื่อเพิ่มความแม่นยำของแบบจำลองของฉันได้อย่างไร ฉันมีความคิดที่จะปฏิเสธการอนุมานในการสมัครบัตรเครดิต แต่ต้องดิ้นรนกับความคิดที่จะใช้มันเพื่อเพิ่มความแม่นยำของแบบจำลองของฉัน
10 logistic 


1
คุณจะสร้าง ROC curves สำหรับการตรวจสอบความถูกต้องแบบ cross-one-out ได้อย่างไร
เมื่อทำการตรวจสอบความถูกต้องไขว้ 5 เท่า (เช่น) เป็นเรื่องปกติที่จะคำนวณเส้นโค้ง ROC ที่แยกต่างหากสำหรับแต่ละ 5 เท่าและบ่อยครั้งที่เส้นโค้ง ROC เฉลี่ยกับ std dev แสดงเป็นความหนาของเส้นโค้ง อย่างไรก็ตามสำหรับการข้ามการตรวจสอบความถูกต้องของ LOO ที่มีการทดสอบดาต้าพอยน์เพียงครั้งเดียวในแต่ละครั้งดูเหมือนจะไม่น่าสนใจที่จะคำนวณ ROC "โค้ง" สำหรับดาต้าพอยน์นี้ ฉันได้รับคะแนนข้อมูลการทดสอบทั้งหมดของฉัน (พร้อมกับค่า p ที่คำนวณแยกต่างหาก) และรวมพวกมันไว้ในชุดใหญ่ชุดหนึ่งเพื่อคำนวณเส้นโค้ง ROC เดียว แต่นี่เป็นสิ่งที่ควรทำเพื่อสถิติเชิงสถิติหรือไม่ วิธีที่ถูกต้องในการใช้การวิเคราะห์ ROC คือเมื่อจำนวนจุดข้อมูลในแต่ละเท่าเป็นหนึ่ง (เช่นในกรณีของการตรวจสอบข้าม LOO)

4
หนังสือที่ดีเกี่ยวกับวิธีการเชิงสถิติสถิติ
เมื่อฉันเรียนหลักสูตรสถิติเชิงทฤษฎีในระดับปริญญาตรีเมื่อ 10 ปีก่อนเราใช้สถิติคณิตศาสตร์สมัยใหม่โดย Dudewicz และ Mishra ฉันพบว่าฉันอ้างถึงหนังสือเล่มนี้แล้วและฉันนึกถึงตัวอย่างรหัสบางส่วนที่อยู่ในชุดประกอบสำหรับ IBM 370 ในขณะที่แปลกตาฉันไม่สามารถช่วยได้ แต่รู้สึกว่าวันนี้ค่อนข้างเก่า หนังสือคุณภาพสูงเล่มใดที่มีอยู่ในเหล้าองุ่นเมื่อเร็ว ๆ นี้?
10 references 

2
ไม่ว่าจะใช้การชดเชยในการถดถอยปัวซองเมื่อทำนายเป้าหมายการทำงานทั้งหมดที่ผู้เล่นฮอกกี้ทำคะแนน
ฉันมีคำถามเกี่ยวกับสิ่งที่ดีกว่าหรือไม่ใช้การชดเชย สมมติว่าเป็นโมเดลที่ง่ายมากที่คุณต้องการอธิบายจำนวนเป้าหมาย (โดยรวม) ในฮอกกี้ ดังนั้นคุณมีเป้าหมายจำนวนเกมที่เล่นและตัวแปรดัมมี่ "กองหน้า" ซึ่งเท่ากับ 1 หากผู้เล่นเป็นกองหน้าและ 0 อย่างอื่น ดังนั้นรุ่นใดต่อไปนี้ที่ระบุไว้ถูกต้อง? เป้าหมาย = เกม + กองหน้าหรือ เป้าหมาย = ชดเชย (เกม) + กองหน้า อีกครั้งเป้าหมายคือเป้าหมายโดยรวมและจำนวนเกมเป็นเกมโดยรวมสำหรับผู้เล่นคนเดียว ตัวอย่างเช่นอาจมีผู้เล่นที่หยิบขึ้นมาที่มี 50 เป้าหมายใน 100 เกมและผู้เล่นอีกคนที่มี 20 เป้าหมายใน 50 เกมเป็นต้น ฉันควรทำอย่างไรเมื่อฉันต้องการประเมินจำนวนเป้าหมาย จำเป็นหรือไม่ที่จะใช้การชดเชยตรงนี้ อ้างอิง: ดูคำถามก่อนหน้านี้ที่พูดถึงเมื่อใช้ offsets ในการถดถอยปัวซองโดยทั่วไป

2
สังเกตพบการกระจายตัวแบบเบ้ซ้ายและสมมาตร
มันค่อนข้างยากสำหรับฉันที่จะอธิบาย แต่ฉันจะพยายามทำให้ปัญหาของฉันเป็นที่เข้าใจได้ ก่อนอื่นคุณต้องรู้ว่าฉันได้ทำการถดถอยเชิงเส้นอย่างง่ายจนถึงตอนนี้ ก่อนที่ผมจะประมาณค่าสัมประสิทธิ์ฉันดูการกระจายของฉันYมันหนักไปทางซ้ายเบ้ หลังจากที่ฉันประเมินแบบจำลองแล้วฉันค่อนข้างแน่ใจว่าจะสังเกตสิ่งที่เหลืออยู่แบบเบ้ซ้ายในรูปแบบ QQ-Plot เป็น wel แต่ฉันไม่ได้ทำอย่างแน่นอน อะไรคือสาเหตุของการแก้ไขนี้? ความผิดพลาดอยู่ที่ไหน หรือมีการกระจายอะไรจะทำอย่างไรกับการกระจายของระยะข้อผิดพลาดหรือไม่YYyYYy

1
ประสิทธิภาพแบบเกาส์หมายความว่าอย่างไร
ในกรณีที่เครื่องประมาณที่มีประสิทธิภาพประสิทธิภาพของเกาส์หมายถึงอะไร ตัวอย่างเช่นQnQnQ_{_n} มีประสิทธิภาพแบบเกาส์ 82% และจุดแบ่ง 50% การอ้างอิงคือ: Rousseeuw PJ และ Croux, C. (1993) “ ทางเลือกในการเบี่ยงเบนสัมบูรณ์แบบมัธยฐาน” เจอเมริกันสถิติรอง, 88, 1273-1283

2
ฉันจะอธิบายความแปรปรวนเชิงพื้นที่ในรูปแบบเชิงเส้นได้อย่างไร
พื้นหลัง ฉันมีข้อมูลจากการศึกษาภาคสนามซึ่งมีสี่ระดับการรักษาและหกซ้ำในแต่ละช่วงตึก (4x6x2 = 48 การสังเกต) บล็อกอยู่ห่างกันประมาณ 1 ไมล์และภายในบล็อกมีตารางของ 42, 2m x 4m แปลงและทางเดินกว้าง 1m; การศึกษาของฉันใช้เพียง 24 แปลงในแต่ละบล็อก ฉันต้องการประเมินความแปรปรวนร่วมเชิงพื้นที่ นี่คือตัวอย่างการวิเคราะห์โดยใช้ข้อมูลจากบล็อกเดียวโดยไม่มีการบัญชีสำหรับความแปรปรวนร่วมเชิงพื้นที่ ในชุดข้อมูลplotคือ id ของพล็อตxคือตำแหน่ง x และyตำแหน่ง y ของแต่ละพล็อตที่มีพล็อต 1 อยู่ตรงกลางที่ 0, 0 levelคือระดับการรักษาและresponseเป็นตัวแปรตอบกลับ layout <- structure(list(plot = c(1L, 3L, 5L, 7L, 8L, 11L, 12L, 15L, 16L, 17L, 18L, 22L, 23L, 26L, …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.