สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
มีความแตกต่างในการทำงานระหว่างอัตราต่อรองและอัตราส่วนอันตรายหรือไม่?
ในการถดถอยโลจิสติกอัตราต่อรองที่ 2 หมายถึงเหตุการณ์นั้นมีความเป็นไปได้ที่จะมีโอกาสมากขึ้น 2 เท่าเมื่อเพิ่มการทำนายหนึ่งหน่วย ในการถดถอยแบบค็อกซ์อัตราส่วนความอันตรายที่ 2 หมายถึงเหตุการณ์จะเกิดขึ้นสองครั้งบ่อยครั้งในแต่ละช่วงเวลาที่มีการเพิ่มขึ้นหนึ่งหน่วยในตัวทำนาย สิ่งเหล่านี้ไม่เหมือนกันจริงหรือ อะไรคือข้อได้เปรียบในการทำ Cox Regression และการได้รับอัตราส่วนอันตรายหากเราสามารถได้รับข้อมูลที่เหมือนกันจากอัตราต่อรองของ Logistic Regression

1
วิธีการวัดความน่าเชื่อถือของการจัดอันดับฉันทามติ (ปัญหาจากหนังสือ Kemeny-Snell)
สมมติว่า kkk ผู้เชี่ยวชาญแต่ละคนขอให้จัดอันดับชุด nnnวัตถุในการสั่งซื้อหรือการตั้งค่า อนุญาตให้มีความสัมพันธ์ในการจัดอันดับ John Kemeny และ Laurie Snell ในหนังสือปี 1962 ของพวกเขา"แบบจำลองทางคณิตศาสตร์ในสังคมศาสตร์"เสนอให้แก้ปัญหาต่อไป: โครงการ 111. พัฒนาตัวชี้วัดความน่าเชื่อถือของการจัดอันดับฉันทามติโดยkkkผู้เชี่ยวชาญ ตัวอย่างเช่นสิ่งนี้อาจขึ้นอยู่กับการเปลี่ยนแปลงที่ใหญ่ที่สุดที่อาจเกิดขึ้นได้โดยการเปลี่ยนการจัดอันดับของผู้เชี่ยวชาญคนเดียว (ความสนใจจะต้องจ่ายให้กับความเป็นไปได้ของการจัดอันดับฉันทามติหลายอย่าง) พิสูจน์ทฤษฎีบทบางประการเกี่ยวกับการยินยอมที่เชื่อถือได้มากที่สุดและน้อยที่สุดเท่าที่จะเป็นไปได้kkk. หนังสือเล่มนี้ให้สัญกรณ์สำหรับการจัดอันดับและวิธีการสำหรับการรวมการจัดอันดับ แต่ไม่มีคำตอบสำหรับปัญหาข้างต้น ก่อนอื่นฉันคิดถึงKendall'sWWWค่าสัมประสิทธิ์ของความสอดคล้องกันแต่ดูเหมือนว่ามันไม่เหมาะ ความคิดใด ๆ ยินดีต้อนรับ!

2
โครงสร้างความแปรปรวนร่วม - ความแปรปรวนร่วมสำหรับผลสุ่มใน lme4
โครงสร้างความแปรปรวนร่วมแปรปรวนเริ่มต้นสำหรับผลแบบสุ่มในglmerหรือlmerในlme4แพคเกจคืออะไร? หนึ่งจะระบุโครงสร้างความแปรปรวนร่วมแปรปรวนอื่นสำหรับผลสุ่มในรหัสได้อย่างไร ฉันไม่พบข้อมูลใด ๆ เกี่ยวกับสิ่งนี้ในlme4เอกสารประกอบ

3
อันไหนดีกว่า stl หรือย่อยสลาย?
ฉันกำลังทำการวิเคราะห์อนุกรมเวลาโดยใช้อาร์ฉันต้องแยกย่อยข้อมูลของฉันออกเป็นแนวโน้มองค์ประกอบตามฤดูกาลและการสุ่ม ฉันมีข้อมูลรายสัปดาห์เป็นเวลา 3 ปี ฉันได้พบทั้งสองฟังก์ชั่นในการวิจัย - และstl() decompose()ฉันได้อ่านแล้วว่าstl()มันไม่ดีสำหรับการย่อยสลายแบบทวีคูณ ใครสามารถบอกฉันเกี่ยวกับสถานการณ์ที่ฟังก์ชั่นเหล่านี้ใช้งานได้บ้าง
10 r  time-series 

3
การคำนวณ“ ความน่าจะเป็นของการครอบคลุมจริง” นั้นเหมือนกับการคำนวณ“ ช่วงเวลาที่น่าเชื่อถือ” หรือไม่
ฉันอ่านตำราสถิติระดับเริ่มต้น ในบทที่เกี่ยวกับการประมาณค่าความน่าจะเป็นสูงสุดของสัดส่วนความสำเร็จของข้อมูลที่มีการแจกแจงแบบทวินามมันเป็นสูตรสำหรับการคำนวณช่วงความเชื่อมั่น พิจารณาความน่าจะเป็นที่ครอบคลุมจริงของมันนั่นคือความน่าจะเป็นที่วิธีการสร้างช่วงเวลาที่จับค่าพารามิเตอร์ที่แท้จริง นี่อาจจะน้อยกว่าค่าเล็กน้อย และดำเนินต่อไปพร้อมกับข้อเสนอแนะในการสร้างทางเลือก "ช่วงความมั่นใจ" ซึ่งน่าจะมีความน่าจะเป็นที่ครอบคลุม ฉันเผชิญหน้ากับความคิดของความน่าจะเป็นที่ครอบคลุมและตามจริงเป็นครั้งแรก ทำทางของฉันผ่านคำถามเก่า ๆ ที่นี่ฉันคิดว่าฉันเข้าใจมัน: มีแนวคิดที่แตกต่างกันสองอย่างที่เราเรียกว่าความน่าจะเป็นสิ่งแรกที่เป็นไปได้ที่จะเป็นไปได้ว่าเหตุการณ์ที่ยังไม่เกิดขึ้นจะให้ผลลัพธ์ที่กำหนด เป็นไปได้อย่างไรที่ตัวแทนของผู้สังเกตการณ์คาดเดาผลของเหตุการณ์ที่เกิดขึ้นแล้วนั้นเป็นจริง ดูเหมือนว่าช่วงความเชื่อมั่นจะวัดความน่าจะเป็นประเภทแรกเท่านั้นและสิ่งที่เรียกว่า "ช่วงเวลาที่น่าเชื่อถือ" วัดความน่าจะเป็นประเภทที่สอง ฉันสรุปโดยสรุปว่าความมั่นใจเป็นช่วงเวลาที่คำนวณ "ความน่าจะเป็นความครอบคลุมเล็กน้อย" และช่วงเวลาที่น่าเชื่อถือคือช่วงเวลาที่ครอบคลุม "ความน่าจะเป็นความคุ้มครองตามจริง" แต่บางทีฉันอาจตีความหนังสือผิดไป (ไม่ชัดเจนเลยว่าวิธีการคำนวณที่แตกต่างกันนั้นมีให้สำหรับช่วงความมั่นใจและช่วงเวลาที่น่าเชื่อถือหรือช่วงความเชื่อมั่นสองประเภท) หรือแหล่งข้อมูลอื่นที่ฉันเคยมา ความเข้าใจปัจจุบันของฉัน โดยเฉพาะความคิดเห็นที่ฉันได้จากคำถามอื่น ช่วงความเชื่อมั่นสำหรับผู้ถี่ประจำเชื่อถือได้สำหรับ Bayesian ทำให้ฉันสงสัยในข้อสรุปของฉันเนื่องจากหนังสือเล่มนี้ไม่ได้อธิบายวิธีการแบบเบย์ในบทนั้น ดังนั้นโปรดอธิบายหากความเข้าใจของฉันถูกต้องหรือถ้าฉันทำผิดพลาดทางตรรกะ

3
วิธีการรับค่า p ของสัมประสิทธิ์จากการถดถอย bootstrap?
จากQuick-Rของ Robert Kabacoff ฉันมี # Bootstrap 95% CI for regression coefficients library(boot) # function to obtain regression weights bs <- function(formula, data, indices) { d <- data[indices,] # allows boot to select sample fit <- lm(formula, data=d) return(coef(fit)) } # bootstrapping with 1000 replications results <- boot(data=mtcars, statistic=bs, R=1000, formula=mpg~wt+disp) …

3
ความน่าจะเป็นของการแยกจากการสุ่มตัวอย่างหลายครั้งของประชากรเดียวกัน
นี่คือกรณีตัวอย่าง: ฉันมีประชากร 10,000 รายการ แต่ละรายการมีรหัสเฉพาะ ฉันสุ่มเลือก 100 รายการและบันทึกรหัส ฉันเอาไอเท็ม 100 ชิ้นกลับไปเป็นประชากร ฉันสุ่มเลือก 100 รายการอีกครั้งบันทึกรหัสและแทนที่ โดยรวมฉันทำซ้ำการสุ่มตัวอย่างแบบนี้ 5 ครั้ง ความน่าจะเป็นนั้นคืออะไร XXX จำนวนรายการปรากฏในตัวอย่างสุ่มทั้ง 5 รายการหรือไม่ ฉันไม่เชี่ยวชาญในสถิติ สิ่งนี้จะถูกต้องสำหรับหรือไม่?X= 10X=10X = 10 สำหรับการสุ่มตัวอย่างแต่ละครั้งจำนวนชุดค่าผสมที่เป็นไปได้ 100 รายการจาก 10,000 คือb i n o m (10,000,100)binom(10000,100){\rm binom}(10000, 100) จากการรวมกันทั้งหมด 100 รายการชุดค่าผสมมี 10 รายการเฉพาะb i n o m (9990,90)∗ b …

1
การเปรียบเทียบสองตัวอย่างของสัดส่วนการประมาณขนาดตัวอย่าง: R กับ Stata
การเปรียบเทียบสองตัวอย่างของสัดส่วนการประมาณขนาดตัวอย่าง: R กับ Stata ฉันได้ผลลัพธ์ที่แตกต่างกันสำหรับขนาดตัวอย่างดังนี้: ในอาร์ power.prop.test(p1 = 0.70, p2 = 0.85, power = 0.90, sig.level = 0.05) ผลลัพธ์: (ดังนั้น 161) สำหรับแต่ละกลุ่มn = 160.7777n=160.7777n = 160.7777 ในStata sampsi 0.70 0.85, power(0.90) alpha(0.05) ผลลัพธ์:สำหรับแต่ละกลุ่มn = 174n=174n = 174 ทำไมถึงแตกต่าง ขอบคุณ BTW ฉันรันการคำนวณขนาดตัวอย่างเดียวกันในSAS JMPผลลัพธ์: (เกือบจะเหมือนกับผลลัพธ์ R)n = 160n=160n = 160

4
เหตุใด KNN จึงไม่ใช่ "อิงตามโมเดล"
ESLบทที่ 2.4 ดูเหมือนว่าจะจัดประเภทการถดถอยเชิงเส้นเป็น "ตามโมเดล" เนื่องจากมันถือว่าในขณะที่ไม่มีการประมาณแบบเดียวกันสำหรับเพื่อนบ้านที่อยู่ใกล้เคียง k แต่ทั้งสองวิธีไม่ได้ตั้งสมมติฐานเกี่ยวกับใช่ไหมฉ( x ) ≈ x ⋅ บีตาฉ(x)≈x⋅βf(x) \approx x\cdot\betaฉ( x )ฉ(x)f(x) ในภายหลังใน 2.4 มันยังพูดว่า: กำลังสองน้อยที่สุดสมมติว่าใกล้เคียงกันมากกับฟังก์ชันเชิงเส้นทั่วโลกฉ( x )ฉ(x)f(x) k- เพื่อนบ้านที่ใกล้ที่สุดสมมติว่ามีค่าใกล้เคียงกันกับฟังก์ชันคงที่ในพื้นที่ฉ( x )ฉ(x)f(x) การสันนิษฐาน KNN ดูเหมือนว่ามันจะเป็นทางการได้ (แม้ว่าไม่แน่ใจว่าการทำเช่นนั้นจะนำไปสู่อัลกอริทึม KNN ในวิธีที่สมมติว่าเป็นเส้นนำไปสู่การถดถอยเชิงเส้น)ฉฉf ดังนั้นหาก KNN ไม่ใช่แบบจำลองจริงๆแล้วทำไม? หรือฉันอ่านผิด ESL

1
ป่าสุ่มสามารถทำได้ดีกว่าข้อผิดพลาดการทดสอบ 2.8% ใน MNIST หรือไม่?
ฉันไม่ได้พบวรรณกรรมใด ๆ เกี่ยวกับการใช้ Random Forests กับ MNIST, CIFAR, STL-10 ฯลฯ ดังนั้นฉันจึงคิดว่าฉันจะลองใช้มันด้วยMNIST ที่ไม่เปลี่ยนแปลง ในRฉันลอง: randomForest(train$x, factor(train$y), test$x, factor(test$y), ntree=500) สิ่งนี้ใช้เวลา 2 ชั่วโมงและมีข้อผิดพลาดการทดสอบ 2.8% ฉันยังได้ลองscikit เรียนรู้ด้วย RandomForestClassifier(n_estimators=2000, max_features="auto", max_depth=None) หลังจาก 70 นาทีฉันได้รับข้อผิดพลาดการทดสอบ 2.9% แต่ด้วย n_estimators = 200 แทนฉันได้รับข้อผิดพลาดการทดสอบ 2.8% หลังจากเพียง 7 นาที ด้วยOpenCVฉันพยายาม rf.train(images.reshape(-1, 28**2), cv2.CV_ROW_SAMPLE, labels.astype('int')) การดำเนินการนี้ใช้เวลา 6.5 นาทีและrfการคาดการณ์ทำให้ข้อผิดพลาดในการทดสอบ 15% ฉันไม่ทราบว่ามีต้นไม้กี่ต้นที่ได้รับการฝึกฝนเนื่องจาก …

1
แบบจำลองที่อิ่มตัวนั้นเป็นกรณีพิเศษของรุ่นที่ติดตั้งมากเกินไปหรือไม่?
ฉันพยายามเข้าใจว่าแบบจำลองที่อิ่มตัวคืออะไร AFAIK คือเมื่อคุณมีคุณสมบัติมากเท่าที่สังเกต เราบอกได้ไหมว่าแบบจำลองที่อิ่มตัวนั้นเป็นกรณีพิเศษของโมเดลที่ติดตั้งมากเกินไป?

2
ลักษณนามสำหรับคลาสเดียวเท่านั้น
ในการจำแนกอย่างง่ายเรามีสองคลาส: class-0 และ class-1 ในข้อมูลบางอย่างฉันมีค่าสำหรับ class-1 เท่านั้นดังนั้นไม่มีสำหรับ class-0 ตอนนี้ฉันกำลังคิดที่จะสร้างแบบจำลองเพื่อจำลองข้อมูลสำหรับ class-1 ดังนั้นเมื่อมีข้อมูลใหม่มาโมเดลนี้จะถูกนำไปใช้กับข้อมูลใหม่และพบว่ามีความน่าจะเป็นที่จะบอกว่าข้อมูลใหม่นั้นเหมาะสมกับโมเดลนี้อย่างไร จากนั้นเปรียบเทียบกับเกณฑ์ฉันสามารถกรองข้อมูลที่ไม่เหมาะสม คำถามของฉันคือ: นี่เป็นวิธีที่ดีในการทำงานกับปัญหาดังกล่าวหรือไม่? ลักษณนาม RandomForest สามารถใช้กับกรณีนี้ได้หรือไม่? ฉันจำเป็นต้องเพิ่มข้อมูลเทียมสำหรับ class-0 ซึ่งฉันหวังว่าตัวจําแนกเป็นเสียงรบกวนหรือไม่? แนวคิดอื่นใดที่อาจช่วยแก้ไขปัญหานี้ได้?

2
การทดสอบความเป็นอิสระเทียบกับการทดสอบความเป็นเนื้อเดียวกัน
ฉันกำลังสอนหลักสูตรสถิติขั้นพื้นฐานและวันนี้ฉันจะครอบคลุมการทดสอบความเป็นอิสระของไคสแควร์สำหรับสองประเภทและการทดสอบความเป็นเนื้อเดียวกัน สถานการณ์ทั้งสองนี้แตกต่างกันตามแนวคิด แต่สามารถใช้สถิติการทดสอบและการกระจายแบบเดียวกันได้ ในการทดสอบความเป็นเนื้อเดียวกันผลรวมส่วนล่างสำหรับหนึ่งในหมวดหมู่จะถือว่าเป็นส่วนหนึ่งของการออกแบบ - เป็นตัวแทนของจำนวนวิชาที่เลือกสำหรับแต่ละกลุ่มการทดลอง แต่เนื่องจากการทดสอบไคสแควร์หมุนรอบการปรับสภาพบนยอดรวมทั้งหมดจึงไม่มีผลทางคณิตศาสตร์ที่จะแยกความแตกต่างระหว่างการทดสอบความเป็นเนื้อเดียวกันและการทดสอบความเป็นอิสระด้วยข้อมูลเด็ดขาดอย่างน้อยก็ไม่มีเมื่อใช้การทดสอบนี้ คำถามของฉันมีดังต่อไปนี้: มีโรงเรียนแห่งใดที่มีความคิดทางสถิติหรือวิธีการทางสถิติที่จะให้ผลการวิเคราะห์ที่แตกต่างกันขึ้นอยู่กับว่าเรากำลังทดสอบความเป็นอิสระ (โดยที่ margin ทั้งหมดเป็นตัวแปรสุ่ม) หรือทดสอบความเป็นเนื้อเดียวกัน กำหนดโดยการออกแบบ)? ในกรณีที่ต่อเนื่องบอกว่าเราสังเกตในเรื่องเดียวกันและทดสอบความเป็นอิสระหรือสังเกตในประชากรที่แตกต่างกันและทดสอบว่าพวกเขามาจากการกระจายตัวเดียวกันวิธีการที่แตกต่างกัน การวิเคราะห์ vs t-test) เกิดอะไรขึ้นถ้าข้อมูลหมวดหมู่มาจากตัวแปรที่ต่อเนื่องแบบแยกส่วน การทดสอบความเป็นอิสระและความเป็นเนื้อเดียวกันควรแยกไม่ออกหรือไม่?( X, วาย)(X,Y)(X,Y)(X1,X2)(X1,X2)(X_1, X_2)

2
สูงสุดและปิดบ่อย - คำตอบรวมอยู่ด้วย
My dataset:My dataset:My \ \ dataset: 1:A,B,C,E1:A,B,C,E1: A,B,C,E 2:A,C,D,E2:A,C,D,E2:A,C,D,E 3: B,C,E3: B,C,E3:\ \ \ \ \ B,C,E 4:A,C,D,E4:A,C,D,E4:A,C,D,E 5: C,D,E5: C,D,E5:\ \ \ \ C, D, E 6: A,D,E6: A,D,E6: \ \ \ \ A, D,E ฉันต้องการที่จะหาชุดรายการบ่อยสูงสุดและปิดชุดรายการบ่อย ชุดรายการที่ใช้บ่อย X∈FX∈FX ∈ Fเป็นสูงสุดถ้ามันไม่ได้มี supersets ใด ๆ บ่อย ชุดรายการที่ใช้บ่อย X ∈ F ปิดหากไม่มีชุดซูเปอร์เซ็ตที่มีความถี่เท่ากัน …

3
โมเดลผสมเชิงเส้นทั่วไป: การเลือกรูปแบบ
คำถาม / หัวข้อนี้เกิดขึ้นในการสนทนากับเพื่อนร่วมงานและฉันกำลังมองหาความคิดเห็นเกี่ยวกับเรื่องนี้: ฉันกำลังสร้างแบบจำลองข้อมูลบางอย่างโดยใช้การถดถอยโลจิสติกเอฟเฟกต์แบบสุ่มแม่นยำกว่าการถดถอยโลจิสติกแบบตัดขวางที่แม่นยำ สำหรับผลกระทบคงที่ฉันมี 9 ตัวแปรที่น่าสนใจและเข้ามาพิจารณา ฉันต้องการเลือกรูปแบบบางอย่างเพื่อค้นหาตัวแปรที่มีความสำคัญและให้รูปแบบ "ดีที่สุด" (เอฟเฟกต์หลักเท่านั้น) ความคิดแรกของฉันคือการใช้ AIC เพื่อเปรียบเทียบแบบจำลองที่แตกต่างกัน แต่ด้วย 9 ตัวแปรฉันไม่ตื่นเต้นเกินไปที่จะเปรียบเทียบ 2 ^ 9 = 512 รุ่นที่แตกต่างกัน (คำหลัก: การขุดลอกข้อมูล) ฉันพูดคุยเรื่องนี้กับเพื่อนร่วมงานและเขาบอกฉันว่าเขาจำได้ว่าอ่านเกี่ยวกับการใช้การเลือกแบบจำลองแบบขั้นตอน (หรือไปข้างหน้า) กับ GLMM แต่แทนที่จะใช้ p-value (เช่นจากการทดสอบอัตราส่วนความน่าจะเป็นสำหรับ GLMM) เราควรใช้ AIC เป็นเกณฑ์ในการเข้า / ออก ฉันพบความคิดนี้ที่น่าสนใจมาก แต่ฉันไม่พบการอ้างอิงใด ๆ ที่กล่าวถึงเรื่องนี้เพิ่มเติมและเพื่อนร่วมงานของฉันจำไม่ได้ว่าเขาอ่านที่ไหน หนังสือหลายเล่มแนะนำให้ใช้ AIC เพื่อเปรียบเทียบแบบจำลอง แต่ฉันไม่พบการสนทนาใด ๆ เกี่ยวกับการใช้สิ่งนี้พร้อมกับขั้นตอนการเลือกรุ่นแบบขั้นตอนหรือแบบส่งต่อ ดังนั้นฉันมีสองคำถามโดยทั่วไป: มีอะไรผิดปกติหรือไม่หากใช้ AIC …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.