สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

4
แหล่งข้อมูลที่ดีที่ให้ประวัติของสถิติคืออะไร
อะไรคือแหล่งข้อมูลออนไลน์หรือออฟไลน์ที่ดีที่ให้ภาพรวมของประวัติของสถิติและการพัฒนาที่สำคัญในสถิติจนถึงปัจจุบัน ฉันได้อ่านหน้าประวัติความเป็นมาของสถิติใน Wikipediaแล้ว

1
เหตุใดผู้คนจึงใช้คำว่า "น้ำหนักของหลักฐาน" และแตกต่างจาก "ข้อมูลร่วมกันแบบชี้จุด" อย่างไร
ที่นี่ "น้ำหนักของหลักฐาน" (WOE) เป็นคำทั่วไปในวรรณคดีทางวิทยาศาสตร์และนโยบายการตีพิมพ์ที่พบบ่อยที่สุดในบริบทของการประเมินความเสี่ยงที่กำหนดโดย: W ( e : h ) = บันทึกพี ( e | h )พี ( e | h¯¯¯)w(e:h)=log⁡p(e|h)p(e|h¯)w(e : h) = \log\frac{p(e|h)}{p(e|\overline{h})} โดยที่คือหลักฐานhอีeeชั่วโมงhhคือสมมุติฐาน ตอนนี้ฉันต้องการทราบว่าอะไรคือความแตกต่างที่สำคัญกับ PMI (ข้อมูลร่วมกันแบบจุด) p m i ( e , h ) = บันทึกp ( e , h )p ( e ) ∗ p ( …

2
ปัญหาการแปลงจากปัจจัยเป็นตัวแปรตัวเลขใน R [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้เป็นไปตามหัวข้อสำหรับการตรวจสอบข้าม ปิดให้บริการใน7 ปีที่ผ่านมา ฉันต้องการแปลงตัวแปรปัจจัยเป็นตัวเลข แต่as.numericไม่มีผลกระทบที่ฉันคาดหวัง ด้านล่างฉันได้รับสถิติสรุปสำหรับรุ่นตัวเลขของตัวแปรตามตัวแปรดั้งเดิม หมายถึงการนับต่อ 1 ... บางที (เขาคาดเดา) ระดับของปัจจัยที่มีทั้งชื่อและหมายเลขและฉันคาดหวังว่าค่าของตัวแปรใหม่จะมาจากชื่อเมื่อas.numericถูกออกแบบมาเพื่อใช้หมายเลข? > describe.by(as.numeric(df$sch), df$sch) group: var n mean sd median trimmed mad min max range skew kurtosis se 1 1 5389 1 0 1 1 0 1 1 0 NaN NaN 0 --------------------------------------------------------- group: 001 …

2
เปรียบเทียบค่าสัมประสิทธิ์สหสัมพันธ์
ฉันมีชุดข้อมูลสองชุดที่มีค่า ~ 250.000 สำหรับตัวอย่าง 78 และ 35 ตัวอย่างบางส่วนเป็นสมาชิกของครอบครัวและอาจมีผลกระทบของข้อมูล ฉันคำนวณความสัมพันธ์แบบคู่และมันแตกต่างกันระหว่าง 0.7 และ 0.95 แต่อยากทราบว่ามีความแตกต่างอย่างมีนัยสำคัญในค่าสัมประสิทธิ์สหสัมพันธ์ระหว่างครอบครัวกับครอบครัวหรือไม่? วิธีที่ดีที่สุดในการทำเช่นนี้คืออะไร? ขอบคุณ

1
ตัวอย่างของเมื่อช่วงความมั่นใจและช่วงเวลาที่น่าเชื่อถือตรงกัน
ในบทความวิกิพีเดียเรื่องCredible Intervalกล่าวว่า: สำหรับกรณีของพารามิเตอร์เดียวและข้อมูลที่สามารถสรุปได้ในสถิติที่เพียงพอเพียงครั้งเดียวก็สามารถแสดงให้เห็นว่าช่วงเวลาที่น่าเชื่อถือและช่วงความเชื่อมั่นจะเกิดขึ้นหากพารามิเตอร์ที่ไม่รู้จักเป็นพารามิเตอร์ตำแหน่ง (เช่นฟังก์ชันความน่าจะเป็นไปข้างหน้ามีรูปแบบ Pr (x | μ) = f (x - μ)) โดยก่อนหน้านั้นคือการกระจายแบบคงที่แบบสม่ำเสมอ [5] และหากพารามิเตอร์ที่ไม่รู้จักเป็นพารามิเตอร์ขนาด (เช่นฟังก์ชันความน่าจะเป็นไปข้างหน้ามีรูปแบบ Pr (x | s) = f (x / s)), กับ Jeffreys 'ก่อนหน้า [5] - หลังต่อไปนี้เนื่องจากการลอการิทึมของพารามิเตอร์มาตราส่วนดังกล่าวจะเปลี่ยนเป็นพารามิเตอร์ตำแหน่งที่มีการแจกแจงแบบเดียวกัน แต่สิ่งเหล่านี้เป็นกรณีพิเศษ (แม้ว่าสำคัญ) โดยทั่วไปไม่สามารถทำการเทียบเท่าได้ " ผู้คนสามารถให้ตัวอย่างที่เฉพาะเจาะจงเกี่ยวกับเรื่องนี้ได้หรือไม่? 95% CI จริง ๆ แล้วตรงกับ "โอกาส 95%" เมื่อใดจึง "ละเมิด" คำจำกัดความทั่วไปของ CI

1
จะทดสอบได้อย่างไรว่าข้อมูลของฉันไม่ต่อเนื่องหรือต่อเนื่อง
สำหรับฉันที่จะเลือกเครื่องมือทางสถิติที่เหมาะสมฉันต้องระบุก่อนว่าชุดข้อมูลของฉันไม่ต่อเนื่องหรือต่อเนื่อง คุณพอจะสอนฉันได้ไหมว่าฉันจะทดสอบได้อย่างไรว่าข้อมูลนั้นไม่ต่อเนื่องหรือต่อเนื่องกับ R

1
ประเภทใดที่เหลือและระยะทางของ Cook ที่ใช้สำหรับ GLM
ไม่มีใครรู้ว่าสูตรระยะทางของ Cook คืออะไร? สูตรระยะทางของ Cook ดั้งเดิมใช้ส่วนที่เหลือเป็นราย ๆ แต่ทำไม R จึงใช้ std เพียร์สันที่เหลือเมื่อคำนวณระยะทางพล็อตของ Cook สำหรับ GLM ฉันรู้ว่าเศษที่เหลือเป็นนักเรียนไม่ได้กำหนดไว้สำหรับ GLMs แต่สูตรคำนวณระยะทางของ Cook มีลักษณะอย่างไร สมมติตัวอย่างต่อไปนี้: numberofdrugs <- rcauchy(84, 10) healthvalue <- rpois(84,75) test <- glm(healthvalue ~ numberofdrugs, family=poisson) plot(test, which=5) สูตรสำหรับระยะทางของ Cook คืออะไร กล่าวอีกนัยหนึ่งสูตรการคำนวณเส้นประสีแดงคืออะไร สูตรนี้สำหรับเพียร์สันที่เหลืออยู่นั้นมาจากที่ไหน?

2
การค้นหาดัชนีคอลัมน์ตามชื่อใน R [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้เป็นไปตามหัวข้อสำหรับการตรวจสอบข้าม ปิดให้บริการใน6 ปีที่ผ่านมา ในกรอบข้อมูลฉันต้องการรับดัชนีของคอลัมน์ตามชื่อ ตัวอย่างเช่น: x <- data.frame(foo=c('a','b','c'),bar=c(4,5,6),quux=c(4,5,6)) ฉันต้องการทราบดัชนีคอลัมน์สำหรับ "บาร์" ฉันมากับสิ่งต่อไปนี้ แต่ดูเหมือนไม่เหมาะสม มีบิวด์อินตรงไปตรงมามากกว่าที่ฉันหายไปไหม? seq(1,length(names(x)))[names(x) == "bar"] [1] 2
11 r 

1
วิธีกราฟิกใดที่มีประโยชน์ในการแสดงภาพรวมว่ามีความไม่แน่นอนอย่างไร
ฉันมีชุดของระบบที่มีความไม่แน่นอนสะสมอยู่ภายใน สิ่งเหล่านี้ไม่ได้เติมแต่งอย่างหมดจดเสมอไป - บางครั้งก็เป็น ฉันประสบความสำเร็จในการใช้แผนภูมิแฟน ๆ แผนภูมิแท่งที่มีช่วงความมั่นใจและแผนการสำหรับการสื่อสารรายการเดียว แต่ฉันจะแสดงให้เห็นว่าความไม่แน่นอนสะสมและรวมกันอย่างไรในขณะที่ยังแสดงจุดข้อมูลที่มีความไม่แน่นอนอยู่ด้วย

1
วิธีหยุด excel จากการเปลี่ยนช่วงเมื่อคุณลากสูตรลงมา [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้เป็นไปตามหัวข้อสำหรับการตรวจสอบข้าม ปิดให้บริการใน7 ปีที่ผ่านมา ฉันพยายามทำให้คอลัมน์ชุดข้อมูลปกติในสเปรดชีท Excel ฉันต้องการรับค่าเพื่อให้ค่าสูงสุดในคอลัมน์คือ = 1 และต่ำสุดคือ = ถึง 0 ดังนั้นฉันจึงได้สูตรมา: =(A1-MIN(A1:A30))/(MAX(A1:A30)-MIN(A1:A30)) ดูเหมือนว่าจะทำงานได้ดี แต่เมื่อฉันลากสูตรลงไปเพื่อเติมเซลล์ด้านล่างตอนนี้จะA1เพิ่มขึ้น แต่A1:A30ก็ทำได้เช่นกัน มีวิธีในการล็อคช่วงนี้หรือไม่ในขณะที่อัพเดตเฉพาะหมายเลขที่ฉันสนใจ ฉันได้ลองใส่ Max และ min ในเซลล์อื่นแล้วอ้างอิงมัน แต่มันแค่อ้างอิงเซลล์ภายใต้ที่ Max และ min อยู่และฉันได้หารด้วยศูนย์ข้อผิดพลาดเพราะไม่มีอะไรอยู่
11 excel 

1
การจำลองซีรี่ส์ ARIMA (1,1,0)
ฉันได้ติดตั้งโมเดล ARIMA กับซีรี่ส์เวลาดั้งเดิมและรุ่นที่ดีที่สุดคือ ARIMA (1,1,0) ตอนนี้ฉันต้องการจำลองซีรีส์จากโมเดลนั้น ฉันเขียนโมเดล AR (1) อย่างง่าย แต่ฉันไม่เข้าใจวิธีการปรับความแตกต่างภายในโมเดล ARI (1,1,0) รหัส R ต่อไปนี้สำหรับซีรีย์ AR (1) คือ: phi= -0.7048 z=rep(0,100) e=rnorm(n=100,0,0.345) cons=2.1 z[1]=4.1 for (i in 2:100) z[i]=cons+phi*z[i-1]+e[i] plot(ts(Y)) ฉันจะรวมคำต่าง ARI (1,1) ในรหัสข้างต้นได้อย่างไร คนใดคนหนึ่งช่วยฉันในเรื่องนี้
11 r  time-series  arima 

2
ความแปรปรวนของตัวแปรสุ่มสองน้ำหนัก
ปล่อย: ค่าเบี่ยงเบนมาตรฐานของตัวแปรสุ่มA = σ1= 5A=σ1=5A =\sigma_{1}=5 ค่าเบี่ยงเบนมาตรฐานของตัวแปรสุ่มB = σ2= 4B=σ2=4B=\sigma_{2}=4 ดังนั้นความแปรปรวนของ A + B คือ: VR ( W1A + w2B ) = w21σ21+ w22σ22+ 2 วัตต์1W2พี1 , 2σ1σ2Var(w1A+w2B)=w12σ12+w22σ22+2w1w2p1,2σ1σ2Var(w_{1}A+w_{2}B)= w_{1}^{2}\sigma_{1}^{2}+w_{2}^{2}\sigma_{2}^{2} +2w_{1}w_{2}p_{1,2}\sigma_{1}\sigma_{2} ที่ไหน: พี1 , 2p1,2p_{1,2}คือความสัมพันธ์ระหว่างตัวแปรสุ่มสองตัว W1w1w_{1}คือน้ำหนักของตัวแปรสุ่ม A W2w2w_{2}คือน้ำหนักของตัวแปรสุ่ม B W1+ w2= 1w1+w2=1w_{1}+w_{2}=1 รูปด้านล่างแสดงความแปรปรวนของ A และ B เมื่อน้ำหนักของ A เปลี่ยนจาก 0 เป็น …

4
คุณทดสอบการใช้งาน k-mean ได้อย่างไร?
คำเตือน: ฉันโพสต์คำถามนี้ใน Stackoverflow แต่ฉันคิดว่านี่อาจจะเหมาะกว่าสำหรับแพลตฟอร์มนี้ คุณทดสอบการใช้งาน k-mean ของคุณสำหรับชุดข้อมูลหลายมิติได้อย่างไร ฉันคิดว่าจะใช้งานการใช้งานที่มีอยู่แล้ว (เช่น Matlab) กับข้อมูลและเปรียบเทียบผลลัพธ์กับอัลกอริทึมของฉัน แต่สิ่งนี้จะต้องใช้อัลกอริธึมทั้งสองทำงานมากกว่ากันและการทำแผนที่ระหว่างผลลัพธ์ทั้งสองอาจไม่ใช่เค้ก คุณมีความคิดที่ดีกว่านี้ไหม?

3
วิธีการทดสอบด้วยตัวอย่างขนาดใหญ่?
ฉันมีสองประชากรหนึ่งมี N = 38,704 (จำนวนการสังเกต) และอื่น ๆ ที่มี N = 1,313,662 ชุดข้อมูลเหล่านี้มี ~ 25 ตัวแปรอย่างต่อเนื่องทั้งหมด ฉันใช้ค่าเฉลี่ยของแต่ละชุดข้อมูลและคำนวณสถิติการทดสอบโดยใช้สูตร t = ข้อผิดพลาดหมายถึงความแตกต่าง / std ปัญหาคือระดับของเสรีภาพ ตามสูตรของ df = N1 + N2-2 เราจะมีอิสระมากกว่าที่ตารางสามารถจัดการได้ ข้อเสนอแนะเกี่ยวกับเรื่องนี้? วิธีตรวจสอบสถิติ t ที่นี่ ฉันรู้ว่า t-test ใช้สำหรับการจัดการตัวอย่าง แต่ถ้าเราใช้สิ่งนี้กับตัวอย่างขนาดใหญ่
11 t-test 

1
เหตุใดจึงต้องใช้การขยายคอร์นิชฟิชเชอร์แทนที่จะเป็นตัวอย่าง Quantile
การขยายตัวของคอร์นิชฟิชเชอร์เป็นวิธีการประมาณปริมาณของการแจกแจงตามช่วงเวลา (ในแง่นี้ฉันเห็นว่าเป็นส่วนเสริมของการขยาย Edgeworthซึ่งให้การประมาณของการแจกแจงสะสมตามช่วงเวลา) ฉันอยากจะรู้ว่าในสถานการณ์ใดที่เราจะชอบการขยายตัวของคอร์นิช - ฟิชเชอร์สำหรับการทดลองเชิงประจักษ์ ตัวอย่าง quantile หรือในทางกลับกัน เดาไม่กี่: สามารถคำนวณช่วงเวลาตัวอย่างได้ทางออนไลน์ในขณะที่การประมาณปริมาณตัวอย่างทำได้ยาก ในกรณีนี้โฆษณา CF 'ชนะ' หากมีความสามารถในการคาดการณ์ช่วงเวลา CF จะอนุญาตให้หนึ่งในการใช้ประโยชน์จากการคาดการณ์เหล่านี้สำหรับการประเมินเชิงปริมาณ CF Expansion อาจให้การประมาณค่าควอนไทล์นอกช่วงของค่าที่สังเกตได้ในขณะที่ควอนไทด์ตัวอย่างอาจไม่ควร ฉันไม่ทราบวิธีคำนวณช่วงความมั่นใจรอบ ๆ การประมาณควอนไทล์ที่ CF กำหนด ในกรณีนี้ตัวอย่าง quantile 'wins' ดูเหมือนว่า CF Expansion ต้องการหนึ่งในการประมาณช่วงเวลาที่สูงขึ้นของการแจกแจง ข้อผิดพลาดในการประมาณการเหล่านี้อาจรวมกันในลักษณะที่การขยาย CF มีข้อผิดพลาดมาตรฐานที่สูงกว่าควอนไทด์ตัวอย่าง คนอื่น ๆ ? ไม่มีใครมีประสบการณ์ใช้ทั้งสองวิธีเหล่านี้หรือไม่

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.