สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
คุณจะเห็นภาพของช่องทางที่แบ่งกลุ่มอย่างไร (และคุณสามารถใช้กับ Python ได้หรือไม่)
ฉันเห็นโพสต์นี้ใน Moz ซึ่งนำเสนอช่องทางการตลาดที่แบ่งกลุ่ม: สิ่งนี้จะมีค่าค่อนข้างน้อยในงานของฉัน สิ่งที่ฉันไม่มีความคิดก็คือทำอย่างไรจึงจะเห็นภาพข้อมูลดิบเพื่อแสดงช่องทางที่แบ่งกลุ่มแบบนี้ แนวคิดคือยอดขายที่นำมาจากแหล่งต่าง ๆ (ซึ่งเราใช้เพื่อแบ่งกลุ่มข้อมูลตาม) และผ่านหลายขั้นตอนตามเวลาที่พวกเขาเปลี่ยนเป็นดีล จากแต่ละขั้นไปยังอีกบางคนย่อหย่อน ความกว้างของแต่ละชิ้นถูกกำหนดโดยจำนวนนำที่แน่นอนในแต่ละชิ้น [ แก้ไข : สังเกตภาพที่ใช้สำหรับการอ้างอิงที่นี่ทำให้เข้าใจผิดเมื่อมันมาถึงตัวเลขที่ระบุทางด้านขวาของแต่ละชิ้น ดูเหมือนจะไม่มีความสัมพันธ์ระหว่างความกว้างของชิ้นและหมายเลข รูปภาพควรถูกใช้เพื่ออ้างอิงถึงการออกแบบช่องทางแบ่งส่วนเท่านั้น] อย่างไรก็ตามความคิดใด ๆ วิธีการเห็นภาพหรือไม่ ถ้าเป็นไปได้ฉันชอบที่จะมีวิธีใน Python นี่คือGoogle เอกสารที่มีข้อมูลหุ่นหากใครต้องการ ... มองไปข้างหน้าเพื่อข้อมูลเชิงลึกของคุณ ขอบคุณ!

2
การเลือกจำนวนขององค์ประกอบหลักที่กระจัดกระจายเพื่อรวมไว้ในการถดถอย
ไม่มีใครมีประสบการณ์กับวิธีการเลือกจำนวนขององค์ประกอบหลักที่กระจัดกระจายเพื่อรวมไว้ในแบบจำลองการถดถอยหรือไม่?

2
Optimism bias - การประเมินความผิดพลาดโดยประมาณ
หนังสือองค์ประกอบของการเรียนรู้เชิงสถิติ (มีให้ใน PDF ออนไลน์) กล่าวถึงอคติที่เหมาะสม (7.21, หน้า 229) มันระบุว่าอคติในแง่ดีคือความแตกต่างระหว่างข้อผิดพลาดการฝึกอบรมและข้อผิดพลาดในตัวอย่าง (ข้อผิดพลาดสังเกตว่าถ้าเราตัวอย่างค่าผลลัพธ์ใหม่ที่แต่ละจุดฝึกอบรมเดิม) (ต่อด้านล่าง) ถัดไปจะระบุอคติเชิงบวกนี้ ( ) เท่ากับความแปรปรวนร่วมของค่า y ที่เราประมาณและค่า y ที่แท้จริง (สูตรต่อด้านล่าง) ฉันมีปัญหาในการทำความเข้าใจว่าทำไมสูตรนี้บ่งบอกถึงการมองในแง่ดี อย่างไร้เดียงสาฉันจะคิดว่าความแปรปรวนร่วมที่แข็งแกร่งระหว่างจริงและทำนายเพียงอธิบายความถูกต้อง - ไม่มองในแง่ดี แจ้งให้เราทราบหากมีคนสามารถช่วยได้มาของสูตรหรือแบ่งปันสัญชาตญาณ ωω\omegayyyyyy

1
เงื่อนไขแบบเต็มสามารถกำหนดการกระจายข้อต่อได้หรือไม่?
ฉันได้ยินมาว่าเงื่อนไขทั้งหมด (ตามที่ใช้ในการสุ่มตัวอย่างกิ๊บส์) สามารถกำหนดการกระจายข้อต่อได้ แต่ฉันไม่เข้าใจว่าทำไมและอย่างไร หรือว่าฉันเข้าใจผิด? ขอบคุณ!

1
ค่าการตัดระยะทางของ Cook
ฉันได้อ่านระยะทางของแม่ครัวเพื่อระบุตัวผิดที่มีอิทธิพลต่อการถดถอยของฉัน ในการศึกษาดั้งเดิมของ Cook เขาบอกว่าอัตราการตัด 1 ควรเทียบเคียงเพื่อระบุผู้มีอิทธิพล อย่างไรก็ตามการศึกษาอื่น ๆ ใช้4n4n\frac{4}{n} หรือ 4n - k - 14n-k-1\frac{4}{n-k-1} เป็นตัวตัด ในการศึกษาของฉันไม่มีของเหลือของฉันมีค่า D สูงกว่า 1 อย่างไรก็ตามถ้าฉันใช้ 4n4n\frac{4}{n} เป็นทางลัด (4149= .026 )(4149=0.026)(\frac{4}{149}= .026)แล้วมีจุดข้อมูลต่าง ๆ ซึ่งถือว่าเป็นผู้มีอิทธิพล ฉันตัดสินใจที่จะทดสอบว่าการลบจุดข้อมูลเหล่านี้จะสร้างความแตกต่างให้กับการถดถอยเชิงเส้นทั่วไปของฉันหรือไม่ IV ทั้งหมดของฉันยังคงมีความสำคัญและไม่มีการเปลี่ยนแปลงที่ชัดเจน ฉันควรรักษาจุดข้อมูลทั้งหมดของฉันไว้และใช้อัตราการตัด 1 หรือลบออก?

2
R ตรวจจับแนวโน้มการเพิ่ม / ลดลงของอนุกรมเวลา
ฉันมีซีรีย์เวลาจำนวนมากพร้อมช่วงเวลา: วันสัปดาห์หรือเดือน ด้วยstl()ฟังก์ชั่นหรือกับloess(x ~ y)ฉันสามารถดูแนวโน้มของซีรีส์เวลาโดยเฉพาะ ฉันต้องการตรวจสอบว่าแนวโน้มของอนุกรมเวลาเพิ่มขึ้นหรือลดลง ฉันจะจัดการสิ่งนั้นได้อย่างไร ฉันพยายามคำนวณสัมประสิทธิ์การถดถอยเชิงเส้นด้วยlm(x ~ y)และเล่นกับสัมประสิทธิ์ความชัน ( If |slope|>2 and slope>0 thenแนวโน้มเพิ่มขึ้นelse if |slope|>2 and slope<0- ลดลง) อาจมีวิธีอื่นและวิธีที่มีประสิทธิภาพกว่าสำหรับการตรวจจับแนวโน้ม? ขอบคุณ! ตัวอย่าง: ฉันมี,timeserie1 timeserie2ฉันต้องการอัลกอริทึมแบบง่ายที่จะบอกฉันว่าtimeserie2เป็นอัลกอริทึมที่เพิ่มขึ้นและในtimeserie1แนวโน้มไม่เพิ่มขึ้นหรือลดลง ฉันควรใช้เกณฑ์ใด timeserie1: 1774 1706 1288 1276 2350 1821 1712 1654 1680 1451 1275 2140 1747 1749 1770 1797 1485 1299 2330 1822 1627 1847 …
9 r  time-series  trend 

1
การติดตั้ง DLM สัมประสิทธิ์ตามเวลาที่ต่างกัน
ฉันต้องการให้พอดีกับ DLM ด้วยค่าสัมประสิทธิ์การแปรผันของเวลานั่นคือส่วนขยายของการถดถอยเชิงเส้นปกติ yt=θ1+θ2x2yt=θ1+θ2x2y_t = \theta_1 + \theta_2x_2. ฉันมีผู้ทำนาย (x2x2x_2) และตัวแปรตอบกลับ (ytyty_t) จับปลาประจำปีทางทะเลและในทะเลตามลำดับตั้งแต่ปี 1950 - 2011 ฉันต้องการให้โมเดลการถดถอย DLM ปฏิบัติตาม yt=θt,1+θt,2xtyt=θt,1+θt,2xty_t = \theta_{t,1} + \theta_{t,2}x_t สมการวิวัฒนาการของระบบอยู่ที่ไหน θt=Gtθt−1θt=Gtθt−1\theta_t = G_t \theta_{t-1} จากหน้า 43 ของโมเดลเชิงเส้นไดนามิกพร้อม R โดย Petris และคณะ บางรหัสที่นี่ fishdata <- read.csv("http://dl.dropbox.com/s/4w0utkqdhqribl4/fishdata.csv", header=T) x <- fishdata$marinefao y <- fishdata$inlandfao lmodel <- lm(y …

3
สัญชาตญาณเกี่ยวกับเอนโทรปีร่วม
ฉันมีปัญหาในการสร้างสัญชาตญาณเกี่ยวกับเอนโทรปีร่วม = ความไม่แน่นอนในการกระจายข้อต่อ ; = ความไม่แน่นอนใน ; = ไม่แน่นอนใน(y)H( X, วาย)H(X,Y)H(X,Y)p ( x , y)p(x,y)p(x,y)H( X)H(X)H(X)พีx( x )px(x)p_x(x)H( Y)H(Y)H(Y)พีY( y)py(y)p_y(y) ถ้า H (X) สูงการกระจายจะไม่แน่นอนมากขึ้นและถ้าคุณรู้ว่าผลลัพธ์ของการกระจายนั้นคุณมีข้อมูลเพิ่มเติม! ดังนั้น H (X) จึงทำการหาปริมาณข้อมูล ตอนนี้เราสามารถแสดงH( X, วาย) ≤ H( X) + H( Y)H(X,Y)≤H(X)+H(Y)H(X,Y) \leq H(X) + H(Y) แต่ถ้าคุณรู้ว่าคุณสามารถรับและดังนั้นในบางกรณีมีข้อมูลมากกว่าทั้งและดังนั้นไม่ควร ' ความไม่แน่นอนที่เกี่ยวข้องกับ p (x, y) นั้นมากกว่าความไม่แน่นอนของบุคคลหรือไม่p ( x …

1
การประมาณความน่าจะเป็นสูงสุดมีการกระจายตัวแบบประมาณโดยประมาณอย่างไร
ฉันได้อ่านเกี่ยวกับ MLE เป็นวิธีการสร้างการกระจายที่เหมาะสม ฉันเจอข้อความที่บอกว่าการประมาณการความเป็นไปได้สูงสุด "มีการแจกแจงแบบปกติโดยประมาณ" นี่หมายความว่าถ้าฉันใช้ MLE ซ้ำหลายครั้งกับข้อมูลของฉันและตระกูลการแจกแจงที่ฉันพยายามจะพอดีโมเดลที่ฉันได้รับจะกระจายตามปกติหรือไม่ ลำดับการแจกแจงมีการกระจายอย่างไร

2
ทำไม 0.05 <p <0.95 ผลลัพธ์จึงเรียกว่าผลบวกผิด?
แก้ไข:พื้นฐานของคำถามของฉันมีข้อบกพร่องและฉันจำเป็นต้องใช้เวลาในการพิจารณาว่าจะสามารถทำให้เข้าใจได้หรือไม่ แก้ไข 2:ชี้แจงว่าฉันรับรู้ว่า p-value ไม่ใช่การวัดโดยตรงของความน่าจะเป็นของสมมติฐานว่าง แต่ฉันสมมติว่ายิ่งค่า p-value ใกล้ถึง 1 ยิ่งมีโอกาสมากขึ้นที่สมมติฐานจะมี ถูกเลือกสำหรับการทดสอบทดลองที่มีสมมติฐานว่างตรงกันเป็นจริงในขณะที่ค่า p-value ใกล้เคียงกับ 0 ยิ่งมีโอกาสมากขึ้นที่จะมีการเลือกสมมติฐานสำหรับการทดสอบทดลองที่มีสมมติฐานว่างเป็นเท็จ ฉันไม่สามารถเห็นได้ว่านี่เป็นความผิดอย่างไรเว้นแต่ชุดของสมมติฐานทั้งหมด (หรือสมมติฐานทั้งหมดที่เลือกสำหรับการทดลอง) เป็นพยาธิสภาพ แก้ไข 3:ฉันคิดว่าฉันยังไม่ได้ใช้คำศัพท์ที่ชัดเจนเพื่อถามคำถามของฉัน เมื่อตัวเลขลอตเตอรีถูกอ่านออกมาและคุณจับคู่กับตั๋วของคุณทีละรายการการเปลี่ยนแปลงบางอย่าง ความน่าจะเป็นที่คุณชนะไม่เปลี่ยนแปลง แต่ความน่าจะเป็นที่คุณสามารถปิดวิทยุได้ มีการเปลี่ยนแปลงที่คล้ายกันซึ่งเกิดขึ้นเมื่อทำการทดลอง แต่ฉันมีความรู้สึกว่าคำศัพท์ที่ฉันใช้ - "ค่า p เปลี่ยนโอกาสในการเลือกสมมติฐานที่แท้จริง" - ไม่ใช่คำศัพท์ที่ถูกต้อง แก้ไข 4:ฉันได้รับคำตอบอย่างละเอียดและให้ข้อมูลที่น่าอัศจรรย์สองอย่างที่มีข้อมูลมากมายให้ฉันทำงาน ฉันจะโหวตให้พวกเขาทั้งคู่แล้วและกลับมาตอบรับเมื่อฉันได้เรียนรู้มากพอจากคำตอบทั้งสองเพื่อที่จะรู้ว่าพวกเขาตอบหรือทำให้คำถามของฉันไม่ถูกต้อง คำถามนี้เปิดเวิร์มกระป๋องที่ใหญ่กว่าที่ฉันคาดไว้กินมาก ในเอกสารที่ฉันอ่านฉันได้เห็นผลลัพธ์ด้วย p&gt; 0.05 หลังจากการตรวจสอบความถูกต้องที่เรียกว่า "ผลบวกปลอม" อย่างไรก็ตามมันก็ยังไม่น่าเป็นไปได้มากกว่าที่ฉันได้เลือกสมมติฐานเพื่อทดสอบด้วยสมมติฐานว่างที่สอดคล้องกันเท็จเมื่อข้อมูลการทดลองมี ap &lt;0.50ซึ่งต่ำ แต่&gt; 0.05 และไม่ใช่ทั้งสมมติฐานว่างและ สมมติฐานการวิจัยมีความไม่แน่นอน / ไม่มีนัยสำคัญทางสถิติ (จากการตัดนัยสำคัญทางสถิติแบบธรรมดา) …

1
ฉันควรรายงานช่วงเวลาที่น่าเชื่อถือแทนที่จะเป็นช่วงความมั่นใจหรือไม่
หลังจากสะดุดแนวคิดในหนังสือเรียนสถิติฉันพยายามปิดท้ายเกี่ยวกับมันและในที่สุดก็มาถึงบทสรุปที่ดูเหมือนจะพอดีกับคำอธิบายทั้งหมดที่ฉันได้เห็นจนถึงตอนนี้: ช่วงเวลาที่น่าเชื่อถือคือสิ่งที่นักสถิติไม่คิดว่าความมั่นใจ ช่วงเวลาคือ พูดนอกเรื่องสำหรับผู้ที่ชอบฉันจากชั่วโมงที่ผ่านมาที่ไม่ทราบความแตกต่าง หากเราสังเกตข้อมูลและทำนายพารามิเตอร์จากนั้นสมมุติว่าค่าเฉลี่ย μμ\muช่วงเวลาที่น่าเชื่อถือคือช่วงเวลา [μmin, μmax][μmin, μmax][\mu_{\text{min}},\ \mu_{\text{max}}]ซึ่งเรามั่นใจ 95% ว่า mu อยู่ภายใน (หรืออีกจำนวนหนึ่งที่ไม่ใช่ 95% ถ้าเราใช้ระดับอื่น) ช่วงความเชื่อมั่นการสอนในชั้นเรียนสถิติเบื้องต้นสามารถทับซ้อนกับช่วงเวลาที่น่าเชื่อถือ แต่จะไม่เสมอทับซ้อนกัน หากคุณต้องการคำอธิบายที่กล้าลองอ่านนี้และคำถามนี้เกี่ยวกับการตรวจสอบข้าม สิ่งที่ช่วยให้ฉันเข้าใจในที่สุดหลังจากคำตอบที่หัวมากคือคำตอบนี้ หมายความว่าจะเป็นการดีกว่าหรือไม่ในทางวิทยาศาสตร์ที่จะใช้ช่วงเวลาที่น่าเชื่อถือผ่านช่วงความเชื่อมั่นในผลลัพธ์ของฉัน ถ้าใช่ทำไมฉันถึงไม่เห็นสิ่งพิมพ์ใด ๆ ที่ใช้มัน? เป็นเพราะแนวคิดควรใช้ แต่นักวิทยาศาสตร์การวัดยังไม่ทันกับวิธีการทางสถิติที่ถูกต้อง? หรือความหมายของช่วงความมั่นใจเริ่มต้นเหมาะสมกว่าที่จะอธิบายผลลัพธ์จากการศึกษาเชิงประจักษ์หรือไม่? หรือว่าในทางปฏิบัติแล้วพวกเขามักจะทับซ้อนกันซึ่งมันไม่สำคัญเลย? ตัวเลือกขึ้นอยู่กับการแจกแจงเชิงสถิติที่เราสมมติให้กับข้อมูลของเราหรือไม่? อาจมีการแจกแจงแบบเกาส์พวกมันซ้อนทับกันเสมอตัวเลขดังนั้นไม่มีใครอยู่นอกสถิติบริสุทธิ์ที่ใส่ใจเกี่ยวกับความแตกต่าง (การศึกษาจำนวนมากที่ฉันได้อ่านไม่ได้ใส่ใจที่จะคำนวณช่วงเวลาใด ๆและอาจประมาณ 1% ข้อมูลของพวกเขาอาจไม่ได้รับการกระจายตามปกติ มันขึ้นอยู่กับสถานะทางวิทยาศาสตร์ทฤษฎีของเราหรือไม่? ตัวอย่างเช่นรู้สึกว่าควรใช้ช่วงความมั่นใจในการทำงานในเชิงบวกและช่วงเวลาที่น่าเชื่อถือในงานการตีความ แต่ฉันไม่แน่ใจว่าความรู้สึกนี้ถูกต้อง

2
การรวมตัวแปรคำอธิบายที่ละเอียดมากขึ้นเมื่อเวลาผ่านไป
ฉันพยายามที่จะเข้าใจว่าฉันจะสร้างแบบจำลองตัวแปรที่ดีที่สุดได้อย่างไรเมื่อเวลาผ่านไป ตัวอย่างเช่นพิจารณาการสร้างแบบจำลองอัตราการกู้คืนเงินให้สินเชื่อที่ผิดนัด สมมติว่าเรามีชุดข้อมูลที่มีข้อมูล 20 ปีและในช่วง 15 ปีแรกเรารู้เพียงว่าเงินกู้นั้นมีหลักประกันหรือไม่ แต่ไม่มีอะไรเกี่ยวกับคุณลักษณะของหลักประกันนั้น อย่างไรก็ตามในช่วงห้าปีที่ผ่านมาเราสามารถแบ่งหลักประกันออกเป็นหมวดหมู่ต่างๆซึ่งคาดว่าจะเป็นตัวทำนายที่ดีของอัตราการกู้คืน ด้วยการตั้งค่านี้ฉันต้องการให้พอดีกับแบบจำลองของข้อมูลกำหนดมาตรการต่าง ๆ เช่นนัยสำคัญทางสถิติของตัวทำนายและจากนั้นทำนายด้วยตัวแบบ กรอบข้อมูลใดที่ขาดหายไปพอดีกับสิ่งนี้? มีการพิจารณาพิเศษใด ๆ ที่เกี่ยวข้องกับความจริงที่ว่าตัวแปรอธิบายที่ละเอียดมากขึ้นมีให้เฉพาะหลังจากเวลาที่กำหนดซึ่งต่างจากการกระจัดกระจายไปทั่วตัวอย่างประวัติศาสตร์หรือไม่?

1
วิธีการคำนวณไคสแควร์ใน Excel vs R
ฉันกำลังดูแผ่น excel ที่อ้างว่าคำนวณแต่ฉันไม่รู้จักวิธีนี้และฉันสงสัยว่าฉันทำอะไรหายไปหรือเปล่าχ2χ2\chi^2 นี่คือข้อมูลที่วิเคราะห์: +------------------+----------+----------+ | Total Population | Observed | Expected | +------------------+----------+----------+ | 2000 | 42 | 32.5 | | 2000 | 42 | 32.5 | | 2000 | 25 | 32.5 | | 2000 | 21 | 32.5 | +------------------+----------+----------+ และนี่คือผลรวมของแต่ละกลุ่มเพื่อคำนวณไคสแควร์: P = (sum of all observed)/(sum …
9 r  chi-squared  excel 

1
สามารถใช้ bootstrap resampling ใหม่เพื่อคำนวณช่วงความมั่นใจสำหรับความแปรปรวนของชุดข้อมูลได้หรือไม่?
ฉันรู้ว่าถ้าคุณสุ่มตัวอย่างจากชุดข้อมูลซ้ำหลาย ๆ ครั้งและคำนวณค่าเฉลี่ยในแต่ละครั้งค่าเฉลี่ยเหล่านี้จะเป็นไปตามการแจกแจงแบบปกติ (โดย CLT) ดังนั้นคุณสามารถคำนวณช่วงความมั่นใจในค่าเฉลี่ยของชุดข้อมูลได้โดยไม่ต้องทำการตั้งสมมติฐานใด ๆ เกี่ยวกับการแจกแจงความน่าจะเป็นของชุดข้อมูล ฉันสงสัยว่าถ้าคุณสามารถทำสิ่งที่คล้ายกันกับความแปรปรวน นั่นคือถ้าฉันต้องสุ่มตัวอย่างใหม่จากชุดข้อมูลหลาย ๆ ครั้งและคำนวณความแปรปรวนในแต่ละครั้งความแปรปรวนเหล่านี้จะเป็นไปตามการแจกแจงที่แน่นอน (ไม่ว่าการแจกแจงความน่าจะเป็นดั้งเดิมของชุดข้อมูลนั้นคืออะไร) ฉันรู้ว่าถ้าชุดข้อมูลดั้งเดิมนั้นเป็นเรื่องปกติความแปรปรวนจะเป็นไปตามการแจกแจงแบบไคสแควร์ แต่ในกรณีที่มันไม่ปกติ

3
เหตุใดการถดถอยเชิงเส้นจึงไม่สามารถคาดการณ์ผลลัพธ์ของลำดับที่กำหนดอย่างง่ายได้
เพื่อนร่วมงานของฉันส่งปัญหานี้ให้ฉันอย่างเห็นได้ชัดว่าทำให้รอบบนอินเทอร์เน็ต: If $3 = 18, 4 = 32, 5 = 50, 6 = 72, 7 = 98$, Then, $10 =$ ? คำตอบน่าจะเป็น 200 3*6 4*8 5*10 6*12 7*14 8*16 9*18 10*20=200 เมื่อฉันทำการถดถอยเชิงเส้นใน R: data &lt;- data.frame(a=c(3,4,5,6,7), b=c(18,32,50,72,98)) lm1 &lt;- lm(b~a, data=data) new.data &lt;- data.frame(a=c(10,20,30)) predict &lt;- predict(lm1, newdata=new.data, interval='prediction') ฉันเข้าใจ: …
9 r  regression  lm 

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.