สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
เหตุใดการควบคุม FDR จึงเข้มงวดน้อยกว่าการควบคุม FWER
ฉันได้อ่านแล้วว่าการควบคุม FDR นั้นเข้มงวดน้อยกว่าการควบคุม FWER เช่นในWikipedia : ขั้นตอนการควบคุม FDR ออกแรงควบคุมที่เข้มงวดน้อยกว่าการค้นพบที่ผิดพลาดเมื่อเปรียบเทียบกับขั้นตอนอัตราข้อผิดพลาดในระดับครอบครัว (FWER) (เช่นการแก้ไข Bonferroni) สิ่งนี้จะเพิ่มพลังงานที่ค่าใช้จ่ายในการเพิ่มอัตราข้อผิดพลาดประเภทที่ 1 เช่นการปฏิเสธสมมติฐานว่างไม่มีผลเมื่อมันควรได้รับการยอมรับ แต่ฉันสงสัยว่ามันแสดงให้เห็นว่าเป็นจริงทางคณิตศาสตร์ได้อย่างไร มีความสัมพันธ์ระหว่าง FDR และ FWER บ้างไหม

3
ทดสอบว่าตัวแปรติดตามการแจกแจงแบบเดียวกันหรือไม่
หากคุณต้องการทดสอบว่าตัวแปรสองตัวตามการแจกแจงแบบเดียวกันหรือไม่มันเป็นการทดสอบที่ดีที่จะเรียงลำดับตัวแปรทั้งสองอย่างจากนั้นตรวจสอบความสัมพันธ์ของพวกเขาหรือไม่ หากสูง (อย่างน้อย 0.9?) แสดงว่าตัวแปรนั้นมีแนวโน้มที่มาจากการแจกแจงแบบเดียวกัน ด้วยการกระจายที่นี่ฉันหมายถึง "ปกติ", "ไคสแควร์", "แกมมา" ฯลฯ

2
ความสับสนกับการทดสอบเพิ่มมากขึ้น Dickey Fuller
ฉันทำงานในชุดข้อมูลที่มีอยู่ในแพคเกจelectricity R TSAจุดประสงค์ของฉันคือการตรวจสอบว่าarimaแบบจำลองจะเหมาะสมกับข้อมูลนี้หรือไม่และในที่สุดก็พอดี ดังนั้นฉันจึงดำเนินการดังนี้: 1: พล็อตอนุกรมเวลาซึ่งส่งผลให้กราฟต่อไปนี้: 2: ฉันต้องการที่จะใช้ log ของelectricityเพื่อรักษาความแปรปรวนและหลังจากนั้นซีรีส์ที่แตกต่างกันตามความเหมาะสม แต่ก่อนทำเช่นนั้น ชุดข้อมูลดั้งเดิมโดยใช้การทดสอบadf(เพิ่มยิ่งขึ้นดิกกี้) และน่าประหลาดใจมันส่งผลดังนี้: รหัสและผลลัพธ์: adf.test(electricity) Augmented Dickey-Fuller Test data: electricity Dickey-Fuller = -9.6336, Lag order = 7, p-value = 0.01 alternative hypothesis: stationary Warning message: In adf.test(electricity) : p-value smaller than printed p-value ตามความคิดเกี่ยวกับอนุกรมเวลาของผู้เริ่มต้นของฉันฉันคิดว่ามันหมายความว่าข้อมูลนั้นเป็นข้อมูลนิ่ง (p-value ขนาดเล็กปฏิเสธสมมติฐานว่างของความไม่คงที่) แต่ดูพล็อตทีฉันไม่พบวิธีนี้สามารถนิ่ง ใครบ้างมีคำอธิบายที่ถูกต้องสำหรับเรื่องนี้?

2
R ภาษาความแตกต่างระหว่าง rnorm และ runif คืออะไร [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามดังนั้นจึงเป็นหัวข้อสำหรับการตรวจสอบข้าม ปิดให้บริการใน6 ปีที่ผ่านมา ความแตกต่างระหว่างฟังก์ชั่นrnormและrunifใน R คืออะไร?
16 r 

2
คำอธิบายง่าย ๆ สำหรับช่วงเวลาในโซ่มาร์คอฟ
ใครช่วยอธิบายฉันด้วยวิธีที่เข้าใจง่ายว่าช่วงเวลาของห่วงโซ่มาร์คอฟคืออะไร? มันถูกกำหนดไว้ดังนี้: สำหรับทุกรัฐที่อยู่ในiiiSSS didid_i = gcd{n∈N|p(n)ii>0}=1{n∈N|pii(n)>0}=1\{n \in \mathbb{N} | p_{ii}^{(n)} > 0\} =1 Thank you for your effort!

1
คำถามเกี่ยวกับวิธีการทำให้ค่าสัมประสิทธิ์การถดถอยเป็นปกติ
ไม่แน่ใจว่าคำว่า normalize เป็นคำที่ถูกต้องที่จะใช้ที่นี่หรือไม่ แต่ฉันจะพยายามอย่างดีที่สุดเพื่ออธิบายสิ่งที่ฉันพยายามถาม ตัวประมาณที่ใช้ในที่นี้คือกำลังสองน้อยสุด สมมติว่าคุณมีy = β 0 + β 1 x 1y=β0+β1x1y=\beta_0+\beta_1x_1คุณสามารถจัดให้อยู่กึ่งกลางค่าเฉลี่ยโดยy = β ′ 0 + β 1 x ′ 1y=β′0+β1x′1y=\beta_0'+\beta_1x_1'โดยที่β ′ 0 = β 0 + β 1 ˉ x 1β′0=β0+β1x¯1\beta_0'=\beta_0+\beta_1\bar x_1และx ′ 1 = x - ˉ xx′1=x−x¯x_1'=x-\bar x , ดังนั้นβ ′ 0β′0\beta_0'ไม่มีอิทธิพลต่อการประมาณβ 1β1\beta_1อีกต่อไป โดยที่ผมหมายถึงนี้β …

2
เพียร์สันที่เหลือ
คำถามเริ่มต้นเกี่ยวกับส่วนที่เหลือของเพียร์สันในบริบทของการทดสอบไคสแควร์เพื่อความเหมาะสม: เช่นเดียวกับสถิติการทดสอบchisq.testฟังก์ชั่นของ R รายงานส่วนที่เหลือของเพียร์สัน: (obs - exp) / sqrt(exp) ฉันเข้าใจว่าทำไมการดูความแตกต่างที่แท้จริงระหว่างค่าที่สังเกตและค่าที่คาดหวังไม่ใช่ข้อมูลนั้นเนื่องจากตัวอย่างขนาดเล็กจะส่งผลให้เกิดความแตกต่างเล็กน้อย อย่างไรก็ตามฉันต้องการทราบเพิ่มเติมเกี่ยวกับผลกระทบของตัวหาร: ทำไมหารด้วยรากของค่าที่คาดไว้ นี่คือส่วนที่เหลือ 'มาตรฐาน' หรือไม่?

1
ขอบเขตบนของความหนาแน่นของโคคูล่า?
Fréchet-Hoeffding ผูกไว้บนใช้กับฟังก์ชั่นการกระจายเชื่อมและมันจะได้รับจาก C(u1,...,ud)≤min{u1,..,ud}.C(u1,...,ud)≤min{u1,..,ud}.C(u_1,...,u_d)\leq \min\{u_1,..,u_d\}. มีความคล้ายคลึงกัน (ในแง่ที่ว่ามันขึ้นอยู่กับความหนาแน่นของขอบ) สำหรับความหนาแน่นของแทนที่จะเป็น CDF หรือไม่?c(u1,...,ud)c(u1,...,ud)c(u_1,...,u_d) การอ้างอิงใด ๆ จะได้รับการชื่นชมอย่างมาก

1
การกระจายกับ
มีข้อมูลใดบ้างเกี่ยวกับการกระจายที่มีตายสะสมที่ ? ฟังก์ชั่นการสร้าง cumulant เป็นรูปแบบ ฉันพบว่ามันเป็นการ จำกัด การกระจายของตัวแปรสุ่มบางตัว แต่ฉันไม่สามารถค้นหาข้อมูลใด ๆ ได้nnn1n1n\frac 1 nκ(t)=∫10etx−1x dx.κ(t)=∫01etx−1x dx. \kappa(t) = \int_0 ^ 1 \frac{e^{tx} - 1}{x} \ dx.

1
เกณฑ์การตั้งค่า STL s.window width
ใช้Rเพื่อทำการแยกสลาย STL s.windowควบคุมความรวดเร็วขององค์ประกอบตามฤดูกาลที่สามารถเปลี่ยนแปลงได้ ค่าขนาดเล็กช่วยให้การเปลี่ยนแปลงรวดเร็วยิ่งขึ้น การตั้งค่าหน้าต่างตามฤดูกาลให้เป็นอนันต์เทียบเท่ากับการบังคับให้ส่วนประกอบตามฤดูกาลเป็นคาบ (กล่าวคือเหมือนกันทุกปี) คำถามของฉัน: ถ้าผมมีเวลาแบบรายเดือน (ที่มีความถี่เท่ากับ ) สิ่งที่เกณฑ์ควรจะใช้ชุด?121212s.window มีการเชื่อมโยงระหว่างความถี่นั้นกับอนุกรมเวลาหรือไม่

2
สังเกตเมทริกซ์ข้อมูลเป็นตัวประมาณความสอดคล้องของเมทริกซ์ข้อมูลที่คาดหวัง?
ฉันพยายามที่จะพิสูจน์ว่าเมทริกซ์ข้อมูลที่สังเกตได้ประเมินที่ตัวประมาณความน่าจะเป็นค่าสูงสุดที่ไม่สม่ำเสมอ (MLE) ซึ่งเป็นค่าประมาณที่ไม่แน่นอนของเมทริกซ์ข้อมูลที่คาดหวัง นี่คือผลลัพธ์ที่ยกมาอย่างกว้างขวาง แต่ไม่มีใครให้การอ้างอิงหรือหลักฐาน (ฉันหมดแรงฉันคิดว่าหน้าแรกของผลการค้นหาของ google และตำราสถิติของฉัน) 20 หน้า! การใช้ลำดับของ MLE ที่สอดคล้องกันอย่างอ่อนฉันสามารถใช้กฏที่อ่อนแอของจำนวนมาก (WLLN) และทฤษฎีการทำแผนที่แบบต่อเนื่องเพื่อให้ได้ผลลัพธ์ตามที่ฉันต้องการ อย่างไรก็ตามฉันเชื่อว่าไม่สามารถใช้ทฤษฎีบทการทำแผนที่อย่างต่อเนื่องได้ แต่ฉันคิดว่าต้องใช้กฎหมายเครื่องแบบของคนจำนวนมาก (ULLN) มีใครทราบถึงข้อมูลอ้างอิงที่มีหลักฐานนี้หรือไม่? ฉันมีความพยายามที่ ULLN แต่ไม่ต้องสนใจเลยสำหรับตอนนี้ ฉันต้องขออภัยในความยาวของคำถามนี้ แต่จะต้องมีการจดบันทึก สัญกรณ์เป็นเหมือน folows (หลักฐานของฉันอยู่ท้าย) สมมติว่าเรามีตัวอย่าง IID ของตัวแปรสุ่ม{ Y 1 , ... , Y N }{Y1,…,YN}\{Y_1,\ldots,Y_N\}กับความหนาแน่นฉ( ~ Y | θ )f(Y~|θ)f(\tilde{Y}|\theta)ที่θ ∈ Θ ⊆ R kθ∈Θ⊆Rk\theta\in\Theta\subseteq\mathbb{R}^{k} (ที่นี่~ YY~\tilde{Y}เป็นเพียงตัวแปรสุ่มทั่วไปที่มีความหนาแน่นเดียวกัน …

1
เทคนิคการบูตสแตรปที่เหมาะสมสำหรับข้อมูลคลัสเตอร์หรือไม่
ฉันมีคำถามเกี่ยวกับเทคนิคการบูตสแตรปที่เหมาะสมเพื่อใช้กับข้อมูลที่มีการจัดกลุ่มที่แข็งแกร่ง ฉันได้รับมอบหมายให้ประเมินรูปแบบการทำนายผลผสมแบบหลายตัวแปรบนข้อมูลการเรียกร้องค่าสินไหมทดแทนโดยการให้คะแนนแบบจำลองพื้นฐานปัจจุบันในข้อมูลการอ้างสิทธิ์ล่าสุดเพื่อพิจารณาว่าแบบจำลองทำนายว่าตอนใดของการดูแลที่มีความถี่สูงสุดของเซสชัน เปอร์เซ็นต์ไทล์ที่ 95) ความไวความจำเพาะและค่าการทำนายเชิงบวก (PPV) จะถูกนำมาใช้เพื่อประเมินประสิทธิภาพของแบบจำลอง Bootstrapping ดูเหมือนจะเป็นวิธีที่ถูกต้องในการสร้างช่วงความมั่นใจสำหรับความอ่อนไหวความเฉพาะเจาะจงและเปอร์เซ็นต์ PPV โชคไม่ดีที่ bootstrap ที่ไร้เดียงสานั้นไม่เหมาะสมเนื่องจากข้อมูลการเรียกร้องคือ 1) มีความสัมพันธ์กับผู้ให้บริการดูแล 2) จัดแบ่งเป็นตอนของการดูแลด้วยการเข้าชมบ่อยครั้งมากขึ้นในช่วงหลายเดือนก่อนหน้านี้ในตอนของการดูแล ความแตกต่างของเทคนิค bootstrap แบบเคลื่อนย้ายบล็อกจะเหมาะสมหรือไม่ หรืออาจเป็นขั้นตอน bootstrap สามขั้นตอนจะทำงาน: 1) ตัวอย่างที่มีการเปลี่ยนจากผู้ให้บริการที่แตกต่างในข้อมูลแล้ว 2) ตัวอย่างที่มีการเปลี่ยนจากตอนที่แตกต่างกันของการดูแลโดยผู้ให้บริการที่เลือกแล้ว 3) ตัวอย่างที่มีการทดแทน ตอนที่เลือก ขอบคุณมากสำหรับคำแนะนำใด ๆ !

2
แนวทางการฝึกอบรมสำหรับชุดข้อมูลที่มีความไม่สมดุลสูง
ฉันมีชุดข้อมูลการทดสอบที่ไม่สมดุลสูง ชุดบวกประกอบด้วย 100 กรณีในขณะที่ชุดลบประกอบด้วย 1500 กรณี ในด้านการฝึกอบรมฉันมีกลุ่มผู้สมัครที่ใหญ่กว่า: ชุดฝึกอบรมเชิงบวกมี 1200 รายและชุดฝึกอบรมเชิงลบมี 12,000 ราย สำหรับสถานการณ์ประเภทนี้ฉันมีหลายทางเลือก: 1) การใช้ SVM แบบถ่วงน้ำหนักสำหรับชุดฝึกอบรมทั้งหมด (P: 1200, N: 12000) 2) การใช้ SVM ตามชุดการฝึกอบรมตัวอย่าง (P: 1200, N: 1200) ตัวอย่างเชิงลบ 1200 รายการจะถูกสุ่มตัวอย่างจาก 12,000 กรณี มีคำแนะนำเชิงทฤษฎีในการตัดสินใจเลือกวิธีใดดีกว่า เนื่องจากชุดข้อมูลทดสอบมีความไม่สมดุลสูงฉันควรใช้ชุดฝึกอบรมที่ไม่สมดุลเช่นกันหรือไม่

3
กฎการหยุดที่เป็นทางเลือกไม่ได้อยู่ในตำราเรียน
กฎการหยุดส่งผลกระทบต่อความสัมพันธ์ระหว่างค่า P และอัตราข้อผิดพลาดที่เกี่ยวข้องกับการตัดสินใจ รายงานล่าสุดโดย Simmons และคณะ 2011เหรียญเป็นปริญญาอิสระของนักวิจัยเพื่ออธิบายชุดของพฤติกรรมที่พวกเขาคิดว่าจะรับผิดชอบต่อรายงานจำนวนมากในวรรณคดีจิตวิทยาที่พบว่าไม่สามารถทำซ้ำได้ จากพฤติกรรมเหล่านั้นกฎการหยุดชั่วคราวหรือการวิเคราะห์ชั่วคราวที่ไม่ได้ประกาศเป็นสิ่งที่ฉันสนใจในขณะนี้ฉันอธิบายถึงผลกระทบของอัตราความผิดพลาดที่มีต่อนักเรียนของฉัน แต่ดูเหมือนจะไม่ได้อธิบายไว้ในหนังสือเรียนที่นักเรียนใช้ ใช้!). ในร้านหนังสือหลักในมหาวิทยาลัยของฉันมีหนังสือสถิติสิบสี่เล่มที่มุ่งเป้าไปที่นักเรียนระดับเบื้องต้นในสาขาวิชาต่าง ๆ เช่นวิทยาศาสตร์ชีวภาพธุรกิจวิศวกรรม ฯลฯ มีเพียงตำราเดียวเท่านั้นที่มีรายการดัชนี "การทดสอบตามลำดับ" และไม่มีรายการดัชนี ' หยุดกฎ ' มีตำราสถิติระดับเบื้องต้นที่อธิบายถึงปัญหากฎการหยุดแบบไม่บังคับหรือไม่? Simmons, JP, Nelson, LD และ Simonsohn, U. (2011) false-positive จิตวิทยา: ความยืดหยุ่นไม่เปิดเผยในการเก็บรวบรวมข้อมูลและการวิเคราะห์อนุญาตให้นำเสนอสิ่งใดเป็นสําคัญ วิทยาศาสตร์จิตวิทยา, 22 (11), 1359–1366 ดอย: 10.1177 / 0956797611417632

2
การกระจายก่อนหน้านี้สามารถ / ควรใช้สำหรับความแปรปรวนในตัวแบบเบย์เอซันแบบลำดับชั้นเมื่อความแปรปรวนเฉลี่ยมีความน่าสนใจอย่างไร
ในกระดาษของเขาอ้างกันอย่างแพร่หลายกระจายก่อนหน้าสำหรับพารามิเตอร์ความแปรปรวนในรูปแบบลำดับชั้น (916 การอ้างอิงจนถึง Google Scholar) Gelman เสนอว่าการแจกแจงก่อนหน้าแบบไม่ให้ข้อมูลที่ดีสำหรับความแปรปรวนในแบบจำลอง Bayesian แบบลำดับชั้นคือการกระจายแบบสม่ำเสมอและการกระจายครึ่งหนึ่ง หากฉันเข้าใจสิ่งที่ถูกต้องสิ่งนี้จะทำงานได้ดีเมื่อเป็นพารามิเตอร์ตำแหน่ง (เช่นค่าเฉลี่ย) เป็นสิ่งที่น่าสนใจหลัก บางครั้งพารามิเตอร์ความแปรปรวนเป็นที่สนใจหลักอย่างไรก็ตามเช่นเมื่อวิเคราะห์ข้อมูลการตอบสนองของมนุษย์จากงานเวลาหมายถึงความแปรปรวนของเวลามักจะวัดที่น่าสนใจ ในกรณีเหล่านั้นมันไม่ชัดเจนสำหรับฉันว่าความสามารถแปรผันตามลำดับชั้นได้อย่างไรเช่นการแจกแจงแบบเดียวกันเนื่องจากฉันหลังจากการวิเคราะห์ต้องการได้รับความน่าเชื่อถือของความแปรปรวนเฉลี่ยทั้งในระดับผู้เข้าร่วมและในระดับกลุ่ม คำถามของฉันคือ: การกระจายแบบใดที่แนะนำเมื่อสร้างแบบจำลองแบบเบย์แบบลำดับชั้นเมื่อความแปรปรวนของข้อมูลเป็นความสนใจหลัก ฉันรู้ว่าการแจกแจงแกมมาสามารถแก้ไขได้โดยระบุค่าเฉลี่ยและ SD ยกตัวอย่างเช่นแบบลำดับชั้นด้านล่างเป็นจากหนังสือ Kruschke ของการทำเบส์วิเคราะห์ข้อมูล แต่ Gelman สรุปปัญหาบางอย่างกับการกระจายแกมม่าในบทความของเขาและฉันจะขอบคุณสำหรับคำแนะนำทางเลือกโดยเฉพาะอย่างยิ่งทางเลือกที่ไม่ยากที่จะทำงานใน BUGS / JAGS

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.