สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
การประมาณความแปรปรวนเมื่อเวลาผ่านไป
ฉันมีชุดข้อมูลที่มี ~ 7,500 การตรวจเลือดจาก ~ 2,500 คน ฉันกำลังพยายามหาว่าความแปรปรวนในการตรวจเลือดเพิ่มขึ้นหรือลดลงตามระยะเวลาระหว่างการทดสอบสองครั้งหรือไม่ ตัวอย่างเช่น - ฉันวาดเลือดของคุณสำหรับการทดสอบพื้นฐานแล้ววาดตัวอย่างที่สองทันที หกเดือนต่อมาฉันวาดอีกตัวอย่าง หนึ่งอาจคาดว่าความแตกต่างระหว่างพื้นฐานและการทดสอบซ้ำทันทีจะมีขนาดเล็กกว่าความแตกต่างระหว่างพื้นฐานและการทดสอบหกเดือน แต่ละจุดบนพล็อตด้านล่างสะท้อนความแตกต่างระหว่างการทดสอบสองครั้ง X คือจำนวนวันระหว่างการทดสอบสองครั้ง Y คือขนาดของความแตกต่างระหว่างการทดสอบทั้งสอง อย่างที่คุณเห็นการทดสอบไม่ได้กระจายไปตาม X อย่างสม่ำเสมอ - การศึกษาไม่ได้ออกแบบมาเพื่อตอบคำถามนี้ เนื่องจากคะแนนมีการซ้อนกันอย่างมากในค่าเฉลี่ยฉันจึงได้รวมสายควอไทล์ 95% (สีน้ำเงิน) และ 99% (แดง) ตามหน้าต่าง 28 วัน เห็นได้ชัดว่าสิ่งเหล่านี้ได้รับการดึงออกมาจากจุดที่รุนแรงกว่า แต่คุณก็เข้าใจ ข้อความ ALT http://a.imageshack.us/img175/6595/diffsbydays.png ฉันคิดว่าความแปรปรวนค่อนข้างคงที่ หากมีสิ่งใดสูงกว่าเมื่อการทดสอบซ้ำภายในระยะเวลาอันสั้น ฉันจะจัดการเรื่องนี้ด้วยวิธีที่เป็นระบบบัญชีสำหรับการเปลี่ยนแปลง n ในแต่ละช่วงเวลาได้อย่างไร (และบางช่วงที่ไม่มีการทดสอบเลย) ความคิดของคุณได้รับการชื่นชมอย่างมาก เพื่อการอ้างอิงนี่คือการกระจายจำนวนวันระหว่างการทดสอบและการทดสอบซ้ำ: ข้อความ ALT http://a.imageshack.us/img697/6572/testsateachtimepoint.png

1
คุณใช้การวิเคราะห์เศษซากแบบหลังพอดีชนิดใด
เมื่อดำเนินการถดถอยเชิงเส้นหลายครั้งของ OLS แทนที่จะวางแผนส่วนที่เหลือเทียบกับค่าติดตั้งฉันวางแผนส่วนที่เหลือแบบนักเรียน (ภายใน) กับค่าติดตั้ง (เหมือนกันสำหรับ covariates) ส่วนที่เหลือเหล่านี้ถูกกำหนดเป็น: อี* * * *ผม= eผมs2( 1 - ชมฉันฉัน)---------√อีผม* * * *=อีผมs2(1-ชั่วโมงผมผม)\begin{equation} e^*_i = \frac{e_i}{\sqrt{s^2 (1-h_{ii})}} \end{equation} โดยที่คือส่วนตกค้างและh i iเป็นองค์ประกอบในแนวทแยงของเมทริกซ์หมวก ในการรับค่าส่วนที่เหลือเป็นรายนักศึกษาเหล่านี้ใน R คุณสามารถใช้คำสั่งอีผมอีผมe_iชั่วโมงฉันฉันชั่วโมงผมผมh_{ii}rstandard คนประเภทใดที่ใช้เป็นประจำในบริบทนี้ ตัวอย่างเช่นคุณแค่ติดกับหรือคุณใช้ของเหลือของ jackknife หรืออย่างอื่นทั้งหมดอีผมอีผมe_i หมายเหตุ: ฉันไม่สนใจเอกสารที่กำหนดประเภทใหม่ของสารตกค้างที่ไม่มีใครเคยใช้

5
การแปลง normalizing อื่นใดที่ใช้กันทั่วไปนอกเหนือจากที่พบโดยทั่วไปเช่นสแควร์รูท, บันทึกเป็นต้น
ในการวิเคราะห์คะแนนการทดสอบ (เช่นในด้านการศึกษาหรือจิตวิทยา) เทคนิคการวิเคราะห์ทั่วไปมักจะสมมติว่ามีการแจกจ่ายข้อมูลตามปกติ อย่างไรก็ตามอาจบ่อยกว่าไม่ได้คะแนนมีแนวโน้มที่จะเบี่ยงเบนบางครั้งอย่างรุนแรงจากปกติ ฉันคุ้นเคยกับการแปลง normalizing พื้นฐานบางอย่างเช่น: สแควร์รูท, ลอการิทึม, การแปลงส่วนกลับเพื่อลดความเบ้เป็นบวก, เวอร์ชันที่สะท้อนข้างต้นสำหรับการลดความเบ้เชิงลบ, กำลังสองสำหรับการกระจายเลป ฉันเคยได้ยินเรื่องการแปลงอาร์ซีนและการแปลงพลังงานแม้ว่าฉันจะไม่ค่อยมีความรู้เกี่ยวกับมัน ดังนั้นฉันอยากรู้ว่านักวิเคราะห์ที่ใช้การแปลงแบบอื่นคืออะไร?

11
การปฏิวัติสถิติในช่วง 50 ปีที่ผ่านมา? [ปิด]
ตามที่เป็นอยู่ในปัจจุบันคำถามนี้ไม่เหมาะสำหรับรูปแบบคำถาม & คำตอบของเรา เราคาดหวังว่าคำตอบจะได้รับการสนับสนุนจากข้อเท็จจริงการอ้างอิงหรือความเชี่ยวชาญ แต่คำถามนี้อาจเรียกร้องให้มีการอภิปรายโต้แย้งโต้แย้งหรือการอภิปรายเพิ่มเติม หากคุณรู้สึกว่าคำถามนี้สามารถปรับปรุงและเปิดใหม่ได้โปรดไปที่ศูนย์ช่วยเหลือเพื่อขอคำแนะนำ ปิดให้บริการใน9 ปีที่ผ่านมา สถิติด้านใดที่ได้รับการปฏิวัติอย่างมีนัยสำคัญในช่วง 50 ปีที่ผ่านมา? ตัวอย่างเช่นประมาณ 40 ปีที่ผ่านมา Akaike กับเพื่อนร่วมงานได้ปฏิวัติพื้นที่ของการเลือกปฏิบัติแบบจำลองทางสถิติ ประมาณ 10 ปีที่แล้ว Hyndman กับเพื่อนร่วมงานได้ปฏิวัติพื้นที่ของการทำให้เรียบแบบเอ็กซ์โปเนนเชียล ประมาณ XX ปีที่แล้ว ... ฉันจะทำรายการต่อไปได้อย่างไรด้วยปีและชื่อโปรด? จากสถิติฉันหมายถึงทั้งสี่ประเภทจากที่อยู่ของประธานาธิบดีบาร์โธโลมิวในปี 1995 สถิติที่มากขึ้นและน้อยลงของ Chambers ด้วยกันตามที่ระบุไว้ในที่อยู่ประธานาธิบดีล่าสุดของ Hand ใน 'สถิติสมัยใหม่' และอื่น ๆ ที่เกี่ยวข้องกับอาชีพ
10 history 

2
การรับและตีความช่วงความเชื่อมั่นที่บูตสแตรปจากข้อมูลลำดับชั้น
ฉันสนใจที่จะรับช่วงความมั่นใจในการบูตที่มีปริมาณ X เมื่อปริมาณนี้วัดได้ 10 ครั้งในแต่ละ 10 คน วิธีหนึ่งคือการได้รับค่าเฉลี่ยต่อบุคคลจากนั้น bootstrap หมายถึง (เช่น resample วิธีที่มีการเปลี่ยน) อีกวิธีคือทำตามขั้นตอนต่อไปนี้ของขั้นตอน bootstrapping: ในแต่ละบุคคลให้ทดลองการสังเกตซ้ำของบุคคลที่ 10 ด้วยการแทนที่จากนั้นคำนวณค่าเฉลี่ยใหม่สำหรับบุคคลนั้นและคำนวณค่าเฉลี่ยกลุ่มใหม่ ในวิธีการนี้แต่ละบุคคลที่สังเกตเห็นในชุดข้อมูลดั้งเดิมจะมีส่วนร่วมกับค่าเฉลี่ยของกลุ่มในการวนซ้ำของโพรซีเดอร์บูตสแตรปทุกครั้ง ในที่สุดวิธีที่สามคือการรวมสองวิธีข้างต้น: resample บุคคลแล้ว resample ภายในบุคคลเหล่านั้น วิธีนี้แตกต่างจากวิธีการก่อนหน้านี้ที่อนุญาตให้บุคคลเดียวกันมีส่วนร่วมคูณกับค่าเฉลี่ยของกลุ่มในการทำซ้ำแต่ละครั้งเนื่องจากการบริจาคแต่ละครั้งถูกสร้างขึ้นผ่านขั้นตอนการสุ่มตัวอย่างอิสระการมีส่วนร่วมเหล่านี้อาจแตกต่างกันเล็กน้อย ในทางปฏิบัติฉันพบว่าวิธีการเหล่านี้ให้ผลการประมาณที่แตกต่างกันสำหรับช่วงความมั่นใจ (เช่นชุดข้อมูลหนึ่งฉันพบว่าวิธีที่สามให้ช่วงความเชื่อมั่นที่มากกว่าช่วงสองวิธีแรก) ดังนั้นฉันสงสัยว่าแต่ละสิ่งอาจเป็นอย่างไร ตีความเพื่อเป็นตัวแทน

2
เป็นไปได้ไหมที่จะอ่านคอลัมน์ CSV โดยตรงเป็นข้อมูลหมวดหมู่?
ฉันจำเป็นต้องวิเคราะห์ด้วย R ข้อมูลจากการสำรวจทางการแพทย์ (พร้อมคอลัมน์มากกว่า 100 คอลัมน์) ที่มาในรูปแบบ CSV ฉันจะใช้เสียงอึกทึกสำหรับการวิเคราะห์เริ่มต้น แต่เบื้องหลังมันยังคงเป็นอาร์ ถ้าฉันread.csv ()ไฟล์คอลัมน์ที่มีรหัสตัวเลขจะถือว่าเป็นข้อมูลตัวเลข ฉันรู้ว่าฉันสามารถสร้างคอลัมน์เด็ดขาดจากพวกเขาด้วยfactor ()แต่การทำเพื่อ 100+ คอลัมน์เป็นความเจ็บปวด ฉันหวังว่าจะมีวิธีที่ดีกว่าในการบอกให้ R นำเข้าคอลัมน์เป็นปัจจัยโดยตรง หรืออย่างน้อยก็แปลงพวกมันให้เข้าที่หลังจากนั้น ขอบคุณ!

2
ความแตกต่างระหว่างการวิเคราะห์ข้อมูลการทำงานและการวิเคราะห์ข้อมูลมิติสูงคืออะไร
มีการอ้างอิงจำนวนมากในวรรณกรรมทางสถิติถึง " ข้อมูลการทำงาน " (เช่นข้อมูลที่เป็นเส้นโค้ง) และในแนวขนานกับ " ข้อมูลมิติสูง " (เช่นเมื่อข้อมูลเป็นเวกเตอร์มิติสูง) คำถามของฉันเกี่ยวกับความแตกต่างระหว่างข้อมูลสองประเภท เมื่อพูดถึงวิธีการทางสถิติที่ประยุกต์ใช้ในกรณีที่ 1 สามารถเข้าใจได้ว่าเป็นการใช้วิธีการใหม่จากกรณีที่ 2 ถึงการฉายภาพในขอบเขตย่อยที่มีขอบเขตมิติของพื้นที่ของฟังก์ชั่น . และจะแปลปัญหาการทำงานให้เป็นปัญหาเวคเตอร์แบบมิติแน่นอน (เนื่องจากในวิชาคณิตศาสตร์ประยุกต์ทุกอย่างก็มีขอบเขตในบางจุด) คำถามของฉันคือ เราสามารถพูดได้ว่ากระบวนการทางสถิติใด ๆ ที่ใช้กับข้อมูลการทำงานสามารถนำไปใช้ (เกือบจะโดยตรง) กับข้อมูลมิติสูงและกระบวนการใด ๆ ที่อุทิศให้กับข้อมูลมิติสูงสามารถนำไปใช้กับข้อมูลการทำงานได้หรือไม่ หากคำตอบคือไม่คุณสามารถอธิบายได้ไหม? แก้ไข / ปรับปรุงด้วยความช่วยเหลือของคำตอบของ Simon Byrne: sparsity (สมมติฐาน S-เบาบางลูกและอ่อนแอลิตรPลูกP &lt; 1 ) ใช้เป็นสมมติฐานโครงสร้างในการวิเคราะห์ทางสถิติสูงมิติล.พีล.พีl^pล.พีล.พีl^pp &lt; 1พี&lt;1p<1 "ความเรียบ" ใช้เป็นข้อสมมติฐานเชิงโครงสร้างในการวิเคราะห์ข้อมูลการทำงาน ในทางกลับกันการแปลงฟูริเยร์และการแปลงเวฟเล็ตแบบผกผันจะเปลี่ยนความเป็นช่องว่างให้เป็นความเรียบเนียนและความเรียบเนียนจะถูกเปลี่ยนเป็นแบบ Sparcity โดยการแปลงเวฟเล็ตและฟูริเยร์ สิ่งนี้ทำให้ความแตกต่างที่สำคัญที่ Simon พูดถึงไม่สำคัญอย่างนั้นเหรอ?

3
การรวมอนุกรมเวลาเพื่อทำให้ดูมีความหมายมากขึ้นหรือไม่
คำถามอื่นเกี่ยวกับอนุกรมเวลาจากฉัน ฉันมีชุดข้อมูลที่ให้บันทึกรายวันของเหตุการณ์รุนแรงในโรงพยาบาลจิตเวชเป็นเวลาสามปี ด้วยความช่วยเหลือจากคำถามก่อนหน้านี้ฉันเล่นซอกับมันและมีความสุขมากขึ้นในตอนนี้ สิ่งที่ฉันมีตอนนี้คือซีรี่ส์รายวันมีเสียงดังมาก มันผันผวนอย่างรุนแรงขึ้น ๆ ลง ๆ จาก 0 ถึง 20 เท่าการใช้พล็อตเหลืองและแพ็คเกจพยากรณ์ (ซึ่งฉันสามารถแนะนำสำหรับมือใหม่อย่างฉัน) ฉันเพิ่งได้รับเส้นแบนโดยสิ้นเชิงด้วยความมั่นใจอย่างมากจากการคาดการณ์ อย่างไรก็ตามการรวมข้อมูลรายสัปดาห์หรือรายเดือนทำให้รู้สึกมากขึ้น พวกเขากวาดลงจากจุดเริ่มต้นของซีรีส์แล้วเพิ่มอีกครั้งในกลาง การวางแผนและแพ็คเกจการคาดการณ์จะสร้างสิ่งที่ดูมีความหมายมากขึ้น มันรู้สึกเหมือนโกงอยู่นิดหน่อย ฉันแค่ชอบรุ่นรวมเพราะดูดีโดยไม่มีเหตุผลจริงหรือไม่ หรือมันจะดีกว่าที่จะคำนวณค่าเฉลี่ยเคลื่อนที่และใช้เป็นพื้นฐาน? ฉันกลัวว่าฉันไม่เข้าใจทฤษฎีเบื้องหลังทั้งหมดนี้ดีพอที่จะมั่นใจในสิ่งที่ยอมรับได้

2
ไตรลักษณ์ของการทดสอบในความเป็นไปได้สูงสุด: จะทำอย่างไรเมื่อเผชิญกับข้อสรุปที่ขัดแย้งกัน?
การทดสอบอัตราส่วนตัวบ่งชี้ความน่าจะเป็นและตัวคูณลากรองจ์ในบริบทของการประมาณความน่าจะเป็นสูงสุดนั้นจะเทียบเท่ากันแบบเชิงเส้นกำกับ อย่างไรก็ตามสำหรับตัวอย่างเล็ก ๆ พวกเขามีแนวโน้มที่จะแตกต่างกันเล็กน้อยและในบางกรณีพวกเขาส่งผลให้ข้อสรุปที่แตกต่างกัน พวกเขาสามารถจัดอันดับตามพวกเขามีแนวโน้มที่จะปฏิเสธโมฆะได้อย่างไร จะทำอย่างไรเมื่อการทดสอบมีคำตอบที่ขัดแย้งกัน คุณสามารถเลือกคำตอบที่ต้องการหรือมี "กฎ" หรือ "คำแนะนำ" เป็นวิธีการดำเนินการต่อไปได้หรือไม่?

6
ใช้หลักการประมวลผลสัญญาณที่น่าสงสัยเพื่อระบุแนวโน้ม
ฉันกำลังเสนอให้พยายามหาแนวโน้มในข้อมูลระยะยาวที่มีเสียงดังมาก ข้อมูลนั้นเป็นการวัดรายสัปดาห์ของสิ่งที่เคลื่อนไหวประมาณ 5 มม. ในช่วงเวลาประมาณ 8 เดือน ข้อมูลมีความแม่นยำ 1 มม. และมีเสียงดังมากเปลี่ยนเป็นประจำ +/- 1 หรือ 2 มม. ในหนึ่งสัปดาห์ เรามีข้อมูลไปยังมิลลิเมตรที่ใกล้ที่สุดเท่านั้น เราวางแผนที่จะใช้การประมวลผลสัญญาณพื้นฐานด้วยการแปลงฟูริเยร์ที่รวดเร็วเพื่อแยกสัญญาณรบกวนออกจากข้อมูลดิบ สมมติฐานพื้นฐานคือถ้าเราสะท้อนชุดข้อมูลของเราและเพิ่มลงในส่วนท้ายของชุดข้อมูลที่มีอยู่ของเราเราสามารถสร้างความยาวคลื่นเต็มรูปแบบของข้อมูลและดังนั้นข้อมูลของเราจะแสดงในการแปลงฟูริเยร์ที่รวดเร็วและหวังว่าจะแยกมันออกได้ . ระบุว่าสิ่งนี้ฟังดูน่าสงสัยเล็กน้อยสำหรับฉันนี่เป็นวิธีที่คุ้มค่าหรือไม่หรือเป็นวิธีการทำมิเรอร์และต่อท้ายข้อมูลของเรา เรากำลังดูวิธีการอื่น ๆ เช่นการใช้ตัวกรองสัญญาณความถี่ต่ำเช่นกัน


1
ทฤษฎีบทที่ไม่มีอาหารกลางวันและความสอดคล้อง K-NN
ในการเรียนรู้การคำนวณทฤษฎีบทของ NFL ระบุว่าไม่มีผู้เรียนสากล สำหรับอัลกอริทึมการเรียนรู้ทุกครั้งจะมีการแจกแจงที่ทำให้ผู้เรียนส่งออกไฮเปอร์ซิสด้วยข้อผิดพลาดขนาดใหญ่ที่มีความน่าจะเป็นสูง (แม้ว่าจะมีไฮเปอร์ข้อผิดพลาดต่ำ) บทสรุปก็คือเพื่อที่จะเรียนรู้คลาสไฮเปอร์ซิสหรือการแจกแจงต้องถูก จำกัด ในหนังสือของพวกเขา "ทฤษฎีความน่าจะเป็นของการจดจำรูปแบบ", Devroye et al ได้พิสูจน์ความจริงดังต่อไปนี้สำหรับผู้เรียนที่อยู่ใกล้ที่สุดของเค - เรียน: Assume โดยที่สมมติว่า μ มีความหนาแน่น ถ้า k → ∞ และ k / n → 0 แล้วทุก ε &gt; 0 , มี N, เซนต์ สำหรับทุก n &gt; N:P(Rn-R* * * *&gt; ϵ ) &lt; 2 e x …

1
โอกาสสำหรับกระบวนการนี้คืออะไร?
ผู้ป่วยเข้ารับการรักษาในโรงพยาบาล ระยะเวลาพำนักของพวกเขาขึ้นอยู่กับ 2 สิ่ง: ความรุนแรงของการบาดเจ็บและประกันของพวกเขาเต็มใจที่จะจ่ายเพื่อรักษาพวกเขาในโรงพยาบาล ผู้ป่วยบางรายจะออกไปก่อนกำหนดหากประกันของพวกเขาตัดสินใจที่จะหยุดจ่ายเงินสำหรับการเข้าพักของพวกเขา สมมติว่าต่อไปนี้: 1) ความยาวของการเข้าพัก Poisson กระจาย (เพียงสมมตินี้สำหรับตอนนี้ก็อาจจะหรืออาจจะไม่เป็นจริงสมมติฐาน) กับพารามิเตอร์\λλ\lambda 2) แผนประกันภัยหลากหลายครอบคลุมการเข้าพัก 7, 14, และ 21 วัน ผู้ป่วยจำนวนมากจะออกเดินทางหลังจาก 7,14 หรือ 21 วันอยู่ (เพราะประกันหมดและพวกเขาต้องออกไป) ถ้าฉันได้รับข้อมูลจากกระบวนการนี้มันอาจมีลักษณะดังต่อไปนี้: อย่างที่คุณเห็นมีหนามแหลมที่เครื่องหมาย 7, 14 และ 21 วัน นี่คือผู้ป่วยที่ออกเมื่อประกันสิ้นสุด เห็นได้ชัดว่าข้อมูลสามารถจำลองเป็นส่วนผสมได้ ฉันมีเวลายากลำบากที่จะเขียนความเป็นไปได้สำหรับการกระจายตัวนี้ มันเหมือนปัวซองที่พองเกินศูนย์ แต่เงินเฟ้ออยู่ที่ 7, 14 และ 21 โอกาสในการเกิดข้อมูลนี้คืออะไร? กระบวนการคิดที่อยู่เบื้องหลังความน่าจะเป็นคืออะไร?

1
t-SNE พร้อมตัวแปรแบบต่อเนื่องและไบนารีแบบผสม
ฉันกำลังตรวจสอบการสร้างภาพข้อมูลมิติสูงโดยใช้ t-SNE ฉันมีข้อมูลบางส่วนที่มีไบนารีผสมและตัวแปรต่อเนื่องและข้อมูลดูเหมือนว่าจะจัดกลุ่มข้อมูลไบนารีได้อย่างง่ายดายเกินไป แน่นอนว่าสิ่งนี้คาดว่าจะเป็นข้อมูลสเกล (ระหว่าง 0 ถึง 1): ระยะ Euclidian จะยิ่งใหญ่ที่สุด / เล็กที่สุดระหว่างตัวแปรไบนารี เราควรจัดการกับชุดข้อมูลไบนารี / ต่อเนื่องผสมโดยใช้ t-SNE อย่างไร เราควรดร็อปคอลัมน์ไบนารีหรือไม่ มันมีความแตกต่างที่metricเราสามารถใช้? เป็นตัวอย่างให้พิจารณารหัสหลามนี้: x1 = np.random.rand(200) x2 = np.random.rand(200) x3 = np.r_[np.ones(100), np.zeros(100)] X = np.c_[x1, x2, x3] # plot of the original data plt.scatter(x1, x2, c=x3) # … format graph ดังนั้นข้อมูลดิบของฉันคือ: …

1
เหตุใดสถิติแบบเบย์จึงกลายเป็นหัวข้อวิจัยที่ได้รับความนิยมมากขึ้นเรื่อย ๆ [ปิด]
ปิด คำถามนี้เป็นคำถามความคิดเห็นตาม ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้สามารถตอบข้อเท็จจริงและการอ้างอิงได้โดยแก้ไขโพสต์นี้ ปิดเมื่อปีที่แล้ว การสืบค้นในพื้นที่วิจัยของโปรแกรมสถิติของ US News 100 อันดับแรกเกือบทั้งหมดเป็นสถิติเบย์ อย่างไรก็ตามถ้าฉันไปโรงเรียนชั้นล่างพวกเขาส่วนใหญ่ยังคงทำการวิจัยสถิติแบบดั้งเดิม / บ่อยครั้ง ตัวอย่างเช่นโรงเรียนปัจจุบันของฉัน (อันดับระหว่าง 150 ถึง 200 ในการจัดอันดับ QS โลกสำหรับสถิติจึงไม่ถือว่าเป็นโรงเรียนระดับชั้นนำ) มีอาจารย์เพียงคนเดียวที่มุ่งเน้นไปที่สถิติแบบเบย์และเกือบจะมีความแค้นต่อสถิติแบบเบย์ นักเรียนระดับปริญญาตรีบางคนที่ฉันได้พูดคุยด้วยถึงแม้จะบอกว่านักสถิติแบบเบย์กำลังทำสถิติแบบเบย์เพื่อประโยชน์ของมันซึ่งแน่นอนว่าฉันไม่เห็นด้วยอย่างยิ่ง อย่างไรก็ตามฉันสงสัยว่าทำไมในกรณีนี้ ฉันมีการคาดเดาการศึกษาหลายประการ: (a) มีที่ว่างไม่เพียงพอสำหรับความก้าวหน้าในวิธีการทางสถิติแบบคลาสสิก / บ่อยครั้งและการวิจัยเชิงปฏิบัติเพียงอย่างเดียวในการวิจัยสถิติแบบคลาสสิก / บ่อยครั้งอยู่ในแอปพลิเคชันซึ่งจะเป็นจุดสนใจหลักของโรงเรียนระดับล่าง มีแนวโน้มไปสู่การวิจัยเชิงทฤษฎีและระเบียบวิธี (b) มันขึ้นอยู่กับสนามหนัก สาขาสถิติบางสาขาเหมาะสำหรับสถิติแบบเบย์เช่นการประยุกต์ใช้วิธีการทางวิทยาศาสตร์จำนวนมากในขณะที่สาขาอื่นเหมาะสำหรับสถิติแบบดั้งเดิมเช่นพื้นที่ทางการเงิน (แก้ไขฉันถ้าฉันผิด) ด้วยเหตุนี้ฉันคิดว่าโรงเรียนระดับชั้นนำมีสถิติมากมายที่ใช้งานแอพพลิเคชั่นในสาขาวิทยาศาสตร์ในขณะที่แผนกสถิติชั้นล่างของโรงเรียนส่วนใหญ่มุ่งเน้นการใช้งานในด้านการเงิน และเงินทุน (c) มีปัญหาใหญ่ ๆ เกี่ยวกับวิธีการที่ใช้บ่อยซึ่งไม่สามารถแก้ไขได้เช่นแนวโน้มที่จะเกิด MLE มากเกินไปเป็นต้นและดูเหมือนว่า Bayesian จะให้คำตอบที่ยอดเยี่ยม (d) พลังการคำนวณอยู่ที่นี่ดังนั้นการคำนวณแบบเบย์ไม่ได้เป็นคอขวดอีกต่อไปเมื่อ 30 …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.