สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
การสร้างภาพเหตุผลเพียงพอสำหรับการแปลงข้อมูลหรือไม่
ปัญหา ฉันต้องการพล็อตความแปรปรวนที่อธิบายโดยพารามิเตอร์ 30 ตัวแต่ละตัวเช่น barplot ที่มีแถบที่แตกต่างกันสำหรับแต่ละพารามิเตอร์และความแปรปรวนบนแกน y: อย่างไรก็ตามความแปรปรวนจะเบ้อย่างมากต่อค่าเล็กรวมถึง 0 ซึ่งสามารถเห็นได้ในฮิสโตแกรมด้านล่าง: ถ้าฉันแปลงมันด้วยมันจะง่ายขึ้นที่จะเห็นความแตกต่างระหว่างค่าเล็ก ๆ (ฮิสโตแกรมและบาร์พล็อตด้านล่าง):log(x+1)log⁡(x+1)\log(x+1) คำถาม การพล็อตในระดับบันทึกเป็นเรื่องปกติ แต่การวางแผนสมเหตุสมผลหรือไม่?log(x+1)log⁡(x+1)\log(x+1)

2
ความน่าเชื่อถือระหว่างกลางสำหรับเหตุการณ์ในอนุกรมเวลาที่มีความไม่แน่นอนเกี่ยวกับเวลาของเหตุการณ์
ฉันมีผู้เขียนโค้ดอิสระหลายคนที่พยายามระบุเหตุการณ์ในอนุกรมเวลา - ในกรณีนี้ดูวิดีโอการสนทนาแบบตัวต่อตัวและมองหาพฤติกรรมที่ไม่เกี่ยวกับภาษา (เช่นพยักหน้า) และการเข้ารหัสเวลาและหมวดหมู่ของแต่ละรายการ เหตุการณ์ ข้อมูลนี้อาจได้รับการพิจารณาว่าเป็นชุดข้อมูลที่ไม่ต่อเนื่องโดยมีอัตราการสุ่มตัวอย่างสูง (30 เฟรม / วินาที) หรือเป็นอนุกรมเวลาต่อเนื่องแล้วแต่ว่างานใดจะใช้งานได้ง่ายกว่า ฉันต้องการคำนวณความน่าเชื่อถือระหว่างผู้ประเมินบางอย่าง แต่ฉันคาดว่าจะมีความไม่แน่นอนเมื่อเกิดเหตุการณ์ขึ้น นั่นคือฉันคาดหวังว่า coder หนึ่งอาจยกตัวอย่างเช่นโค้ดที่การเคลื่อนไหวบางอย่างเริ่มต้นขึ้นภายในหนึ่งวินาทีหลังจากที่ตัวแปลงสัญญาณอื่นคิดว่ามันเริ่มต้นขึ้น สิ่งเหล่านี้เป็นเหตุการณ์ที่เกิดขึ้นน้อยมากหากสิ่งนั้นช่วยได้ โดยทั่วไปแล้วอย่างน้อยหลายวินาที (หลายร้อยเฟรมวิดีโอ) ระหว่างเหตุการณ์ มีวิธีที่ดีของการประเมินความน่าเชื่อถือระหว่างผู้ประเมินที่มีลักษณะที่ทั้งสองเหล่านี้ชนิดของข้อตกลงและความขัดแย้ง (1) ทำผู้ประเมินเห็นด้วยกับสิ่งที่เหตุการณ์ที่เกิดขึ้น (ถ้ามี) และ (2) พวกเขาไม่เห็นด้วยในเมื่อมันเกิดขึ้น? ข้อที่สองมีความสำคัญต่อฉันเพราะฉันสนใจที่จะดูเวลาของเหตุการณ์เหล่านี้เทียบกับสิ่งอื่น ๆ ที่เกิดขึ้นในการสนทนาเหมือนกับที่คนอื่นพูดกัน การฝึกมาตรฐานในสาขาของฉันดูเหมือนจะแบ่งสิ่งต่าง ๆ ออกเป็นชิ้นเวลาพูด 1/4 ของวินาทีหรือมากกว่านั้นรวมเหตุการณ์ที่ผู้ทำโค้ดแต่ละคนรายงานต่อเวลาชิ้นจากนั้นคำนวณคัปปาของโคเฮนหรือการวัดที่คล้ายกัน แต่ตัวเลือกระยะเวลาการแบ่งเป็นแบบเฉพาะกิจและฉันไม่ได้รับความคิดที่ดีเกี่ยวกับความไม่แน่นอนในช่วงเวลาของเหตุการณ์ ความคิดที่ดีที่สุดที่ฉันมีมาจนถึงตอนนี้คือฉันสามารถคำนวณกราฟความน่าเชื่อถือบางชนิดได้ สิ่งที่คล้ายคัปปาเป็นฟังก์ชั่นของขนาดของหน้าต่างที่ฉันพิจารณาสองเหตุการณ์ว่าถูกให้รหัสในเวลาเดียวกัน ฉันไม่แน่ใจจริงๆว่าจะไปจากที่นั่น ...

3
ทดสอบความไม่เชิงเส้นในการถดถอยโลจิสติกส์ (หรือการถดถอยแบบอื่น ๆ )
หนึ่งในข้อสันนิษฐานของการถดถอยโลจิสติกคือความเป็นเส้นตรงใน logit ดังนั้นเมื่อฉันสร้างแบบจำลองและเรียกใช้แล้วฉันจะทดสอบความไม่เชิงเส้นโดยใช้การทดสอบ Box-Tidwell หนึ่งในเครื่องมือทำนายต่อเนื่อง (X) ของฉันได้ทดสอบค่าบวกสำหรับความไม่เชิงเส้น ฉันควรทำอย่างไรต่อไป เนื่องจากนี่เป็นการละเมิดสมมติฐานที่ฉันจะกำจัดตัวทำนาย (X) หรือรวมถึงการแปลงแบบไม่เชิงเส้น (X * X) หรือแปลงตัวแปรเป็นหมวดหมู่? หากคุณมีการอ้างอิงคุณช่วยชี้ให้ฉันเห็นด้วยได้ไหม?


4
การกระจายของ OR (อัตราต่อรอง) คืออะไร?
ฉันมีบทความมากมายที่นำเสนอ "OR" ด้วย -95% CI (ช่วงความเชื่อมั่น) ฉันต้องการประเมินค่า P ของบทความสำหรับ OR ที่สังเกตได้จากบทความ สำหรับสิ่งนั้นฉันต้องการสมมติฐานเกี่ยวกับการแจกแจง OR ฉันสามารถสมมติ / ใช้การกระจายใดได้อย่างปลอดภัย

1
T-test สองตัวอย่างพร้อมข้อมูลถ่วงน้ำหนัก
ฉันต้องการทำการทดสอบสองตัวอย่างเพื่อทดสอบความแตกต่างระหว่างสองตัวอย่างอิสระซึ่งแต่ละตัวอย่างปฏิบัติตามสมมติฐานของการทดสอบ T (การแจกแจงแต่ละครั้งสามารถสันนิษฐานได้ว่าเป็นอิสระและกระจายตัวเหมือนปกติพร้อมความแปรปรวนเท่ากัน) . ความซับซ้อนเพียงอย่างเดียวจากการทดสอบสองตัวอย่างขั้นพื้นฐานคือข้อมูลมีน้ำหนัก ฉันกำลังใช้ค่าเฉลี่ยถ่วงน้ำหนักและส่วนเบี่ยงเบนมาตรฐาน แต่น้ำหนักของ N นั้นจะทำให้ขนาดของกลุ่มตัวอย่างพองขึ้นจริงดังนั้นจึงมีอคติกับผลลัพธ์ มันเป็นเพียงกรณีของการแทนที่ Ns ถ่วงน้ำหนักด้วย Ns ถ่วงน้ำหนัก?
13 t-test 

1
ความแตกต่าง / ความสัมพันธ์ระหว่างวิธีการของช่วงเวลากับ GMM คืออะไร?
บางคนสามารถอธิบายความแตกต่างระหว่างวิธีการของช่วงเวลากับ GMM (วิธีการทั่วไปของช่วงเวลา) ความสัมพันธ์ของพวกเขาและอื่น ๆ ที่ควรใช้เมื่อใด

4
วิธีที่ดีที่สุดในการรวบรวมและวิเคราะห์ข้อมูล
เมื่อไม่นานมานี้เริ่มสอนตนเองเกี่ยวกับการเรียนรู้ของเครื่องจักรและการวิเคราะห์ข้อมูลฉันพบว่าตัวเองชนกำแพงอิฐที่ต้องการสร้างและค้นหาชุดข้อมูลขนาดใหญ่ ฉันต้องการใช้ข้อมูลที่รวบรวมไว้ในชีวิตการงานและชีวิตส่วนตัวของฉันแล้ววิเคราะห์ แต่ฉันไม่แน่ใจว่าจะทำสิ่งต่อไปนี้ได้ดีที่สุด: ฉันจะเก็บข้อมูลนี้ได้อย่างไร Excel? SQL? ?? เป็นวิธีที่ดีสำหรับผู้เริ่มต้นในการเริ่มพยายามวิเคราะห์ข้อมูลนี้อย่างไร ฉันเป็นโปรแกรมเมอร์คอมพิวเตอร์มืออาชีพดังนั้นความซับซ้อนไม่ได้อยู่ในการเขียนโปรแกรม แต่เฉพาะเจาะจงมากขึ้นหรือน้อยลงในโดเมนของการวิเคราะห์ข้อมูล แก้ไข: ขอโทษสำหรับความคลุมเครือของฉันเมื่อคุณเริ่มเรียนรู้เกี่ยวกับบางสิ่งบางอย่างมันยากที่จะรู้ว่าสิ่งที่คุณไม่รู้ไม่รู้ใช่มั้ย ;) ต้องบอกว่าจุดมุ่งหมายของฉันคือการใช้สิ่งนี้กับสองหัวข้อหลัก: การวัดทีมงานซอฟแวร์ (คิดว่าความเร็ว Agile, ความเสี่ยงเชิงปริมาณ, ความน่าจะเป็นของการทำซ้ำที่เสร็จสมบูรณ์ได้รับ x จำนวนเรื่องคะแนน) การเรียนรู้ของเครื่อง (ข้อยกเว้นของระบบได้เกิดขึ้นในชุดของโมดูลที่กำหนดความน่าจะเป็นที่โมดูลจะโยนข้อยกเว้นในฟิลด์จะมีค่าใช้จ่ายเท่าไหร่ข้อมูลจะบอกฉันเกี่ยวกับโมดูลหลักเพื่อปรับปรุงที่จะได้รับ คาดเดาได้ว่าส่วนใดของระบบที่ผู้ใช้จะต้องการใช้ต่อไปเพื่อเริ่มการโหลดข้อมูล ฯลฯ )

3
ใครช่วยอธิบายอัลกอริธึมการเผยแพร่กลับได้ไหม [ซ้ำ]
คำถามนี้มีคำตอบอยู่ที่นี่แล้ว : อัลกอริทึม Backpropagation (2 คำตอบ) ปิดให้บริการใน4 เดือนที่ผ่านมา อัลกอริทึมการเผยแพร่กลับคืออะไรและทำงานอย่างไร

1
สามารถรองรับเครื่องเวกเตอร์ในข้อมูลขนาดใหญ่ได้หรือไม่?
ด้วยความรู้ที่ จำกัด ที่ฉันมีใน SVM มันเป็นสิ่งที่ดีสำหรับเมทริกซ์ข้อมูลแบบสั้นและอ้วน (มีคุณสมบัติมากมายและไม่มากเกินไป) แต่ไม่ใช่สำหรับข้อมูลขนาดใหญ่XXX ผมเข้าใจเหตุผลหนึ่งคือ Kernel Matrix เป็นn × nเมทริกซ์ที่nคือจำนวนของอินสแตนซ์ในข้อมูล ถ้าเรามีการพูด, 100K ข้อมูลเคอร์เนลเมทริกซ์Kจะมี10 10องค์ประกอบและอาจต้องใช้เวลาความทรงจำที่ ~ 80GKKKn × nn×nn \times nnnnKKK1010101010^{10} มีการดัดแปลง SVM ที่สามารถใช้กับข้อมูลขนาดใหญ่ได้หรือไม่? (พูดในระดับคะแนนข้อมูล 100K ถึง 1M ใช่ไหม)

3
วิธีการรันการถดถอยเชิงเส้นในแบบคู่ขนาน / กระจายสำหรับการตั้งค่าข้อมูลขนาดใหญ่?
ฉันกำลังทำงานกับปัญหาการถดถอยเชิงเส้นที่มีขนาดใหญ่มากด้วยขนาดข้อมูลที่ใหญ่จนพวกเขาต้องถูกเก็บไว้ในกลุ่มของเครื่อง มันจะใหญ่เกินไปที่จะรวมตัวอย่างทั้งหมดไว้ในหน่วยความจำของเครื่องเดียว (แม้แต่ดิสก์) เมื่อต้องการถดถอยข้อมูลเหล่านี้ฉันกำลังคิดถึงวิธีการแบบขนานนั่นคือเรียกใช้การถดถอยในแต่ละกล่องแล้วคำนวณค่าเบต้าตามสถิติของแต่ละเบต้าแต่ละตัว (อาจเป็นค่าเฉลี่ยหรือค่ามัธยฐาน) สิ่งนี้สมเหตุสมผลหรือไม่? ถ้าเป็นเช่นนั้นวิธีการที่ฉันควรจะได้รับทั้งหมดที่คาดว่าจะR2R2R^2จากแต่ละR2R2R^2 ?


2
Keras: ทำไมสูญเสียลดลงในขณะที่ val_loss เพิ่มขึ้น?
ฉันตั้งค่าการค้นหากริดสำหรับกลุ่มของพารามิเตอร์ ฉันกำลังพยายามหาพารามิเตอร์ที่ดีที่สุดสำหรับ Keras neural net ที่จัดหมวดหมู่แบบไบนารี เอาต์พุตเป็น 1 หรือ 0 มีคุณลักษณะประมาณ 200 รายการ เมื่อฉันทำการค้นหากริดฉันได้รับแบบจำลองมากมายและพารามิเตอร์ของพวกเขา แบบจำลองที่ดีที่สุดมีพารามิเตอร์เหล่านี้: Epochs : 20 Batch Size : 10 First Activation : sigmoid Learning Rate : 1 First Init : uniform และผลลัพธ์สำหรับโมเดลนั้นคือ: loss acc val_loss val_acc 1 0.477424 0.768542 0.719960 0.722550 2 0.444588 0.788861 0.708650 0.732130 3 …

2
ทำไมการหยุดการทดสอบ A / B ก่อนที่จะถึงขนาดตัวอย่างที่ดีที่สุด
ฉันรับผิดชอบในการนำเสนอผลการทดสอบ A / B (ทำงานกับรูปแบบของเว็บไซต์) ที่ บริษัท ของฉัน เราใช้ทดสอบเป็นเวลาหนึ่งเดือนแล้วตรวจสอบค่า P-ในช่วงเวลาปกติจนกว่าจะถึงอย่างมีนัยสำคัญ (หรือละทิ้งความสำคัญถ้าไม่ถึงหลังจากใช้ทดสอบเป็นเวลานาน) บางสิ่งบางอย่างตอนนี้ผมกำลังหาออกเป็นปฏิบัติเข้าใจผิด ฉันต้องการที่จะหยุดการปฏิบัตินี้ในขณะนี้ แต่การทำเช่นนั้นฉันต้องการที่จะเข้าใจว่าทำไมมันผิด ฉันเข้าใจว่าขนาดของเอฟเฟกต์ขนาดตัวอย่าง (N) เกณฑ์นัยสำคัญของอัลฟา (α) และกำลังทางสถิติหรือเบต้าที่เลือกหรือโดยนัย (β) มีความสัมพันธ์ทางคณิตศาสตร์ แต่สิ่งที่เปลี่ยนแปลงเมื่อเราหยุดการทดสอบของเราก่อนที่เราจะถึงขนาดตัวอย่างที่ต้องการ? ฉันได้อ่านโพสต์ไม่กี่ที่นี่ (คือนี้ , นี้และนี้ ) และพวกเขาบอกฉันว่าประมาณการของฉันจะลำเอียงและอัตราการของฉันประเภทที่ 1 การเพิ่มขึ้นของข้อผิดพลาดอย่างมาก แต่มันเกิดขึ้นได้อย่างไร? ฉันกำลังมองหาคำอธิบายทางคณิตศาสตร์บางอย่างที่จะแสดงผลของขนาดตัวอย่างต่อผลลัพธ์อย่างชัดเจน ฉันเดาว่ามันมีบางอย่างเกี่ยวกับความสัมพันธ์ระหว่างปัจจัยที่ฉันกล่าวถึงข้างต้น แต่ฉันไม่สามารถค้นหาสูตรที่แน่นอนและทำงานออกมาได้ด้วยตัวเอง สำหรับตัวอย่างเช่นการหยุดการทดสอบจะเพิ่มอัตราความผิดพลาด Type 1 ก่อนกำหนด Alright แต่ทำไม เกิดอะไรขึ้นเพื่อเพิ่มอัตราข้อผิดพลาดประเภท 1 ฉันขาดสัญชาตญาณตรงนี้ ช่วยด้วย.

2
ความแตกต่างระหว่างตัวแปรสุ่มและตัวอย่างสุ่มคืออะไร?
การแสดงออกสองอย่างนี้ทำให้ฉันสับสนมากเมื่อฉันเรียนรู้สถิติ ดูเหมือนว่าพวกเขาจะแตกต่างกันโดยสิ้นเชิง ตัวอย่างสุ่มคือการสุ่มเก็บตัวอย่างจากประชากรในขณะที่ตัวแปรสุ่มเป็นเหมือนฟังก์ชั่นที่แมปชุดของผลลัพธ์ที่เป็นไปได้ทั้งหมดของการทดสอบเป็นจำนวนจริง อย่างไรก็ตามพูดว่าถ้าฉันวาดตัวอย่าง , ,และ , โดยที่และไม่เป็นที่รู้จักคือ , ,ตัวอย่างสุ่มหรือตัวแปรสุ่ม?X1X1X_1X2X2X_2X3X3X_3Xi∼N(μ,σ2)Xi∼N(μ,σ2)X_i \sim N(\mu,\sigma^2)μμ\muσσ\sigmaX1X1X_1X2X2X_2X3X3X_3

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.