สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
อนุพันธ์ของกระบวนการแบบเกาส์เซียน
ฉันเชื่อว่าอนุพันธ์ของกระบวนการเกาส์เซียน (GP) เป็นอีก GP และฉันอยากรู้ว่ามีสมการแบบปิดสำหรับสมการทำนายของอนุพันธ์ของ GP หรือไม่? โดยเฉพาะอย่างยิ่งฉันใช้กำลังสองชี้แจง (หรือที่เรียกว่า Gaussian) ความแปรปรวนร่วมและต้องการทราบเกี่ยวกับการทำนายเกี่ยวกับอนุพันธ์ของกระบวนการแบบเกาส์

2
วิธีการเลือกความกว้างถังที่ดีที่สุดในขณะที่การสอบเทียบโมเดลความน่าจะเป็นเป็นอย่างไร
ความเป็นมา:มีคำถาม / คำตอบที่ดีเกี่ยวกับวิธีการปรับเทียบแบบจำลองซึ่งทำนายความน่าจะเป็นของผลลัพธ์ที่เกิดขึ้น ตัวอย่างเช่น คะแนนหนาม , และการสลายตัวของมันเข้าไปในความละเอียดของความไม่แน่นอนและความน่าเชื่อถือ แผนการสอบเทียบและการถดถอยแบบไอโซโทนิก วิธีการเหล่านี้มักจะต้องใช้วิธีการ binning กับความน่าจะเป็นที่คาดการณ์ดังนั้นพฤติกรรมของผลลัพธ์ (0, 1) จะถูกทำให้ราบเรียบเหนือถังขยะโดยรับผลลัพธ์ที่เป็นค่าเฉลี่ย ปัญหา: อย่างไรก็ตามฉันไม่พบสิ่งใดที่แนะนำให้ฉันทราบเกี่ยวกับวิธีเลือกความกว้างของถังขยะ คำถาม:ฉันจะเลือกความกว้างของถังที่เหมาะสมได้อย่างไร ความพยายาม:มีความกว้างถังขยะทั่วไปสองแห่งที่ใช้งานอยู่: ความกว้างเท่ากัน binning เช่น 10 bins ละครอบคลุม 10% ของช่วงเวลา [0, 1] วิธี Binning ของ Tukey กล่าวถึงที่นี่ แต่ตัวเลือกเหล่านี้ของถังขยะจะเหมาะสมที่สุดหากมีใครสนใจที่จะค้นหาช่วงเวลาในความน่าจะเป็นที่คาดการณ์ซึ่งคาดการณ์ผิดมากที่สุด?

1
ค่าสัมประสิทธิ์ที่เหมือนกันประมาณในรูปแบบปัวซอง vs ควอซี - ปัวซอง
ในการสร้างแบบจำลองข้อมูลการนับการเรียกร้องในสภาพแวดล้อมการประกันภัยฉันเริ่มต้นด้วย Poisson แต่แล้วสังเกตเห็นการทับซ้อนกัน Quasi-Poisson เป็นแบบอย่างที่ดีกว่าความสัมพันธ์แปรปรวนที่ดีกว่า Poisson พื้นฐาน แต่ฉันสังเกตเห็นว่าสัมประสิทธิ์เป็นเหมือนกันทั้งใน Poisson และ Quasi-Poisson หากนี่ไม่ใช่ข้อผิดพลาดเหตุใดจึงเป็นเช่นนี้ การใช้ Quasi-Poisson บน Poisson มีประโยชน์อย่างไร สิ่งที่ควรทราบ: การสูญเสียที่อยู่ภายใต้พื้นฐานส่วนเกินซึ่ง (ฉันเชื่อว่า) ป้องกัน Tweedie จากการทำงาน - แต่มันเป็นการกระจายครั้งแรกที่ฉันพยายาม ฉันยังตรวจสอบรุ่นของ NB, ZIP, ZINB และ Hurdle แต่ก็ยังพบว่า Quasi-Poisson นั้นเหมาะสมที่สุด ฉันทดสอบการกระจายตัวเกินขนาดผ่านการทดสอบการกระจายในแพ็คเกจ AER พารามิเตอร์การกระจายของฉันอยู่ที่ประมาณ 8.4 โดยมีค่า p อยู่ที่ขนาด 10 ^ -16 ฉันกำลังใช้ glm () กับ family = …

4
เบาะแสว่าปัญหาเหมาะสมอย่างยิ่งสำหรับการถดถอยเชิงเส้น
ฉันเรียนรู้การถดถอยเชิงเส้นโดยใช้รู้เบื้องต้นเกี่ยวกับการวิเคราะห์การถดถอยเชิงเส้นโดยอจิกและ Vining ฉันต้องการเลือกโครงการวิเคราะห์ข้อมูล ฉันมีความคิดที่ไร้เดียงสาว่าการถดถอยเชิงเส้นนั้นเหมาะสมเมื่อผู้ต้องสงสัยคนหนึ่งเท่านั้นที่มีความสัมพันธ์เชิงเส้นตรงระหว่างตัวแปรอธิบายและตัวแปรตอบสนอง แต่มีแอพพลิเคชั่นในโลกแห่งความจริงไม่มากนักที่ดูเหมือนจะตรงตามเกณฑ์นี้ แต่การถดถอยเชิงเส้นค่อนข้างแพร่หลาย แง่มุมของโครงการที่นักสถิติที่มีประสบการณ์กำลังคิดอยู่ว่าพวกเขาอยู่ในรองเท้าของฉันหรือไม่โดยมองหาคำถาม + ข้อมูลที่เหมาะสมกับการถดถอยเชิงเส้น

1
การประเมินผลของ“ ประมาณปกติ” สำหรับการทดสอบที
ฉันกำลังทดสอบวิธีการที่เท่าเทียมกันโดยใช้การทดสอบ t ของ Welch การแจกแจงพื้นฐานอยู่ไกลจากปกติ (บิดเบือนมากกว่าตัวอย่างในการสนทนาที่เกี่ยวข้องที่นี่ ) ฉันสามารถรับข้อมูลเพิ่มเติมได้ แต่ต้องการวิธีที่มีหลักการในการพิจารณาว่าจะทำเช่นไร มีฮิวริสติกที่ดีสำหรับการประเมินว่าการแจกตัวอย่างเป็นที่ยอมรับหรือไม่? การเบี่ยงเบนใด ๆ จากภาวะปกติที่เกี่ยวข้องกับอะไรมากที่สุด มีวิธีการอื่น ๆ - เช่นอาศัยช่วงความเชื่อมั่นบูตสำหรับสถิติตัวอย่าง - ซึ่งจะทำให้รู้สึกมากขึ้น?

1
การถดถอยโลจิสติกอันดับใน Python
ฉันต้องการเรียกใช้การถดถอยแบบลอจิสติกอันดับใน Python สำหรับตัวแปรตอบกลับที่มีสามระดับและมีปัจจัยที่อธิบายน้อย statsmodelsแพคเกจสนับสนุน logit ไบนารีและ logit พหุนาม (MNLogit) รุ่น แต่ไม่ได้รับคำสั่ง logit เนื่องจากคณิตศาสตร์พื้นฐานไม่แตกต่างกันฉันจึงสงสัยว่ามันสามารถนำไปใช้งานได้อย่างง่ายดายโดยใช้สิ่งเหล่านี้หรือไม่ (อีกทางหนึ่งคือแพ็คเกจ Python อื่น ๆ ที่ใช้งานได้)

1
การ์ดเกม: ถ้าฉันจั่วไพ่สี่ใบโดยสุ่มและคุณจั่วไพ่หกใบความน่าจะเป็นที่ไพ่สูงสุดของฉันสูงกว่าแต้มสูงสุดของคุณคืออะไร?
ตามที่ระบุไว้ในชื่อกล่าวว่าถ้าฉันสุ่มไพ่ 4 ใบและคุณดึงไพ่ 6 ใบจากเด็คเดียวกันความน่าจะเป็นที่การ์ดสูงสุดของฉันชนะไพ่สูงสุดของคุณคืออะไร การเปลี่ยนแปลงนี้จะเกิดขึ้นได้อย่างไรหากเราดึงออกมาจากเด็คที่แตกต่างกัน ขอบคุณ!

1
การทดสอบความเหมาะสมในการถดถอยโลจิสติก เราต้องการทดสอบแบบใด
ฉันหมายถึงคำถามและคำตอบ: วิธีการเปรียบเทียบ (ความน่าจะเป็น) ความสามารถในการทำนายของแบบจำลองที่พัฒนาจากการถดถอยโลจิสติก? โดย @Clark Chong และคำตอบ / ความคิดเห็นโดย @Frank Harrell และคำถามองศาความเป็นอิสระของในการทดสอบ Hosmer-Lemeshowχ2χ2\chi^2และความคิดเห็น ฉันได้อ่านเอกสารDW Hosmer, T. Hosmer, S. Le Cessie, S. Lemeshow, "การเปรียบเทียบการทดสอบความดีพอดีสำหรับรูปแบบการถดถอยโลจิสติก", สถิติการแพทย์, ฉบับที่ 16, 965-980 (1997) หลังจากอ่านฉันสับสนเพราะคำถามที่ฉันอ้างถึงขอให้ชัดเจนสำหรับ "(ความน่าจะเป็น) ความสามารถในการทำนาย" ซึ่งในความคิดของฉันไม่เหมือนกับสิ่งที่ดี - ของ - พอดี - แบบทดสอบในกระดาษ supra มุ่ง: ดังที่พวกเราส่วนใหญ่ทราบกันว่าการถดถอยแบบลอจิสติกถือว่าการเชื่อมโยงรูปตัว S ระหว่างตัวแปรอธิบายและความน่าจะเป็นของความสำเร็จรูปแบบการทำงานของรูปตัว S คือ P(y=1|xi)=11+e−(β0+∑iβixi)P(y=1|xi)=11+e−(β0+∑iβixi)P(y=1|_{x_i})=\frac{1}{1+e^{-(\beta_0+\sum_i \beta_i x_i)}} โดยไม่ต้องแสร้งว่าไม่มีข้อบกพร่องในการทดสอบ …

2
แปลปัญหาการเรียนรู้ของเครื่องเป็นกรอบการถดถอย
สมมติว่าฉันมีแผงของการอธิบายตัวแปรสำหรับฉัน= 1 . . N , T = 1 . . Tเช่นเดียวกับเวกเตอร์ของตัวแปรตามผลไบนารีY ฉันที ดังนั้นYจะสังเกตได้เฉพาะในครั้งสุดท้ายTและไม่ใช่ก่อนหน้านี้ กรณีทั่วไปอย่างสมบูรณ์คือการมีหลายX i j tสำหรับj = 1 ... Kสำหรับแต่ละหน่วยiในแต่ละครั้งtXฉันทีXitX_{it}ฉัน= 1 . . ยังไม่มีข้อความi=1...Ni = 1 ... NT = 1 . . Tt=1...Tt = 1 ... TYฉันTYiTY_{iT}YYYTTTXฉันเจทีXijtX_{ijt}j = 1 ... Kj=1...Kj=1...Kผมiitttแต่ขอเน้นที่กรณีเพื่อความกระชับK=1K=1K=1 การใช้งานของคู่ "ไม่สมดุล" มีตัวแปรอธิบายความสัมพันธ์ชั่วคราวเช่น (ราคาหุ้นรายวันเงินปันผลรายไตรมาส), (รายงานสภาพอากาศรายวัน, พายุเฮอริเคนรายปี) หรือ …

2
การดักจับรูปแบบเริ่มต้นเมื่อใช้การขยายส่วนแบ็คอัปที่ผ่านการตัดทอนผ่านเวลา (RNN / LSTM)
บอกว่าฉันใช้ RNN / LSTM เพื่อทำการวิเคราะห์ความเชื่อมั่นซึ่งเป็นวิธีการแบบตัวต่อตัว (ดูบล็อกนี้ ) เครือข่ายได้รับการฝึกฝนผ่านการ backpropagation ที่ถูกตัดทอนผ่านช่วงเวลา (BPTT) ซึ่งเครือข่ายไม่ได้ถูกควบคุมในขั้นตอนสุดท้ายเพียง 30 ขั้นตอนตามปกติ ในกรณีของฉันแต่ละส่วนข้อความของฉันที่ฉันต้องการจัดหมวดหมู่นั้นมีความยาวมากกว่า 30 ขั้นตอนที่ไม่ได้ถูกควบคุม (ประมาณ 100 คำ) จากความรู้ของฉัน BPTT ใช้เวลาเพียงครั้งเดียวสำหรับส่วนข้อความเดียวซึ่งก็คือเมื่อมันผ่านส่วนข้อความทั้งหมดและคำนวณเป้าหมายการจำแนกเลขฐานสองซึ่งเปรียบเทียบกับฟังก์ชันการสูญเสียเพื่อค้นหาข้อผิดพลาดyyy การไล่ระดับสีจะไม่ถูกคำนวณโดยคำนึงถึงคำแรกของแต่ละส่วนข้อความ RNN / LSTM จะยังสามารถปรับน้ำหนักเพื่อจับรูปแบบเฉพาะที่เกิดขึ้นภายในสองสามคำแรกเท่านั้นได้อย่างไร ตัวอย่างเช่นสมมติว่าประโยคทั้งหมดที่ทำเครื่องหมายว่าเริ่มต้นด้วย "ฉันรักสิ่งนี้" และประโยคทั้งหมดที่ทำเครื่องหมายว่าเริ่มต้นด้วย "ฉันเกลียดสิ่งนี้" RNN / LSTM จะจับได้อย่างไรว่าเมื่อมันถูกยกเลิกการลงทะเบียนสำหรับ 30 ขั้นตอนสุดท้ายเมื่อพบกับจุดสิ้นสุดของลำดับความยาว 100 ขั้นตอนpositivepositivepositivenegativenegativenegative

3
วิธีต่างๆในการสร้างช่วงความมั่นใจสำหรับอัตราต่อรองจากการถดถอยโลจิสติก
ฉันกำลังศึกษาวิธีสร้างช่วงความมั่นใจ 95% สำหรับอัตราส่วนอัตราต่อรองจากค่าสัมประสิทธิ์ที่ได้จากการถดถอยโลจิสติก ดังนั้นเมื่อพิจารณาถึงรูปแบบการถดถอยโลจิสติก log(p1−p)=α+βxlog⁡(p1−p)=α+βx \log\left(\frac{p}{1 - p}\right) = \alpha + \beta x \newcommand{\var}{\rm Var} \newcommand{\se}{\rm SE} เช่นนั้นx=0x=0x = 0สำหรับกลุ่มควบคุมและx=1x=1x = 1สำหรับกลุ่มเคส ฉันได้อ่านแล้วว่าวิธีที่ง่ายที่สุดคือการสร้าง 95% CI สำหรับββ\betaจากนั้นเราก็ใช้ฟังก์ชั่นเลขชี้กำลังนั่นคือ β^±1.96×SE(β^)→exp{β^±1.96×SE(β^)}β^±1.96×SE(β^)→exp⁡{β^±1.96×SE(β^)} \hat{\beta} \pm 1.96\times \se(\hat{\beta}) \rightarrow \exp\{\hat{\beta} \pm 1.96\times \se(\hat{\beta})\} คำถามของฉันคือ: อะไรคือเหตุผลทางทฤษฎีที่แสดงให้เห็นถึงขั้นตอนนี้? ฉันรู้ว่าodds ratio=exp{β}odds ratio=exp⁡{β}\mbox{odds ratio} = \exp\{\beta\}และตัวประมาณความน่าจะเป็นสูงสุดไม่เปลี่ยนแปลง อย่างไรก็ตามฉันไม่รู้จักการเชื่อมต่อระหว่างองค์ประกอบเหล่านี้ วิธีการเดลต้าควรสร้างช่วงความมั่นใจ 95% เช่นเดียวกับขั้นตอนก่อนหน้านี้หรือไม่ ใช้วิธีการเดลต้า exp{β^}∼˙N(β, …

5
เครื่องจักรอัตโนมัติเรียนรู้ที่จะฝันหรือไม่?
เมื่อฉันค้นพบการเรียนรู้ของเครื่องฉันเห็นเทคนิคที่น่าสนใจต่าง ๆ เช่น: โดยอัตโนมัติขั้นตอนวิธีการปรับแต่งด้วยเทคนิคเช่นgrid search, ได้รับผลลัพธ์ที่ถูกต้องมากขึ้นผ่านการรวมกันของขั้นตอนวิธีการที่แตกต่างกันของ "พิมพ์" เหมือนกันว่าboosting, ได้รับผลลัพธ์ที่ถูกต้องมากขึ้นผ่านการรวมกันของขั้นตอนวิธีการที่แตกต่างกัน ( แต่ไม่ใช่ชนิดเดียวกันของอัลกอริทึม) ว่าstacking, และอาจมีอีกมากที่ฉันยังต้องค้นพบ ... คำถามของฉันมีดังต่อไปนี้: มีชิ้นส่วนเหล่านั้นทั้งหมด แต่เป็นไปได้หรือไม่ที่จะรวมเข้าด้วยกันเพื่อสร้างอัลกอริทึมที่ใช้เป็นข้อมูลที่ได้รับการทำความสะอาดและผลลัพธ์ที่ดีโดยการนำเอาเทคนิคที่ดีที่สุดออกมา? (แน่นอนว่ามันอาจจะมีประสิทธิภาพน้อยกว่าที่นักวิทยาศาสตร์ด้านข้อมูลมืออาชีพ แต่เขาจะดีกว่าฉัน!) ถ้าใช่คุณมีรหัสตัวอย่างหรือคุณรู้กรอบที่สามารถทำได้หรือไม่? แก้ไข:หลังจากคำตอบบางอย่างดูเหมือนว่าจะต้องแคบลงบางส่วน ลองยกตัวอย่างเรามีหนึ่งคอลัมน์ที่มีข้อมูลหมวดหมู่ลองเรียกมันมาyและเราต้องการทำนายจากข้อมูลตัวเลขที่เป็นข้อมูลXหุ่นหรือข้อมูลตัวเลขจริง (ความสูงอุณหภูมิ) เราถือว่าการทำความสะอาดเสร็จสิ้นแล้ว มีอัลกอริทึมที่มีอยู่ที่สามารถใช้ข้อมูลดังกล่าวและเอาท์พุททำนาย? (โดยการทดสอบอัลกอริธึมหลายตัวการปรับจูนการเพิ่มประสิทธิภาพ ฯลฯ ) ถ้าใช่มันมีประสิทธิภาพในการคำนวณ (การคำนวณเสร็จในเวลาที่เหมาะสมถ้าเราเปรียบเทียบกับอัลกอริทึมปกติ) และคุณมีตัวอย่างของรหัสหรือไม่?

3
อัลกอริทึมใดที่ฉันสามารถใช้เพื่อค้นหาความสัมพันธ์ระหว่างเหตุการณ์
ฉันยังใหม่กับการเรียนรู้ของเครื่องดังนั้นฉันจึงพยายามค้นหาวรรณกรรมบางอย่าง แต่ฉันไม่แน่ใจด้วยซ้ำว่าจะให้ Google ทำอะไร ข้อมูลของฉันอยู่ในรูปแบบต่อไปนี้: User A performs Action P User B performs Action Q User C performs Action R ... User C performs Action X User A performs Action Y User B performs Action Z ... ที่การดำเนินการแต่ละรายการมีลักษณะบางอย่าง (วันที่เวลาลูกค้า ฯลฯ ) มีผู้ใช้ประมาณ 300 คนและเรามีการดำเนินการประมาณ 20,000 รายการ คำถาม : ฉันต้องการตรวจสอบว่ามีสาเหตุ / …

2
"ไม่มีทฤษฎีอาหารกลางวันฟรี" ใช้กับการทดสอบทางสถิติทั่วไปหรือไม่
ผู้หญิงที่ฉันทำงานขอให้ฉันทำ ANOVA แบบทางเดียวกับข้อมูลบางอย่าง ฉันตอบว่าข้อมูลนั้นเป็นข้อมูลการวัดซ้ำ (อนุกรมเวลา) และฉันคิดว่าการสันนิษฐานว่ามีการละเมิดความเป็นอิสระ เธอตอบว่าฉันไม่ควรกังวลเกี่ยวกับสมมติฐานเพียงทำแบบทดสอบและเธอจะคำนึงถึงว่าอาจไม่ตรงตามสมมติฐาน ดูเหมือนจะไม่ถูกต้องสำหรับฉัน ฉันค้นคว้ามาแล้วและพบว่าการโพสต์บล็อกที่ยอดเยี่ยมนี้โดย David Robinson การจัดกลุ่ม K- หมายถึงไม่ใช่อาหารกลางวันฟรี ฉันได้ดูเอกสารต้นฉบับและติดตามสิ่งต่างๆและคณิตศาสตร์ตรงไปตรงมาเล็กน้อย ส่วนสำคัญของมัน - ตามที่ David Robinson - ดูเหมือนว่าพลังของการทดสอบทางสถิติมาจากสมมติฐานของมัน และเขาให้สองตัวอย่างที่ยอดเยี่ยม เมื่อฉันอ่านบทความอื่น ๆ และโพสต์บล็อกเกี่ยวกับบทความนี้ดูเหมือนว่าจะมีการอ้างอิงเสมอในแง่ของการเรียนรู้แบบควบคุมหรือค้นหา ดังนั้นคำถามของฉันคือทฤษฎีบทนี้ใช้กับการทดสอบทางสถิติโดยทั่วไปหรือไม่? กล่าวอีกนัยหนึ่งเราสามารถพูดได้ว่าพลังของ t-test หรือ ANOVA นั้นมาจากการยึดมั่นในสมมติฐานและอ้างอิงทฤษฎีบทอาหารกลางวันฟรี ฉันเป็นหนี้เอกสารฉบับสุดท้ายของเจ้านายเกี่ยวกับงานที่ฉันทำและฉันอยากรู้ว่าฉันสามารถอ้างอิงทฤษฎีบท No Free Lunch ได้หรือไม่โดยระบุว่าคุณไม่สามารถเพิกเฉยต่อสมมติฐานของการทดสอบทางสถิติและบอกว่าคุณจะนำสิ่งนั้นไปใช้ บัญชีเมื่อประเมินผล

2
เหตุผลสำหรับการผันก่อน?
นอกจากการใช้งานแล้วยังมีเหตุผลอื่นใด (ทางคณิตศาสตร์, ปรัชญา, ฮิวริสติก, ฯลฯ ) สำหรับการใช้นักบวชคอนจูเกตหรือไม่? หรือมันเป็นเพียงแค่ว่าโดยปกติแล้วจะเป็นการประมาณที่ดีพอและทำให้สิ่งต่าง ๆ ง่ายขึ้นมาก?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.