สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
ครอบครัวเอ็กซ์โพเนนเชียล: พบกับสถิติที่เพียงพอที่คาดหวัง
คำถามของฉันเกิดขึ้นจากการอ่านการอ่านของ Minka "การประมาณการแจกแจงดีริชเลต์"ซึ่งระบุสิ่งต่อไปนี้โดยไม่มีข้อพิสูจน์ในบริบทของการหาตัวประมาณความน่าจะเป็นสูงสุดสำหรับการแจกแจงไดริชเล็ตจากการสังเกตเวกเตอร์สุ่ม เช่นเดียวกับตระกูลเอ็กซ์โพเนนเชียลเมื่อการไล่ระดับสีเป็นศูนย์สถิติเพียงพอที่คาดหวังจะเท่ากับสถิติที่เพียงพอที่สังเกตได้ ฉันไม่เห็นการประเมินความเป็นไปได้สูงสุดในตระกูลเอ็กซ์โปเนนเชียลที่นำเสนอด้วยวิธีนี้และฉันไม่พบคำอธิบายที่เหมาะสมในการค้นหาของฉัน ใครบางคนสามารถให้ข้อมูลเชิงลึกเกี่ยวกับความสัมพันธ์ระหว่างสถิติที่สังเกตและคาดว่าเพียงพอและอาจช่วยให้เข้าใจการประมาณค่าความน่าจะเป็นสูงสุดในการลดความแตกต่างได้

3
ทำไมคนชอบข้อมูลที่ราบรื่น
ฉันต้องใช้เคอร์เนล Squared Exponential (SE) สำหรับ Gaussian Process Regression ข้อดีของเคอร์เนลนี้คือ: 1) ง่าย ๆ : มีเพียง 3 พารามิเตอร์เท่านั้น 2) ราบรื่น: เคอร์เนลนี้คือเกาส์เซียน ทำไมคนถึงชอบ 'ความเรียบ' มาก ๆ ? ฉันรู้ว่าเคอร์เนลเกาส์เซียนมีความแตกต่างกันอย่างมากมาย แต่นั่นสำคัญมากเหรอ? (โปรดแจ้งให้เราทราบหากมีเหตุผลอื่นว่าทำไมเคอร์เนล SE จึงได้รับความนิยม) PS: ฉันบอกว่าสัญญาณส่วนใหญ่ในโลกแห่งความเป็นจริง (ไม่มีเสียงรบกวน) ราบรื่นดังนั้นจึงมีเหตุผลที่จะใช้เมล็ดเรียบเพื่อสร้างแบบจำลอง ใครช่วยกรุณาเข้าใจแนวคิดนี้ได้บ้าง

4
ชุดย่อยที่มีความสัมพันธ์กันน้อยที่สุดของตัวแปรสุ่มจากเมทริกซ์สหสัมพันธ์
ฉันมีความสัมพันธ์เมทริกซ์ซึ่งผมได้ใช้ค่าสัมประสิทธิ์สหสัมพันธ์ของเพียร์สันเชิงเส้นผ่านของ Matlab corrcoef () เมทริกซ์สหสัมพันธ์ของมิติ 100x100 นั่นคือฉันคำนวณเมทริกซ์สหสัมพันธ์กับตัวแปรสุ่ม 100 ตัวAAA กลุ่มคนเหล่านี้ตัวแปรสุ่ม 100 ผมอยากที่จะหา 10 ตัวแปรสุ่มที่มีความสัมพันธ์เมทริกซ์มีว่า "ความสัมพันธ์น้อย" เป็นไปได้ (ดูปริมาณเท่าใด "ความสัมพันธ์มากขึ้น" เมทริกซ์สหสัมพันธ์ประกอบด้วยเมื่อเทียบกับความสัมพันธ์เมทริกซ์ Bเกี่ยวกับตัวชี้วัดเพื่อวัด ความสัมพันธ์โดยรวมในเมทริกซ์ความสัมพันธ์) ฉันสนใจเฉพาะความสัมพันธ์แบบคู่เท่านั้น มีวิธีการที่ดีในการค้นหาตัวแปรสุ่ม 10 ตัวในระยะเวลาที่เหมาะสมหรือไม่ (เช่นฉันไม่ต้องการลองชุดค่าผสม)? อัลกอริทึมการประมาณก็โอเค(10010)(10010)\binom{100}{10}

3
ความสำคัญของหมวกเมทริกซ์คืออะไรในการถดถอยเชิงเส้น?
ความสำคัญของเมทริกซ์ของหมวกคืออะไรในการวิเคราะห์การถดถอยH=X(X′X)−1X′H=X(X′X)−1X′H=X(X^{\prime}X )^{-1}X^{\prime} มันเป็นเพียงการคำนวณง่ายขึ้น?

5
การใช้ deciles เพื่อหาความสัมพันธ์เป็นแนวทางที่ถูกต้องทางสถิติหรือไม่?
ฉันมีตัวอย่างของจุดข้อมูล 1,449 จุดที่ไม่สัมพันธ์กัน (r-squared 0.006) เมื่อวิเคราะห์ข้อมูลฉันค้นพบว่าการแบ่งค่าตัวแปรอิสระออกเป็นกลุ่มเชิงบวกและเชิงลบดูเหมือนว่าจะมีความแตกต่างอย่างมีนัยสำคัญในค่าเฉลี่ยของตัวแปรตามสำหรับแต่ละกลุ่ม การแบ่งคะแนนออกเป็น 10 ถังขยะ (deciles) โดยใช้ค่าตัวแปรอิสระดูเหมือนว่าจะมีความสัมพันธ์กันมากขึ้นระหว่างหมายเลข decile และค่าตัวแปรขึ้นอยู่กับค่าเฉลี่ย (r-squared 0.27) ฉันไม่รู้เกี่ยวกับสถิติมากนักดังนั้นนี่เป็นคำถามสองสามข้อ: นี่เป็นวิธีทางสถิติที่ถูกต้องหรือไม่? มีวิธีการหาจำนวนที่ดีที่สุดของถังขยะหรือไม่? คำที่เหมาะสมสำหรับแนวทางนี้คืออะไรฉันจึงสามารถใช้ Google ได้ มีแหล่งข้อมูลเบื้องต้นอะไรบ้างที่จะเรียนรู้เกี่ยวกับวิธีการนี้ มีวิธีอื่นใดอีกบ้างที่ฉันสามารถใช้เพื่อค้นหาความสัมพันธ์ในข้อมูลนี้ นี่คือข้อมูลช่วงชั้นสำหรับการอ้างอิง: https://gist.github.com/georgeu2000/81a907dc5e3b7952bc90 แก้ไข: นี่คือภาพของข้อมูล: โมเมนตัมของอุตสาหกรรมเป็นตัวแปรอิสระคุณภาพของจุดเข้าใช้งานขึ้นอยู่กับ

2
การถดถอยโลจิสติกและตัวแปรอิสระอันดับ
ฉันได้พบโพสต์นี้: ใช่. สัมประสิทธิ์สะท้อนการเปลี่ยนแปลงของอัตราต่อรองสำหรับการเพิ่มขึ้นของการเปลี่ยนแปลงในตัวทำนายลำดับ ข้อมูลจำเพาะรุ่น (ทั่วไปมาก) นี้จะถือว่าผู้ทำนายมีผลกระทบเชิงเส้นในส่วนที่เพิ่มขึ้น ในการทดสอบสมมติฐานคุณสามารถเปรียบเทียบแบบจำลองที่คุณใช้ตัวแปรลำดับเป็นตัวทำนายเดียวกับแบบที่คุณไม่เห็นการตอบสนองและปฏิบัติต่อพวกมันเป็นตัวทำนายหลาย ๆ ตัว หากโมเดลหลังไม่ส่งผลให้มีขนาดพอดีดีขึ้นอย่างมีนัยสำคัญจากนั้นดำเนินการเพิ่มขึ้นแต่ละครั้งเนื่องจากการมีเอฟเฟกต์แบบเชิงเส้นนั้นสมเหตุสมผล - @ dmk38 12 ธ.ค. 53 ที่ 5:21 คุณช่วยบอกฉันได้ไหมว่าจะหาสิ่งที่เผยแพร่ที่สนับสนุนการอ้างสิทธิ์นี้ได้ที่ไหน ฉันทำงานกับข้อมูลและฉันต้องการใช้ตัวแปรอิสระตามลำดับในการถดถอยโลจิสติก

1
เหตุใดจึงไม่สามารถสรุปการทดสอบ Kolmogorov-Smirnov เป็น 2 มิติหรือมากกว่าได้
คำถามบอกว่ามันทั้งหมด ฉันได้อ่านทั้งสองอย่างที่ไม่สามารถสรุป KS ให้มีขนาดเท่ากันหรือใหญ่กว่าสองเท่าได้และการใช้งานที่มีชื่อเสียงเช่นนั้นในNumerical Recipesนั้นผิดปกติ คุณช่วยอธิบายได้ว่าทำไมถึงเป็นเช่นนั้น?

1
จะเปรียบเทียบความแข็งแรงของเพียร์สันที่สัมพันธ์กันได้อย่างไร
ฉันถูกผู้ตรวจสอบถามว่าเพียร์สันมีความสัมพันธ์ (r-values) ที่นำเสนอในตารางสามารถนำมาเปรียบเทียบกันได้หรือไม่ดังนั้นเราจึงสามารถอ้างได้ว่าเป็น "แข็งแกร่ง" กว่าอีกอันหนึ่ง (นอกเหนือจากการดูค่า r จริง) . คุณจะไปเกี่ยวกับเรื่องนี้อย่างไร ฉันพบวิธีนี้แล้ว http://vassarstats.net/rdiff.html แต่ไม่แน่ใจว่าสิ่งนี้มีผลบังคับใช้หรือไม่

1
การแจกแจงความน่าจะเป็นของฟังก์ชันของตัวแปรสุ่ม
ฉันมีข้อสงสัย: พิจารณาตัวแปรสุ่มที่มีค่าจริง XXX และ ZZZ ทั้งสองถูกกำหนดบนพื้นที่ความน่าจะเป็น (Ω,F,P)(Ω,F,P)(\Omega, \mathcal{F},\mathbb{P}). ปล่อย Y:=g(X,Z)Y=ก.(X,Z)Y:= g(X,Z)ที่ไหน g(⋅)ก.(⋅)g(\cdot)เป็นฟังก์ชั่นมูลค่าที่แท้จริง ตั้งแต่YYY เป็นฟังก์ชั่นของตัวแปรสุ่มมันเป็นตัวแปรสุ่ม ปล่อย x:=X(ω)x=X(ω)x:=X(\omega) เช่นการก่อให้เกิด XXX. คือ P(Y|X=x)=P(g(X,Z)|X=x)P(Y|X=x)=P(ก.(X,Z)|X=x)\mathbb{P}(Y|X=x)=\mathbb{P}(g(X,Z)|X=x) เท่ากับ P(g(x,Z))P(ก.(x,Z))\mathbb{P}(g(x,Z))?

2
การประมาณขนาดของการตัดกันของหลาย ๆ ชุดโดยใช้ตัวอย่างหนึ่งชุด
ฉันกำลังทำงานกับอัลกอริทึมที่ต้องการคำนวณขนาดของชุดที่สร้างโดยจุดตัดของชุดอย่างน้อย 2 ชุด โดยเฉพาะอย่างยิ่ง: Z= |A0∩ … ∩An|z=|A0∩…∩An| z = \left |A_0 \cap \ldots \cap A_n \right | ชุดที่ถูก intersected สร้างขึ้นโดยแบบสอบถาม SQL และในความพยายามที่จะทำให้สิ่งต่าง ๆ รวดเร็วฉันได้รับการนับของแต่ละแบบสอบถามก่อนเวลาแล้วนำชุดที่มีจำนวนต่ำสุด ( ) และใช้ ID เหล่านั้นเป็นขอบเขตบน ข้อความค้นหาขนาดใหญ่ที่เหลือดังนั้นการแยกจึงมีประสิทธิภาพ:A0A0A_0 Z= | (A0∩A1) ∩ … ∩ (A0∩An) |z=|(A0∩A1)∩…∩(A0∩An)| z = \left |\left ( A_0 \cap A_1 \right ) \cap …
10 error  sample 

2
ทำไมอัลกอริทึมการวนซ้ำของนโยบายจึงรวมเข้ากับนโยบายและฟังก์ชันค่าที่เหมาะสมที่สุด
ผมอ่านแอนดรูอึ้งของเอกสารประกอบการบรรยายเกี่ยวกับการเรียนรู้การเสริมแรงและผมพยายามที่จะเข้าใจว่าทำไมย้ำนโยบายการแปรสภาพการทำงานที่ค่าที่ดีที่สุดและนโยบายที่เหมาะสม *V∗V∗V^*π∗π∗\pi^* การทำซ้ำนโยบายการเรียกคืนคือ: Initialize π randomlyRepeat{Let V:=Vπ \for the current policy, solve bellman's eqn's and set that to the current VLet π(s):=argmaxa∈A∑s′Psa(s′)V(s′)}Initialize π randomlyRepeat{Let V:=Vπ \for the current policy, solve bellman's eqn's and set that to the current VLet π(s):=argmaxa∈A∑s′Psa(s′)V(s′)} \text{Initialize $\pi$ randomly} \\ \text{Repeat}\{\\ \quad Let \ V := …

1
จะตีความค่า P-GAM ได้อย่างไร?
ฉันชื่อฮิวจ์และฉันเป็นนักศึกษาปริญญาเอกโดยใช้แบบจำลองสารเติมแต่งทั่วไปเพื่อทำการวิเคราะห์เชิงสำรวจ ฉันไม่แน่ใจว่าจะตีความค่า p ที่มาจากแพ็คเกจ MGCV และต้องการตรวจสอบความเข้าใจของฉันได้อย่างไร (ฉันใช้รุ่น 1.7-29 และได้อ่านเอกสารของ Simon Wood แล้ว) ฉันค้นหาคำถาม CV อื่น ๆ ก่อน แต่คำถามที่เกี่ยวข้องที่สุดดูเหมือนจะเกี่ยวกับการถดถอยทั่วไปไม่ใช่ค่า p-GAM โดยเฉพาะ ฉันรู้ว่ามีอาร์กิวเมนต์ที่แตกต่างมากมายกับ GAM และค่า p เป็นค่าโดยประมาณเท่านั้น แต่ฉันเพิ่งเริ่มต้นง่ายๆเพื่อดูว่ามี "สัญญาณ" ใด ๆ สำหรับเพื่อนร่วมทุนของฉัน เช่น: Y ~ s (a, k = 3) + s (b, k = 3) + s (c, k = 3) …
10 p-value  mgcv 

2
ค่า P สำหรับเงื่อนไขการโต้ตอบในโมเดลเอฟเฟกต์แบบผสมโดยใช้ lme4
ผมวิเคราะห์ข้อมูลพฤติกรรมบางอย่างที่ใช้lme4ในRส่วนใหญ่ต่อไปนี้บทเรียนที่ดีเยี่ยมในโบเดอฤดูหนาวแต่ผมไม่เข้าใจว่าถ้าฉันจัดการการโต้ตอบอย่างถูกต้อง ที่แย่ไปกว่านั้นไม่มีใครที่เกี่ยวข้องในการวิจัยนี้ใช้แบบจำลองต่าง ๆ ดังนั้นฉันจึงไม่ค่อยมั่นใจเมื่อต้องแน่ใจว่าสิ่งต่าง ๆ ถูกต้อง แทนที่จะส่งเสียงร้องเพื่อขอความช่วยเหลือฉันคิดว่าฉันควรใช้ความพยายามอย่างเต็มที่เพื่อตีความปัญหาแล้วขอการแก้ไขโดยรวมของคุณ อีกสองสามคนคือผู้ช่วยคนอื่น ๆ : ในขณะที่เขียนผมพบคำถามนี้แสดงให้เห็นว่าnlmeขึ้นโดยตรงให้ค่า P สำหรับคำปฏิสัมพันธ์ lme4แต่ฉันคิดว่ามันยังคงถูกต้องที่จะขอให้มีความสัมพันธ์กับ Livius'คำตอบสำหรับคำถามนี้ให้ลิงก์ไปยังการอ่านเพิ่มเติมจำนวนมากซึ่งฉันจะพยายามผ่านในอีกไม่กี่วันข้างหน้าดังนั้นฉันจะแสดงความคิดเห็นกับความคืบหน้าใด ๆ ที่เกิดขึ้น ในข้อมูลของฉันฉันมีตัวแปรขึ้นอยู่กับdvการconditionจัดการ (0 = ควบคุม 1 = สภาพการทดลองซึ่งจะส่งผลให้สูงขึ้นdv) และยังจำเป็นป้ายappropriate: ทดลองรหัส1สำหรับการนี้ควรจะแสดงผล แต่การทดลองรหัส0ยุทธ ไม่ใช่เพราะปัจจัยสำคัญขาดหายไป ฉันยังได้รวมการสกัดแบบสุ่มสองรายการสำหรับsubjectและเพื่อtargetสะท้อนถึงdvค่าที่สัมพันธ์กันในแต่ละวิชาและภายใน 14 ปัญหาที่แก้ไข (ผู้เข้าร่วมแต่ละคนแก้ไขทั้งตัวควบคุมและเวอร์ชันทดลองของปัญหาแต่ละข้อ) library(lme4) data = read.csv("data.csv") null_model = lmer(dv ~ (1 | subject) + (1 | target), data = data) …

1
วิธีการคำนวณช่วงความมั่นใจ 95% สำหรับสมการที่ไม่ใช่เชิงเส้น?
ฉันมีสมการในการทำนายน้ำหนักของ manatees จากอายุของพวกเขาในวัน (dias ในโปรตุเกส): R <- function(a, b, c, dias) c + a*(1 - exp(-b*dias)) ฉันสร้างแบบจำลองมันใน R โดยใช้ nls () และได้กราฟิกนี้: ตอนนี้ฉันต้องการคำนวณช่วงความมั่นใจ 95% และพล็อตมันในกราฟิก ฉันใช้ขีด จำกัด ล่างและสูงกว่าสำหรับแต่ละตัวแปร a, b และ c ดังนี้: lower a = a - 1.96*(standard error of a) higher a = a + 1.96*(standard error of …

3
วิธีการที่ไม่อิงพารามิเตอร์ต่างกันสำหรับการประเมินการแจกแจงความน่าจะเป็นของข้อมูล
ฉันมีข้อมูลบางส่วนและพยายามที่จะทำให้เส้นโค้งเรียบพอดี อย่างไรก็ตามฉันไม่ต้องการบังคับใช้ความเชื่อก่อนหน้านี้มากเกินไปหรือมีแนวคิดรวบยอดที่แข็งแกร่งเกินไป (ยกเว้นสิ่งที่อยู่ในคำถามที่เหลือของฉัน) หรือสิ่งใด ๆ ที่เฉพาะเจาะจง ฉันแค่ต้องการให้มันพอดีกับเส้นโค้งที่เรียบ (หรือมีการกระจายความน่าจะเป็นที่ดีซึ่งมันอาจมาจาก) วิธีเดียวที่ฉันรู้ในการทำเช่นนี้คือการประมาณความหนาแน่นของเคอร์เนล (KDE) ฉันสงสัยว่าถ้าคนรู้วิธีการอื่นในการประเมินสิ่งนั้น ฉันแค่ต้องการรายชื่อของพวกเขาและจากนั้นฉันสามารถทำวิจัยของตัวเองเพื่อค้นหาสิ่งที่ฉันต้องการใช้ ให้การเชื่อมโยงหรือการอ้างอิงที่ดี (หรือสัญชาตญาณที่ดี) ยินดีต้อนรับเสมอ (และได้รับการสนับสนุน)!

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.