สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
G-test เทียบกับการทดสอบ Chi-squared ของ Pearson
ฉันกำลังทดสอบความเป็นอิสระในตารางฉุกเฉินฉันไม่รู้ว่าการทดสอบ G-testหรือการทดสอบไคสแควร์ของ Pearson นั้นดีกว่าหรือไม่ ขนาดตัวอย่างเป็นร้อย แต่มีจำนวนเซลล์ต่ำนับ ตามที่ระบุไว้ในหน้า Wikipediaการประมาณค่าการกระจายไคสแควร์นั้นดีกว่าสำหรับการทดสอบ G-test กว่าสำหรับการทดสอบไคสแควร์ของ Pearson แต่ฉันใช้การจำลอง Monte Carlo เพื่อคำนวณค่า p ดังนั้นจึงมีความแตกต่างระหว่างการทดสอบทั้งสองนี้หรือไม่?ยังไม่มีข้อความ× Mยังไม่มีข้อความ×MN \times M

1
คาดว่ามูลค่าเป็นฟังก์ชั่นของ quantiles หรือไม่?
ฉันสงสัยว่ามีสูตรทั่วไปที่เกี่ยวข้องกับค่าที่คาดหวังของตัวแปรสุ่มต่อเนื่องเป็นฟังก์ชันของ quantiles ของ rv เดียวกันค่าที่คาดหวังของ rvถูกกำหนดเป็น: และ quantiles จะถูกกำหนดเป็น: สำหรับ(0,1)XXX E(X)=∫xdFX(x)E(X)=∫xdFX(x)E(X) = \int x dF_X(x) QpX={x:FX(x)=p}=F−1X(p)QXp={x:FX(x)=p}=FX−1(p)Q^p_X = \{x : F_X(x) = p \} =F_X^{-1}(p) p∈(0,1)p∈(0,1)p\in(0,1) มีอินสแตนซ์ของฟังก์ชันฟังก์ชันเช่นนั้นหรือไม่: GGGE(X)=∫p∈(0,1)G(QpX)dpE(X)=∫p∈(0,1)G(QXp)dpE(X) = \int_{p\in(0,1)} G(Q^p_X) dp

4
ให้ n ของ r.v ที่กระจายอย่างสม่ำเสมอ PDF สำหรับ 1 rv หารด้วยผลรวมของ n r.v ทั้งหมดคืออะไร?
ฉันสนใจกรณีประเภทต่อไปนี้: มีตัวแปรสุ่มแบบต่อเนื่อง 'n' ซึ่งจะต้องรวมเป็น 1 แล้ว PDF จะเป็นอย่างไรสำหรับตัวแปรตัวใดตัวหนึ่ง ดังนั้นถ้าn=3n=3n=3ดังนั้นฉันสนใจในการแจกแจงสำหรับX1X1+X2+X3X1X1+X2+X3\frac{X_1}{X_1+X_2+X_3}โดยที่X1,X2X1,X2X_1, X_2และX3X3 X_3 มีการกระจายอย่างสม่ำเสมอ ค่าเฉลี่ยของหลักสูตรในตัวอย่างนี้คือ1/31/31/3เป็นค่าเฉลี่ยเป็นเพียง1/n1/n1/nและแม้ว่ามันจะเป็นเรื่องง่ายที่จะกระจายจำลองใน R ผมไม่ทราบว่าสิ่งที่เกิดขึ้นจริงสมสำหรับ PDF หรือ CDF คือ สถานการณ์นี้เกี่ยวข้องกับการแจกแจงของ Irwin-Hall ( https://en.wikipedia.org/wiki/Irwin%E2%80%93Hall_distribution ) มีเพียงเออร์วิน - ฮอลล์คือการกระจายตัวของผลรวมของตัวแปรสุ่ม n ชุดในขณะที่ฉันต้องการการกระจายของหนึ่งใน rv ที่เหมือนกันหารด้วยผลรวมของตัวแปร n ทั้งหมด ขอบคุณ
10 uniform 

3
เหตุใดจึงควรทำการเปลี่ยนแปลง WOE ของตัวพยากรณ์เชิงหมวดหมู่ในการถดถอยโลจิสติก
การเปลี่ยนแปลงน้ำหนักของหลักฐาน (WOE) ของตัวแปรเด็ดขาดมีประโยชน์เมื่อใด ตัวอย่างสามารถเห็นได้ในการแปลง WOE (ดังนั้นสำหรับการตอบสนอง , & ตัวทำนายหมวดหมู่ที่มีหมวดหมู่ , & ประสบความสำเร็จจากการทดลองภายในหมวดหมู่ที่ของตัวทำนายนี้, WOE สำหรับหมวดหมู่ที่ถูกกำหนดให้เป็นk y j n j j jyyykkkyjyjy_jnjnjn_jjjjjjj เข้าสู่ระบบYJΣkJYJΣkJ( nJ- yJ)nJ- yJlog⁡yj∑jkyj∑jk(nj−yj)nj−yj\log \frac{y_j} {\sum_j^k {y_j}} \frac{\sum_j^k (n_j-y_j)}{n_j-y_j} & การเปลี่ยนแปลงประกอบด้วยการเข้ารหัสแต่ละหมวดหมู่ของตัวทำนายหมวดหมู่ด้วย WOE เพื่อสร้างตัวทำนายแบบต่อเนื่องใหม่) ฉันต้องการเรียนรู้สาเหตุที่การแปลง WOE ช่วยการถดถอยโลจิสติกส์ ทฤษฎีที่อยู่เบื้องหลังสิ่งนี้คืออะไร?

1
PCA ขนาดใหญ่เป็นไปได้หรือไม่
การวิเคราะห์องค์ประกอบหลัก (PCA) แบบคลาสสิกคือการทำบนเมทริกซ์ข้อมูลอินพุตซึ่งคอลัมน์มีค่าเฉลี่ยเป็นศูนย์ (จากนั้น PCA สามารถ "เพิ่มความแปรปรวนสูงสุด") สามารถทำได้อย่างง่ายดายโดยการจัดคอลัมน์ให้อยู่ตรงกลาง Howenver เมื่อเมทริกซ์การป้อนข้อมูลเบาบางเมทริกซ์กึ่งกลางตอนนี้จะเบาบางอีกต่อไปและ - ถ้าเมทริกซ์มีขนาดใหญ่มาก - ดังนั้นจะไม่พอดีกับหน่วยความจำอีกต่อไป มีวิธีแก้ปัญหาอัลกอริทึมสำหรับปัญหาการจัดเก็บหรือไม่?

1
การสร้างแบบจำลองด้วยป่าสุ่มต้องมีการตรวจสอบข้ามหรือไม่?
เท่าที่ฉันเคยเห็นความคิดเห็นมีแนวโน้มที่จะแตกต่างกันเกี่ยวกับเรื่องนี้ แนวปฏิบัติที่ดีที่สุดจะใช้การตรวจสอบข้าม (โดยเฉพาะอย่างยิ่งหากเปรียบเทียบ RF กับอัลกอริธึมอื่น ๆ ในชุดข้อมูลเดียวกัน) แหล่งที่มาดั้งเดิมระบุว่ามีการคำนวณข้อผิดพลาด OOB ข้อเท็จจริงระหว่างการฝึกอบรมแบบจำลองเพียงพอที่จะเป็นตัวบ่งชี้ประสิทธิภาพของชุดทดสอบ แม้แต่ Trevor Hastie ในการพูดคุยเมื่อไม่นานมานี้กล่าวว่า "Random Forest ให้การตรวจสอบข้ามฟรี" โดยสัญชาตญาณสิ่งนี้สมเหตุสมผลสำหรับฉันหากการฝึกอบรมและพยายามปรับปรุงโมเดล RF-based บนหนึ่งชุดข้อมูล ความคิดเห็นของคุณเกี่ยวกับเรื่องนี้คืออะไร?

2
เราจะพูดอะไรเกี่ยวกับแบบจำลองของข้อมูลเชิงสังเกตในกรณีที่ไม่มีเครื่องมือ?
ฉันเคยถามคำถามเกี่ยวกับเอกสารที่ตีพิมพ์มาแล้วในหลายพื้นที่ที่ใช้การถดถอย (และแบบจำลองที่เกี่ยวข้องเช่นแบบจำลองแบบพาเนลหรือ GLMs) ในข้อมูลเชิงสังเกต (เช่นข้อมูลที่ไม่ได้ผลิตโดยการทดลองที่ควบคุม ในหลายกรณี - แต่ไม่เสมอไป - ข้อมูลถูกตรวจพบตลอดเวลา) แต่เมื่อไม่มีความพยายามในการแนะนำตัวแปรเครื่องมือ ฉันได้ทำการวิพากษ์วิจารณ์จำนวนมากในการตอบสนอง (เช่นการอธิบายปัญหาเกี่ยวกับอคติเมื่อตัวแปรสำคัญอาจหายไป) แต่เนื่องจากคนอื่น ๆ ที่นี่จะไม่สงสัยเลยว่ามีความรู้มากกว่าฉันในหัวข้อนี้ฉันคิดว่าฉันถาม: อะไรคือประเด็นสำคัญ / ผลที่ตามมาของการพยายามหาข้อสรุปเกี่ยวกับความสัมพันธ์ (โดยเฉพาะ แต่ไม่ จำกัด เฉพาะการสรุปเชิงสาเหตุ) ในสถานการณ์เช่นนี้? มีประโยชน์อะไรกับการศึกษาที่เหมาะกับแบบจำลองดังกล่าวในกรณีที่ไม่มีเครื่องมือหรือไม่? มีการอ้างอิงที่ดีอะไรบ้าง (หนังสือหรือเอกสาร) เกี่ยวกับปัญหาของการสร้างแบบจำลอง (โดยเฉพาะอย่างยิ่งที่มีแรงจูงใจทางด้านเทคนิคที่ไม่ชัดเจนของผลที่ตามมาเนื่องจากโดยทั่วไปแล้วคนที่ถามมีภูมิหลังที่หลากหลาย กระดาษ? การอภิปรายเกี่ยวกับข้อควรระวัง / ปัญหาเกี่ยวกับเครื่องมือจะเป็นประโยชน์เช่นกัน (การอ้างอิงพื้นฐานเกี่ยวกับตัวแปรเครื่องมืออยู่ที่นี่แม้ว่าคุณจะต้องเพิ่มสิ่งใดสิ่งหนึ่งก็จะเป็นประโยชน์เช่นกัน) ตัวชี้ไปยังตัวอย่างที่ใช้งานได้ดีของการค้นหาและการใช้เครื่องมือจะเป็นโบนัส แต่ไม่ใช่ประเด็นสำคัญสำหรับคำถามนี้ [ฉันจะชี้คนอื่นให้คำตอบที่ดีที่นี่เช่นคำถามมาหาฉัน ฉันอาจเพิ่มตัวอย่างหนึ่งหรือสองตัวอย่างเมื่อได้รับ]

1
ค้นหา MVUE ที่ไม่เหมือนใคร
คำถามนี้มาจากปัญหาเบื้องต้นทางคณิตศาสตร์รุ่นที่ 6 ของ Robert Hogg 7.4.9 ที่หน้า 388 Let X1,...,XnX1,...,XnX_1,...,X_nจะ IID กับไฟล์ PDF f(x;θ)=1/3θ,−θ<x<2θ,f(x;θ)=1/3θ,−θ<x<2θ,f(x;\theta)=1/3\theta,-\theta0 0 (ก) การค้นหา MLE θของθθ^θ^\hat{\theta}θθ\theta (ข) คือθสถิติเพียงพอสำหรับθ ? ทำไมθ^θ^\hat{\theta}θθ\theta (ค) คือ(n+1)θ^/n(n+1)θ^/n(n+1)\hat{\theta}/n MVUE เอกลักษณ์ของθθ\theta ? ทำไม ฉันคิดว่าฉันสามารถแก้ไข (a) และ (b) ได้ แต่ฉันสับสนโดย (c) สำหรับ): Let Y1<Y2<...YnY1<Y2<...YnY_10, เราจะเห็นอนุพันธ์นี้เป็นลบ, ดังนั้นฟังก์ชันความน่าจะเป็นจึงลดลงL(θ;x)L(θ;x)L(\theta;x) จากและปีn < 2 θ ) , ⇒ ( θ …

4
แผนภาพนี้เรียกว่าอะไร
ใครสามารถบอกฉันว่าชื่อของแผนภาพประเภทนี้ (ถ้ามี) คืออะไร? ทุกคนสามารถแนะนำเครื่องมือใด ๆ แต่ง่าย ๆ ในการพล็อตแผนภาพดังกล่าวได้หรือไม่?

1
เหตุใดการพยากรณ์โมเดล ARMA จึงดำเนินการโดยตัวกรองคาลมาน
อะไรคือข้อดีของการแสดงแบบจำลอง ARMA เป็นแบบจำลองพื้นที่รัฐและการพยากรณ์โดยใช้ตัวกรองคาลมาน วิธีการนี้เป็นตัวอย่างที่ใช้ในการใช้งาน SARIMAX ของ python-statsmodels: https://github.com/statsmodels/statsmodels/tree/master/statsmodels/tsa/statespace

1
การจัดการความสัมพันธ์อัตโนมัติสูงใน MCMC
ฉันกำลังสร้างแบบจำลองเบย์แบบลำดับชั้นที่ค่อนข้างซับซ้อนสำหรับการวิเคราะห์เมตาโดยใช้ R และ JAGS ลดความซับซ้อนของบิตสองระดับที่สำคัญของแบบจำลองมี โดยที่เป็นข้อสังเกตที่จุดสิ้นสุด (ในกรณีนี้จีเอ็มเทียบกับการปลูกพืชที่ไม่ใช่จีเอ็ม) ในการศึกษา ,เป็นผลสำหรับการศึกษา , s เป็นผลกระทบของตัวแปรระดับการศึกษาต่างๆ (สถานะการพัฒนาทางเศรษฐกิจของประเทศที่ ทำการศึกษาชนิดพันธุ์พืชวิธีการศึกษา ฯลฯ ) จัดทำดัชนีโดยกลุ่มฟังก์ชันและyij=αj+ϵiyij=αj+ϵi y_{ij} = \alpha_j + \epsilon_i αj=∑hγh(j)+ϵjαj=∑hγh(j)+ϵj\alpha_j = \sum_h \gamma_{h(j)} + \epsilon_jyijyijy_{ij}iiijjjαjαj\alpha_jjjjγγ\gammahhhϵϵ\epsilons เป็นเงื่อนไขข้อผิดพลาด โปรดทราบว่า s ไม่ใช่สัมประสิทธิ์ของตัวแปรจำลอง แต่มีตัวแปรแตกต่างกันสำหรับค่าระดับการศึกษาที่แตกต่างกัน ตัวอย่างเช่นมีสำหรับประเทศกำลังพัฒนาและสำหรับประเทศที่พัฒนาแล้ว γγ\gammaγγ\gammaγdevelopingγdeveloping\gamma_{developing}γdevelopedγdeveloped\gamma_{developed} ฉันสนใจที่จะประเมินค่าของ s เป็นหลัก ซึ่งหมายความว่าการทิ้งตัวแปรระดับการศึกษาจากตัวแบบไม่ใช่ตัวเลือกที่ดี γγ\gamma มีความสัมพันธ์สูงระหว่างตัวแปรระดับการศึกษาหลายอย่างและฉันคิดว่าสิ่งนี้กำลังสร้างความสัมพันธ์อัตโนมัติขนาดใหญ่ในเครือข่าย MCMC ของฉัน พล็อตการวินิจฉัยนี้แสดงให้เห็นถึงวิถีลูกโซ่ (ซ้าย) และผลสัมพันธ์อัตโนมัติ (ขวา): จากผลของความสัมพันธ์อัตโนมัติฉันได้ขนาดตัวอย่างที่มีประสิทธิภาพ 60-120 จาก …

1
ทำความเข้าใจเกี่ยวกับการใช้ลอการิทึมในลอการิทึม TF-IDF
ฉันกำลังอ่าน: https://en.wikipedia.org/wiki/Tf%E2%80%93idf#Definition แต่ฉันไม่สามารถเข้าใจได้อย่างชัดเจนว่าทำไมสูตรจึงสร้างในแบบที่มันเป็น ฉันเข้าใจอะไร: iDF ควรที่จะวัดระดับความบ่อยครั้งที่คำ S ปรากฏในเอกสารแต่ละฉบับลดลงตามมูลค่าเมื่อคำนั้นปรากฏบ่อยขึ้น จากมุมมองนั้น ฉันD F.( S) = # ของเอกสาร# ของเอกสารที่มี SผมDF(S)=# ของเอกสาร# ของเอกสารที่มี S iDF(S) = \frac{\# \text{ of Documents}}{\# \text{ of Documents containing S}} นอกจากนี้ความถี่เทอมสามารถอธิบายได้อย่างถูกต้องว่า t f( S, D ) = # ของเหตุการณ์ S ในเอกสาร D # จำนวนการเกิดขึ้นสูงสุดสำหรับสตริง Q ใด ๆ ในเอกสาร D …

1
ทำไมระบบการให้คะแนน Elo ใช้กฎการอัปเดตที่ไม่ถูกต้อง
ระบบการจัดระดับ Elo ใช้อัลกอริธึมการลดความลาดชันแบบลาดชันของฟังก์ชั่นการสูญเสียข้ามเอนโทรปีระหว่างความน่าจะเป็นที่คาดหวังและที่สังเกตได้ของผลลัพธ์ในการเปรียบเทียบแบบคู่ เราสามารถเขียนฟังก์ชั่นการสูญเสียทั่วไปเป็น E= - ∑n , ฉันพีผมL o กรัม( qผม)E=−∑n,ipiLog(qi) E=-\sum_{n,i} p_i Log (q_i) ที่ผลรวมจะดำเนินการมากกว่าผลลัพธ์และฝ่ายตรงข้ามทั้งหมดn คือความถี่ที่สังเกตได้ของเหตุการณ์และถึงความถี่ที่คาดหวังn P ฉันฉันถามฉันผมผมinnnพีผมพีผมp_iผมผม_iQผมQผมq_i ในกรณีที่มีเพียงสองผลลัพธ์ที่เป็นไปได้ (ชนะหรือหลวม) และหนึ่งฝ่ายตรงข้ามที่เรามี E= - p L o g( q) - ( 1 - p ) L o g( 1 - q)E=-พีLโอก.(Q)-(1-พี)Lโอก.(1-Q) E=-p Log (q)-(1-p)Log(1-q) ถ้าคืออันดับของผู้เล่นและคืออันดับของผู้เล่นเราสามารถสร้างความน่าจะเป็นที่คาดหวังในฐานะ จากนั้นกฎการอัพเดทลาดลงทางลาดชันฉันπ j j q …

1
การไล่ระดับสีเมื่อการฝึกอบรมเครือข่ายประสาทลึก
เมื่อใดที่ต้องการจะทำการไล่ระดับสีเมื่อฝึก RNN หรือ CNN ฉันสนใจเป็นพิเศษ สิ่งที่จะเป็นค่าเริ่มต้นที่ดีสำหรับการตัด? (แน่นอนสามารถปรับได้)

2
เทย์เลอร์ซีรีย์ประมาณการความคาดหวังของฟังก์ชั่นทั้งหมด (ทั้งหมด) เมื่อใด
รับความคาดหวังของรูปแบบสำหรับตัวแปรสุ่มบางตัวแปรและฟังก์ชันทั้งหมด (เช่นช่วงเวลาของการบรรจบกันเป็นเส้นจริงทั้งหมด)X f ( ⋅ )E(f(X))E(f(X))E(f(X))XXXf(⋅)f(⋅)f(\cdot) ฉันมีฟังก์ชั่นสร้างช่วงเวลาสำหรับและด้วยเหตุนี้สามารถคำนวณช่วงเวลาจำนวนเต็มได้อย่างง่ายดาย ใช้ชุดข้อมูลเทย์เลอร์รอบแล้วใช้ความคาดหวังในแง่ของชุดของช่วงเวลากลาง = f (\ mu) + \ sum_ {n = 2 } ^ {\ infty} \ frac {f ^ {(n)} (\ mu)} {n!} E \ left [(x - \ mu) ^ n \ right] ตัดชุดนี้ E_N (f (x) ) = f (\ mu) …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.