สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล



2
เมื่อใดที่วิธีการ Monte Carlo เป็นที่นิยมมากกว่าวิธีที่ต่างกันชั่วคราว?
ฉันได้ทำการค้นคว้ามากมายเกี่ยวกับการเสริมแรงการเรียนรู้เมื่อเร็ว ๆ นี้ ฉันติดตามการเรียนรู้การเสริมแรงของ Sutton & Barto : คำแนะนำสำหรับสิ่งส่วนใหญ่ ฉันรู้ว่ากระบวนการตัดสินใจของมาร์คอฟคืออะไรและวิธีการเรียนรู้การเขียนโปรแกรมแบบไดนามิก (DP), มอนติคาร์โลและความแตกต่างของ Temporal (DP) สามารถนำมาใช้แก้ปัญหาได้อย่างไร ปัญหาฉันมีคือว่าผมไม่เห็นเมื่อ Monte Carlo จะเป็นตัวเลือกที่ดีกว่า TD-การเรียนรู้ ความแตกต่างที่สำคัญระหว่างพวกเขาคือการเรียนรู้ด้วยระบบ TD ใช้การบูตสแตรปเพื่อประมาณค่าฟังก์ชั่นการกระทำและ Monte Carlo ใช้ค่าเฉลี่ยเพื่อทำสิ่งนี้ให้สำเร็จ ฉันไม่สามารถคิดถึงสถานการณ์จริง ๆ ได้เมื่อนี่เป็นวิธีที่ดีกว่า ฉันเดาว่ามันอาจมีบางอย่างเกี่ยวกับประสิทธิภาพ แต่ฉันไม่สามารถหาแหล่งที่สามารถพิสูจน์ได้ ฉันขาดอะไรบางอย่างหรือ TD-learning เป็นตัวเลือกที่ดีกว่าหรือไม่?

1
ความแตกต่างระหว่างการถดถอยแบบ PLS กับการสร้างแบบจำลองพา ธ PLS คำติชมของ PLS
คำถามนี้ถูกถามที่นี่แต่ไม่มีใครให้คำตอบที่ดี ดังนั้นฉันคิดว่ามันเป็นความคิดที่ดีที่จะนำมันขึ้นมาอีกครั้งและฉันต้องการที่จะเพิ่มความคิดเห็น / คำถามเพิ่มเติม คำถามแรกคือ "PLS path modelling" กับ "PLS regression" ต่างกันอย่างไร? เพื่อให้เป็นเรื่องทั่วไปยิ่งขึ้นการสร้างแบบจำลองสมการโครงสร้าง (SEM) การสร้างแบบจำลองเส้นทางและการถดถอยคืออะไร เพื่อความเข้าใจที่ถดถอยของฉันมุ่งเน้นไปที่การทำนายในขณะที่ SEM ให้ความสำคัญกับความสัมพันธ์ระหว่างการตอบสนองและการทำนายและการสร้างแบบจำลองเส้นทางเป็นกรณีพิเศษของ SEM? คำถามที่สองของฉันคือ PLS ที่น่าเชื่อถือแค่ไหน เมื่อไม่นานมานี้มีการวิพากษ์วิจารณ์มากมายที่เน้นในRönkköและคณะ 2559และRönkköและคณะ 2015ซึ่งนำไปสู่การปฏิเสธเอกสารตาม PLS ในวารสารระดับสูงเช่นวารสารการจัดการการดำเนินงาน ( นี่คือบันทึกจากบรรณาธิการวารสาร): เรามีแผนกปฏิเสธจริงทุกต้นฉบับ PLS-based เพราะเราได้ข้อสรุปว่า PLS ได้รับโดยไม่มีข้อยกเว้นวิธีการสร้างแบบจำลองที่ไม่ถูกต้องในทุกชนิดของรูปแบบการใช้งาน OM นักวิจัย ฉันควรทราบว่าสาขาของฉันคือสเปกโทรสโกปีการจัดการ / จิตวิทยาหรือสถิติ ในเอกสารที่ลิงก์ด้านบนผู้เขียนกำลังพูดถึง PLS เป็นวิธี SEM แต่สำหรับฉันคำวิจารณ์ของพวกเขาดูเหมือนจะใช้กับการถดถอย PLS เช่นกัน

4
โมเดลการเรียนรู้เชิงลึกเป็นพารามิเตอร์หรือไม่ หรือไม่ใช่พารามิเตอร์?
ฉันไม่คิดว่าจะมีคำตอบเดียวสำหรับโมเดลการเรียนรู้ลึกทั้งหมด แบบจำลองการเรียนรู้แบบลึกใดที่เป็นพารามิเตอร์และแบบใดที่ไม่ใช่พารามิเตอร์และเพราะอะไร

1
ทำไม LKJcorr เป็นเมทริกซ์สหสัมพันธ์ที่ดีมาก่อน?
ฉันกำลังอ่านบทที่ 13 "การผจญภัยในความแปรปรวนร่วม" ในหนังสือ ( สุดยอด ) การทบทวนทางสถิติโดย Richard McElreathซึ่งเขานำเสนอรูปแบบลำดับชั้นดังต่อไปนี้: ( Rเป็นเมทริกซ์สหสัมพันธ์) ผู้เขียนอธิบายว่าLKJcorrมันเป็นข้อมูลที่อ่อนแอก่อนที่จะทำงานเป็น normalizing ก่อนสำหรับเมทริกซ์ความสัมพันธ์ แต่ทำไมถึงเป็นเช่นนั้น? มีการLKJcorrกระจายแบบใดที่ทำให้เป็นแบบอย่างที่ดีสำหรับเมทริกซ์สหสัมพันธ์? มีนักบวชที่ดีคนอื่น ๆ ที่ใช้ในการฝึกอบรมสำหรับความสัมพันธ์?

2
การทดสอบ Kolmogorov – Smirnov: ค่า p-value และ ks-test ลดลงเมื่อขนาดของกลุ่มตัวอย่างเพิ่มขึ้น
เหตุใดค่า p และค่า ks-test จึงลดลงเมื่อขนาดตัวอย่างเพิ่มขึ้น ใช้รหัส Python นี้เป็นตัวอย่าง: import numpy as np from scipy.stats import norm, ks_2samp np.random.seed(0) for n in [10, 100, 1000, 10000, 100000, 1000000]: x = norm(0, 4).rvs(n) y = norm(0, 4.1).rvs(n) print ks_2samp(x, y) ผลลัพธ์ที่ได้คือ: Ks_2sampResult(statistic=0.30000000000000004, pvalue=0.67507815371659508) Ks_2sampResult(statistic=0.080000000000000071, pvalue=0.89375155241057247) Ks_2sampResult(statistic=0.03499999999999992, pvalue=0.5654378910227662) Ks_2sampResult(statistic=0.026599999999999957, pvalue=0.0016502962880920896) Ks_2sampResult(statistic=0.0081200000000000161, pvalue=0.0027192461984023855) Ks_2sampResult(statistic=0.0065240000000000853, …

1
ความสัมพันธ์ระหว่าง Hessian Matrix และ Covariance Matrix
ในขณะที่ฉันกำลังศึกษาการประมาณความเป็นไปได้สูงสุดเพื่อทำการอนุมานในการประมาณความน่าจะเป็นสูงสุดเราจำเป็นต้องทราบความแปรปรวน หากต้องการทราบความแปรปรวนฉันต้องรู้ว่า Rao Lower Bound ของแครเมอร์ซึ่งดูเหมือนเมทริกซ์ของ Hessian ที่มีอนุพันธ์อันดับสองเกี่ยวกับความโค้ง ฉันสับสนในการกำหนดความสัมพันธ์ระหว่างเมทริกซ์ความแปรปรวนร่วมกับเมทริกซ์แบบเฮสเซียน หวังว่าจะได้ยินคำอธิบายบางอย่างเกี่ยวกับคำถาม ตัวอย่างง่ายๆจะได้รับการชื่นชม

1
วิธี Nystroem สำหรับการประมาณเคอร์เนล
ฉันได้อ่านเกี่ยวกับวิธีNyströmสำหรับการประมาณเคอร์เนลระดับต่ำ วิธีนี้ถูกนำมาใช้ในการเรียนรู้ scikit [1] เป็นวิธีการฉายตัวอย่างข้อมูลไปยังการประมาณระดับต่ำของการแมปฟีเจอร์เคอร์เนล ตามความรู้ของฉันที่สุดให้ชุดฝึกอบรมและฟังก์ชันเคอร์เนลมันสร้างการประมาณอันดับต่ำของเคอร์เนลเมทริกซ์โดยใช้ SVD กับและC{xi}ni=1{xi}i=1n\{x_i\}_{i=1}^nn×nn×nn \times nKKKWWWCCC K=[WK21KT21K22]K=[WK21TK21K22]K = \left [ \begin{array}{cc} W & K_{21}^T \\ K_{21} & K_{22} \end{array} \right ] C=[WK21]C=[WK21]C = \left [\begin{array}{cc} W \\ K_{21} \end{array}\right ] ,W∈Rl×lW∈Rl×lW \in \mathbb{R}^{l\times l} อย่างไรก็ตามฉันไม่เข้าใจว่าการประมาณระดับต่ำของเมทริกซ์เคอร์เนลสามารถใช้เพื่อฉายตัวอย่างใหม่ไปยังพื้นที่คุณลักษณะเคอร์เนลโดยประมาณได้อย่างไร เอกสารที่ฉันได้พบ (เช่น [2]) ไม่ได้ช่วยอะไรมากเพราะมันเป็นการสอนน้อย นอกจากนี้ฉันยังสงสัยเกี่ยวกับความซับซ้อนในการคำนวณของวิธีนี้ทั้งในขั้นตอนการฝึกอบรมและการทดสอบ [1] http://scikit-learn.org/stable/modules/kernel_approximation.html#nystroem-kernel-approx [2] http://www.jmlr.org/papers/volume13/kumar12a/kumar12a.pdf


5
คุณเห็นโซ่มาร์คอฟลดลงได้อย่างไร?
ฉันมีปัญหาบางอย่างในการทำความเข้าใจกับคุณสมบัติของโซ่มาร์คอฟที่ลดลงไม่ได้ ลดไม่ได้กล่าวกันว่าหมายความว่ากระบวนการสุ่มสามารถ "ไปจากรัฐใด ๆ ไปยังรัฐใด ๆ " แต่สิ่งที่กำหนดว่ามันจะไปจากรัฐไปยังรัฐหรือไม่ไป?iiijjj หน้าวิกิพีเดียให้ formalization นี้: รัฐคือสามารถเข้าถึงได้ (เขียน ) จากรัฐถ้ามีอยู่จำนวนเต็ม ST jjji→ji→ji\rightarrow jiiinij>0nij>0n_{ij}>0P(Xnij=j | X0=i)=p(nij)ij>0P(Xnij=j | X0=i)=pij(nij)>0P(X_{n_{ij}}=j\space |\space X_0=i)=p_{ij}^{(n_{ij})} >0 แล้วการสื่อสารคือถ้าและฉันi→ji→ji\rightarrow jj→ij→ij \rightarrow i จากการลดลงไม่ได้ดังต่อไปนี้อย่างใด

3
เหตุใดมิติข้อมูล VC จึงมีความสำคัญ
Wikipediaบอกว่า: มิติ VC คือความสำคัญของชุดแต้มที่ใหญ่ที่สุดที่อัลกอริทึมสามารถสลาย ตัวอย่างเช่นลักษณนามเชิงเส้นมี cardinality n + 1 คำถามของฉันคือทำไมเราสนใจ ชุดข้อมูลส่วนใหญ่ที่คุณทำการจัดหมวดหมู่เชิงเส้นมีแนวโน้มที่จะมีขนาดใหญ่มากและมีจำนวนมากของคะแนน

3
จะสร้างเมทริกซ์ความสับสนสำหรับตัวแยกประเภทมัลติคลาสได้อย่างไร?
ฉันมีปัญหากับ 6 คลาส ดังนั้นฉันจึงสร้างตัวแยกประเภทมัลติคลาสดังนี้สำหรับแต่ละคลาสฉันมีลักษณนามลอจิสติกการถดถอยหนึ่งตัวโดยใช้ One vs. All ซึ่งหมายความว่าฉันมี 6 ลักษณนามที่แตกต่างกัน ฉันสามารถรายงานเมทริกซ์ความสับสนสำหรับตัวแยกประเภทแต่ละคนของฉัน แต่ฉันต้องการรายงานความสับสนของตัวแยกประเภททั้งหมดดังที่ฉันเห็นในตัวอย่างมากมายที่นี่ ฉันจะทำมันได้อย่างไร ฉันต้องเปลี่ยนกลยุทธ์การจัดหมวดหมู่ของฉันโดยใช้อัลกอริทึม One vs. One แทน One vs. All หรือไม่ เพราะในการฝึกอบรมความสับสนเหล่านี้รายงานกล่าวว่าผลบวกปลอมสำหรับแต่ละชั้นเรียน ตัวอย่างของเมทริกซ์ความสับสนหลายระดับ ฉันต้องการค้นหาจำนวนรายการที่ไม่ถูกจำแนก ในแถวแรกมี 137 ตัวอย่างของชั้นที่ 1 ที่ได้รับการจัดเป็นชั้นที่ 1 และ 13 ตัวอย่างของชั้นที่ 1 ที่ได้รับการจัดเป็นระดับ 2 วิธีรับหมายเลขนี้

1
วิธีใช้ตอการตัดสินใจในฐานะผู้เรียนที่อ่อนแอใน Adaboost
ฉันต้องการใช้ Adaboost โดยใช้ Decision Stump ถูกต้องหรือไม่ที่จะทำการตัดสินใจตอให้มากที่สุดเท่าที่คุณสมบัติของชุดข้อมูลของเราในแต่ละการซ้ำของ Adaboost ตัวอย่างเช่นถ้าฉันมีชุดข้อมูลที่มี 24 คุณลักษณะฉันควรมีตัวแยกประเภทตอการตัดสินใจ 24 ครั้งในการวนซ้ำแต่ละครั้งหรือไม่ หรือฉันควรเลือกคุณสมบัติบางอย่างแบบสุ่มและสร้างตัวจําแนกพวกมันแทนคุณสมบัติทั้งหมดหรือไม่

1
การกระจายบันทึกอย่างสม่ำเสมอหมายถึงอะไร
เมื่อมีคนบอกว่าข้อมูลถูกสุ่มตัวอย่างจากการกระจายอย่างสม่ำเสมอระหว่าง 128 ถึง 4,000 นั่นหมายความว่าอย่างไร มันแตกต่างจากการสุ่มตัวอย่างจากการแจกแจงแบบสม่ำเสมอหรือไม่? ดูกระดาษนี้: http://www.jmlr.org/papers/volume13/bergstra12a/bergstra12a.pdf ขอบคุณ!

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.