สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
แสดงความเท่าเทียมกันระหว่างบรรทัดฐานการถดถอยปกติและบรรทัดฐานการถดถอยแบบ จำกัด การใช้ KKT
ตามที่อ้างอิงเล่ม 1 , เล่ม 2และกระดาษ มีการกล่าวถึงว่ามีความเท่าเทียมกันระหว่างการถดถอยแบบปกติ (Ridge, LASSO และ Elastic Net) และสูตรข้อ จำกัด ฉันยังดูCross Validated 1และCross Validated 2แต่ฉันไม่สามารถเห็นคำตอบที่ชัดเจนแสดงให้เห็นว่าการเทียบเท่าหรือตรรกะ คำถามของฉันคือ จะแสดงความเท่าเทียมกันอย่างไรโดยใช้ Karush – Kuhn – Tucker (KKT) สูตรต่อไปนี้ใช้สำหรับการถดถอยแบบริดจ์ บันทึก คำถามนี้ไม่ใช่การบ้าน มันเป็นเพียงเพื่อเพิ่มความเข้าใจของฉันในหัวข้อนี้ UPDATE ฉันยังไม่มีความคิด

2
ทำไมฟังก์ชั่นการสูญเสีย 0-1 จึงเป็นเรื่องยาก?
ในหนังสือการเรียนรู้ลึกของเอียนกู๊ดเฟลโลว์มันเขียนไว้ว่า บางครั้งฟังก์ชั่นการสูญเสียที่เราสนใจ (พูดว่าการจำแนกผิดพลาด) ไม่ใช่สิ่งที่สามารถเพิ่มประสิทธิภาพได้อย่างมีประสิทธิภาพ ตัวอย่างเช่นการลดการสูญเสียที่คาดไว้ 0-1 ให้น้อยที่สุดนั้นเป็นไปไม่ได้ ในสถานการณ์เช่นนี้มักจะปรับฟังก์ชันการสูญเสียตัวแทนให้เหมาะสมซึ่งทำหน้าที่เป็นพร็อกซี แต่มีข้อดี เหตุใดการสูญเสีย 0-1 จึงเป็นเรื่องยากหรืออธิบายได้อย่างไรในมิติข้อมูลเข้า

1
ทำไม R Squared จึงไม่ใช่มาตรการที่ดีสำหรับการถดถอยที่เหมาะสมเมื่อใช้ LASSO
ฉันได้อ่านในหลาย ๆ ที่ว่า R Squared ไม่ใช่วิธีที่เหมาะสมที่สุดเมื่อแบบจำลองนั้นเหมาะสมกับ LASSO แต่ฉันไม่ชัดเจนเกี่ยวกับว่าทำไมที่เป็น นอกจากนี้คุณสามารถแนะนำทางเลือกที่ดีที่สุดได้หรือไม่

4
อะไรทำให้บ่วงบาศไม่เสถียรสำหรับการเลือกคุณสมบัติ?
ในการตรวจจับแบบบีบอัดมีทฤษฎีบทรับประกันได้ว่า มีวิธีแก้ปัญหากระจัดกระจายc (ดูภาคผนวกสำหรับรายละเอียดเพิ่มเติม)cargmin∥c∥1subject to y=Xcargmin‖c‖1subject to y=Xc\text{argmin} \Vert c \Vert_1\\ \text{subject to } y = Xc ccc มีทฤษฎีบทที่คล้ายกันสำหรับบ่วงบาศหรือไม่? หากมีทฤษฎีบทดังกล่าวไม่เพียง แต่จะรับประกันความมั่นคงของบาศกัมมันตภาพรังสีเท่านั้น แต่มันยังให้การตีความที่มีความหมายมากขึ้นด้วย เชือกสามารถค้นพบเบาบางค่าสัมประสิทธิ์การถดถอยเวกเตอร์cccที่ใช้ในการสร้างการตอบสนองyyyโดยy=Xcy=Xcy = XcXc มีสองเหตุผลที่ฉันถามคำถามนี้: ฉันคิดว่า 'lasso เป็นคำตอบที่กระจัดกระจาย' ไม่ใช่คำตอบว่าทำไมใช้ lasso เพื่อเลือกคุณลักษณะเนื่องจากเราไม่สามารถบอกได้ว่าข้อดีของคุณสมบัติที่เราเลือกคืออะไร ฉันเรียนรู้ Lasso ที่มีชื่อเสียงในเรื่องความไม่แน่นอนในการเลือกคุณสมบัติ ในทางปฏิบัติเราต้องรันตัวอย่างบูตสแตรปเพื่อประเมินความเสถียร อะไรคือเหตุผลที่สำคัญที่สุดที่ทำให้เกิดความไม่แน่นอนนี้ ภาคผนวก: ได้รับXN×M=(x1,⋯,xM)XN×M=(x1,⋯,xM)X_{N \times M} = (x_1, \cdots, x_M)x_M) cccคือΩΩ\Omega -sparse vector ( Ω⩽MΩ⩽M\Omega \leqslant …

1
“ ความหลากหลาย” หมายถึงอะไร?
การใช้ "ความแปรปรวน" หมายถึงการเพิ่มประสิทธิภาพเสมอผ่านการอนุมานแบบผันแปรหรือไม่? ตัวอย่าง: "ตัวเข้ารหัสอัตโนมัติแบบแปรผัน" "วิธีเบย์แบบแปรผัน" "กลุ่มการเปลี่ยนรูปแบบแปรปรวน"

1
ทำความเข้าใจกับการถดถอยเชิงลบ
ฉันกำลังมองหาวรรณกรรมเกี่ยวกับการถดถอยเชิงลบสันเขา ในระยะสั้นมันเป็นลักษณะทั่วไปของการถดถอยเชิงเส้นโดยใช้เชิงลบในสูตรตัวประมาณ:กรณีในเชิงบวกมีทฤษฎีที่ดี: เป็นฟังก์ชั่นการสูญเสียเป็นข้อ จำกัด เป็น Bayes ก่อน ... แต่ฉันรู้สึกหายไปกับรุ่นเชิงลบที่มีเพียงสูตรข้างต้น มันจะมีประโยชน์สำหรับสิ่งที่ฉันทำ แต่ฉันไม่สามารถตีความได้อย่างชัดเจนบีตา = ( X ⊤ X + λ ฉัน) - 1 X ⊤ Yλλ\lambdaβ^=(X⊤X+λI)−1X⊤y.β^=(X⊤X+λI)−1X⊤y.\hat\beta = ( X^\top X + \lambda I)^{-1} X^\top y. คุณรู้ข้อความเบื้องต้นเกี่ยวกับสันเขาเชิงลบหรือไม่? จะตีความได้อย่างไร?

1
การกระจายแบบเกาส์เป็นกรณีเฉพาะของการแจกแจงแบบเบต้าหรือไม่
หากคุณดูการแจกแจงแบบเบต้าด้วยα=β= 4α=β=4\alpha=\beta=4มันจะดูคล้ายกับการแจกแจงแบบเกาส์มาก แต่มันคืออะไร คุณจะพิสูจน์ได้อย่างไรว่าการแจกแจงแบบเบต้า (4,4) เป็นแบบเกาส์เซสหรือไม่?

1
RMSProp และ Adam เทียบกับ SGD
ฉันกำลังทำการทดลองกับชุดตรวจสอบความถูกต้องของ EMNIST โดยใช้เครือข่ายที่มี RMSProp, อดัมและ SGD ฉันได้รับความแม่นยำ 87% กับ SGD (อัตราการเรียนรู้ 0.1) และ dropout (0.1 dropout prob) รวมถึงการทำให้เป็นมาตรฐาน L2 (การลงโทษ 1e-05) เมื่อทดสอบการกำหนดค่าที่แน่นอนเดียวกันกับ RMSProp และ Adam รวมถึงอัตราการเรียนรู้เริ่มต้น 0.001 ฉันได้รับความแม่นยำ 85% และเส้นโค้งการฝึกอบรมที่ราบรื่นน้อยลงอย่างเห็นได้ชัด ฉันไม่ทราบวิธีอธิบายพฤติกรรมนี้ อะไรเป็นสาเหตุของการขาดความเรียบในช่วงการฝึกอบรมและความแม่นยำที่ลดลงและอัตราความผิดพลาดที่สูงขึ้น

5
เป็นไปได้ว่าตัวแปรสุ่มสองตัวจากตระกูลการแจกจ่ายเดียวกันมีความคาดหวังและความแปรปรวนเหมือนกัน แต่ช่วงเวลาที่สูงกว่าต่างกันหรือไม่
ฉันกำลังคิดถึงความหมายของครอบครัวในระดับตำแหน่ง ความเข้าใจของฉันคือสำหรับสมาชิกทุกคนในตระกูลมาตราส่วนตำแหน่งที่ตั้งที่มีพารามิเตอร์ตำแหน่งและมาตราส่วนจากนั้นการกระจายของไม่ขึ้นอยู่กับพารามิเตอร์ใด ๆ และมันก็เหมือนกันสำหรับทุกที่เป็นของตระกูลนั้นXXXaaabbbZ=(X- a ) / bZ=(X−a)/bZ =(X-a)/bXXX ดังนั้นคำถามของฉันคือคุณสามารถให้ตัวอย่างที่สุ่มสองตัวจากตระกูลการแจกจ่ายเดียวกันเป็นมาตรฐาน แต่ไม่ส่งผลให้ตัวแปรสุ่มที่มีการแจกแจงแบบเดียวกันได้หรือไม่ พูดว่าและมาจากตระกูลการแจกจ่ายเดียวกัน (โดยที่ครอบครัวฉันหมายถึงตัวอย่างเช่น Normal หรือ Gamma และอื่น ๆ .. ) กำหนด:XXXYYY Z1=X-μσZ1=X−μσZ_1 = \dfrac{X-\mu}{\sigma} Z2=Y-μσZ2=Y−μσZ_2 = \dfrac{Y-\mu}{\sigma} เรารู้ว่าทั้งสองและมีความคาดหวังเหมือนกันและแปรปรวน 1Z1Z1Z_1Z2Z2Z_2μZ= 0 , σ2Z= 1μZ=0,σZ2=1\mu_Z =0, \sigma^2_Z =1 แต่พวกเขาสามารถมีช่วงเวลาที่สูงขึ้นแตกต่างกันได้หรือไม่ ความพยายามของฉันที่จะตอบคำถามนี้คือถ้าการแจกแจงของและขึ้นอยู่กับพารามิเตอร์มากกว่า 2 ตัว และฉันกำลังคิดถึง general ทั่วไปที่มี 3 พารามิเตอร์XXXYYYt - s t ude n …

1
ผลกระทบที่เกิดจากการปรับประตูหลังและประตูหน้า
หากเราต้องการคำนวณผลกระทบเชิงสาเหตุของต่อในกราฟสาเหตุด้านล่างเราสามารถใช้ทั้งการปรับประตูหลังและทฤษฎีการปรับประตูหน้าเช่น Y P ( y | do ( X = x ) ) = ∑ u P ( y | x , u ) P ( u )XXXYYYP( y| ทำ (X= x ) ) = ∑ยูP( y| x,u)P( u )P(y|do(X=x))=∑uP(y|x,u)P(u)P(y | \textit{do}(X = x)) = \sum_u P(y | x, u) …

4
ความสัมพันธ์ระหว่าง ANOVA เพื่อเปรียบเทียบวิธีการของหลายกลุ่มและ ANOVA เพื่อเปรียบเทียบแบบจำลองที่ซ้อนกันคืออะไร?
ฉันเคยเห็น ANOVA ใช้สองวิธี: อันดับแรกในข้อความสถิติเบื้องต้นของฉัน ANOVA ถูกนำมาใช้เป็นวิธีเปรียบเทียบกลุ่มสามกลุ่มหรือมากกว่านั้นเพื่อปรับปรุงมากกว่าการเปรียบเทียบแบบคู่เพื่อที่จะตัดสินว่าหนึ่งในวิธีนั้นมีความแตกต่างอย่างมีนัยสำคัญทางสถิติหรือไม่ ประการที่สองในข้อความการเรียนรู้เชิงสถิติของฉันฉันเคยเห็น ANOVA เคยใช้แบบจำลองซ้อนกันสอง (หรือมากกว่า) เพื่อตรวจสอบว่าแบบจำลอง 1 ซึ่งใช้ชุดย่อยของตัวทำนายรุ่น 2 เหมาะกับข้อมูลเท่ากันหรือเต็ม รุ่น 2 ยอดเยี่ยม ตอนนี้ฉันคิดว่าในทางใดทางหนึ่งหรือทั้งสองสิ่งนี้คล้ายกันจริง ๆ เพราะพวกเขาทั้งสองใช้การทดสอบ ANOVA แต่บนพื้นผิวพวกเขาดูเหมือนจะแตกต่างกันมากสำหรับฉัน สำหรับหนึ่งการใช้งานครั้งแรกเปรียบเทียบสามกลุ่มขึ้นไปในขณะที่วิธีที่สองสามารถใช้เพื่อเปรียบเทียบเพียงสองรุ่น มีใครบ้างที่โปรดอธิบายการเชื่อมต่อระหว่างการใช้งานทั้งสองนี้

2
หนึ่งคน (ในทางทฤษฎี) สามารถฝึกโครงข่ายประสาทเทียมด้วยตัวอย่างการฝึกอบรมที่น้อยกว่าน้ำหนักได้หรือไม่?
ก่อนอื่น: ฉันรู้ว่าไม่มีขนาดตัวอย่างทั่วไปที่ต้องใช้ในการฝึกอบรมโครงข่ายประสาท ขึ้นอยู่กับปัจจัยหลายอย่างเช่นความซับซ้อนของงานเสียงในข้อมูลและอื่น ๆ ยิ่งฉันมีตัวอย่างการฝึกอบรมมากเท่าไหร่เครือข่ายของฉันก็ยิ่งดีขึ้นเท่านั้น แต่ฉันสงสัยว่า: เป็นไปได้ไหมในทางทฤษฎีที่จะฝึกโครงข่ายประสาทด้วยตัวอย่างการฝึกอบรมที่น้อยกว่าน้ำหนักถ้าฉันคิดว่างานของฉันจะ "ง่าย" เพียงพอหรือไม่ มีใครรู้บ้างไหมว่านี่เป็นตัวอย่างที่ดีหรือไม่? หรือเครือข่ายนี้จะทำงานได้ไม่ดีหรือไม่? ถ้าฉันพิจารณาตัวอย่างเช่นการถดถอยพหุนามฉันไม่สามารถพอดีกับพหุนามระดับ 4 (เช่นมี 5 พารามิเตอร์อิสระ) ในจุดข้อมูลเพียง 4 จุด มีกฎที่คล้ายกันสำหรับเครือข่ายประสาทเทียมหรือไม่โดยพิจารณาจากจำนวนน้ำหนักของฉันเป็นจำนวนพารามิเตอร์อิสระหรือไม่

3
ขั้นตอนวิธีใดที่ต้องใช้การเข้ารหัสแบบร้อนแรง
ฉันไม่เคยแน่ใจว่าจะใช้การเข้ารหัสแบบร้อนแรงหนึ่งครั้งสำหรับตัวแปรเด็ดขาดที่ไม่มีการเรียงลำดับและเมื่อใด ฉันใช้ทุกครั้งที่อัลกอริทึมใช้การวัดระยะทางเพื่อคำนวณความคล้ายคลึงกัน ทุกคนสามารถให้กฎทั่วไปเกี่ยวกับประเภทของอัลกอริทึมที่ต้องใช้คุณลักษณะที่ไม่มีการจัดประเภทเพื่อเข้ารหัสแบบร้อนแรงและแบบใดที่จะไม่

1
การอนุมานแบบแปรผัน KL divergence ต้องการจริง
ถึง (เจียมเนื้อเจียมตัวมาก) ฉันเข้าใจของการอนุมานแปรผันหนึ่งพยายามที่จะใกล้เคียงกับไม่รู้จักกระจายโดยการหาการกระจายที่เพิ่มประสิทธิภาพต่อไปนี้:pppqqq KL(p||q)=∑xp(x)logp(x)q(x)KL(p||q)=∑xp(x)logp(x)q(x)KL (p||q) = \sum\limits_{x} p(x)log \frac {p(x)}{q(x)} เมื่อใดก็ตามที่ฉันลงทุนเวลาในการทำความเข้าใจกับการอนุมานความแปรปรวนฉันยังคงกดปุ่มสูตรนี้และไม่สามารถช่วย แต่รู้สึกว่าฉันไม่มีจุด ดูเหมือนว่าฉันจำเป็นต้องทราบเพื่อคำนวณด) แต่จุดทั้งผมไม่ทราบว่าการกระจายนี้พีpppKL(p||q)KL(p||q)KL(p||q)ppp มันเป็นจุดที่แน่นอนที่ทำให้ฉันดักฟังทุกครั้งที่ฉันพยายามอ่านบางสิ่งที่เปลี่ยนแปลง ฉันกำลังคิดถึงอะไร แก้ไข : ฉันจะเพิ่มความคิดเห็นพิเศษบางส่วนที่นี่อันเป็นผลมาจากคำตอบของ @wij ฉันจะพยายามให้แม่นยำยิ่งขึ้น ในกรณีที่ฉันสนใจดูเหมือนว่าสมเหตุสมผลอย่างสมบูรณ์ที่จะพิจารณาว่าต่อไปนี้ถือ; p(θ|D)=p(D|θ)p(θ)p(D)∝p(D|θ)p(θ)p(θ|D)=p(D|θ)p(θ)p(D)∝p(D|θ)p(θ)p(\theta | D) = \frac{p(D|\theta)p(\theta)}{p(D)} \propto p(D|\theta)p(\theta) ในกรณีนี้ผมจะรู้ว่าสิ่งที่สัดส่วนควรมีลักษณะเช่นเพราะผมจะได้เลือกแบบจำลองสำหรับและtheta) ฉันจะทำนั้นถูกต้องในการบอกว่าฉันก็ต้องไปรับการกระจายครอบครัว [ช่วยบอกเกาส์] ดังกล่าวว่าตอนนี้ฉันสามารถประมาณการด) มันให้ความรู้สึกเหมือนอยู่ในกรณีนี้ผมกำลังพยายามที่จะพอดีกับเกาส์ที่อยู่ใกล้กับที่ไม่ปกติtheta) ถูกต้องหรือไม่pppp(D|θ)p(D|θ)p(D|\theta)p(θ)p(θ)p(\theta)qqqKL(p(θ|D)||q)KL(p(θ|D)||q)KL(p(\theta|D) || q)p(D|θ)p(θ)p(D|θ)p(θ)p(D|\theta)p(\theta) ถ้าเป็นเช่นนั้นฉันรู้สึกว่าฉันสมมติว่าลูกหลานของฉันคือการแจกแจงแบบปกติและฉันแค่พยายามหาค่าที่เป็นไปได้สำหรับการกระจายนี้โดยคำนึงถึงความแตกต่างของKLKLKL

1
อัลกอริทึมการจำแนกประเภทใดที่เราควรใช้หลังจากเห็นว่า t-SNE แยกคลาสได้ดี?
สมมติว่าเรามีปัญหาการจัดหมวดหมู่และในตอนแรกเราต้องการรับข้อมูลเชิงลึกจากนั้นจึงทำการ t-SNE ผลลัพธ์ของ t-SNE แยกคลาสได้เป็นอย่างดี นี่ก็หมายความว่ามันเป็นไปได้ที่จะสร้างรูปแบบการจำแนกประเภทที่จะแยกชั้นเรียนได้เป็นอย่างดี (ถ้า t-SNE ไม่แยกจากกันก็ไม่ได้แปลว่ามาก) การรู้ว่า t-SNE มุ่งเน้นไปที่โครงสร้างภายในและสามารถแยกชั้นเรียนได้เป็นอย่างดี: อัลกอริธึมการจำแนกประเภทใดที่ทำงานได้ดีกับปัญหานี้ Scikit แนะนำ SVM ด้วยเคอร์เนล Gaussian RBF แต่คนอื่น ๆ คืออะไร?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.