สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
สเกล Lasso มีขนาดเมทริกซ์การออกแบบอย่างไร
ถ้าฉันมีเมทริกซ์การออกแบบโดยที่คือจำนวนการสังเกตของมิติความซับซ้อนในการแก้สำหรับด้วย LASSO, wrtและd ? ผมคิดว่าคำตอบควรดูที่วิธีการหนึ่ง Lasso ย้ำเครื่องชั่งน้ำหนักที่มีพารามิเตอร์เหล่านี้มากกว่าวิธีการที่จำนวนซ้ำ (ลู่) เครื่องชั่งน้ำหนักจนกว่าคุณจะรู้สึกอย่างอื่น n วันที่β = argmin β 1X∈ Rn × dX∈Rn×dX\in\mathcal{R}^{n\times d}nnndddndβ^= argminβ12 n| | Xβ- y| |2+ λ | | β| |1β^=argminβ12n||Xβ-Y||2+λ||β||1\hat{\beta}=\text{argmin}_{\beta}\frac{1}{2n} ||X\beta-y||^{2} + \lambda||\beta||_{1}nnnddd ฉันได้อ่านนี้ซับซ้อนก่อนหน้า Lasso คำถามแต่ดูเหมือนว่าที่ขัดแย้งกับการอภิปรายเกี่ยวกับ glmnet ที่นี่และที่นี่ ผมทราบว่ามีขั้นตอนวิธีการจำนวนมากออกมีรวมทั้ง glmnet ของวิธีการ GLM แต่ผมกำลังเขียนกระดาษเกี่ยวกับการเปลี่ยนองค์ประกอบ Lasso ขั้นตอนวิธีการที่ผู้ปกครองและต้องการที่จะรวมถึงการอภิปรายเกี่ยวกับความซับซ้อน Lasso โดยทั่วไปโดยเฉพาะอย่างยิ่งกับdddและnnnnฉันต้องการทราบความซับซ้อนของ glmnet ในกรณีที่ไม่กระจัดกระจายพื้นฐาน แต่บทความที่อ้างถึงมีความสับสนเล็กน้อยเนื่องจากความซับซ้อนของอัลกอริทึมทั้งหมดไม่ชัดเจน

1
ทำไมฉันถึงได้รับการคาดการณ์ที่แตกต่างกันสำหรับการขยายพหุนามด้วยตนเองและการใช้ฟังก์ชั่น R `poly`
ทำไมฉันถึงได้รับการคาดการณ์ที่แตกต่างกันสำหรับการขยายพหุนามด้วยตนเองและการใช้polyฟังก์ชั่นR set.seed(0) x <- rnorm(10) y <- runif(10) plot(x,y,ylim=c(-0.5,1.5)) grid() # xp is a grid variable for ploting xp <- seq(-3,3,by=0.01) x_exp <- data.frame(f1=x,f2=x^2) fit <- lm(y~.-1,data=x_exp) xp_exp <- data.frame(f1=xp,f2=xp^2) yp <- predict(fit,xp_exp) lines(xp,yp) # using poly function fit2 <- lm(y~ poly(x,degree=2) -1) yp <- predict(fit2,data.frame(x=xp)) lines(xp,yp,col=2) ความพยายามของฉัน: ดูเหมือนว่าจะมีปัญหากับการสกัดกั้นเมื่อฉันพอดีกับรูปแบบที่มีการสกัดกั้นคือไม่มี-1ในรูปแบบformulaทั้งสองเส้นจะเหมือนกัน แต่ทำไมไม่มีการสกัดกั้นสองบรรทัดจึงแตกต่างกัน …

3
คำถามสัมภาษณ์นักวิทยาศาสตร์ด้านข้อมูล: การถดถอยเชิงเส้นต่ำและคุณจะทำอย่างไร
ฉันเผชิญหน้ากับคำถามสัมภาษณ์สำหรับงานที่ผู้สัมภาษณ์ถามฉันว่าสมมติว่าของคุณต่ำมาก (ระหว่าง 5 ถึง 10%) สำหรับแบบจำลองความยืดหยุ่นราคา คุณจะแก้ไขคำถามนี้อย่างไรR2R2R^2 ฉันไม่สามารถคิดอย่างอื่นนอกเหนือจากความจริงที่ว่าฉันจะทำการวินิจฉัยการถดถอยเพื่อดูว่าเกิดข้อผิดพลาดหรือควรใช้วิธีการเชิงเส้นใด ๆ อย่างใดฉันคิดว่าผู้สัมภาษณ์ไม่พอใจกับคำตอบของฉัน มีอย่างอื่นที่ทำในสถานการณ์เช่นนี้เพื่อให้พอดีกับแบบจำลองและใช้สำหรับการทำนายระดับการผลิตแม้ว่ามันจะมีค่าต่ำหรือไม่?R2R2R^2 แก้ไข : ในเวลาต่อมาพวกเขาให้ข้อมูลกับฉันเพื่อจำลองปัญหาในระหว่างการสัมภาษณ์และฉันพยายามเพิ่มตัวแปรที่ล่าช้า, ผลกระทบของราคาของคู่แข่ง, หุ่นตามฤดูกาลเพื่อดูว่ามันสร้างความแตกต่างหรือไม่ ไปถึงร้อยละ 17.6 และประสิทธิภาพการทำงานในตัวอย่างที่เก็บไว้ไม่ดี โดยส่วนตัวฉันคิดว่ามันผิดจรรยาบรรณที่จะนำแบบจำลองดังกล่าวมาใช้ในการทำนายสภาพแวดล้อมจริงเพราะจะให้ผลลัพธ์ที่ผิดพลาดและทำให้ลูกค้าสูญเสีย มีอะไรอีกบ้างที่ทำในสถานการณ์เช่นนี้ซึ่งชัดเจนเกินไปที่ทุกคนต้องรู้ บางสิ่งที่ฉันไม่ทราบซึ่งฉันอยากจะพูดว่า 'กระสุนเงิน'R2R2R^2 นอกจากนี้ลองนึกภาพหลังจากเพิ่มตัวแปรภายนอกปรับปรุงให้ดีขึ้นอีก 2% แล้วจะทำอะไรได้บ้างในสถานการณ์นี้ เราควรยกเลิกโครงการสร้างแบบจำลองหรือยังมีความหวังในการพัฒนาแบบจำลองคุณภาพระดับการผลิตซึ่งระบุโดยผลการดำเนินงานในตัวอย่างที่เก็บไว้?R2R2R^2 แก้ไข 2 : ฉันได้โพสต์คำถามนี้ในฟอรัมeconomics.stackexchange.comเพื่อทำความเข้าใจปัญหานี้จากมุมมองของเศรษฐศาสตร์

1
คำอธิบายที่ใช้งานง่ายสำหรับความน่าจะเป็นค่าผกผันของน้ำหนักการรักษา (IPTWs) ในการให้คะแนนความชอบ?
ฉันเข้าใจกลไกของการคำนวณน้ำหนักโดยใช้คะแนนความชอบ : แล้วนำน้ำหนักไปใช้ในการวิเคราะห์การถดถอยและให้น้ำหนักกับ "การควบคุมสำหรับ" หรือยกเลิกการเชื่อมโยงผลกระทบของโควาเรียตในประชากรกลุ่มการรักษาและกลุ่มควบคุมด้วยตัวแปรผลลัพธ์หน้า( xผม)พี(xผม)p(x_i)Wi , j = t r e a tWi , j = c o n t r o l= 1หน้า( xผม)= 11 - p ( xผม)Wผม,J=เสื้อRอีaเสื้อ=1พี(xผม)Wผม,J=คโอnเสื้อRโอล.=11-พี(xผม)\begin{align} w_{i, j={\rm treat}} &= \frac{1}{p(x_i)} \\[5pt] w_{i, j={\rm control}} &= \frac{1}{1-p(x_i)} \end{align} อย่างไรก็ตามในระดับลำไส้ฉันไม่เข้าใจว่าน้ำหนักบรรลุเป้าหมายนี้อย่างไรและทำไมจึงสร้างสมการดังกล่าว

2
สุ่มตัวอย่างการกระจายเบต้าที่มีประสิทธิภาพอย่างมีประสิทธิภาพ
ฉันจะสุ่มตัวอย่างอย่างมีประสิทธิภาพจากการกระจายต่อไปนี้ได้อย่างไร? x ∼ B ( α , β) , x > k x∼B(α,β), x>k x \sim B(\alpha, \beta),\space x > k หากไม่ใหญ่เกินไปการสุ่มตัวอย่างการปฏิเสธอาจเป็นวิธีที่ดีที่สุด แต่ฉันไม่แน่ใจว่าจะดำเนินการอย่างไรเมื่อkมีขนาดใหญ่ อาจจะมีการประมาณแบบเชิงเส้นกำกับบางอย่างที่สามารถใช้ได้?kkkkkk

1
ทำไมผลลัพธ์ฟอเรสต์แบบสุ่มของฉันจึงแปรผัน
ฉันพยายามทดสอบความสามารถของฟอเรสต์แบบสุ่มเพื่อจำแนกตัวอย่างระหว่าง 2 กลุ่ม; มีตัวอย่าง 54 ตัวและตัวแปรต่าง ๆ ที่ใช้สำหรับการจำแนกประเภท ฉันสงสัยว่าทำไมประมาณการนอกถุง (OOB) สามารถเปลี่ยนแปลงได้มากถึง 5% จากกันแม้ว่าฉันจะใช้ต้น 50k? นี่เป็นสิ่งที่ bootstrapping สามารถช่วยได้หรือไม่?

3
นักสถิติหมายถึงอะไรเมื่อพวกเขาพูดว่าเราไม่เข้าใจจริงๆว่า LASSO (การทำให้เป็นมาตรฐาน) ทำงานอย่างไร?
ฉันเคยไปพูดคุยเกี่ยวกับสถิติไม่กี่เมื่อเร็ว ๆ นี้เกี่ยวกับ Lasso (normalization) และจุดที่ทำให้ขึ้นคือเราไม่เข้าใจว่าทำไม Lasso ทำงานหรือทำไมมันทำงานได้ดี ฉันสงสัยว่าข้อความนี้หมายถึงอะไร เห็นได้ชัดว่าฉันเข้าใจว่าทำไม Lasso จึงใช้งานทางเทคนิคโดยการป้องกันการ overfitting ด้วยการหดตัวของพารามิเตอร์ แต่ฉันสงสัยว่ามีความหมายลึกซึ้งกว่าหลังคำสั่งดังกล่าว ไม่มีใครมีความคิดใด ๆ ขอบคุณ!

1
การถดถอยป่าแบบสุ่มสำหรับการทำนายอนุกรมเวลา
ฉันพยายามใช้การถดถอยแบบ RF เพื่อคาดการณ์ประสิทธิภาพของโรงสีกระดาษ ฉันมีข้อมูลแบบนาทีต่อนาทีสำหรับอินพุต (อัตราและปริมาณของเยื่อไม้ที่เข้ามาใน ฯลฯ .. ) รวมถึงประสิทธิภาพของเครื่อง (กระดาษที่ผลิตพลังงานจากเครื่อง) และกำลังคาดการณ์ 10 นาที ล่วงหน้าเกี่ยวกับตัวแปรประสิทธิภาพ ฉันมีข้อมูล 12 เดือนดังนั้นได้แยกเป็นชุดฝึกอบรม 11 เดือนและเดือนสุดท้ายสำหรับการทดสอบ จนถึงตอนนี้ฉันได้สร้างคุณสมบัติใหม่ 10 รายการซึ่งมีค่าความล่าช้า 1-10 นาทีสำหรับตัวแปรประสิทธิภาพแต่ละตัวและใช้สิ่งเหล่านี้รวมทั้งอินพุตเพื่อทำการคาดการณ์ ประสิทธิภาพของชุดทดสอบค่อนข้างดี (ระบบสามารถคาดเดาได้ค่อนข้างมาก) แต่ฉันกังวลว่าฉันขาดอะไรบางอย่างในการเข้าใกล้ ตัวอย่างเช่นในบทความนี้ผู้เขียนระบุวิธีการของพวกเขาในการทดสอบความสามารถในการทำนายของรูปแบบป่าสุ่ม การจำลองดำเนินการโดยเพิ่มสัปดาห์ใหม่ของข้อมูลฝึกอบรมโมเดลใหม่โดยใช้ข้อมูลที่อัปเดตและคาดการณ์จำนวนการระบาดของสัปดาห์ถัดไป สิ่งนี้แตกต่างจากการใช้ข้อมูล 'ภายหลัง' ในอนุกรมเวลาเป็นการทดสอบอย่างไร ฉันควรตรวจสอบความถูกต้องของแบบจำลองการถดถอย RF ด้วยวิธีนี้เช่นเดียวกับชุดข้อมูลการทดสอบหรือไม่ นอกจากนี้วิธีการ 'autoregressive' แบบสุ่มเพื่อการถดถอยป่าแบบนี้ใช้ได้กับอนุกรมเวลาและฉันจำเป็นต้องสร้างตัวแปรที่ล้าหลังจำนวนมากหรือไม่ถ้าฉันสนใจการทำนาย 10 นาทีในอนาคต?

1
กระบวนการแบบเกาส์ (การถดถอย) มีคุณสมบัติการประมาณค่าสากลหรือไม่?
ฟังก์ชันต่อเนื่องใด ๆ ใน [a, b] ซึ่ง a และ b เป็นตัวเลขจริงสามารถประมาณหรือใกล้กับฟังก์ชัน (ในบางบรรทัดฐาน) โดยกระบวนการ Gaussian (การถดถอย) ได้หรือไม่?

2
Tensorflow `tf.train.Optimizer` คำนวณการไล่ระดับสีอย่างไร
ฉันกำลังติดตามบทช่วยสอนผู้ชาญฉลาด Tensorflow ( https://github.com/tensorflow/tensorflow/blob/master/tensorflow/examples/tutorials/mnist/mnist_softmax.py ) บทช่วยสอนใช้tf.train.Optimizer.minimize(โดยเฉพาะtf.train.GradientDescentOptimizer) ฉันไม่เห็นข้อโต้แย้งใด ๆ ที่ถูกส่งผ่านไปที่ใดก็ได้เพื่อกำหนดการไล่ระดับสี Tensor flow นั้นใช้ความแตกต่างของตัวเลขหรือไม่? มีวิธีผ่านในการไล่ระดับสีอย่างที่คุณสามารถทำได้scipy.optimize.minimizeหรือไม่?

3
เปรียบเทียบ 0/10 ถึง 0/20
เมื่อพูดถึงอัตราความสำเร็จของงานมีวิธีใดที่จะแสดงให้เห็นว่า 0 จาก 20 ครั้งคือ "แย่ลง" มากกว่า 0 จาก 10 ครั้ง?

3
ฉันจะเลือกเมตริกที่ดีที่สุดในการวัดการสอบเทียบได้อย่างไร
ฉันเขียนโปรแกรมและทำการพัฒนาโดยอาศัยการทดสอบ หลังจากที่ฉันทำการเปลี่ยนแปลงรหัสของฉันฉันเรียกใช้การทดสอบของฉัน บางครั้งพวกเขาประสบความสำเร็จและบางครั้งพวกเขาก็ล้มเหลว ก่อนที่ฉันจะทำการทดสอบฉันจะเขียนตัวเลขจาก 0.01 ถึง 0.99 เพื่อให้แน่ใจว่าการทดสอบจะสำเร็จ ฉันต้องการทราบว่าฉันปรับปรุงในการทำนายว่าการทดสอบของฉันจะสำเร็จหรือล้มเหลว มันจะดีถ้าฉันสามารถติดตามว่าฉันดีกว่าที่ทำนายว่าการทดสอบจะประสบความสำเร็จในวันจันทร์หรือวันศุกร์ หากความสามารถในการทำนายความสำเร็จในการทดสอบมีความสัมพันธ์กับตัวชี้วัดอื่นที่ฉันติดตามฉันต้องการทราบ นั่นทำให้ฉันมีหน้าที่เลือกเมตริกที่ถูกต้อง ใน Superforcasting Philip Tetlock เสนอให้ใช้คะแนน Brierในการวัดว่าผู้เชี่ยวชาญสอบเทียบได้ดีเพียงใด ตัวชี้วัดที่ได้รับการเสนอชื่อในวรรณคดีก็คือกฎการให้คะแนนลอการิทึม นอกจากนี้ยังมีผู้สมัครอื่น ๆ ฉันจะตัดสินใจได้อย่างไรว่าจะใช้เมตริกใด มีการโต้เถียงกันหรือไม่ที่จะสนับสนุนกฎการให้คะแนนหนึ่งกฎเหนือกฎอื่น ๆ ?

1
อะไรคือความหมายของบาร์คู่และ 2 ที่ด้านล่างในช่องสี่เหลี่ยมน้อยที่สุดธรรมดา?
ผมเห็นเครื่องหมายนี้สำหรับสองน้อยสามัญที่นี่ นาทีW∥ Xw - y∥22minw‖Xw−y‖22 \min_w \left\| Xw - y \right\|^2_2 ฉันไม่เคยเห็นแถบคู่และ 2 ที่ด้านล่าง สัญลักษณ์เหล่านี้หมายถึงอะไร พวกเขามีคำศัพท์เฉพาะสำหรับพวกเขาหรือไม่?

2
เครือข่ายประสาทเทียมสามารถใช้เป็นภาพอินพุตที่มีขนาดต่างกันได้หรือไม่?
ฉันกำลังทำงานบนเครือข่ายการสนทนาเพื่อการจดจำรูปภาพและฉันสงสัยว่าฉันสามารถใส่ภาพที่มีขนาดต่างกันได้หรือไม่ ในโครงการนี้: https://github.com/harvardnlp/im2markup พวกเขาพูดว่า: and group images of similar sizes to facilitate batching ดังนั้นแม้หลังจากประมวลผลล่วงหน้าภาพยังคงมีขนาดแตกต่างกันซึ่งเหมาะสมเนื่องจากไม่ตัดบางส่วนของสูตร มีปัญหาในการใช้ขนาดที่แตกต่างกันหรือไม่? หากมีฉันจะแก้ไขปัญหานี้ได้อย่างไร (เนื่องจากสูตรจะไม่พอดีกับขนาดภาพเดียวกัน) การป้อนข้อมูลใด ๆ จะได้รับการชื่นชมมาก

1
การคำนวณอนุพันธ์ของฟังก์ชันเมทริกซ์นี้คืออะไร
ในหลักสูตรการเรียนรู้ด้วยเครื่องของ Andrew Ng เขาใช้สูตรนี้: ∇Atr(ABATC)=CAB+CTABT∇Atr(ABATC)=CAB+CTABT\nabla_A tr(ABA^TC) = CAB + C^TAB^T และเขาพิสูจน์อย่างรวดเร็วซึ่งแสดงด้านล่าง: ∇Atr(ABATC)=∇Atr(f(A)ATC)=∇∘tr(f(∘)ATC)+∇∘tr(f(A)∘TC)=(ATC)Tf′(∘)+(∇∘Ttr(f(A)∘TC)T=CTABT+(∇∘Ttr(∘T)Cf(A))T=CTABT+((Cf(A))T)T=CTABT+CAB∇Atr(ABATC)=∇Atr(f(A)ATC)=∇∘tr(f(∘)ATC)+∇∘tr(f(A)∘TC)=(ATC)Tf′(∘)+(∇∘Ttr(f(A)∘TC)T=CTABT+(∇∘Ttr(∘T)Cf(A))T=CTABT+((Cf(A))T)T=CTABT+CAB\nabla_A tr(ABA^TC) \\ = \nabla_A tr(f(A)A^TC) \\ = \nabla_{\circ} tr(f(\circ)A^TC) + \nabla_{\circ}tr(f(A)\circ^T C)\\ =(A^TC)^Tf'(\circ) + (\nabla_{\circ^T}tr(f(A)\circ^T C)^T \\ = C^TAB^T + (\nabla_{\circ^T}tr(\circ^T)Cf(A))^T \\ =C^TAB^T + ((Cf(A))^T)^T \\ = C^TAB^T + CAB หลักฐานดูเหมือนหนาแน่นมากโดยไม่มีความคิดเห็นใด ๆ และฉันมีปัญหาในการทำความเข้าใจ เกิดอะไรขึ้นจากความเสมอภาคที่สองถึงสาม

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.