สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
เมื่อใดที่ไม่สามารถตีความการแจกแจงการสุ่มตัวอย่างเป็นเบย์หลังในการตั้งค่าการถดถอยได้
คำถามจริงของฉันอยู่ในสองย่อหน้าสุดท้าย แต่จะกระตุ้นพวกเขา: ถ้าฉันพยายามที่จะประมาณค่าเฉลี่ยของตัวแปรสุ่มที่ตามหลังการแจกแจงปกติที่มีความแปรปรวนที่รู้จักกันฉันได้อ่านว่าการใส่เครื่องแบบก่อนหน้าค่าเฉลี่ยจะส่งผลให้มีการแจกแจงด้านหลังซึ่งเป็นสัดส่วนกับฟังก์ชันความน่าจะเป็น ในสถานการณ์เหล่านี้ช่วงเวลาที่น่าเชื่อถือแบบเบย์คาบเกี่ยวกันอย่างสมบูรณ์แบบกับช่วงความเชื่อมั่นที่พบบ่อยและค่าสูงสุดหลังเบย์ที่ประมาณการหลังเท่ากับความเป็นไปได้สูงสุดที่เกิดขึ้นบ่อยครั้ง ในการตั้งค่าการถดถอยเชิงเส้นอย่างง่าย Y= X β+ ϵ ,ϵ ∼ N( 0 , σ2)Y=Xβ+ϵ,ϵ∼N(0,σ2)Y = \textbf{X}\beta+\epsilon, \hspace{1cm} \epsilon\sim N(0,\sigma^2) ใส่เครื่องแบบไว้ก่อนหน้าและ inverse-gamma ก่อนหน้าด้วยค่าพารามิเตอร์เล็ก ๆ ส่งผลให้หลังที่จะคล้ายกันมากกับบ่อยครั้งและช่วงเวลาที่น่าเชื่อถือสำหรับการกระจายหลังของที่จะคล้ายกับช่วงความเชื่อมั่นมากที่สุดโดยประมาณค่าความน่าจะเป็นสูงสุด พวกเขาจะไม่เหมือนเดิมเพราะก่อนหน้านี้มีอิทธิพลเล็กน้อยและหากการประเมินหลังถูกดำเนินการผ่านการจำลอง MCMC ที่จะแนะนำแหล่งที่มาของความคลาดเคลื่อนอื่น แต่ช่วงเวลาที่น่าเชื่อถือของ Bayesian รอบσ 2 β M P β M L E β | X σ 2 β M Pββ\betaσ2σ2\sigma^2β^MA Pβ^MAP\hat\beta^{MAP}β^ML Eβ^MLE\hat\beta^{MLE}β| Xβ|X\beta|Xσ2σ2\sigma^2β^MA …

3
เมทริกซ์ความสัมพันธ์ทุกตัวเป็นค่าบวกแน่นอนหรือไม่
ฉันกำลังพูดถึงที่นี่เกี่ยวกับเมทริกซ์ของเพียร์สันสหสัมพันธ์ ฉันมักจะได้ยินว่ามันบอกว่าการฝึกอบรมความสัมพันธ์ทั้งหมดจะต้องเป็น semidefinite บวก ความเข้าใจของฉันอยู่ที่การฝึกอบรมที่ชัดเจนในเชิงบวกจะต้องมีลักษณะเฉพาะในขณะที่การฝึกอบรม semidefinite บวกจะต้องมีลักษณะเฉพาะ0 นี่ทำให้ฉันคิดว่าคำถามของฉันสามารถใช้ถ้อยคำใหม่เป็น "เป็นไปได้ไหมที่เมทริกซ์สหสัมพันธ์จะมีค่า eigenvalue "≥ 0 = 0&gt; 0&gt;0> 0≥ 0≥0\ge 0= 0=0= 0 เป็นไปได้สำหรับเมทริกซ์สหสัมพันธ์ (สร้างจากข้อมูลเชิงประจักษ์โดยไม่มีข้อมูลขาดหายไป) เพื่อให้มีค่าลักษณะเฉพาะหรือค่าลักษณะเฉพาะหรือไม่ จะเป็นอย่างไรถ้าเป็นเมทริกซ์สหสัมพันธ์ของประชากรแทน&lt; 0= 0=0= 0&lt; 0&lt;0< 0 ฉันอ่านคำตอบที่ดีที่สุดสำหรับคำถามนี้เกี่ยวกับเมทริกซ์ความแปรปรวนร่วมนั้น พิจารณาสามตัวแปร, ,และ Y เมทริกซ์ความแปรปรวนร่วมของพวกเขา, , ไม่ใช่บวกแน่นอนเนื่องจากมีเวกเตอร์ ( ) ซึ่งมีค่าไม่เป็นบวกY Z = X + Y M z = ( 1 , …

1
ข้อดีและข้อเสียของการใช้ข้อมูลร่วมกันแบบจุดในเมทริกซ์การคิดคำก่อน SVD คืออะไร?
วิธีหนึ่งในการสร้างคำ embeddings มีดังนี้ ( กระจก ): รับ corpora เช่น "ฉันสนุกกับการบินฉันชอบ NLP ฉันชอบการเรียนรู้ลึก" สร้างเมทริกซ์การทับซ้อนของคำจากมัน: ดำเนินการ SVD บนXXXและเก็บคอลัมน์kkkแรกของ U U1:|V|,1:kU1:|V|,1:kU_{1:|V|,1:k} ระหว่างขั้นตอนที่ 2 และ 3 ข้อมูลบางอย่างจะถูกนำมาใช้ร่วมกันในบางจุด(เช่นA. Herbelot และ EM Vecchi 2015. การสร้างโลกที่ใช้ร่วมกัน: การทำแผนที่การกระจายไปยังพื้นที่เชิงความหมายแบบจำลองเชิงทฤษฎีในการประชุม . ลิสบอน, โปรตุเกส .) ข้อดีและข้อเสียของการใช้ข้อมูลร่วมกันแบบจุดในเมทริกซ์การคิดคำก่อน SVD คืออะไร?

2
ตัวกรองและแผนที่การเปิดใช้งานเชื่อมต่อในเครือข่ายประสาทเทียมอย่างไร
แผนที่เปิดใช้งานในเลเยอร์ที่กำหนดเชื่อมต่อกับตัวกรองสำหรับเลเยอร์นั้นอย่างไร ฉันไม่ได้ถามเกี่ยวกับวิธีการดำเนินการ convolutional ระหว่างตัวกรองและแผนที่เปิดใช้งานฉันกำลังถามเกี่ยวกับประเภทของการเชื่อมต่อที่ทั้งสองมี ตัวอย่างเช่นสมมติว่าคุณต้องการเชื่อมต่อเต็มรูปแบบ คุณมีตัวกรองจำนวน f และจำนวนแผนที่เปิดใช้งาน n ในเลเยอร์ที่กำหนด คุณได้รับแผนที่การเปิดใช้งานจำนวน f * n ในเลเยอร์ถัดไปและจำนวนแผนที่การเปิดใช้งานจะเพิ่มขึ้นในแต่ละเลเยอร์ใหม่ นี่คือวิธีที่ฉันคิดเอาไว้ หรือคุณอาจบอกว่าตัวกรองแต่ละตัวเชื่อมต่อกับแผนที่เปิดใช้งานเพียงแผนที่เดียว ในกรณีนี้จำนวนตัวกรองจะเท่ากับจำนวนของแผนที่เปิดใช้งานและทุกชั้นจะมีจำนวนตัวกรองและแผนที่เปิดใช้งานเท่ากัน นี่คือสถาปัตยกรรมปัจจุบันของเครือข่ายของฉันและดูเหมือนว่าจะเรียนรู้ได้ดี แหล่งที่มาหลักของความสับสนของฉันคือดูไดอะแกรมของ convnets ที่ฉันเห็นทางออนไลน์ บางส่วนมี "การเชื่อมต่อแบบเต็ม" ระหว่างตัวกรองและแผนที่เปิดใช้งานเช่นนี้ - ในเลเยอร์แรกคุณมีแผนที่เปิดใช้งาน 4 แห่งและตัวกรอง 2 ตัวน่าจะเป็น แต่ละแผนที่มีความเชื่อมั่นกับตัวกรองแต่ละตัวทำให้เกิด 8 แผนที่ในเลเยอร์ถัดไป ดูดี. แต่ที่นี่เรามีสถาปัตยกรรมที่ไม่สมเหตุสมผลสำหรับฉัน - คุณจะไปจากแผนที่ 6 แห่งในชั้นแรกถึง 16 ในอันดับที่ 2 ได้อย่างไร ฉันสามารถคิดถึงวิธีรับแผนที่ 16 จาก 6 แต่พวกเขาจะไม่มีเหตุผลทำ

1
วัดความสม่ำเสมอของการแจกแจงในวันธรรมดา
ฉันมีปัญหาคล้ายกับคำถามที่ถามที่นี่: เราวัดความไม่สม่ำเสมอของการแจกแจงได้อย่างไร ฉันมีชุดการแจกแจงความน่าจะเป็นในแต่ละวันของสัปดาห์ ฉันต้องการวัดว่าการกระจายแต่ละครั้งนั้นใกล้กับเท่าไหร่ (1 / 7,1 / 7, ... , 1/7) ตอนนี้ฉันใช้คำตอบจากคำถามข้างต้น L2-Norm ซึ่งมีค่า 1 เมื่อการแจกแจงมีมวล 1 เป็นเวลาหนึ่งวันและจะลดลงสำหรับ (1 / 7,1 / 7, 7, ... , 1/7) ฉันกำลังขยายขนาดเชิงเส้นนี้อยู่ระหว่าง 0 ถึง 1 จากนั้นจึงพลิกมัน 0 หมายความว่าไม่สม่ำเสมออย่างสมบูรณ์และ 1 หมายถึงชุดที่สมบูรณ์แบบ มันใช้งานได้ดี แต่ฉันมีปัญหาหนึ่งเรื่อง มันปฏิบัติต่อทุก ๆ วันทำงานอย่างเท่าเทียมกันเป็นมิติหนึ่งในพื้นที่ 7-Dim ดังนั้นจึงไม่ได้คำนึงถึงความใกล้ชิดของวัน กล่าวอีกนัยหนึ่งก็ให้คะแนนเดียวกันกับ (1 / 2,1 / 2,0,0,0,0,0) …

2
สูตร y ~ x + 0 ใน R คำนวณอะไรจริง ๆ
ความแตกต่างทางสถิติระหว่างการทำการถดถอยเชิงเส้นใน R กับformulaชุดเป็นy ~ x + 0แทนที่จะเป็นy ~ xอะไร? ฉันจะตีความผลลัพธ์ที่แตกต่างกันสองแบบได้อย่างไร


1
วิธีการ Bootstrap ทำไม resample“ with replace” แทนที่จะเป็น subsampling แบบสุ่ม
วิธีบูตสแตรปได้เห็นการแพร่กระจายที่ยอดเยี่ยมในปีที่ผ่านมาฉันยังใช้มันมากโดยเฉพาะอย่างยิ่งเพราะเหตุผลที่อยู่เบื้องหลังนั้นค่อนข้างใช้งานง่าย แต่นั่นเป็นสิ่งหนึ่งที่ฉันไม่เข้าใจ เหตุใด Efron จึงเลือกที่จะทำการ resample ด้วยการแทนที่แทนการ subsampling เพียงโดยการสุ่มรวมหรือไม่รวมการสังเกตเดี่ยว ฉันคิดว่าการสุ่มตัวอย่างแบบสุ่มมีคุณภาพดีมากอย่างหนึ่งซึ่งเป็นตัวแทนของสถานการณ์ในชีวิตจริงที่การสังเกตการณ์ที่เรามีในการศึกษาของเราเป็นส่วนย่อยของประชากรสมมุติ ฉันไม่เห็นประโยชน์ของการสังเกตหลายครั้งระหว่างการสุ่มใหม่ ในบริบทจริงไม่มีการสังเกตใดที่คล้ายกันโดยเฉพาะอย่างยิ่งสำหรับสถานการณ์หลายตัวแปรที่ซับซ้อน

2
ฟังก์ชั่นค่าใช้จ่ายข้ามเอนโทรปีในเครือข่ายประสาท
ฉันกำลังดูฟังก์ชั่นค่าใช้จ่ายข้ามเอนโทรปีที่พบในบทช่วยสอนนี้ : C=−1n∑x[ylna+(1−y)ln(1−a)]C=−1n∑x[yln⁡a+(1−y)ln⁡(1−a)]C = -\frac{1}{n} \sum_x [y \ln a+(1−y)\ln(1−a)] เราสรุปอะไรกันแน่? มันเป็นของแน่นอนกว่าแต่และไม่เปลี่ยนกับxทั้งหมดของ 's เป็นปัจจัยการผลิตเข้าไปในหนึ่ง ถูกกำหนดแม้ในย่อหน้าข้างต้นสมการที่เป็นฟังก์ชั่นของผลรวมของทั้งหมดที่ 'และ ' s xxxyyyaaaxxxxxxaaaaaawwwxxx นอกจากนี้ถูกนิยามเป็นจำนวนอินพุตในเซลล์ประสาทนี้โดยเฉพาะใช่ไหม มันเป็นคำพูดเป็น"จำนวนรายการข้อมูลการฝึกอบรม"nnn แก้ไข: ฉันคิดถูกแล้ว C=−1n∑x[ylna+(1−y)ln(1−a)]C=−1n∑x[yln⁡a+(1−y)ln⁡(1−a)]C= -\frac{1}{n} \sum_x [y \ln a+(1−y)\ln(1−a)] จะเป็นฟังก์ชั่นค่าใช้จ่ายสำหรับเครือข่ายทั้งหมดในขณะที่ C=[ylna+(1−y)ln(1−a)]C=[yln⁡a+(1−y)ln⁡(1−a)]C = [y \ln a+(1−y)\ln(1−a)] จะมีค่าใช้จ่ายสำหรับเซลล์ประสาทส่วนบุคคลหรือไม่ ผลรวมไม่ควรอยู่เหนือเซลล์ประสาทขาออกแต่ละอัน?

1
OLS vs. Poisson GLM พร้อมลิงค์ตัวตน
คำถามของฉันเปิดเผยความเข้าใจที่ไม่ดีของฉันเกี่ยวกับการถดถอยปัวซองและ GLMs โดยทั่วไป นี่คือข้อมูลปลอมที่จะแสดงคำถามของฉัน: ### some fake data x=c(1:14) y=c(0, 1, 2, 3, 1, 4, 9, 18, 23, 31, 20, 25, 37, 45) บางฟังก์ชั่นที่กำหนดเองเพื่อกลับ psuedo-R2: ### functions of pseudo-R2 psuR2 &lt;- function(null.dev, model.dev) { 1 - (model.dev / null.dev)} predR2 &lt;- function(actuals, predicted) { 1 - (sum((actuals - predicted)^2)) / …

2
วิธีการฝึกอบรม SVM ผ่านการ backpropagation?
ฉันสงสัยว่าเป็นไปได้ไหมที่จะฝึก SVM (พูดเป็นเส้นตรงเพื่อทำให้เป็นเรื่องง่าย) โดยใช้การขยายภาพย้อนหลัง? ปัจจุบันฉันอยู่ในอุปสรรคเพราะฉันสามารถคิดได้เฉพาะการเขียนผลลัพธ์ของตัวจําแนกเป็น f(x;θ,b)=sgn(θ⋅x−(b+1))=sgn(g(x;θ,b))f(x;θ,b)=sgn(θ⋅x−(b+1))=sgn(g(x;θ,b)) f(\mathbf{x};\theta,b) = \text{sgn}(\theta\cdot\mathbf{x} - (b+1)) = \text{sgn}(g(\mathbf{x};\theta,b)) ดังนั้นเมื่อเราลองและคำนวณ "ย้อนกลับผ่าน" (ข้อผิดพลาดที่แพร่กระจาย) เราจะได้รับ เนื่องจากอนุพันธ์ของsgn(x)คือ dsgn(x)∂E∂x=∂E∂f(x;θ,b)∂f(x;θ,b)x=∂E∂f(x;θ,b)∂sgn(g(x;θ,b))∂g(x;θ,b)∂g(x;θ,b)∂x=δdsgn(z)dzθ=δ⋅0⋅θ=0∂E∂x=∂E∂f(x;θ,b)∂f(x;θ,b)x=∂E∂f(x;θ,b)∂sgn(g(x;θ,b))∂g(x;θ,b)∂g(x;θ,b)∂x=δdsgn(z)dzθ=δ⋅0⋅θ=0 \begin{align} \frac{\partial E}{\partial \mathbf{x}} &= \frac{\partial E}{\partial f(\mathbf{x};\theta,b)} \frac{\partial f(\mathbf{x};\theta,b)}{\mathbf{x}} \\ &= \frac{\partial E}{\partial f(\mathbf{x};\theta,b)} \frac{\partial \text{sgn}(g(\mathbf{x};\theta,b))}{\partial g(\mathbf{x};\theta,b)} \frac{\partial g(\mathbf{x};\theta,b)}{\partial \mathbf{x}} \\ &= \delta \, \frac{d \text{sgn}(z)}{dz} \, \theta \\ &= …

2
วิธีการจำลองข้อมูลเซ็นเซอร์
ฉันสงสัยว่าฉันจะจำลองตัวอย่างของอายุการใช้งานการแจกจ่าย Weibull ได้อย่างไรซึ่งรวมถึงการสังเกตการณ์ที่ถูกตรวจสอบด้วย Type I ตัวอย่างเช่นให้มี n = 3, รูปร่าง = 3, มาตราส่วน = 1 และอัตราการเซ็นเซอร์ = .15, และเวลาการเซ็นเซอร์ = .88 ฉันรู้วิธีสร้างตัวอย่าง Weibull แต่ฉันไม่ทราบวิธีการสร้างข้อมูลเซ็นเซอร์ที่มีการเซ็นเซอร์ประเภทขวาฉันใน R T = rweibull(3, shape=.5, scale=1)

1
ฟังก์ชั่นการสูญเสีย Scikit Binomial Deviance
นี่คือฟังก์ชั่นการสูญเสียส่วนเบี่ยงเบนทวินามของ GradientBoosting def __call__(self, y, pred, sample_weight=None): """Compute the deviance (= 2 * negative log-likelihood). """ # logaddexp(0, v) == log(1.0 + exp(v)) pred = pred.ravel() if sample_weight is None: return -2.0 * np.mean((y * pred) - np.logaddexp(0.0, pred)) else: return (-2.0 / sample_weight.sum() * np.sum(sample_weight * ((y * pred) …

3
เครือข่ายประสาทสามารถเรียนรู้การทำงานและการทำงานของมันได้หรือไม่
ฉันเข้าใจว่าเครือข่ายนิวรัล (NNs) สามารถพิจารณาได้ว่าเป็นผู้ประมาณสากลสำหรับฟังก์ชั่นและอนุพันธ์ภายใต้สมมติฐานบางประการ (ทั้งเครือข่ายและฟังก์ชั่นโดยประมาณ) ในความเป็นจริงฉันได้ทำการทดสอบจำนวนมากเกี่ยวกับฟังก์ชั่นที่เรียบง่าย แต่ไม่สำคัญ (เช่นพหุนาม) และดูเหมือนว่าฉันสามารถประมาณพวกเขาและอนุพันธ์อันดับแรกได้เป็นอย่างดี (ตัวอย่างแสดงไว้ด้านล่าง) อย่างไรก็ตามสิ่งที่ไม่ชัดเจนสำหรับฉันคือว่าทฤษฎีบทที่นำไปสู่การขยาย (หรืออาจจะขยาย) ไปยัง functionals และอนุพันธ์การทำงานของพวกเขา ลองพิจารณาตัวอย่างเช่นการใช้งาน: F[f(x)]=∫badx f(x)g(x)F[f(x)]=∫abdx f(x)g(x)\begin{equation} F[f(x)] = \int_a^b dx ~ f(x) g(x) \end{equation} ด้วยการใช้งานอนุพันธ์: δF[f(x)]δf(x)=g(x)δF[f(x)]δf(x)=g(x)\begin{equation} \frac{\delta F[f(x)]}{\delta f(x)} = g(x) \end{equation} ที่f(x)f(x)f(x)ขึ้นอยู่ทั้งหมดและไม่ใช่นิดบนg(x)g(x)g(x)) NN สามารถเรียนรู้การทำแผนที่ด้านบนและอนุพันธ์ของหน้าที่ได้หรือไม่ โดยเฉพาะอย่างยิ่งหากมีใครแยกโดเมนxxxมากกว่า[a,b][a,b][a,b]และให้f(x)f(x)f(x)(ที่จุดที่ไม่น่าสนใจ) เป็นอินพุตและF[f(x)]F[f(x)]F[f(x)]ในฐานะที่เป็นเอาท์พุท NN สามารถเรียนรู้การทำแผนที่นี้อย่างถูกต้อง (อย่างน้อยในทางทฤษฎี)? ถ้าเป็นเช่นนั้นมันสามารถเรียนรู้อนุพันธ์ของการทำแผนที่ได้หรือไม่ ฉันได้ทำการทดสอบหลายครั้งและดูเหมือนว่า NN อาจเรียนรู้การแมปF[f(x)]F[f(x)]F[f(x)]ได้ในระดับหนึ่ง อย่างไรก็ตามในขณะที่ความถูกต้องของการทำแผนที่นี้ก็โอเค แต่ก็ไม่ได้ยอดเยี่ยม และที่น่าเป็นห่วงก็คืออนุพันธ์ของฟังก์ชันที่คำนวณได้นั้นเป็นขยะที่สมบูรณ์ (ทั้งสองอย่างนี้อาจเกี่ยวข้องกับปัญหาในการฝึกอบรมและอื่น …

1
วิธีการตีความแปลงกล่องหยัก
ในขณะที่ทำ EDA ฉันตัดสินใจใช้พล็อตกล่องเพื่อแสดงความแตกต่างระหว่างสองระดับของปัจจัย วิธีที่ggplotแสดงผลพล็อตกล่องนั้นเป็นที่น่าพอใจ แต่ก็ค่อนข้างง่าย (พล็อตแรกด้านล่าง) ในขณะที่ค้นคว้าลักษณะของกล่องแปลงผมเริ่มทำการทดลองด้วยรอยหยัก ฉันเข้าใจว่ารอยหยักแสดงค่า CI รอบ ๆ ค่ามัธยฐานและหากรอยหยักสองกล่องไม่ทับซ้อนกันก็มี 'หลักฐานที่แข็งแกร่ง' - ที่ระดับความเชื่อมั่น 95% - ค่าเฉลี่ยนั้นแตกต่างกัน ในกรณีของฉัน (พล็อตที่สอง) รอยหยักไม่ทับซ้อนกันอย่างมีความหมาย แต่ทำไมด้านล่างของกล่องทางด้านขวามือจึงมีรูปร่างแปลก ๆ ? การพล็อตข้อมูลเดียวกันในพล็อตไวโอลินไม่ได้ระบุสิ่งผิดปกติเกี่ยวกับความหนาแน่นของความน่าจะเป็นของไวโอลินที่เกี่ยวข้อง

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.