สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
การแจกแจงแบบ t มีหางที่หนักกว่าการแจกแจงแบบปกติ
ในบันทึกการบรรยายของฉันมันบอกว่า การแจกแจงแบบทีดูเหมือนปกติ แต่มีหางที่หนักกว่าเล็กน้อย ฉันเข้าใจว่าทำไมมันจึงดูเป็นปกติ (เพราะทฤษฎีบทขีด จำกัด กลาง) แต่ฉันมีเวลายากที่จะเข้าใจวิธีการพิสูจน์ทางคณิตศาสตร์ว่ามันมีหางที่หนักกว่าการแจกแจงแบบปกติและหากมีวิธีการวัดจนถึงระดับที่หนักกว่าการกระจายแบบปกติ

2
จำนวนของช่องเก็บเมื่อคำนวณข้อมูลร่วมกัน
ฉันต้องการหาปริมาณความสัมพันธ์ระหว่างตัวแปรสองตัวคือ A และ B โดยใช้ข้อมูลร่วมกัน วิธีการคำนวณก็คือการทำข้อสังเกต (ดูตัวอย่างโค้ดไพ ธ อนด้านล่าง) อย่างไรก็ตามสิ่งที่ปัจจัยกำหนดจำนวนถังขยะที่เหมาะสม? ฉันต้องการการคำนวณที่รวดเร็วดังนั้นฉันจึงไม่สามารถใช้ถังขยะจำนวนมากเพื่อความปลอดภัย from sklearn.metrics import mutual_info_score def calc_MI(x, y, bins): c_xy = np.histogram2d(x, y, bins)[0] mi = mutual_info_score(None, None, contingency=c_xy) return mi

3
โครงสร้างของโครงข่ายประสาทเทียม (LSTM, GRU)
ฉันพยายามที่จะเข้าใจสถาปัตยกรรมของ RNNs ฉันพบบทช่วยสอนนี้ซึ่งมีประโยชน์มาก: http://colah.github.io/posts/2015-08-Understanding-LSTMs/ โดยเฉพาะภาพนี้: สิ่งนี้เหมาะสมกับเครือข่าย feed-forward หรือไม่? ภาพนี้เป็นเพียงโหนดอื่นในแต่ละเลเยอร์หรือไม่

2
วิธี coxph ของ R () จัดการกับมาตรการซ้ำ ๆ ได้อย่างไร?
บริบท ฉันพยายามที่จะเข้าใจว่า Rox coxph () ยอมรับและจัดการรายการซ้ำ ๆ สำหรับวิชา (หรือผู้ป่วย / ลูกค้าถ้าคุณต้องการ) บางคนเรียกรูปแบบยาวนี้บางคนเรียกว่า 'มาตรการซ้ำ' ดูตัวอย่างชุดข้อมูลที่มีคอลัมน์ ID ในส่วนคำตอบที่: แพ็คเกจที่ดีที่สุดสำหรับรุ่น Cox ที่แปรเปลี่ยนตามเวลา ยังถือว่าโควาเรียตมีการเปลี่ยนแปลงตลอดเวลาและมีตัวแปรเซ็นเซอร์หนึ่งตัว (เช่นเหตุการณ์) ซึ่งเป็นไบนารี คำถาม 1) ในคำตอบของลิงก์ด้านบนหาก ID ไม่ได้รับเป็นพารามิเตอร์ในการเรียกไปยัง coxph () ผลลัพธ์ควรเหมือนกับการรวม cluster (ID) เป็นพารามิเตอร์ใน coxph () หรือไม่? ฉันพยายามค้นหาเอกสาร แต่ดูเหมือนว่าจะไม่ได้ระบุที่อยู่อย่างชัดเจน (1): https://stat.ethz.ch/pipermail/r-help//2013-July/357466.html 2) ถ้าคำตอบของ (1) คือ 'ไม่' ดังนั้น (ทางคณิตศาสตร์) ทำไม? ดูเหมือนว่าคลัสเตอร์ () …

1
การใช้ค่ามัธยฐานสำหรับการคำนวณผลต่าง
ฉันมีตัวแปรสุ่ม 1 มิติซึ่งเบ้มาก เพื่อเป็นการทำให้การกระจายนี้เป็นแบบปกติฉันต้องการใช้ค่ามัธยฐานแทนค่าเฉลี่ย คำถามของฉันคือ: ฉันสามารถคำนวณความแปรปรวนของการแจกแจงโดยใช้ค่ามัธยฐานในสูตรแทนค่าเฉลี่ยได้หรือไม่? เช่นฉันสามารถแทนที่ V a r (X) = ∑ [ (Xผม- m e a n ( X))2] / nVaR(X)=Σ[(Xผม-ม.อีan(X))2]/n \mathrm{Var}(X) = \sum[(X_i - \mathrm{mean}(X))^2]/n กับ V a r (X) = ∑ [ (Xผม- m e d i a n ( X))2] / nVaR(X)=Σ[(Xผม-ม.อีdผมan(X))2]/n \mathrm{Var}(X) = \sum[(X_i …
10 variance  mean  median 

3
ใช้การถดถอยกับโครงการนอกช่วงข้อมูลตกลงหรือไม่ ไม่เคยตกลง บางครั้งก็โอเค?
คุณคิดอย่างไรเกี่ยวกับการใช้การถดถอยกับโครงการนอกช่วงข้อมูล หากเราแน่ใจว่ามันเป็นไปตามรูปแบบเชิงเส้นหรือพลังงานรูปแบบนั้นจะไม่เป็นประโยชน์นอกเหนือจากช่วงข้อมูลหรือไม่ เช่นฉันมีปริมาณการขับเคลื่อนด้วยราคา เราควรจะสามารถคาดการณ์ราคานอกช่วงข้อมูลที่ฉันเชื่อ ความคิดของคุณ? VOL PRICE 3044 4.97 2549 4.97 3131 4.98 2708 4.98 2860 4.98 2907 4.98 3107 4.98 3194 4.98 2753 4.98 3228 4.98 3019 4.98 3077 4.99 2597 4.99 2706 4.99 3000 4.99 3022 4.99 3084 4.99 3973 4.99 3675 4.99 3065 4.99 3407 4.99 2359 …

1
Bayes ที่แปรผันรวมกับ Monte Carlo
ฉันกำลังอ่าน Bayes แปรปรวนและเมื่อฉันเข้าใจมันลงมาจากแนวคิดที่ว่าคุณประมาณ (โดยที่คือตัวแปรแฝงของโมเดลของคุณและข้อมูลที่สังเกต) ด้วยฟังก์ชัน , ทำให้ข้อสันนิษฐานที่เป็นตัวประกอบว่าโดยที่เป็นเซตย่อยของตัวแปรแฝง จากนั้นจะสามารถแสดงให้เห็นว่าปัจจัยที่เหมาะสมที่สุดคือ: p(z∣x)p(z∣x)p(z\mid x)zzzxxxq(z)q(z)q(z)qqqqi(zi)qi(zi)q_i(z_i)ziziz_iqi(zi)qi(zi)q_i(z_i)q∗i(zi)=⟨lnp(x,z)⟩z/i+const.qi∗(zi)=⟨ln⁡p(x,z)⟩z/i+const. q^*_i(z_i) = \langle \ln p(x, z)\rangle_{z/i} + \text{const.} ที่ไหนวงเล็บมุมแสดงความคาดหวังมากกว่าตัวแปรแฝงทั้งหมดยกเว้นเกี่ยวกับการกระจาย(z)ziziz_iq(z)q(z)q(z) ตอนนี้นิพจน์นี้มักถูกประเมินผลเชิงวิเคราะห์เพื่อให้คำตอบที่แน่นอนกับมูลค่าเป้าหมายโดยประมาณ อย่างไรก็ตามมันเกิดขึ้นกับฉันว่าเนื่องจากนี่เป็นความคาดหวังแนวทางที่ชัดเจนคือประมาณความคาดหวังนี้โดยการสุ่มตัวอย่าง นี่จะให้คำตอบโดยประมาณสำหรับฟังก์ชันเป้าหมายโดยประมาณ แต่มันทำให้เป็นอัลกอริธึมที่ง่ายมากบางทีสำหรับกรณีที่วิธีการวิเคราะห์ไม่เป็นไปได้ คำถามของฉันคือนี่เป็นวิธีการที่รู้จักหรือไม่? มันมีชื่อหรือไม่? มีเหตุผลว่าทำไมมันอาจทำงานได้ไม่ดีหรืออาจไม่ให้อัลกอริธึมแบบง่าย ๆ ?

1
อนุพันธ์ของการสูญเสียเอนโทรปีใน word2vec
ฉันกำลังพยายามหาทางแก้ไขปัญหาชุดแรกของเนื้อหาหลักสูตรออนไลน์ของ cs224d stanford และฉันมีปัญหาบางอย่างเกี่ยวกับปัญหา 3A: เมื่อใช้แบบจำลองข้าม word2vec กับฟังก์ชั่นการทำนายแบบ softmax และฟังก์ชั่นการสูญเสียเอนโทรปี ต้องการคำนวณการไล่ระดับสีเทียบกับเวกเตอร์คำที่คาดคะเน เมื่อได้รับฟังก์ชั่น softmax: wi^=Pr(wordi∣r^,w)=exp(wTir^)∑|V|jexp(wTjr^)wi^=Pr(wordi∣r^,w)=exp⁡(wiTr^)∑j|V|exp(wjTr^) \hat{w_i} = \Pr(word_i\mid\hat{r}, w) = \frac{\exp(w_i^T \hat{r})}{\sum_{j}^{|V|}exp(w_j^T\hat{r})} และฟังก์ชั่นข้ามเอนโทรปี: CE(w,w^)=−∑kwklog(wk^)CE(w,w^)=−∑kwklog(wk^)CE(w, \hat{w}) = -\sum\nolimits_{k} w_klog(\hat{w_k}) เราจำเป็นต้องคำนวณ∂CE∂r^∂CE∂r^\frac{\partial{CE}}{\partial{\hat{r}}} ขั้นตอนของฉันมีดังนี้: CE(w,w^)=−∑|V|kwklog(exp(wTkr^)∑|V|jexp(wTjr^))CE(w,w^)=−∑k|V|wklog(exp⁡(wkTr^)∑j|V|exp(wjTr^))CE(w, \hat{w}) = -\sum_{k}^{|V|} w_klog(\frac{\exp(w_k^T \hat{r})}{\sum_{j}^{|V|}exp(w_j^T\hat{r})}) =−∑|V|kwklog(exp(wTkr^)−wklog(∑|V|jexp(wTjr^))=−∑k|V|wklog(exp⁡(wkTr^)−wklog(∑j|V|exp(wjTr^))= -\sum_{k}^{|V|} w_klog(\exp(w_k^T \hat{r}) - w_klog(\sum_{j}^{|V|}exp(w_j^T\hat{r})) ตอนนี้ได้รับwkwkw_kเป็นหนึ่งเวกเตอร์ร้อนและฉันเป็นชั้นที่ถูกต้อง: CE(w,w^)=−wTir^+log(∑|V|jexp(wTjr^))CE(w,w^)=−wiTr^+log(∑j|V|exp(wjTr^))CE(w, \hat{w}) = - w_i^T\hat{r} + log(\sum_{j}^{|V|}exp(w_j^T\hat{r})) ∂CE∂r^=−wi+1∑|V|jexp(wTjr^)∑|V|jexp(wTjr^)wj∂CE∂r^=−wi+1∑j|V|exp(wjTr^)∑j|V|exp(wjTr^)wj\frac{\partial{CE}}{\partial{\hat{r}}} …

2
แนวโน้มอัตราการรอดชีวิตในกรณีศึกษาการควบคุม
ฉันส่งบทความที่ถูกปฏิเสธเนื่องจากวิธีการวิเคราะห์การเอาตัวรอดที่ไม่เหมาะสม ผู้ชี้ขาดไม่มีรายละเอียดหรือคำอธิบายอื่นใดนอกเหนือจาก: "การวิเคราะห์การเอาชีวิตรอดตามแนวโน้มเวลาต้องใช้วิธีการเซ็นเซอร์ที่ซับซ้อนยิ่งขึ้น" คำถาม: ความเสี่ยงส่วนเกินของการเสียชีวิตของผู้สูบบุหรี่ลดลงในทศวรรษที่ผ่านมาหรือไม่? ข้อมูล: ผู้สูบบุหรี่ 25,000 คนในเยอรมนี พวกเขาลงทะเบียนในการศึกษาในช่วงเวลาระหว่างปี 1995 และ 2014 แต่ละสูบบุหรี่ได้รับการจับคู่ (ในช่วงเวลาของการลงทะเบียน) กับเพศและอายุการจับคู่การควบคุมจากประชากรทั่วไป (ที่ไม่สูบบุหรี่) ฉันมีเวลาที่แน่นอนของการเสียชีวิตสำหรับทุกคนที่เสียชีวิตในช่วงระยะเวลาการศึกษาทั้งหมด คนที่ไม่ตายระหว่างการติดตามจะถูกเซ็นเซอร์ การศึกษานี้มีจุดประสงค์เพื่อตรวจสอบความเสี่ยงส่วนเกินของการเสียชีวิตของผู้สูบบุหรี่ในแต่ละปีตั้งแต่ปี 2538-2557 จุดมุ่งหมายคือการคำนวณ: อัตราอุบัติการณ์การเสียชีวิตของผู้สูบบุหรี่และผู้ไม่สูบบุหรี่ในแต่ละปีและตรวจสอบแนวโน้มเหล่านี้ ความเสี่ยงส่วนเกินของการเสียชีวิตในหมู่ผู้สูบบุหรี่ในแต่ละปี (หรือระยะเวลาไม่กี่ปีติดต่อกัน) ควรวิเคราะห์ข้อมูลอย่างไร จำได้ไหมว่าคนที่รวมอยู่ในปี 1998 อาจเสียชีวิตในปี 2558 แนวทางที่ถูกต้องในการใช้รูปแบบกระบวนการนับด้วยการเริ่มต้นและหยุดการอัปเดตสำหรับแต่ละปีหรือไม่ นี่คือวิธีการที่ผู้ตัดสินไม่ชอบ: อัตราอุบัติการณ์ถูกคำนวณโดยวิธีการปัวซงถดถอย เรารวมเวลาติดตามเป็นตัวชดเชยในโมเดลและรวมอายุเพศสถานะการสูบบุหรี่และช่วงเวลาตามปฏิทิน (รวมสองปีติดต่อกัน) เป็นตัวทำนายในโมเดล จากนั้นคำนวณอัตราต่อ 1,000 คนต่อปีโดยใช้ฟังก์ชั่นทำนาย () ของอาร์ระยะเวลาชดเชย (ติดตามผล) คือระยะเวลาการสังเกตทั้งหมดของบุคคล (วัน) จากการลงทะเบียน ใช้แบบจำลอง Cox เพื่อประเมินความเสี่ยงสัมพัทธ์สำหรับผู้สูบบุหรี่ในแต่ละช่วงเวลาตั้งแต่ต้นจนจบการศึกษา เพื่อความง่ายเราเปรียบเทียบอัตราส่วนอันตรายในช่วงแรกกับอัตราส่วนอันตรายในช่วงสุดท้าย ปัญหา: …

1
การตีความของ sparsity นี้ถูกต้องหรือไม่?
ตามเอกสารของremoveSparseTermsฟังก์ชั่นจากtmแพคเกจนี่คือสิ่งที่ sparsity นำมาซึ่ง: A term-document matrix where those terms from x are removed which have at least a sparse percentage of empty (i.e., terms occurring 0 times in a document) elements. I.e., the resulting matrix contains only terms with a sparse factor of less than sparse. ดังนั้นการตีความที่ถูกต้องของสิ่งนี้คือการพูดว่าถ้าsparseเท่ากับ 0.99 เราจะลบคำที่ปรากฏในที่สุด 1% …

6
สัญกรณ์เป็นอย่างไร
สัญกรณ์อ่านอย่างไร? มันเป็นต่อไปนี้การกระจายปกติ? หรือคือการกระจายปกติ? หรือบางทีเป็นปกติประมาณ ..X∼N(μ,σ2)X∼N(μ,σ2)X\sim N(\mu,\sigma^2)XXX XXX XXX เกิดอะไรขึ้นถ้ามีตัวแปรหลายตัวที่ตามมา (หรือคำใดก็ตาม) การกระจายตัวเดียวกัน มันเขียนอย่างไร

3
การระบุคุณสมบัติที่กรองหลังจากการเลือกคุณสมบัติด้วย scikit เรียนรู้
นี่คือรหัสของฉันสำหรับวิธีการเลือกคุณสมบัติใน Python: from sklearn.svm import LinearSVC from sklearn.datasets import load_iris iris = load_iris() X, y = iris.data, iris.target X.shape (150, 4) X_new = LinearSVC(C=0.01, penalty="l1", dual=False).fit_transform(X, y) X_new.shape (150, 3) แต่หลังจากได้ X ใหม่ (ตัวแปรตาม - X_new) ใหม่ฉันจะรู้ได้อย่างไรว่าตัวแปรใดที่ถูกลบและตัวแปรใดที่ถูกพิจารณาในตัวแปรที่อัพเดทใหม่นี้ (อันใดอันหนึ่งที่ถูกลบหรือที่สามอยู่ในข้อมูล) เหตุผลในการรับรหัสนี้คือการใช้การกรองแบบเดียวกันกับข้อมูลการทดสอบใหม่

1
การตรวจสอบความถดถอยแบบไขว้ใน R
ฟังก์ชัน R cv.glm (ไลบรารี่: บูต) คำนวณข้อผิดพลาดในการทำนายการตรวจสอบความถูกต้องข้ามแบบ K-fold สำหรับโมเดลเชิงเส้นทั่วไปและส่งกลับเดลต้า มันเหมาะสมหรือไม่ที่จะใช้ฟังก์ชั่นนี้สำหรับการถดถอยแบบ lasso (ไลบรารี่: glmnet) และถ้าเป็นเช่นนั้นจะสามารถดำเนินการได้อย่างไร? ไลบรารี glmnet ใช้ cross-validation เพื่อให้ได้พารามิเตอร์การกลึงที่ดีที่สุด แต่ฉันไม่พบตัวอย่างใด ๆ ที่ cross-validates สมการ glmnet สุดท้าย

2
"พารามิเตอร์ส่วนประกอบความแปรปรวน" ในรูปแบบเอฟเฟกต์ผสมคืออะไร
ในหน้า 12 ของหนังสือของBates เกี่ยวกับตัวแบบผสมเอฟเฟกต์เขาอธิบายแบบจำลองดังต่อไปนี้: ใกล้ถึงจุดสิ้นสุดของภาพหน้าจอเขากล่าวถึง ปัจจัยความแปรปรวนร่วม ΛθΛθ\Lambda_{\theta}ทั้งนี้ขึ้นอยู่กับพารามิเตอร์แปรปรวนองค์ประกอบ ,θθ\theta โดยไม่อธิบายว่าความสัมพันธ์คืออะไร พูดว่าเราได้รับแล้วเราจะได้มาได้อย่างไรθθ\thetaΛθΛθ\Lambda_{\theta} ในบันทึกที่เกี่ยวข้องนี่เป็นหนึ่งในหลาย ๆ ตัวอย่างที่ฉันพบว่าการจัดแสดงของเบตส์มีรายละเอียดเล็กน้อย มีข้อความที่ดีกว่าที่จริงแล้วผ่านกระบวนการปรับให้เหมาะสมของการประมาณค่าพารามิเตอร์และหลักฐานสำหรับการแจกแจงสถิติการทดสอบหรือไม่?

3
ความสัมพันธ์ระหว่างของการถดถอยอย่างง่ายและการถดถอยหลายครั้ง
คำถามพื้นฐานที่เกี่ยวข้องกับการถดถอย OLS ของR2R2R^2 เรียกใช้ OLS regression y ~ x1 เรามีบอกว่า 0.3R2R2R^2 รัน OLS regression y ~ x2 เรามีอีกอันบอกว่า 0.4R2R2R^2 ตอนนี้เราเรียกใช้การถดถอย y ~ x1 + x2 ค่า R ของการถดถอยนี้มีค่าเท่าไหร่ ฉันคิดว่ามันชัดเจนว่าสำหรับการถดถอยหลายครั้งไม่ควรน้อยกว่า 0.4 แต่เป็นไปได้หรือที่จะมากกว่า 0.7?R2R2R^2

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.