สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
ทำไม P> 0.5 cutoff ไม่“ ดีที่สุด” สำหรับการถดถอยโลจิสติก
คำนำ: ฉันไม่สนใจเกี่ยวกับข้อดีของการใช้ cutoff หรือไม่หรือควรเลือก cutoff ด้วยวิธีใด คำถามของฉันเป็นคณิตศาสตร์อย่างหมดจดและเนื่องจากความอยากรู้ การถดถอยแบบลอจิสติกเป็นแบบจำลองความน่าจะเป็นแบบมีเงื่อนไขหลังของคลาส A กับคลาส B และมันเหมาะกับไฮเปอร์เพลนที่ความน่าจะเป็นแบบเงื่อนไขหลังมีค่าเท่ากัน ดังนั้นในทางทฤษฎีฉันเข้าใจว่า 0.5 การจำแนกจุดจะลดข้อผิดพลาดทั้งหมดโดยไม่คำนึงถึงความสมดุลเนื่องจากมันเป็นแบบจำลองความน่าจะเป็นด้านหลัง (สมมติว่าคุณพบอัตราส่วนระดับเดียวกันอย่างสม่ำเสมอ) ในตัวอย่างชีวิตจริงของฉันฉันได้รับความแม่นยำต่ำมากโดยใช้ P> 0.5 เป็นตัวเลือกการแยกประเภทของฉัน (ความแม่นยำประมาณ 51%) อย่างไรก็ตามเมื่อฉันดูที่ AUC มันสูงกว่า 0.99 ดังนั้นฉันจึงดูค่า cutoff ที่แตกต่างกันและพบว่า P> 0.6 ให้ความแม่นยำ 98% (90% สำหรับคลาสที่เล็กกว่าและ 99% สำหรับคลาสที่ใหญ่กว่า) - มีเพียง 2% ของคดีที่ไม่ได้จัดประเภท ชั้นเรียนมีความไม่สมดุลอย่างมาก (1: 9) และเป็นปัญหาระดับสูง อย่างไรก็ตามฉันจัดสรรคลาสอย่างเท่าเทียมกันในแต่ละชุดการตรวจสอบความถูกต้องไขว้กันเพื่อไม่ให้มีความแตกต่างระหว่างความสมดุลของคลาสระหว่างแบบจำลองพอดีกับการคาดเดา ฉันพยายามใช้ข้อมูลเดียวกันจากตัวแบบและในการทำนายและปัญหาเดียวกันก็เกิดขึ้น ฉันสนใจในเหตุผลที่ 0.5 จะไม่ลดข้อผิดพลาดให้น้อยที่สุดฉันคิดว่านี่น่าจะเป็นเพราะการออกแบบถ้าแบบจำลองนั้นพอดีโดยลดการสูญเสียเอนโทรปี …

2
การเรียนรู้เชิงลึกมีประโยชน์สำหรับการเพิ่มประสิทธิภาพ combinatorial หรือไม่
มีกลุ่มวิจัยที่ทำงานเกี่ยวกับการใช้การเรียนรู้เชิงลึกสำหรับปัญหาการปรับให้เหมาะสมแบบ combinatorial หรือไม่?

1
สถิติที่เพียงพอต่อความสำเร็จร่วมกัน: เครื่องแบบ (a, b)
Letเป็นตัวอย่างที่สุ่มจากการกระจายชุดบนที่&lt;bให้และเป็นสถิติการสั่งซื้อที่ใหญ่ที่สุดและเล็กที่สุด แสดงให้เห็นว่าสถิติเป็นสถิติที่เพียงพอสมบูรณ์ร่วมกันสำหรับพารามิเตอร์B) X=(x1,x2,…xn)X=(x1,x2,…xn)\mathbf{X}= (x_1, x_2, \dots x_n)(a,b)(a,b)(a,b)a&lt;ba&lt;ba < bY1Y1Y_1YnYnY_n(Y1,Yn)(Y1,Yn)(Y_1, Y_n)θ=(a,b)θ=(a,b)\theta = (a, b) ไม่มีปัญหาสำหรับฉันที่จะแสดงความพอเพียงโดยใช้การแยกตัวประกอบ คำถาม:ฉันจะแสดงความสมบูรณ์ได้อย่างไร โดยเฉพาะอย่างยิ่งฉันต้องการคำใบ้ ความพยายาม:ฉันสามารถแสดงหมายถึงสำหรับการแจกชุดพารามิเตอร์แบบเดียว แต่ฉันติดอยู่กับการแจกชุดพารามิเตอร์ทั้งสองE[g(T(x))]=0E[g(T(x))]=0\mathbb E[g(T(x))] = 0g(T(x))=0g(T(x))=0g(T(x)) = 0 ฉันลองเล่นกับและใช้การกระจายแบบร่วมของและแต่ฉันไม่แน่ใจว่าถ้าฉันไปในทิศทางที่ถูกต้องเนื่องจากแคลคูลัสกำลังทำให้ฉันสะดุดE[g(Y1,Yn)]E[g(Y1,Yn)]\mathbb E[g(Y_1, Y_n)]Y1Y1Y_1YnYnY_n

2
วิธีการกำหนดเขตการปฏิเสธเมื่อไม่มี UMP
พิจารณาโมเดลการถดถอยเชิงเส้น ,y=Xβ+uy=Xβ+u\mathbf{y}=\mathbf{X\beta}+\mathbf{u} ,u∼N(0,σ2I)u∼N(0,σ2I)\mathbf{u}\sim N(\mathbf{0},\sigma^2\mathbf{I}) 0E( u ∣ X ) = 0E(u∣X)=0E(\mathbf{u}\mid\mathbf{X})=\mathbf{0} ขอ VS H 1 : σ 2 0 ≠ σ 2H0: σ20= σ2H0:σ02=σ2H_0: \sigma_0^2=\sigma^2H1: σ20≠ σ2H1:σ02≠σ2H_1: \sigma_0^2\neq\sigma^2 เราสามารถอนุมานได้ว่าที่วันที่ฉันm(X)=n×k และเอ็มเอ็กซ์เป็นสัญกรณ์ปกติสำหรับเมทริกซ์สังหาร,MXY= Yที่ YคือตัวแปรYถดถอยบนXYTMXYσ2∼ χ2( n - k )yTMXyσ2∼χ2(n−k)\frac{\mathbf{y}^T\mathbf{M_X}\mathbf{y}}{\sigma^2}\sim \chi^2(n-k)dฉันm ( X ) = n × kdim(X)=n×kdim(\mathbf{X})=n\times kMXMX\mathbf{M_X}MXy = y^MXy=y^\mathbf{M_X}\mathbf{y}=\hat{\mathbf{y}}Y^y^ \hat{\mathbf{y}}Yy\mathbf{y}XX\mathbf{X} หนังสือที่ฉันอ่านระบุดังต่อไปนี้: …

2
เหตุใดจึงใช้กลุ่มบ่วงบาศแทนสายบ่วง
ฉันได้อ่านว่ากลุ่ม lasso ใช้สำหรับการเลือกตัวแปรและ sparsity ในกลุ่มของตัวแปร ฉันต้องการทราบสัญชาตญาณที่อยู่เบื้องหลังการเรียกร้องนี้ เหตุใดจึงเลือกกลุ่มบาศกลุส ทำไมเส้นทางการแก้ปัญหาแบบกลุ่มแบบไม่ต่อเนื่องเป็นเส้นตรง

2
การอธิบายความแปรปรวนของตัวแบบการถดถอย
นี่อาจเป็นคำอธิบายง่ายๆ (ฉันหวังอยู่แล้ว) ฉันได้ทำการวิเคราะห์การถดถอยใน Matlab โดยใช้กล่องเครื่องมือการถดถอย อย่างไรก็ตามฉันได้เจอการศึกษาที่ระบุสิ่งนี้: "การใช้การวิเคราะห์การถดถอยมันเป็นไปได้ที่จะสร้างแบบจำลองการทำนายโดยใช้คุณสมบัติสี่เสียงที่อธิบายความแปรปรวน 60%" ลิงก์ไปยังบทความอยู่ที่นี่หากจำเป็น: บทความ ฉันไม่แน่ใจ 100% ว่านี่หมายถึงอะไร แต่ฉันหวังว่ามันจะง่าย 60% ก็เป็นสิ่งที่ดีเช่นกัน? ฉันพยายามค้นหาสิ่งนี้ แต่เนื่องจากมีเปอร์เซ็นต์ก่อนคำว่า 'ความแปรปรวน' เสมอจึงเป็นการยากที่จะหาคำตอบ
13 variance 

1
Pdf ของกำลังสองของตัวแปรสุ่มปกติมาตรฐาน [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้เป็นไปตามหัวข้อสำหรับการตรวจสอบข้าม ปิดให้บริการใน4 ปีที่แล้ว ฉันมีปัญหานี้ที่ฉันจะต้องพบกับรูปแบบไฟล์ PDF ของ 2 ทั้งหมดที่ผมรู้ก็คือว่ามีการกระจาย(0,1) สิ่งที่ชนิดของการกระจายคือ ? เช่นเดียวกับ ? ฉันจะหา pdf ได้อย่างไร X N ( 0 , 1 ) Y = X 2 XY=X2Y=X2Y = X^2XXXN(0,1)N(0,1)N(0,1)Y=X2Y=X2Y = X^2XXX

2
เกณฑ์ปกติร่วมเป็นเงื่อนไขที่จำเป็นสำหรับการรวมของตัวแปรสุ่มปกติให้เป็นปกติหรือไม่?
ในการแสดงความคิดเห็นต่อไปนี้คำตอบของฉันนี้จะเป็นคำถามที่เกี่ยวข้องกับผู้ใช้ ssdecontrol และ Glen_b ถามว่าปกติร่วมกันของและเป็นสิ่งที่จำเป็นสำหรับการเข้าไปยุ่งเกี่ยวกับภาวะปกติของจำนวนเงินที่ ? แน่นอนว่ามาตรฐานร่วมกันนั้นเพียงพอแล้วเป็นที่รู้จักกันดี คำถามเพิ่มเติมนี้ไม่ได้กล่าวถึงที่นั่นและอาจคุ้มค่าที่จะพิจารณาในสิทธิของตนเองXXXYYYX+YX+YX+Y ฉันจึงถาม ทำมีอยู่ตามปกติตัวแปรสุ่มและดังกล่าวว่า เป็นตัวแปรสุ่มปกติ แต่และมีความไม่ ร่วมกันตัวแปรสุ่มปกติ?XXXYYYX+YX+YX+YXXXYYY หากและไม่จำเป็นต้องมีการแจกแจงแบบปกติดังนั้นจึงเป็นเรื่องง่ายที่จะหาตัวแปรสุ่มแบบปกติเช่นนั้น ตัวอย่างหนึ่งสามารถพบได้ในคำตอบก่อนหน้าของฉัน (ลิงค์ด้านบน) ฉันเชื่อว่าคำตอบของคำถามที่เน้นสีด้านบนคือใช่และได้โพสต์ (สิ่งที่ฉันคิดว่าเป็น) เป็นตัวอย่างสำหรับคำตอบของคำถามนี้XXXYYY

1
เกณฑ์ที่เหมาะสมที่สุดของ F1 คืออะไร จะคำนวณอย่างไร?
ฉันใช้ h2o.glm () ฟังก์ชันใน R ซึ่งให้ตารางฉุกเฉินในผลลัพธ์พร้อมกับสถิติอื่น ๆ ตารางฉุกเฉินจะนำไปสู่ ​​" Cross Tab ตามเกณฑ์ที่เหมาะสมที่สุดของ F1 " Wikipediaกำหนดคะแนน F1 หรือคะแนน F เป็นค่าเฉลี่ยฮาร์มอนิกของความแม่นยำและการเรียกคืน แต่ไม่พบความแม่นยำและการเรียกคืนเฉพาะเมื่อผลลัพธ์ของค่าที่คาดการณ์ไว้ของการถดถอยโลจิสติก (ตัวอย่าง) ถูกแปลงเป็นไบนารีโดยใช้การตัดยอด ตอนนี้จากการตัดออกฉันจำได้ว่าอะไรคือความเชื่อมโยงระหว่างคะแนน F1 และเกณฑ์ที่เหมาะสม เกณฑ์ที่เหมาะสมที่สุดคำนวณอย่างไร เกณฑ์ที่เหมาะสมที่สุดของ F1 คำนวณอย่างไร ขออภัยถ้าฉันพลาดบางอย่างฉันยังใหม่ต่อสถิติที่นี่
13 threshold 

2
สูตรสำหรับช่วงความมั่นใจ 95% สำหรับ
ฉันค้นหาและค้นหาบน stats.stackexchange แต่ไม่พบสูตรการคำนวณช่วงความมั่นใจ 95% สำหรับค่าสำหรับการถดถอยเชิงเส้น ทุกคนสามารถให้ได้หรือไม่R2R2R^2 ยิ่งไปกว่านั้นสมมติว่าฉันใช้การถดถอยเชิงเส้นด้านล่างในอาร์ฉันจะคำนวณช่วงความมั่นใจ 95% สำหรับค่าโดยใช้รหัส R ได้อย่างไรR2R2R^2 lm_mtcars &lt;- lm(mpg ~ wt, mtcars)

3
ผลทางทฤษฎีหลังโครงข่ายประสาทเทียม
ฉันเพิ่งครอบคลุมโครงข่ายประสาทเทียมในหลักสูตรการเรียนรู้ของเครื่อง Coursera และฉันต้องการทราบทฤษฎีเพิ่มเติมเบื้องหลังพวกเขา ฉันพบว่าแรงจูงใจที่พวกเขาเลียนแบบชีววิทยาค่อนข้างน่าพอใจ บนพื้นผิวปรากฏว่าในแต่ละระดับเราแทนที่ covariates ด้วยการรวมกันเชิงเส้นของพวกเขา ด้วยการทำซ้ำ ๆ เราอนุญาตให้มีการปรับโมเดลที่ไม่ใช่เชิงเส้น สิ่งนี้ทำให้เกิดคำถาม: ทำไมบางครั้งเครือข่ายประสาทจึงต้องการที่จะปรับโมเดลที่ไม่ใช่เชิงเส้น โดยทั่วไปแล้วฉันอยากจะรู้ว่าโครงข่ายประสาทเทียมนั้นอยู่ในกรอบของการอนุมานแบบเบย์ซึ่งอธิบายไว้ในรายละเอียดในหนังสือของ ET Jaynes "ทฤษฎีความน่าจะเป็น: ตรรกะของวิทยาศาสตร์" หรือพูดง่ายๆทำไมเครือข่ายประสาทเทียมทำงานเมื่อทำงาน และแน่นอนความจริงที่ว่าพวกเขาทำนายผลสำเร็จนั้นแสดงว่าพวกเขาทำตามกรอบดังกล่าวข้างต้น

1
อะไรคือความแตกต่างระหว่างการตีความเส้นโค้ง GINI และ AUC
เราใช้ในการสร้างเส้นโค้ง GINI โดยใช้การยกที่สร้างขึ้นด้วยความช่วยเหลือของร้อยละของดีและไม่ดีสำหรับการสร้างดัชนีชี้วัด แต่สิ่งที่ฉันได้ศึกษาว่าเส้นโค้ง ROC นั้นถูกสร้างขึ้นโดยใช้เมทริกซ์ความสับสนที่มีความเฉพาะเจาะจง (1- จริงลบ) เป็นแกน x และความไว (บวกจริง) เป็นแกน Y ดังนั้นผลลัพธ์ของ GINI และ ROC จึงเหมือนกันกับข้อแตกต่างอย่างหนึ่งคือสิ่งหลังนั้นคำนึงถึงความสอดคล้องและค่าความไม่ลงรอยกัน (TP, FP, FN, TN)
13 roc  gini 

4
การตีความความแปรปรวนของเอฟเฟกต์แบบสุ่มในเครื่องแปล
ฉันกำลังทบทวนบทความเกี่ยวกับการผสมเกสรซึ่งมีการแจกแจงข้อมูลแบบทวินาม (ผลไม้สุกหรือไม่มี) ดังนั้นฉันจึงใช้เอglmerฟเฟกต์แบบสุ่มหนึ่งอัน (พืชเดี่ยว) และผลคงที่หนึ่งอัน (การรักษา) ผู้ตรวจทานต้องการทราบว่าพืชมีผลต่อชุดผลไม้หรือไม่ แต่ฉันมีปัญหาในการตีความglmerผลลัพธ์ ฉันได้อ่านจากเว็บไซต์และดูเหมือนว่าอาจมีปัญหากับการเปรียบเทียบglmและglmerรุ่นโดยตรงดังนั้นฉันจึงไม่ทำเช่นนั้น ฉันคิดว่าวิธีที่ตรงไปตรงมาที่สุดในการตอบคำถามคือเพื่อเปรียบเทียบความแปรปรวนของเอฟเฟกต์แบบสุ่ม (1.449 ด้านล่าง) กับความแปรปรวนทั้งหมดหรือความแปรปรวนที่อธิบายโดยการรักษา แต่ฉันจะคำนวณผลต่างอื่น ๆ เหล่านี้ได้อย่างไร ดูเหมือนว่าจะไม่รวมอยู่ในผลลัพธ์ด้านล่าง ฉันอ่านบางอย่างเกี่ยวกับความแปรปรวนตกค้างที่ไม่รวมอยู่ในทวินามglmer- ฉันจะตีความความสำคัญสัมพัทธ์ของเอฟเฟกต์แบบสุ่มได้อย่างไร &gt; summary(exclusionM_stem) Generalized linear mixed model fit by maximum likelihood (Laplace Approximation) [glmerMod] Family: binomial ( logit ) Formula: cbind(Fruit_1, Fruit_0) ~ Treatment + (1 | PlantID) AIC BIC logLik deviance …

2
การตีความความแปรปรวนร่วมของสัมประสิทธิ์การถดถอยคืออะไร?
ฟังก์ชัน lm ใน R สามารถพิมพ์ค่าความแปรปรวนร่วมประมาณของสัมประสิทธิ์การถดถอย ข้อมูลนี้ให้อะไรกับเรา? ตอนนี้เราสามารถตีความแบบจำลองได้ดีขึ้นหรือวินิจฉัยปัญหาที่อาจเกิดขึ้นในแบบจำลองได้หรือไม่

2
เมื่อใดจึงควรใช้เครือข่ายแบบเบย์ผ่านวิธีการเรียนรู้ของเครื่องอื่น ๆ ?
ฉันคาดว่าอาจไม่มีคำตอบที่ชัดเจนสำหรับคำถามนี้ แต่ฉันเคยใช้อัลกอริทึมการเรียนรู้ของเครื่องจักรมาหลายครั้งในอดีตและพยายามเรียนรู้เกี่ยวกับ Bayesian Networks ฉันต้องการที่จะเข้าใจภายใต้สถานการณ์ใดหรือคุณต้องการเลือกใช้เครือข่ายแบบเบย์ผ่านวิธีการอื่น ๆ สำหรับปัญหาประเภทใด

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.