สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
การทดสอบ Signed-Rank Test ของ Wilcoxon จะดีกว่าแบบทดสอบ t-Test หรือ Sign Test อย่างไร
หลังจากการสนทนาบางส่วน (ด้านล่าง) ตอนนี้ฉันมีภาพที่ชัดเจนของคำถามที่มุ่งเน้นดังนั้นนี่คือคำถามที่ได้รับการแก้ไขแม้ว่าความคิดเห็นบางส่วนอาจดูเหมือนไม่เกี่ยวข้องกับคำถามเดิม ดูเหมือนว่าการทดสอบแบบ t- มาบรรจบกันอย่างรวดเร็วสำหรับการแจกแจงแบบสมมาตรซึ่งการทดสอบแบบลงนามจะถือว่าสมมาตรและสำหรับการกระจายแบบสมมาตรนั้นไม่แตกต่างกันระหว่างค่าเฉลี่ย / pseudomedians / ค่ามัธยฐาน ถ้าเป็นเช่นนั้นภายใต้สถานการณ์ใดนักสถิติที่ไม่มีประสบการณ์ค่อนข้างจะพบว่าการทดสอบแบบมีลายเซ็นมีประโยชน์เมื่อเขา / เธอมีทั้งแบบทดสอบ t-test และทดสอบแบบลงชื่อ? หากหนึ่งในนักเรียนของฉัน (เช่นสังคมศาสตร์) กำลังพยายามทดสอบว่าการรักษาหนึ่งทำได้ดีกว่าอีกหรือไม่ (โดยการวัดที่ค่อนข้างง่ายตีความเช่นความคิดของความแตกต่าง "เฉลี่ย") ฉันกำลังดิ้นรนเพื่อหาสถานที่สำหรับการเซ็นชื่อ - การทดสอบยศแม้ว่าโดยทั่วไปแล้วดูเหมือนว่าจะได้รับการสอนและการทดสอบการลงชื่อก็ไม่สนใจในมหาวิทยาลัยของฉัน

2
การแจกแจงเหนือรายการที่เรียงลำดับ
สมมติว่าเรามีรายการสั่งซื้อ [a, b, c, ... x, y, z, ...] ฉันกำลังมองหาตระกูลของการกระจายด้วยการสนับสนุนในรายการข้างต้นปกครองโดยพารามิเตอร์อัลฟาบางอย่างเพื่อที่: สำหรับ alpha = 0 จะกำหนดความน่าจะเป็น1ให้กับรายการแรกด้านบนและ 0 สำหรับส่วนที่เหลือ aนั่นคือถ้าเราลิ้มลองจากรายการนี้ด้วยการเปลี่ยนเรามักจะได้รับ เมื่ออัลฟาเพิ่มขึ้นเราจะกำหนดความน่าจะเป็นที่สูงขึ้นและสูงขึ้นให้กับส่วนที่เหลือของรายการโดยคำนึงถึงลำดับของรายการหลังจากการสลายตัวแบบเอ็กซ์โปเนนเชียล เมื่อ alpha = 1 เรากำหนดความน่าจะเป็นที่เท่ากันให้กับทุกรายการในรายการดังนั้นการสุ่มตัวอย่างจากรายการนั้นคล้ายกับการละเว้นการสั่งซื้อ นี่คล้ายกับการกระจายทางเรขาคณิต แต่มีความแตกต่างที่น่าสังเกต: การกระจายตัวทางเรขาคณิตถูกกำหนดเหนือจำนวนธรรมชาติทั้งหมด ในกรณีของฉันด้านบนรายการมีขนาดคงที่ การแจกแจงเชิงเรขาคณิตไม่ได้ถูกกำหนดไว้สำหรับ alpha = 0

3
ตัวแปรตัวบ่งชี้สำหรับข้อมูลไบนารี: {-1,1} vs {0,1}
ฉันสนใจในการโต้ตอบการรักษาตัวแปรร่วมในบริบทของการทดลอง / ทดลองควบคุมแบบสุ่มกับการรักษาแบบไบนารีตัวบ่งชี้ที่ได้รับมอบหมายTTTT ฉันได้เห็นทั้งและทั้งนี้ขึ้นอยู่กับวิธี / แหล่งที่มาที่เฉพาะเจาะจงสำหรับอาสาสมัครที่ได้รับการรักษาและไม่ได้รับการรักษาตามลำดับT={1,0}T={1,0}T=\{1,0\}T={1,−1}T={1,−1}T=\{1, -1\} มีกฎของหัวแม่มือเมื่อใช้หรือหรือไม่?{1,0}{1,0}\{1,0\}{1,−1}{1,−1}\{1, -1\} การตีความแตกต่างกันอย่างไร

4
"ชุดข้อมูล" มีความหมายอะไรกันแน่?
มันเป็นเพียงการรวมจุดข้อมูล? หรือมันคือการเป็นตัวแทนของจุดข้อมูลสำหรับองค์ประกอบที่แตกต่างกันในรูปแบบตารางจัดเรียงกับค่าของตัวแปรที่แตกต่างกันอย่างไร มันแตกต่างจากข้อมูลดิบอย่างไร

1
คำนวณการทำนายผลแบบสุ่มด้วยตนเองสำหรับโมเดลเชิงเส้นผสม
ฉันกำลังพยายามคำนวณการทำนายผลแบบสุ่มจากแบบจำลองเชิงเส้นผสมด้วยมือและการใช้สัญกรณ์ของ Wood ในแบบจำลองการเติมทั่วไป: การแนะนำด้วย R (pg 294 / pg 307 ของ pdf) ฉันสับสนกับสิ่งที่แต่ละพารามิเตอร์ หมายถึง ด้านล่างนี้เป็นบทสรุปจากไม้ กำหนดรูปแบบผสมเชิงเส้น Y=Xβ+Zb+ϵY=Xβ+Zb+ϵ Y = X\beta + Zb + \epsilon โดยที่ b N (0, ψ ) และϵ ∼ N (0, σ 2 )∼∼\simψψ\psiϵ∼ϵ∼\epsilon \simσ2σ2\sigma^{2} ถ้า b และ y เป็นตัวแปรสุ่มที่มีการแจกแจงปกติร่วม [by]∼N[[0Xβ],[ψΣybΣbyΣθσ2]][by]∼N[[0Xβ],[ψΣbyΣybΣθσ2]]\begin{align*} \begin{bmatrix} b\\ y \end{bmatrix} &\sim N …

2
ค่าเฉลี่ยความหมายแบบมีเงื่อนไขหมายถึงความเป็นกลางและความสอดคล้องของตัวประมาณค่า OLS
พิจารณาโมเดลการถดถอยหลายแบบต่อไปนี้:Y=Xβ+Zδ+U.(1)(1)Y=Xβ+Zδ+U.Y=X\beta+Z\delta+U.\tag{1} นี่คือคือคอลัมน์เวกเตอร์ aเมทริกซ์ ; aคอลัมน์เวกเตอร์ aเมทริกซ์; aเวกเตอร์คอลัมน์; และ , ข้อผิดพลาด, เวกเตอร์คอลัมน์YYYn×1n×1n\times 1XXXn×(k+1)n×(k+1)n\times (k+1)ββ\beta(k+1)×1(k+1)×1(k+1)\times 1ZZZn×ln×ln\times lδδ\deltal×1l×1l\times 1UUUn×1n×1n\times1 คำถาม อาจารย์ของฉันหนังสือแนะนำเศรษฐมิติฉบับที่ 3 โดย James H. Stock and Mark W. Watson, p. 281 และเศรษฐมิติ: Honor's Exam Review Session (PDF) , p. 7 ได้แสดงต่อไปนี้กับฉัน หากเราถือว่าสิ่งที่เรียกว่าความเป็นอิสระแบบมีเงื่อนไขซึ่งตามคำจำกัดความหมายความว่าE(U|X,Z)=E(U|Z),(2)(2)E(U|X,Z)=E(U|Z),E(U|X,Z)=E(U|Z),\tag{2} และถ้าการสันนิษฐานของสี่เหลี่ยมจัตุรัสน้อยที่สุดเป็นไปตามเงื่อนไขยกเว้นค่าศูนย์ที่เป็นเงื่อนไข (ดังนั้นเราจึงถือว่า ) (ดู 1 -3 ด้านล่าง),E(U|X,Z)=0E(U|X,Z)=0E(U|X,Z)=0E(U|X,Z)=E(U|Z)≠0E(U|X,Z)=E(U|Z)≠0E(U|X,Z)=E(U|Z) \neq 0 จากนั้นตัวประมาณ …

2
การทดสอบสัมประสิทธิ์นัยสำคัญในการถดถอยโลจิสติก Lasso
[คำถามที่คล้ายกันถูกถามที่นี่โดยไม่มีคำตอบ] ฉันมีโมเดลการถดถอยโลจิสติกที่มีการทำให้เป็นมาตรฐาน L1 (การถดถอยโลจิสติก Lasso) และฉันต้องการทดสอบค่าสัมประสิทธิ์ที่เหมาะสมสำหรับความสำคัญและรับค่า p ของพวกเขา ฉันรู้ว่าการทดสอบของ Wald (ตัวอย่าง) เป็นตัวเลือกในการทดสอบความสำคัญของสัมประสิทธิ์ส่วนบุคคลในการถดถอยแบบเต็มโดยไม่มีการทำให้เป็นมาตรฐาน แต่ด้วย Lasso ฉันคิดว่าปัญหาอื่น ๆ เกิดขึ้นซึ่งไม่อนุญาตให้ใช้สูตร Wald ตามปกติ ตัวอย่างเช่นการประมาณค่าความแปรปรวน neded สำหรับการทดสอบไม่เป็นไปตามการแสดงออกปกติ กระดาษ Lasso ดั้งเดิม http://statweb.stanford.edu/~tibs/lasso/lasso.pdf แนะนำให้ใช้ขั้นตอนการบูตบู๊ตเพื่อประเมินความแปรปรวนของสัมประสิทธิ์ซึ่งอาจต้องใช้ (อีกครั้งฉันคิดว่า) สำหรับการทดสอบ (ส่วน 2.5 วรรคสุดท้ายของหน้า 272 และจุดเริ่มต้นที่ 273): วิธีการหนึ่งคือผ่าน bootstrap:สามารถแก้ไขได้หรือเราอาจปรับให้เหมาะสมกับสำหรับตัวอย่าง bootstrap แต่ละตัวอย่าง การแก้ไขนั้นคล้ายคลึงกับการเลือกชุดย่อยที่ดีที่สุด ( จากคุณสมบัติ ) แล้วใช้ข้อผิดพลาดมาตรฐานกำลังสองน้อยที่สุดสำหรับชุดย่อยนั้นเสื้อเสื้อtเสื้อเสื้อtเสื้อเสื้อt สิ่งที่ฉันเข้าใจคือ: ติดตั้ง Lasso regression ซ้ำ ๆ …

1
จะตรวจสอบข้ามกับ cv.glmnet (LASSO regression ใน R) ได้อย่างไร?
ฉันสงสัยว่าจะเข้าใกล้การฝึกอบรมและทดสอบแบบจำลอง LASSO โดยใช้ glmnet ใน R ได้อย่างไร โดยเฉพาะฉันสงสัยว่าจะทำอย่างไรหากขาดชุดข้อมูลการทดสอบภายนอกทำให้ฉันต้องใช้การตรวจสอบข้าม (หรือวิธีการอื่นที่คล้ายคลึงกัน) เพื่อทดสอบแบบจำลอง LASSO ของฉัน ให้ฉันทำลายสถานการณ์ของฉัน: ฉันมีชุดข้อมูลเพียงชุดเดียวเพื่อแจ้งและฝึกอบรมโมเดล glmnet ของฉัน ดังนั้นฉันจะต้องใช้การตรวจสอบข้ามเพื่อแยกข้อมูลของฉันเพื่อสร้างวิธีทดสอบโมเดลของฉัน ฉันกำลังใช้อยู่cv.glmnetซึ่งตามรายละเอียดแพ็คเกจ : ทำการตรวจสอบความถูกต้องข้ามของ k-fold สำหรับ glmnet, สร้างพล็อตและส่งกลับค่าสำหรับแลมบ์ดา การตรวจสอบข้ามถูกดำเนินการในcv.glmnetการเลือกแลมบ์ดาที่ดีที่สุดหรือเป็นวิธีการตรวจสอบข้ามโดยทั่วไปหรือไม่ กล่าวอีกนัยหนึ่งฉันยังต้องทำอีกขั้นตอนการตรวจสอบข้ามเพื่อ "ทดสอบ" โมเดลของฉันหรือไม่ ฉันทำงานกับข้อสันนิษฐานที่ว่า "ใช่แล้ว" ในกรณีนี้ฉันจะตรวจสอบcv.glmnetรุ่นของฉันได้อย่างไร ฉันต้องทำด้วยตนเองหรืออาจเป็นcaretฟังก์ชั่นที่มีประโยชน์สำหรับรุ่น glmnet หรือไม่? ฉันจะใช้ "ลูป" สองจุดศูนย์กลางของการตรวจสอบความถูกต้องไขว้หรือไม่ ... ฉันใช้ "ลูปด้านใน" ของ CV ผ่านcv.glmnetเพื่อกำหนดค่าแลมบ์ดาที่ดีที่สุดในแต่ละkเท่าของ "ลูปภายนอก" ของการประมวลผลการตรวจสอบความถูกต้องข้าม ? หากฉันทำการตรวจสอบความถูกต้องของcv.glmnetรูปแบบการตรวจสอบความถูกต้องไขว้ฉันจะแยกโมเดล "ดีที่สุด" (จากแลมบ์ดา "ที่ดีที่สุด") …

2
ตัวอย่างของตัวแปรสุ่มคืออะไร?
ตัวแปรสุ่มถูกกำหนดให้เป็นฟังก์ชั่นที่สามารถวัดได้จากที่หนึ่งσพีชคณิต( Ω 1 , F 1 )ที่มีพื้นฐานการวัดPไปยังอีกσพีชคณิต( Ω 2 , F 2 )XXXσσ\sigma(Ω1,F1)(Ω1,F1)(\Omega_1, \mathcal F_1)PPPσσ\sigma(Ω2,F2)(Ω2,F2)(\Omega_2, \mathcal F_2) เราจะพูดถึงตัวอย่างของตัวแปรสุ่มนี้ได้อย่างไร เราปฏิบัติต่อมันเป็นองค์ประกอบจากΩ 2หรือไม่? หรือเป็นฟังก์ชั่นที่วัดเช่นเดียวกับX ?XnXnX^nΩ2Ω2\Omega_2XXX ฉันจะอ่านเพิ่มเติมเกี่ยวกับเรื่องนี้ได้ที่ไหน ตัวอย่าง: ในการประมาณค่า Monte Carlo เราพิสูจน์ความเป็นกลางของตัวประมาณโดยพิจารณาจากตัวอย่างเพื่อใช้เป็นฟังก์ชัน หากความคาดหวังของตัวแปรสุ่มXถูกกำหนดเป็น(Xn)Nn=1(Xn)n=1N(X^n)_{n = 1}^NXXX E[X]=∫Ω1X(ω1)dP(ω1)E[X]=∫Ω1X(ω1)dP(ω1)\begin{align} \mathbb E[X] = \int_{\Omega_1} X(\omega_1) \,\mathrm dP(\omega_1) \end{align} และสมมติว่าเป็นฟังก์ชันและX n = Xเราสามารถดำเนินการดังนี้:XnXnX^nXn=XXn=XX^n = X E[1N∑n=1Nf(Xn)]=1N∑n=1NE[f(Xn)]=1N∑n=1NE[f(X)]=E[f(X)].E[1N∑n=1Nf(Xn)]=1N∑n=1NE[f(Xn)]=1N∑n=1NE[f(X)]=E[f(X)].\begin{align} \mathbb E\left[\frac{1}{N} \sum_{n …

4
เราจะอธิบายได้อย่างไรว่าตัวประเมินที่ไม่เอนเอียงคืออะไรสำหรับคนธรรมดา?
สมมติว่าเป็นประมาณการที่เป็นกลางสำหรับ\แล้วแน่นอน\ θE[ θ |θ]=θθ^θ^\hat{\theta}θθ\thetaE[θ^∣θ]=θE[θ^∣θ]=θ\mathbb{E}[\hat{\theta} \mid \theta] = \theta เราอธิบายเรื่องนี้กับคนทั่วไปได้อย่างไร? ในอดีตสิ่งที่ฉันพูดคือถ้าคุณเฉลี่ยค่าของเป็นจำนวนมากเมื่อขนาดตัวอย่างใหญ่ขึ้นคุณจะได้ประมาณดีขึ้น θθ^θ^\hat{\theta}θθ\theta สำหรับฉันแล้วนี่เป็นปัญหา ฉันคิดว่าสิ่งที่ฉันอธิบายจริง ๆ นี่คือปรากฏการณ์ของการเป็นแบบไม่ลำเอียงแบบไม่มีสัญญาณแทนที่จะเป็นแบบไม่เอนเอียงคือ ที่\ hat {\ theta}มีแนวโน้มที่จะขึ้นอยู่กับnlimn→∞E[θ^∣θ]=θ,limn→∞E[θ^∣θ]=θ,\lim_{n \to \infty}\mathbb{E}[\hat{\theta} \mid \theta] = \theta\text{,}θ^θ^\hat{\theta}nnn ดังนั้นเราจะอธิบายได้อย่างไรว่าตัวประมาณที่เป็นกลางคืออะไรกับคนธรรมดา?

1
มีการใช้งานตัวอย่างมอนติคาร์โล / MCMC ซึ่งสามารถจัดการกับการกระจายของภาพหลังหรือไม่?
ขณะนี้ฉันใช้วิธีแบบเบย์เพื่อประเมินพารามิเตอร์สำหรับโมเดลที่ประกอบด้วย ODE หลายตัว เนื่องจากฉันมีพารามิเตอร์ 15 ตัวที่จะประมาณพื้นที่การสุ่มตัวอย่างของฉันคือ 15 มิติและการค้นหาการกระจายหลังดูเหมือนว่าจะมีค่าสูงสุดในพื้นที่ซึ่งแยกได้ตามภูมิภาคขนาดใหญ่ที่มีความน่าจะเป็นต่ำมาก สิ่งนี้นำไปสู่ปัญหาการผสมของโซ่ Monte Carlo ของฉันเนื่องจากมันไม่น่าเป็นไปได้มากที่โซ่หนึ่ง "กระโดด" จากจำนวนสูงสุดในท้องถิ่นเดียวและบังเอิญโดนหนึ่งในยอดเขาอื่น ๆ โดยไม่ตั้งใจ ดูเหมือนว่าจะมีงานวิจัยจำนวนมากในพื้นที่นี้เนื่องจากเป็นเรื่องง่ายที่จะหาเอกสารที่เกี่ยวข้องกับปัญหานี้ (ดูด้านล่าง) แต่การค้นหาการใช้งานจริงนั้นยาก ฉันพบแพ็คเกจที่เกี่ยวข้องกับการเปลี่ยนแปลงของโมเลกุล แต่ไม่ใช่การอนุมานแบบเบย์ มีการใช้งานตัวอย่าง MC (MC) MC ซึ่งสามารถจัดการกับ maxima แบบแยกได้หรือไม่ ฉันถูกบังคับให้ทำงานกับ Matlab เพราะนั่นคือสิ่งที่ฉันเขียนในแบบจำลอง ODE ดังนั้นข้อเสนอเกี่ยวกับ Matlab ยินดีต้อนรับมากที่สุด ;-) อย่างไรก็ตามหากมี "แอพพลิเคชั่นนักฆ่า" ในภาษาอื่น ๆ บางทีฉันสามารถโน้มน้าวให้ PI ของฉันเปลี่ยน ;-) ขณะนี้ฉันกำลังทำงานกับตัวอย่าง Monte Carlo Delayed- Reject / …

1
การจำลองผลลัพธ์สำหรับการถดถอยเชิงเส้น glmnet โดยใช้เครื่องมือเพิ่มประสิทธิภาพทั่วไป
ฐานะที่เป็นรัฐชื่อฉันพยายามที่จะทำซ้ำผลจากการ glmnet เชิงเส้นโดยใช้เพิ่มประสิทธิภาพ LBFGS lbfgsจากห้องสมุด เครื่องมือเพิ่มประสิทธิภาพนี้ช่วยให้เราสามารถเพิ่มคำศัพท์ปกติ L1 โดยไม่ต้องกังวลเกี่ยวกับความแตกต่างตราบใดที่ฟังก์ชันวัตถุประสงค์ของเรา (ไม่มีคำศัพท์ปกติของ L1) นั้นเป็นนูน ปัญหาการถดถอยเชิงเส้นแบบยืดหยุ่นสุทธิในกระดาษ glmnetนั้นได้รับโดย ที่X \ in \ mathbb {R} ^ {n \ times p}คือเมทริกซ์การออกแบบy \ in \ mathbb {R} ^ pเป็นเวกเตอร์ของการสังเกต\ alpha \ in [0,1]คือพารามิเตอร์เน็ตยืดหยุ่นและ\ lambda> 0คือพารามิเตอร์การทำให้เป็นมาตรฐาน โอเปอเรเตอร์\ Vert x \ Vert_pหมายถึงบรรทัดฐาน Lp ปกติminβ∈Rp12n∥β0+Xβ−y∥22+αλ∥β∥1+12(1−α)λ∥β∥22minβ∈Rp12n‖β0+Xβ−y‖22+αλ‖β‖1+12(1−α)λ‖β‖22\min_{\beta \in \mathbb{R}^p} \frac{1}{2n}\Vert \beta_0 + X\beta …

5
โมเดลการจำแนกประเภทที่ตีความได้มากที่สุด
ยกเว้นต้นไม้ตัดสินใจและการถดถอยโลจิสติกโมเดลการจำแนกประเภทอื่นใดที่ให้การตีความที่ดี ฉันไม่สนใจความถูกต้องหรือพารามิเตอร์อื่น ๆ การตีความผลลัพธ์เป็นสิ่งสำคัญเท่านั้น

4
ความแตกต่างระหว่างโครงข่ายประสาทและการเรียนรู้อย่างลึกซึ้ง
ในแง่ของความแตกต่างระหว่างโครงข่ายประสาทและการเรียนรู้เชิงลึกเราสามารถแสดงรายการได้หลายรายการเช่นมีเลเยอร์เพิ่มขึ้นชุดข้อมูลขนาดใหญ่ฮาร์ดแวร์คอมพิวเตอร์ทรงพลังเพื่อให้การฝึกอบรมมีความซับซ้อน นอกจากนี้มีคำอธิบายรายละเอียดเพิ่มเติมเกี่ยวกับความแตกต่างระหว่าง NN และ DL หรือไม่?

1
ความสัมพันธ์ระหว่างอัตราการเรียนรู้และจำนวนเลเยอร์ที่ซ่อนอยู่?
มีกฎของหัวแม่มือระหว่างความลึกของเครือข่ายประสาทและอัตราการเรียนรู้หรือไม่? ฉันสังเกตเห็นว่ายิ่งเครือข่ายลึกเท่าไรอัตราการเรียนรู้ก็จะยิ่งต่ำลงเท่านั้น หากถูกต้องทำไมถึงเป็นเช่นนั้น

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.