สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
การเผยแพร่ข้อผิดพลาด SD vs SE
ฉันมีการวัดลักษณะนิสัยแบบ 3 ถึง 5 ข้อต่อบุคคลในสองเงื่อนไขที่แตกต่างกัน (A และ B) ฉันวางแผนค่าเฉลี่ยสำหรับแต่ละบุคคลในแต่ละสภาพและฉันจะใช้ข้อผิดพลาดมาตรฐาน ( เช่น ,กับ = จำนวนวัด) เป็นแถบข้อผิดพลาด NSD/N−−√SD/NSD/\sqrt{N}NNN ตอนนี้ฉันต้องการพล็อตความแตกต่างระหว่างการวัดเฉลี่ยต่อบุคคลในสภาพ A และเงื่อนไข B ฉันรู้ว่าฉันสามารถระบุข้อผิดพลาดที่แพร่กระจายได้: SD=SD2A+SD2B−−−−−−−−−−√SD=SDA2+SDB2SD=\sqrt{SD_A^2+SD_B^2} แต่ฉันจะเผยแพร่ข้อผิดพลาดมาตรฐานได้อย่างไร (เนื่องจากฉันจัดการกับค่าเฉลี่ยของการวัด) แทนที่จะเป็นค่าเบี่ยงเบนมาตรฐาน มันสมเหตุสมผลหรือไม่?

2
PyMC สำหรับการจัดกลุ่มแบบไม่ใช้พารามิเตอร์: กระบวนการ Dirichlet เพื่อประเมินพารามิเตอร์ของส่วนผสมแบบเกาส์ไม่สามารถทำคลัสเตอร์ได้
การตั้งค่าปัญหา หนึ่งในปัญหาของเล่นครั้งแรกที่ฉันต้องการใช้ PyMC กับการจัดกลุ่มแบบไม่ใช้พารามิเตอร์: ให้ข้อมูลบางส่วนสร้างแบบจำลองเป็นแบบเกาส์และเรียนรู้จำนวนของกลุ่มและค่าเฉลี่ยและความแปรปรวนร่วมของแต่ละกลุ่ม สิ่งที่ฉันรู้เกี่ยวกับวิธีนี้ส่วนใหญ่มาจากการบรรยายทางวิดีโอโดย Michael Jordan และ Yee Whye Teh ประมาณปี 2007 (ก่อนที่จะกลายเป็นความโกรธแค้น) และสองสามวันสุดท้ายของการอ่านบทเรียนของดร. Fonnesbeck และ E. Chen [fn1], [ Fn2] แต่ปัญหาคือการศึกษาที่ดีและมีการใช้งานที่น่าเชื่อถือ [fn3] ในปัญหาของเล่นนี้ฉันสร้างสิบดึงจากหนึ่งมิติเกาส์และสี่สิบวาดจาก . อย่างที่คุณเห็นด้านล่างฉันไม่ได้สลับการสุ่มเพื่อให้ง่ายต่อการบอกว่าตัวอย่างใดมาจากส่วนประกอบผสมN ( μ = 4 , σ = 2 )ยังไม่มีข้อความ( μ = 0 , σ= 1 )N(μ=0,σ=1)\mathcal{N}(\mu=0, \sigma=1)ยังไม่มีข้อความ( μ = 4 , σ= …

2
มันสมเหตุสมผลหรือไม่ที่จะคำนวณช่วงความมั่นใจและเพื่อทดสอบสมมติฐานเมื่อมีข้อมูลจากประชากรทั้งหมด
มันสมเหตุสมผลหรือไม่ที่จะคำนวณช่วงความมั่นใจและเพื่อทดสอบสมมติฐานเมื่อมีข้อมูลจากประชากรทั้งหมด ในความคิดของฉันคำตอบคือไม่เนื่องจากเราสามารถคำนวณค่าที่แท้จริงของพารามิเตอร์ได้อย่างถูกต้อง แต่แล้วสัดส่วนสูงสุดของข้อมูลจากประชากรดั้งเดิมที่อนุญาตให้เราใช้เทคนิคดังกล่าวคืออะไร?

2
Goodness of fit test: คำถามเกี่ยวกับเกณฑ์ทดสอบ Anderson – Darling และCramér – von Mises
ฉันอ่านหน้าเว็บสำหรับความดีของการทดสอบพอดีเมื่อฉันมาถึงการทดสอบแอนเดอ-ดาร์ลิ่งและเกณฑ์Cramér-von Mises จนถึงตอนนี้ฉันก็ได้ประเด็นแล้ว ดูเหมือนว่าการทดสอบแอนเดอ-ดาร์ลิ่งและเกณฑ์Cramér-von Mises จะคล้ายกันเพียงขึ้นอยู่กับฟังก์ชั่นที่แตกต่างกันถ่วงน้ำหนักนอกจากนี้ยังมีความแตกต่างจากเกณฑ์Cramér-von Mises ชื่อการทดสอบวัตสันwww โดยทั่วไปฉันมีสองคำถามที่นี่ มีผลลัพธ์ของ Google ไม่มากนักเกี่ยวกับสองวิธีนี้ พวกเขายังคงสถานะของศิลปะ? หรือถูกแทนที่ด้วยวิธีที่ดีกว่าอยู่แล้ว? เป็นบิตของความประหลาดใจเป็นไปตามบทความนี้เกี่ยวกับการเปรียบเทียบอำนาจของ Shapiro-Wilk, Kolmogorov-Smirnov, Lilliefors และแอนเดอ-ดาร์ลิ่งทดสอบ , AD มีประสิทธิภาพค่อนข้างดี; ดีกว่า Lilliefors และ KS เสมอและใกล้เคียงกับการทดสอบ SW ซึ่งได้รับการออกแบบมาโดยเฉพาะสำหรับการแจกแจงแบบปกติ ช่วงความมั่นใจสำหรับการทดสอบดังกล่าวคืออะไร? สำหรับการทดสอบ AD, CM และ Watson ฉันเห็นตัวแปรสถิติการทดสอบที่กำหนดไว้ในหน้า wiki แต่ไม่พบช่วงความมั่นใจ สิ่งที่เป็นเพียงตรงไปตรงมามากขึ้นสำหรับการทดสอบ KS: บนหน้าวิกิพีเดีย , ช่วงความเชื่อมั่นจะถูกกำหนดโดยซึ่งถูกกำหนดจากฟังก์ชันการกระจายสะสมของKKαKαK_\alphaKKK

6
โมเดลที่ยืดหยุ่นและไม่ยืดหยุ่นในการเรียนรู้ของเครื่อง
ฉันเจอคำถามง่าย ๆ ในการเปรียบเทียบโมเดลที่ยืดหยุ่น (เช่น splines) กับโมเดลที่ไม่ยืดหยุ่น (เช่นการถดถอยเชิงเส้น) ภายใต้สถานการณ์ที่แตกต่างกัน คำถามคือ: โดยทั่วไปเราคาดหวังว่าประสิทธิภาพของวิธีการเรียนรู้ทางสถิติที่ยืดหยุ่นจะทำงานได้ดีขึ้นหรือแย่ลงกว่าวิธีที่ไม่ยืดหยุ่นเมื่อ: จำนวนตัวทำนายพีพีpมีขนาดใหญ่มากและจำนวนการสังเกตnnnนั้นน้อยมาก ความแปรปรวนของข้อกำหนดข้อผิดพลาดคือมีค่าสูงมาก?σ2= Var ( e )σ2=var(อี)σ^2 = \text{Var}(e) ฉันคิดว่าสำหรับ (1) เมื่อมีขนาดเล็กโมเดลที่ยืดหยุ่นได้ดีกว่า (ไม่แน่ใจ) สำหรับ (2) ฉันไม่รู้ว่ารุ่นไหนดีกว่ากันnnn

3
ความสับสนที่เกี่ยวข้องกับตาข่ายยืดหยุ่น
ฉันกำลังอ่านบทความนี้เกี่ยวข้องกับเครือข่ายอีลาสติก พวกเขาบอกว่าพวกเขาใช้ตาข่ายยืดหยุ่นเพราะถ้าเราแค่ใช้ Lasso มันก็มีแนวโน้มที่จะเลือกตัวทำนายเพียงตัวเดียวในกลุ่มที่มีความสัมพันธ์สูง แต่นี่ไม่ใช่สิ่งที่เราต้องการ ฉันหมายความว่ามันช่วยเราจากปัญหาความหลากสีไม่ได้ ข้อเสนอแนะ / ชี้แจง?

1
ทฤษฎีทั่วไปเกี่ยวกับความมั่นคงและความเป็นไปได้เชิงเส้นกำกับของความเป็นไปได้สูงสุด
ฉันสนใจในการอ้างอิงที่ดีสำหรับผลลัพธ์ที่เกี่ยวข้องกับคุณสมบัติเชิงเส้นกำกับของตัวประมาณความน่าจะเป็นสูงสุด พิจารณารูปแบบที่ฉn ( x | θ )เป็นnหนาแน่นมิติและθ nเป็น MLE ตามกลุ่มตัวอย่างX 1 , ... , X nจากf n ( ⋅ ∣ θ{fn(⋅∣θ):θ∈Θ,n∈N}{fn(⋅∣θ):θ∈Θ,n∈N}\{f_n(\cdot \mid \theta): \theta \in \Theta, n \in \mathbb N\}fn(x∣θ)fn(x∣θ)f_n(\mathbf x \mid \theta)nnnθ^nθ^n\hat \theta_nX1,…,XnX1,…,XnX_1, \ldots, X_nfn(⋅∣θ0)fn(⋅∣θ0)f_n(\cdot \mid \theta_0) where θ0θ0\theta_0 is the "true" value of θθ\theta. There are two irregularities …

1
ทำไมนักสถิติจึงไม่ใช้ข้อมูลร่วมกันเพื่อเป็นตัวชี้วัดความสัมพันธ์?
ฉันได้เห็นการพูดคุยสองสามครั้งโดยนักสถิติที่ไม่ใช่พวกเขาดูเหมือนจะนำเสนอมาตรการความสัมพันธ์โดยใช้ข้อมูลร่วมกันมากกว่าการถดถอย ฉันคิดว่ามันมีเหตุผลที่ดีที่นักสถิติไม่ใช้วิธีนี้ ความเข้าใจของคนธรรมดาของฉันคือการประมาณการของข้อมูลเอนโทรปี / ข้อมูลร่วมกันมีแนวโน้มที่จะเป็นปัญหาและไม่เสถียร ฉันถือว่าพลังเป็นปัญหาเช่นกัน: พวกเขาพยายามหลีกเลี่ยงสิ่งนี้โดยอ้างว่าพวกเขาไม่ได้ใช้กรอบการทดสอบแบบพารามิเตอร์ โดยทั่วไปแล้วงานประเภทนี้จะไม่รบกวนการคำนวณพลังงานหรือแม้แต่ความมั่นใจ / ความน่าเชื่อถือ แต่ถ้าจะรับตำแหน่งผู้สนับสนุนของปีศาจมันเป็นการบรรจบกันอย่างช้าๆซึ่งเป็นเรื่องใหญ่เมื่อชุดข้อมูลมีขนาดใหญ่มาก? นอกจากนี้บางครั้งวิธีการเหล่านี้ดูเหมือนจะ "ทำงาน" ในแง่ที่ว่าสมาคมได้รับการตรวจสอบความถูกต้องโดยการศึกษาติดตามผล บทวิจารณ์ที่ดีที่สุดในการใช้ข้อมูลร่วมกันเป็นตัวชี้วัดความเชื่อมโยงคืออะไรและทำไมจึงไม่ใช้กันอย่างแพร่หลายในการฝึกสถิติ แก้ไข: นอกจากนี้ยังมีเอกสารที่ดีที่ครอบคลุมปัญหาเหล่านี้หรือไม่

4
การถดถอยของ x กับ y ดีกว่า y ใน x ในกรณีนี้หรือไม่
เครื่องมือที่ใช้ในการวัดระดับกลูโคสในเลือดของบุคคลนั้นจะถูกตรวจสอบจากกลุ่มตัวอย่าง 10 คน นอกจากนี้ยังมีการวัดระดับด้วยวิธีการทางห้องปฏิบัติการที่แม่นยำมาก เครื่องมือวัดจะถูกแทนด้วย x การวัดขั้นตอนในห้องปฏิบัติการนั้นเขียนด้วย y โดยส่วนตัวแล้วฉันคิดว่า y on x นั้นถูกต้องมากขึ้นเพราะความตั้งใจที่จะใช้เครื่องมือการอ่านเพื่อทำนายการอ่านในห้องปฏิบัติการ และ y on x ลดข้อผิดพลาดของการคาดคะเนดังกล่าว แต่คำตอบที่ให้คือ x กับ y

3
การถดถอยทั่วไปแบบถ่วงน้ำหนักใน BUGS, JAGS
ในRเราสามารถ "น้ำหนักก่อนหน้า" การglmถดถอยผ่านพารามิเตอร์น้ำหนัก ตัวอย่างเช่น: glm.D93 <- glm(counts ~ outcome + treatment, family = poisson(), weights=w) วิธีนี้สามารถทำได้ในJAGSหรือBUGSรูปแบบ? ฉันพบบทความบางส่วนเกี่ยวกับเรื่องนี้ แต่ไม่มีบทความใดแสดงให้เห็น ฉันสนใจตัวอย่างปัวซองและการถดถอยโลจิสติกเป็นส่วนใหญ่

2
เหตุใดจึงยากที่จะรวมความไม่แน่นอนในเอฟเฟกต์แบบสุ่มเมื่อทำการทำนายจากตัวแบบผสม?
มีหลายเธรดใน R-sig-ME เกี่ยวกับการได้รับช่วงความเชื่อมั่นสำหรับการทำนายโดยใช้lme4และnlmeในอาร์ตัวอย่างเช่นที่นี่และที่นี่ในปี 2010 รวมถึงคำอธิบายของ Dougals Bates ซึ่งเป็นหนึ่งในผู้เขียนของทั้งสองแพคเกจ ฉันลังเลที่จะพูดคำต่อคำเพราะเขากลัวว่าพวกเขาจะถูกนำออกไปจากบริบท แต่อย่างไรก็ตามความคิดเห็นหนึ่งที่เขาทำคือ "คุณกำลังรวมพารามิเตอร์และตัวแปรสุ่มเข้ากับการคาดการณ์ของคุณและฉันไม่แน่ใจว่าการประเมินความแปรปรวนของการคาดการณ์เหล่านั้นหมายความว่าอย่างไร Bayesian อาจจะเข้าใจได้ แต่ฉันไม่สามารถเข้าใจได้ " https://stat.ethz.ch/pipermail/r-sig-mixed-models/2010q1/003447.html ฉันรู้ว่าแพ็คเกจ glmm ของ Bayesian MCMCglmmสามารถสร้างช่วงเวลาที่น่าเชื่อถือสำหรับการคาดการณ์ เมื่อเร็ว ๆ นี้รุ่นพัฒนาของlme4on github ได้รับpredictวิธีการ แต่มันมาพร้อมกับความคิดเห็นต่อไปนี้: "@note ไม่มีตัวเลือกสำหรับการคำนวณข้อผิดพลาดมาตรฐานของการทำนายเนื่องจากเป็นการยากที่จะกำหนดวิธีการที่มีประสิทธิภาพซึ่งรวมความไม่แน่นอนในพารามิเตอร์ความแปรปรวนเราขอแนะนำ \ code {\ link {bootMer}} สำหรับงานนี้" https://github.com/lme4/lme4/blob/master/R/predict.R เหตุใดจึงยากที่จะรวมความไม่แน่นอนในเอฟเฟกต์แบบสุ่มเมื่อทำการคาดการณ์จากโมเดลผสมในการตั้งค่าที่ใช้บ่อย

4
การบรรจบกันของน้ำหนักเครือข่ายประสาท
ฉันมาถึงสถานการณ์ที่น้ำหนักของเครือข่ายประสาทของฉันไม่ได้มาบรรจบกันแม้หลังจากการวนซ้ำ 500 ครั้ง เครือข่ายประสาทของฉันมี 1 อินพุตเลเยอร์, ​​1 เลเยอร์ที่ซ่อนอยู่และ 1 เลเยอร์เอาท์พุท พวกมันมีอยู่ประมาณ 230 โหนดใน input layer, 9 nodes ใน hidden layer และ 1 output node ใน output layer ฉันอยากรู้ว่าถ้าฉันหยุดก่อนกำหนด (พูดว่าหยุดการฝึกอบรมเครือข่ายประสาทหลังจากทำซ้ำ 100 ครั้ง) จะมีผลกระทบอะไรกับโมเดลนี้? ยังต้องการที่จะรู้ว่ามาตรฐานอุตสาหกรรมของการทำงานคืออะไรถ้าน้ำหนักในเครือข่ายประสาทไม่ได้มาบรรจบกัน?

2
การเพิ่มเอฟเฟกต์แบบสุ่มมีผลต่อการประมาณค่าสัมประสิทธิ์
ฉันได้รับการสอนเสมอว่าเอฟเฟกต์แบบสุ่มมีอิทธิพลต่อความแปรปรวน (ข้อผิดพลาด) เท่านั้นและเอฟเฟกต์แบบคงที่จะมีอิทธิพลต่อค่าเฉลี่ยเท่านั้น แต่ฉันได้พบตัวอย่างที่ผลกระทบแบบสุ่มมีอิทธิพลต่อค่าเฉลี่ย - การประมาณค่าสัมประสิทธิ์: require(nlme) set.seed(128) n <- 100 k <- 5 cat <- as.factor(rep(1:k, each = n)) cat_i <- 1:k # intercept per kategorie x <- rep(1:n, k) sigma <- 0.2 alpha <- 0.001 y <- cat_i[cat] + alpha * x + rnorm(n*k, 0, sigma) plot(x, y) …

3
การเลือกคุณสมบัติควรทำกับข้อมูลการฝึกอบรมเท่านั้น (หรือข้อมูลทั้งหมด)?
ควรเลือกคุณลักษณะที่ทำกับข้อมูลการฝึกอบรมเท่านั้น (หรือข้อมูลทั้งหมด)? ฉันผ่านการสนทนาและเอกสารเช่นGuyon (2003)และSinghi และ Liu (2006)แต่ก็ยังไม่แน่ใจเกี่ยวกับคำตอบที่ถูก การตั้งค่าการทดสอบของฉันเป็นดังนี้: ชุดข้อมูล: การควบคุมที่ดีต่อสุขภาพ 50 คนและผู้ป่วยโรค 50 คน (คุณสมบัติ cca 200 ที่สามารถเกี่ยวข้องกับการทำนายโรค) ภารกิจคือการวินิจฉัยโรคตามคุณสมบัติที่มีอยู่ สิ่งที่ฉันทำคือ ใช้ชุดข้อมูลทั้งหมดและทำการเลือกคุณสมบัติ (FS) ฉันเก็บเฉพาะคุณสมบัติที่เลือกไว้เพื่อการประมวลผลต่อไป แยกเพื่อทดสอบและฝึกอบรมตัวจําแนกรถไฟโดยใช้ข้อมูลรถไฟและคุณสมบัติที่เลือก จากนั้นใช้ตัวจําแนกเพื่อทดสอบข้อมูล (อีกครั้งโดยใช้เฉพาะคุณสมบัติที่เลือก) ใช้การตรวจสอบความถูกต้องแบบลาก่อน รับความถูกต้องจำแนก ค่าเฉลี่ย: ทำซ้ำ 1) -3) N ครั้ง (100)ยังไม่มีข้อความ= 50ยังไม่มีข้อความ=50N=50 ฉันจะยอมรับว่าการทำ FS กับชุดข้อมูลทั้งหมดสามารถแนะนำอคติบางอย่าง แต่ความเห็นของฉันคือ "เฉลี่ยโดยเฉลี่ย" ในระหว่างการหาค่าเฉลี่ย (ขั้นตอนที่ 4) ถูกต้องหรือไม่ (ความแปรปรวนความแม่นยำคือ&lt; 2 %&lt;2%<2\% ) 1 …

3
การลดขนาดสูญเสียข้อมูลบางส่วนหรือไม่?
เช่นเดียวกับชื่อเรื่องการลดขนาดจะสูญเสียข้อมูลบางส่วนหรือไม่ พิจารณาตัวอย่าง PCA หากข้อมูลที่ฉันมีอยู่น้อยมากฉันจะถือว่า "การเข้ารหัสที่ดีกว่า" สามารถพบได้ (นี่เกี่ยวข้องกับการจัดอันดับของข้อมูลหรือไม่) และไม่มีอะไรจะหายไป

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.