สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
วิธีที่เหมาะสมในการจัดการกับตารางฉุกเฉิน 3 ระดับ
ฉันมีตารางฉุกเฉินสามระดับโดยมีข้อมูลการนับสปีชีส์หลายชนิดพืชโฮสต์ที่พวกเขาถูกรวบรวมและการสะสมนั้นเกิดขึ้นในวันที่ฝนตกหรือไม่ (อันนี้สำคัญจริงๆ!) เมื่อใช้ R ข้อมูลปลอมอาจเป็นดังนี้: count <- rpois(8, 10) species <- rep(c("a", "b"), 4) host <- rep(c("c","c", "d", "d"), 2) rain <- c(rep(0,4), rep(1,4)) my.table <- xtabs(count ~ host + species + rain) , , rain = 0 species host a b c 12 15 d 10 13 , , …

2
วิธีตัวอย่าง X อย่างรวดเร็วถ้า exp (X) ~ Gamma
ฉันมีปัญหาในการสุ่มตัวอย่างอย่างง่ายโดยที่วงในของฉันดูเหมือน: v = sample_gamma(k, a) โดยที่sample_gammaตัวอย่างจากการแจกแจงแกมม่าเป็นตัวอย่าง Dirichlet มันใช้งานได้ดี แต่สำหรับค่าบางส่วนของ k / a การคำนวณ downstream underflows บางส่วน ฉันปรับมันเพื่อใช้ตัวแปรพื้นที่บันทึก: v = log(sample_gamma(k, a)) หลังจากปรับโปรแกรมที่เหลือทั้งหมดมันทำงานได้อย่างถูกต้อง (อย่างน้อยมันก็ให้ผลลัพธ์ที่แน่นอนเหมือนกันในกรณีทดสอบ) อย่างไรก็ตามมันช้ากว่าเดิม มีวิธีการโดยตรงตัวอย่างโดยไม่ใช้ฟังก์ชั่นช้าเช่นlog ( ) ? ฉันลอง googling สำหรับสิ่งนี้ แต่ฉันไม่รู้ด้วยซ้ำว่าการกระจายนี้มีชื่อสามัญ (log-gamma?)X, ประสบการณ์( X) ∼ GammaX,exp⁡(X)∼GammaX, \exp(X) \sim \text{Gamma}เข้าสู่ระบบ( )log⁡()\log()

1
ข้อผิดพลาดประเภทโดยรวมเมื่อทำการทดสอบข้อมูลที่สะสมซ้ำ ๆ
ฉันมีคำถามเกี่ยวกับกลุ่มวิธีการตามลำดับ ตามที่ Wikipedia: ในการทดลองแบบสุ่มกับกลุ่มการรักษาสองกลุ่มการทดสอบตามลำดับกลุ่มแบบดั้งเดิมจะใช้ในลักษณะดังต่อไปนี้: หากมีอาสาสมัครในแต่ละกลุ่มมีการวิเคราะห์ระหว่างกาลจะดำเนินการในอาสาสมัคร 2n การวิเคราะห์ทางสถิติจะดำเนินการเพื่อเปรียบเทียบทั้งสองกลุ่มและหากยอมรับสมมติฐานทางเลือกการทดลองจะสิ้นสุดลง มิเช่นนั้นการทดลองจะดำเนินต่อไปสำหรับวิชา 2n อีกวิชาโดยมี n วิชาต่อกลุ่ม การวิเคราะห์ทางสถิติจะดำเนินการอีกครั้งในวิชา 4n หากทางเลือกได้รับการยอมรับการทดลองจะสิ้นสุดลง มิฉะนั้นจะดำเนินการประเมินเป็นระยะ ๆ จนกว่าจะมีตัวแบบ N 2 ชุดให้เลือก เมื่อมาถึงจุดนี้การทดสอบทางสถิติครั้งสุดท้ายจะดำเนินการและการทดลองจะถูกยกเลิก แต่ด้วยการทดสอบข้อมูลที่สะสมซ้ำ ๆ ในแบบนี้ระดับความผิดพลาดที่เป็นประเภทที่สูงเกินจริง ... หากตัวอย่างเป็นอิสระจากกันข้อผิดพลาดประเภท I โดยรวมจะเป็นα⋆α⋆\alpha^{\star} α⋆= 1 - ( 1 - α )kα⋆=1−(1−α)k\alpha^{\star} = 1 - (1 - \alpha)^k โดยที่คือระดับของการทดสอบแต่ละครั้งและคือจำนวนการค้นหาระหว่างกาลkαα\alphakkk แต่ตัวอย่างไม่ได้เป็นอิสระเนื่องจากทับซ้อนกัน สมมติว่าการวิเคราะห์ระหว่างกาลจะดำเนินการที่เพิ่มขึ้นของข้อมูลเท่ากันจะพบว่า (สไลด์ 6) คุณช่วยอธิบายให้ฉันฟังว่าตารางนี้ได้มาอย่างไร

2
ฉันควรรู้อะไรเกี่ยวกับการออกแบบอัลกอริทึม Hybrid / Hamiltonian Monte Carlo ที่ดี?
ฉันกำลังออกแบบอัลกอริทึมการสุ่มตัวอย่างแบบไฮบริดมอนติคาร์โลสำหรับPyMCและฉันพยายามทำให้มันยุ่งยากและเป็นไปได้โดยทั่วไปดังนั้นฉันกำลังมองหาคำแนะนำที่ดีในการออกแบบอัลกอริทึม HMC ฉันได้อ่านบทสำรวจของ RadfordและBeskos et กระดาษล่าสุดของการปรับจูน (ขนาดขั้นตอน) ที่เหมาะสมของ HMC และฉันได้รวบรวมเคล็ดลับต่อไปนี้: ตัวแปรโมเมนตัมควรแจกจ่ายด้วยความแปรปรวนร่วม , โดยทั่วไปคืออะไรบางอย่างเช่นเมทริกซ์ความแปรปรวนร่วมของการแจกแจง (สำหรับการแจกแจงแบบง่าย), แต่อาจแตกต่างกันไป โดยค่าเริ่มต้นฉันใช้ hessian ที่โหมดC−1C−1C^{-1}CCC ควรคำนวณวิถีด้วยวิธี leapfrog (ผู้ประกอบการรายอื่นดูเหมือนจะไม่คุ้มค่า) อัตราการยอมรับที่เหมาะสมคือ. 651 สำหรับปัญหาที่มีขนาดใหญ่มากและสูงกว่านั้น ขนาดสเต็ปควรถูกปรับสัดส่วนเช่นโดยที่เป็นตัวแปรอิสระและคือจำนวนมิติL×d(1/4)L×d(1/4)L\times d^{(1/4)}LLLddd ขนาดของขั้นตอนควรมีขนาดเล็กลงเมื่อมีหางแสงหรือภูมิภาคอื่นที่มีลักษณะความมั่นคงแปลก การสุ่มขนาดขั้นตอนสามารถช่วยได้ มีความคิดอื่น ๆ ที่ฉันควรนำมาใช้หรืออย่างน้อยพิจารณา? เอกสารอื่น ๆ ที่ฉันควรอ่าน? ตัวอย่างเช่นมีอัลกอริทึมขนาดขั้นตอนการปรับตัวที่คุ้มค่าหรือไม่ มีคำแนะนำที่ดีเกี่ยวกับความยาววิถีหรือไม่? ในความเป็นจริงแล้วผู้ประกอบการที่ดีกว่า บางคนได้โปรดทำให้ชุมชนนี้เป็นวิกิ

2
GLM หลังจากการเลือกรุ่นหรือการทำให้เป็นมาตรฐาน
ฉันอยากจะถามคำถามนี้ในสองส่วน ทั้งสองจัดการกับโมเดลเชิงเส้นทั่วไป แต่ข้อตกลงแรกกับการเลือกรูปแบบและข้อตกลงอื่น ๆ ที่มีการทำให้เป็นมาตรฐาน ความเป็นมา:ฉันใช้โมเดล GLMs (แบบเชิงเส้นโลจิสติกส์การถดถอยแบบแกมม่า) สำหรับการทำนายและคำอธิบาย เมื่อฉันอ้างถึง " สิ่งปกติที่เกิดขึ้นกับการถดถอย " ฉันหมายถึงคำอธิบายด้วย (i) ช่วงความมั่นใจรอบค่าสัมประสิทธิ์ (ii) ช่วงความเชื่อมั่นรอบการทำนายและ (iii) การทดสอบสมมติฐานเกี่ยวกับการรวมกันเชิงเส้นของสัมประสิทธิ์เช่น " มีความแตกต่างระหว่างการรักษา A และการรักษา B หรือไม่ " คุณสูญเสียความสามารถในการทำสิ่งเหล่านี้อย่างถูกกฎหมายโดยใช้ทฤษฎีปกติภายใต้ข้อใดข้อหนึ่งต่อไปนี้หรือไม่? และถ้าเป็นเช่นนั้นสิ่งเหล่านี้จะดีสำหรับแบบจำลองที่ใช้สำหรับการทำนายที่บริสุทธิ์หรือไม่? I.เมื่อ GLM มีความเหมาะสมผ่านกระบวนการคัดเลือกแบบบางรุ่น (สำหรับรูปสมส่วนบอกขั้นตอนแบบขั้นตอนตาม AIC) ครั้งที่สอง เมื่อ GLM เหมาะสมผ่านวิธีการทำให้เป็นมาตรฐาน (พูดโดยใช้ glmnet ใน R) ความรู้สึกของฉันคือสำหรับฉันคำตอบคือในทางเทคนิคที่คุณควรใช้ bootstrap สำหรับ " สิ่งปกติที่ทำกับการถดถอย " แต่ไม่มีใครปฏิบัติตามนั้น เพิ่ม: …

7
แพ็คเกจการขุดข้อความสำหรับ R คืออะไรและมีโปรแกรมขุดข้อความโอเพ่นซอร์สอื่น ๆ อีกหรือไม่
คุณสามารถแนะนำแพ็คเกจการขุดข้อความใน R ที่สามารถใช้กับข้อมูลจำนวนมากได้หรือไม่? ประการที่สองมี GUI สำหรับแพ็คเกจการขุดข้อความใน R หรือไม่? ประการที่สามมีอีกโปรแกรมขุดข้อความโอเพนซอร์สที่ใช้งานง่ายและใช้งานง่ายหรือไม่
12 r  text-mining 

1
ออนไลน์วิธีการทางสถิติที่ปรับขนาดได้
นี่คือแรงบันดาลใจจากการถดถอยเชิงเส้นออนไลน์ที่มีประสิทธิภาพซึ่งฉันพบว่าน่าสนใจมาก มีข้อความหรือแหล่งข้อมูลใดบ้างที่อุทิศให้กับการคำนวณทางสถิติขนาดใหญ่โดยการคำนวณด้วยชุดข้อมูลที่ใหญ่เกินไปที่จะพอดีกับหน่วยความจำหลัก ตัวอย่างเช่นเป็นไปได้หรือไม่ที่จะใส่โมเดลเอฟเฟกต์แบบผสมเข้ากับแฟชั่นออนไลน์ มีใครบ้างไหมที่มองหาผลกระทบของการแทนที่เทคนิคการเพิ่มประสิทธิภาพลำดับที่ 2 มาตรฐานสำหรับ MLE ด้วยลำดับที่ 1 เทคนิคประเภท SGD

5
วัดระยะทางที่ดีที่สุดที่จะใช้
บริบท ฉันมีข้อมูลสองชุดที่ฉันต้องการเปรียบเทียบ แต่ละองค์ประกอบข้อมูลในทั้งสองชุดเป็นเวกเตอร์ที่มี 22 มุม (ทั้งหมดระหว่างและ ) มุมนั้นเกี่ยวข้องกับรูปแบบท่าถ่ายรูปของมนุษย์ที่กำหนดดังนั้นท่ามุมจึงถูกกำหนดโดยมุมต่อ 22 มุมเธ−π−π-\piππ\pi ในที่สุดสิ่งที่ฉันพยายามทำคือกำหนด "ความใกล้ชิด" ของข้อมูลสองชุด ดังนั้นสำหรับแต่ละท่า (เวกเตอร์ 22D) ในชุดเดียวฉันต้องการค้นหาเพื่อนบ้านที่ใกล้ที่สุดในชุดอื่นและสร้างพล็อตระยะทางสำหรับคู่ที่ใกล้ที่สุด คำถาม ฉันสามารถใช้ระยะทางแบบยุคลิดหรือไม่? เพื่อให้มีความหมายฉันคิดว่าการวัดระยะทางจะต้องมีการกำหนดเป็น: , โดยที่คือค่าสัมบูรณ์และ mod คือ modulo แล้วใช้ที่เกิด 22 Thetas ผมสามารถดำเนินการคำนวณระยะทางยุคลิดมาตรฐาน2}| . . . | √θ=|θ1−θ2|modπθ=|θ1−θ2|modπ\theta = |\theta_1 - \theta_2| \quad mod \quad \pi|...||...||...|t21+t22+…+t222−−−−−−−−−−−−−−√t12+t22+…+t222\sqrt{t_1^2 + t_2^2 + \ldots + t_{22}^2} ถูกต้องหรือไม่ การวัดระยะทางอื่นจะมีประโยชน์มากกว่าเช่นไคสแควร์หรือ …

4
การวิเคราะห์ข้อมูลลมด้วย R
สวัสดีฉันกำลังทำการวิเคราะห์ข้อมูลลมเพื่อประเมินพลังงานจากกังหันลม ฉันใช้เวลา 10 ปีของข้อมูลลมและทำกราฟฮิสโตแกรม ขั้นตอนที่สองของฉันคือการกระจายข้อมูล Weibull ให้พอดีกับข้อมูล ฉันใช้ R พร้อมแพ็คเกจlmomเพื่อคำนวณรูปร่าง Weibul และมาตราส่วนนี่คือรหัสที่ฉันใช้: >library(lmom) wind.moments<-samlmu(as.numeric(pp$WS)) moments<-pelwei(wind.moments) x.wei<-rweibull(n=length(pp$WS), shape=moments["delta"], scale=moments["beta"]) hist(as.numeric(pp$WS), freq=FALSE) lines(density(x.wei), col="red", lwd=4) ดูเหมือนว่ามีความล่าช้าระหว่างข้อมูลและฟังก์ชันความหนาแน่น คุณช่วยฉันได้ไหม คำถามอื่นคือคุณสามารถช่วยฉันในการคำนวณพลังงานประจำปีจากฟังก์ชันความหนาแน่นได้หรือไม่ ขอบคุณ
12 r  distributions 

4
การตั้งค่า Sweave, R, ลาเท็กซ์, Eclipse StatET [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้เป็นไปตามหัวข้อสำหรับการตรวจสอบข้าม ปิดให้บริการใน3 ปีที่ผ่านมา ไม่กี่วันที่ผ่านมาฉันเห็นโพสต์เกี่ยวกับวิธีตั้งค่า SweaveR ซึ่งจะอนุญาตให้ผู้ใช้ส่งออกสิ่งต่าง ๆ โดยตรงเช่นตารางกราฟ ฯลฯ ไปยัง Latex ฉันไม่สามารถทำตามคำแนะนำได้ ทุกคนสามารถให้คำแนะนำทีละขั้นตอนเกี่ยวกับวิธีการทำได้ทั้ง Mac และ Windows
12 r 

2
Split-Plot ANOVA: การทดสอบเปรียบเทียบแบบใน R
ฉันจะทดสอบเอฟเฟกต์ใน ANOVA แบบแยกส่วนได้อย่างไรโดยใช้การเปรียบเทียบแบบจำลองที่เหมาะสมสำหรับใช้กับXและMข้อโต้แย้งของanova.mlm()ใน R ฉันคุ้นเคยกับ?anova.mlmDalgaard (2007) [1] น่าเสียดายที่มันมีเฉพาะแปรงแบบแยกส่วน การทำเช่นนี้ในการออกแบบแบบสุ่มอย่างสมบูรณ์ด้วยสองปัจจัยภายในวิชา: N <- 20 # 20 subjects total P <- 3 # levels within-factor 1 Q <- 3 # levels within-factor 2 DV <- matrix(rnorm(N* P*Q), ncol=P*Q) # random data in wide format id <- expand.grid(IVw1=gl(P, 1), IVw2=gl(Q, 1)) # intra-subjects layout …

2
ฉันจะทราบวิธีการประมาณค่าพารามิเตอร์ที่จะเลือกได้อย่างไร
มีวิธีการค่อนข้างน้อยสำหรับการประมาณค่าพารามิเตอร์ที่นั่น MLE, UMVUE, MoM, การตัดสินใจเชิงทฤษฎีและอื่น ๆ ทั้งหมดดูเหมือนว่าพวกเขามีเหตุผลเชิงเหตุผลว่าทำไมพวกเขาถึงมีประโยชน์สำหรับการประมาณค่าพารามิเตอร์ มีวิธีใดวิธีหนึ่งที่ดีกว่าวิธีอื่นหรือเป็นเพียงแค่วิธีที่เรากำหนดว่าตัวประเมินที่ "เหมาะสมที่สุด" (คล้ายกับวิธีการลดข้อผิดพลาด orthogonal ให้เกิดการประมาณที่แตกต่างจากวิธีกำลังสองน้อยที่สุด)?

2
80% ของข้อมูลที่ขาดหายไปในตัวแปรเดียว
มีตัวแปรหนึ่งในข้อมูลของฉันมี 80% ของข้อมูลที่ขาดหายไป ข้อมูลขาดหายไปเนื่องจากไม่มีอยู่จริง (เช่นจำนวนเงินกู้ของธนาคารที่ บริษัท ค้างชำระ) ฉันเจอบทความที่บอกว่าวิธีการปรับตัวแปร dummy เป็นวิธีแก้ปัญหานี้ หมายความว่าฉันต้องเปลี่ยนตัวแปรต่อเนื่องนี้เป็นหมวดหมู่หรือไม่ นี่เป็นทางออกเดียวหรือไม่? ฉันไม่ต้องการวางตัวแปรนี้ตามที่คิดในทางทฤษฎีมันเป็นสิ่งสำคัญสำหรับคำถามการวิจัยของฉัน

3
ฉันสามารถใช้การถดถอยแบบหลายครั้งได้หรือไม่เมื่อฉันมีตัวทำนายที่เป็นหมวดหมู่และแบบต่อเนื่องผสมกัน?
ดูเหมือนว่าคุณสามารถใช้การเข้ารหัสสำหรับตัวแปรเด็ดขาดหนึ่งตัว แต่ฉันมีตัวแปรเด็ดขาดสองตัวและตัวแปรทำนายต่อเนื่องหนึ่งตัว ฉันสามารถใช้การถดถอยแบบหลายครั้งใน SPSS ได้หรือไม่และอย่างไร? ขอบคุณ!

2
การทดสอบทางสถิติสำหรับค่าทำนายผลบวกและลบ
ฉันอ่านกระดาษและเห็นตารางเปรียบเทียบ PPV (Positive Predictive Value) กับ NPV (Negative Predictive Value) พวกเขาทำการทดสอบทางสถิติบางอย่างสำหรับพวกเขานี่เป็นภาพร่างของตาราง: PPV NPV p-value 65.9 100 < 0.00001 ... ทุกแถวหมายถึงตารางฉุกเฉินเฉพาะ พวกเขาทดสอบสมมติฐานอะไร ขอบคุณ!

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.