สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
มีวิธีในการประมาณค่าพารามิเตอร์การกระจายที่ได้รับเพียงแค่จำนวน
มีวิธีที่จะพอดีกับการกระจายที่ระบุถ้าคุณได้รับเพียงไม่กี่ quantiles? ตัวอย่างเช่นถ้าฉันบอกคุณว่าฉันมีชุดข้อมูลแกมม่ากระจายและเชิงประจักษ์ 20%, 30%, 50% และ 90% - คุณสมบัติคือตามลำดับ: 20% 30% 50% 90% 0.3936833 0.4890963 0.6751703 1.3404074 ฉันจะไปและประมาณค่าพารามิเตอร์ได้อย่างไร มีหลายวิธีในการทำเช่นนั้นหรือมีขั้นตอนเฉพาะอยู่แล้ว? แก้ไขเพิ่มเติม:ฉันไม่ได้ขอการกระจายแกมม่าโดยเฉพาะนี่เป็นเพียงตัวอย่างเพราะฉันกังวลว่าฉันไม่สามารถอธิบายคำถามได้อย่างเหมาะสม งานของฉันคือฉันมี quantiles ที่กำหนด (2-4) และต้องการประเมินพารามิเตอร์ (1-3) ของการแจกแจงไม่กี่อย่างที่เป็น "ปิด" ที่สุด บางครั้งมีวิธีแก้ปัญหาที่แน่นอน (หรือไม่มีที่สิ้นสุด) บางครั้งไม่ถูกต้องใช่ไหม

3
วิธีการทดสอบว่ากลุ่มย่อยหมายถึงแตกต่างจากกลุ่มโดยรวมที่มีกลุ่มย่อยหรือไม่
ฉันจะทดสอบได้อย่างไรว่าค่าเฉลี่ย (เช่นความดันโลหิต) ของกลุ่มย่อย (เช่นผู้ที่เสียชีวิต) แตกต่างจากกลุ่มทั้งหมด (เช่นทุกคนที่เป็นโรครวมถึงผู้ที่เสียชีวิต)? เห็นได้ชัดว่ากลุ่มแรกเป็นกลุ่มย่อยของกลุ่มที่สอง ฉันควรใช้การทดสอบสมมติฐานแบบใด

1
การกระจายค่าประมาณค่าลักษณะเฉพาะสำหรับข้อมูล iid (สม่ำเสมอหรือปกติ)
สมมติว่าฉันมีชุดข้อมูลด้วย ddd ขนาด (เช่น d= 20d=20d=20) เพื่อให้แต่ละมิติคือ iid Xผม∼ คุณ[ 0 ; 1 ]Xi∼U[0;1]X_i \sim U[0;1] (อีกทางหนึ่งแต่ละมิติ Xผม∼ N[ 0 ; 1 ]Xi∼N[0;1]X_i \sim \mathcal N[0;1]) และเป็นอิสระจากกัน ตอนนี้ฉันวาดวัตถุสุ่มจากชุดข้อมูลนี้และรับ k = 3 ⋅ dk=3⋅dk=3\cdot dเพื่อนบ้านที่ใกล้ที่สุดและคำนวณ PCA ในชุดนี้ ตรงกันข้ามกับสิ่งที่เราคาดหวังค่าลักษณะเฉพาะนั้นไม่เหมือนกันทั้งหมด ในเครื่องแบบ 20 มิติผลลัพธ์ทั่วไปจะเป็นดังนี้: 0.11952316626613427, 0.1151758808663646, 0.11170020254046743, 0.1019390988585198, 0.0924502502204256, 0.08716272453538032, 0.0782945015348525, 0.06965903935713605, 0.06346159593226684, 0.054527131148532824, …

2
พารามิเตอร์การบูตแบบกึ่งพารามิเตอร์และแบบไม่มีพารามิเตอร์สำหรับรุ่นผสม
ตัดต่อไปนี้จะนำมาจากบทความนี้ ฉันเป็นมือใหม่ในการบู๊ตสแตรปและพยายามที่จะใช้การบู๊ตสแปปปิ้งแบบกึ่งพารามิเตอร์แบบกึ่งพารามิเตอร์และแบบไม่มีพารามิเตอร์สำหรับแบบจำลองเชิงเส้นผสมกับR bootแพ็คเกจ รหัส R นี่คือRรหัสของฉัน: library(SASmixed) library(lme4) library(boot) fm1Cult <- lmer(drywt ~ Inoc + Cult + (1|Block) + (1|Cult), data=Cultivation) fixef(fm1Cult) boot.fn <- function(data, indices){ data <- data[indices, ] mod <- lmer(drywt ~ Inoc + Cult + (1|Block) + (1|Cult), data=data) fixef(mod) } set.seed(12345) Out <- boot(data=Cultivation, statistic=boot.fn, R=99) …
9 r  mixed-model  bootstrap  central-limit-theorem  stable-distribution  time-series  hypothesis-testing  markov-process  r  correlation  categorical-data  association-measure  meta-analysis  r  anova  confidence-interval  lm  r  bayesian  multilevel-analysis  logit  regression  logistic  least-squares  eda  regression  notation  distributions  random-variable  expected-value  distributions  markov-process  hidden-markov-model  r  variance  group-differences  microarray  r  descriptive-statistics  machine-learning  references  r  regression  r  categorical-data  random-forest  data-transformation  data-visualization  interactive-visualization  binomial  beta-distribution  time-series  forecasting  logistic  arima  beta-regression  r  time-series  seasonality  large-data  unevenly-spaced-time-series  correlation  statistical-significance  normalization  population  group-differences  demography 

1
วิธีการวัดความไม่แน่นอนเชิงสถิติ
ฉันค่อนข้างใหม่กับสถิติและเข้าใจว่าคำถามของฉันอาจผิดไปอย่างสิ้นเชิง ฉันกำลังทดสอบอัลกอริทึมของตัวเองกับที่อื่น ในขณะที่ผลลัพธ์ไม่เหมือนกันฉันต้องการแสดงให้เห็นว่าความแตกต่างนั้น "ไม่มีนัยสำคัญทางสถิติ" ฉันจะหาจำนวนนี้เพื่อทำให้ประเด็นของฉันได้อย่างไร

1
จะวัดความสัมพันธ์ระหว่างตัวแปรเด็ดขาดอย่างไร [ซ้ำ]
คำถามนี้มีคำตอบอยู่ที่นี่แล้ว : ความสัมพันธ์ระหว่างตัวแปรเด็ดขาด (1 คำตอบ) ปิดให้บริการใน6 เดือนที่ผ่านมา ฉันรู้ว่าเราสามารถใช้ Spearman rho เพื่อวัดความสัมพันธ์ระหว่างตัวแปรตัวเลข แต่จะวัดความสัมพันธ์ระหว่างตัวแปรเด็ดขาดได้อย่างไร

1
การถดถอยหลายครั้งพร้อมตัวแปรทำนายที่ขาดหายไป
สมมติว่าเราได้รับชุดข้อมูลของฟอร์มและ{n-1}) เราจะได้รับงานของการทำนายขึ้นอยู่กับค่าของxเราประเมินการถดถอยสองจุดโดยที่: (y,x1,x2,⋯,xn)(y,x1,x2,⋯,xn)(y,x_{1},x_{2},\cdots, x_{n})(y,x1,x2,⋯,xn−1)(y,x1,x2,⋯,xn−1)(y,x_{1},x_{2},\cdots, x_{n-1})yyyxxxyy=f1(x1,⋯,xn−1,xn)=f2(x1,⋯,xn−1)(1)(2)(1)y=f1(x1,⋯,xn−1,xn)(2)y=f2(x1,⋯,xn−1) \begin{align} y &=f_{1}(x_{1},\cdots, x_{n-1}, x_{n}) \tag{1} \\ y &=f_{2}(x_{1},\cdots, x_{n-1}) \tag{2} \end{align} นอกจากนี้เรายังประเมินการถดถอยที่ทำนายค่าของตามค่าของนั่นคือ: xnxnx_{n}(x1,⋯,xn−1)(x1,⋯,xn−1)(x_{1},\cdots, x_{n-1})xn=f3(x1,⋯,xn−1)(3)(3)xn=f3(x1,⋯,xn−1) x_{n}=f_{3}(x_{1},\cdots, x_{n-1}) \tag{3} สมมติว่าตอนนี้เราได้รับค่าของจากนั้นเราจะมีสองวิธีที่แตกต่างกันในการทำนาย :(x1,⋯,xn−1)(x1,⋯,xn−1)(x_{1},\cdots, x_{n-1})yyy yy=f1(x1,⋯,xn−1,f3(x1,⋯,xn−1))=f2(x1,⋯,xn−1)(4)(5)(4)y=f1(x1,⋯,xn−1,f3(x1,⋯,xn−1))(5)y=f2(x1,⋯,xn−1) \begin{align} y&=f_{1}(x_{1},\cdots, x_{n-1},f_{3}(x_{1},\cdots,x_{n-1})) \tag{4} \\ y&=f_{2}(x_{1},\cdots, x_{n-1}) \tag{5} \end{align} โดยทั่วไปอันไหนดีกว่ากัน? ฉันเดาว่าสมการแรกจะดีกว่าเพราะใช้ข้อมูลจากจุดข้อมูลสองรูปแบบในขณะที่สมการที่สองใช้ข้อมูลจากจุดข้อมูลเฉพาะที่มีค่าตัวทำนายสถิติการฝึกอบรมของฉันมี จำกัด และฉันต้องการคำแนะนำจากผู้เชี่ยวชาญn−1n−1n-1 นอกจากนี้โดยทั่วไปแล้ววิธีการที่ดีที่สุดสำหรับข้อมูลที่มีข้อมูลไม่สมบูรณ์คืออะไร ในคำอื่น ๆ วิธีการที่เราสามารถดึงข้อมูลมากที่สุดจากข้อมูลที่ไม่ได้มีค่าในทุกมิติ?nnn

3
อคติการตอบสนองการกระจายขึ้นอยู่กับการถดถอยป่าแบบสุ่ม
ฉันใช้แพ็คเกจ randomForest ใน R (R เวอร์ชั่น 2.13.1, randomForest เวอร์ชัน 4.6-2) สำหรับการถดถอยและสังเกตเห็นอคติที่สำคัญในผลลัพธ์ของฉัน: ข้อผิดพลาดในการทำนายขึ้นอยู่กับค่าของตัวแปรการตอบสนอง ค่าสูงนั้นคาดการณ์ไม่ได้และค่าต่ำจะทำนายค่ามากเกินไป ตอนแรกฉันสงสัยว่านี่เป็นผลมาจากข้อมูลของฉัน แต่ตัวอย่างง่าย ๆ ดังต่อไปนี้แสดงให้เห็นว่านี่เป็นสิ่งที่เกิดขึ้นจากอัลกอริธึมการสุ่มป่า: n = 1000; x1 = rnorm(n, mean = 0, sd = 1) response = x1 predictors = data.frame(x1=x1) rf = randomForest(x=predictors, y=response) error = response-predict(rf, predictors) plot(x1, error) ฉันสงสัยว่าอคตินั้นขึ้นอยู่กับการกระจายตัวของการตอบสนองตัวอย่างเช่นหากx1กระจายอย่างสม่ำเสมอจะไม่มีอคติ ถ้าx1มีการแจกแจงแบบ exponential อคติคือด้านเดียว โดยพื้นฐานแล้วค่าของการตอบสนองที่ส่วนท้ายของการแจกแจงแบบปกติคือค่าผิดปกติ …

3
คาดว่าจะมีประสิทธิภาพที่ดีที่สุดในชุดข้อมูล
ว่าฉันมีปัญหาการเรียนรู้เครื่องอย่างง่ายเช่นการจำแนกประเภท ด้วยเกณฑ์มาตรฐานบางอย่างในการมองเห็นหรือการรับรู้เสียงฉันในฐานะมนุษย์นั้นเป็นตัวจําแนกที่ดีมาก ฉันจึงมีสัญชาตญาณว่าลักษณนามจะดีแค่ไหน แต่ด้วยจุดข้อมูลจำนวนมากจุดหนึ่งคือฉันไม่รู้ว่าตัวจําแนกฉันฝึกได้ดีเพียงใด นี่คือข้อมูลที่ฉันไม่ใช่ลักษณนามที่ดีมาก (พูดแยกแยะอารมณ์ของบุคคลจากข้อมูล EEG) มันเป็นไปไม่ได้จริงๆที่จะได้รับปรีชาว่าปัญหาของฉันคืออะไร ตอนนี้ถ้าฉันถูกนำเสนอด้วยปัญหาการเรียนรู้ของเครื่องฉันอยากจะรู้ว่าฉันทำได้ดีแค่ไหน มีวิธีการใด ๆ ที่หลักการนี้ คุณจะทำอย่างไร เห็นภาพข้อมูลหรือไม่ เริ่มด้วยแบบง่าย ๆ ? เริ่มต้นด้วยโมเดลที่ซับซ้อนมาก ๆ และดูว่าฉันสามารถใช้งานได้มากเกินไปหรือไม่? คุณกำลังค้นหาอะไรหากคุณต้องการตอบคำถามนี้ คุณหยุดพยายามเมื่อไหร่

2
ติดตั้งโมเดลพัวซอง GLM ผสมกับความชันและจุดตัดแบบสุ่ม
ขณะนี้ฉันกำลังทำงานกับแบบจำลองอนุกรมเวลาของปัวซองที่พยายามประเมินผลของการเปลี่ยนแปลงวิธีการนับจำนวนที่ได้รับ (เปลี่ยนจากการทดสอบการวินิจฉัยหนึ่งไปสู่อีกการทดสอบหนึ่ง) ในขณะที่ควบคุมแนวโน้มอื่น ๆ ในช่วงเวลาหนึ่ง อุบัติการณ์ของโรค) ฉันมีข้อมูลสำหรับไซต์ต่าง ๆ จำนวนมาก ในขณะที่ฉันกำลังซ่อมบำรุงเกมด้วยเช่นกันฉันพอดีกับ GLM พื้นฐานที่เหมาะสมกับแนวโน้มเวลาในพวกเขาจากนั้นจึงรวมผลลัพธ์ รหัสสำหรับสิ่งนี้จะมีลักษณะเช่นนี้ใน SAS: PROC GENMOD data=work.data descending; model counts = dependent_variable time time*time / link=log dist = poisson; run; หรือนี่ใน R: glm(counts ~ dependent_variable + time + time*time, family="poisson") จากนั้นนำค่าประมาณเหล่านั้นมารวมกันในหลาย ๆ ไซต์ มันก็ถูกแนะนำด้วยว่าให้ฉันลองใช้แบบจำลองปัวซองผสมกับความชันแบบสุ่มและจุดตัดสำหรับแต่ละไซต์แทนที่จะรวมกัน ดังนั้นโดยพื้นฐานแล้วคุณต้องมีเอฟเฟกต์คงที่ของ dependent_variable จากนั้นจะมีเอฟเฟกต์แบบสุ่มสำหรับการสกัดกั้นและเวลา (หรือเวลาและเวลาที่ดีเลิศ ^ 2 …

1
รูปแบบใดสำหรับชุดข้อมูลที่ท้าทาย (ซีรีย์หลายร้อยครั้งพร้อมการซ้อนจำนวนมาก)
ฉันมีชุดข้อมูลที่ค่อนข้างซับซ้อนในการวิเคราะห์และฉันไม่สามารถหาวิธีแก้ปัญหาที่ดีได้ นี่คือสิ่งที่: 1.ข้อมูลดิบเป็นแมลงบันทึกเพลงเป็นหลัก เพลงแต่ละเพลงทำจากระเบิดหลายครั้งและแต่ละเพลงทำจากชุดย่อย บุคคลทั้งหมดได้รับการบันทึกเป็นเวลา 5 นาที จำนวนระเบิดและตำแหน่งในการบันทึกอาจแตกต่างกันมากระหว่างบุคคลเช่นเดียวกับจำนวนหน่วยย่อยต่อการระเบิด 2.ฉันมีความถี่ผู้ให้บริการ (ความถี่พื้นฐาน) ของแต่ละหน่วยย่อยและนั่นคือสิ่งที่ฉันต้องการวิเคราะห์ ปัญหาของฉัน: 1.ความถี่ภายในการระเบิดไม่ชัดเจน (แม้ว่าจะค่อนข้างเสถียร แต่ความถี่ของหน่วยย่อย n-1 จะมีผลกับหน่วยย่อย n) 2.การระเบิดยังไม่ขึ้นอยู่กับการบันทึก 3.พวกเขามีความอิสระน้อยลงเมื่อความถี่ลดลงตามเวลา (แต่ละคนเบื่อที่จะร้องเพลงดังนั้นความถี่ของเพลงจึงลดลงและลดลง) หยดดูเหมือนจะเป็นเส้นตรง 4. การทำรัง = ฉันมีประชากรซ้ำกัน 3 แห่งสำหรับสองแห่งคือ A และ B ดังนั้นฉันจึงมี A1, A2, A3 และ B1, B2, B3 สิ่งที่ฉันต้องการจะทำ: 1.อธิบายความแตกต่างของความถี่ระหว่างสถานที่สองแห่งของฉัน (ทดสอบทางสถิติ) 2.ระบุความถี่ที่ลดลงระหว่างสองตำแหน่ง (ดูว่ามันลดลงเร็วกว่าหนึ่งในนั้นหรือไม่) ทำอย่างไร: นั่นคือเหตุผลที่ฉันต้องการความช่วยเหลือ: ฉันไม่รู้ ดูเหมือนว่ากรณีของฉันรวมปัญหาที่มักไม่เห็นด้วยกัน ฉันได้อ่านเกี่ยวกับโมเดลผสม, เกี่ยวกับ …

3
Spline df selection ในปัญหาโมเดลเสริมปัวซองทั่วไป
ฉันได้รับการกระชับข้อมูลอนุกรมเวลาโดยใช้รูปแบบการเติมแต่งทั่วไป Poisson ใช้ PROC GAMSAS โดยทั่วไปฉันมีกระบวนการตรวจสอบข้ามแบบทั่วไปในตัวแล้วสร้าง "จุดเริ่มต้น" ที่ดีสำหรับเส้นโค้งเดี่ยวของฉันซึ่งเป็นฟังก์ชันที่ไม่ใช่เชิงเส้นของเวลาพร้อมกับคำพารามิเตอร์เดียว (อันที่ฉัน สนใจจริงๆ) จนถึงตอนนี้มันทำงานได้ค่อนข้างว่ายน้ำยกเว้นหนึ่งในชุดข้อมูลของฉัน มีการสังเกตในชุดข้อมูล 132 ชุดและ GCV แนะนำให้มีอิสระในระดับ 128 องศา ดูเหมือนว่า ... ผิด ผิดมาก ที่สำคัญมันยังไม่เสถียรเลย ฉันลองวิธีที่สองโดยใช้บางอย่างเช่น "เปลี่ยนค่าประมาณ" เพื่อหยุดเพิ่มองศาอิสระเมื่อการประมาณค่าพารามิเตอร์หยุดหยุดการเปลี่ยนแปลงเพราะเหตุใดจึงต้องเพิ่มการควบคุมหากไม่มีอะไรแตกต่างกัน ปัญหาคือว่าการประมาณการไม่เสถียรเลย ฉันลองใช้องศาอิสระดังต่อไปนี้และอย่างที่คุณเห็นคำศัพท์เกี่ยวกับพารามิเตอร์จะเด้งไปมาอย่างดุเดือด: DF: Parametric Estimate: 1 -0.76903 2 -0.56308 3 -0.47103 4 -0.43631 5 -0.33108 6 -0.1495 7 0.0743 8 0.33459 9 0.62413 10 …

1
การถดถอยโลจิสติกส์: จัดกลุ่มและไม่จัดกลุ่มตัวแปร (ใช้ R)
ฉันกำลังอ่าน A. Agresti (2007), การแนะนำการวิเคราะห์ข้อมูลเชิงหมวดหมู่ , อันดับที่ 2 รุ่นและไม่แน่ใจว่าฉันเข้าใจย่อหน้านี้ (หน้า 106, 4.2.1) ถูกต้อง (แม้ว่าควรง่าย): ในตารางที่ 3.1 เกี่ยวกับการกรนและโรคหัวใจในบทก่อนหน้า 254 คนรายงานการกรนทุกคืนซึ่ง 30 คนเป็นโรคหัวใจ หากไฟล์ข้อมูลมีการจัดกลุ่มข้อมูลไบนารีเส้นหนึ่งในไฟล์ข้อมูลจะรายงานข้อมูลเหล่านี้ว่าเป็นโรคหัวใจ 30 รายจากขนาดตัวอย่าง 254 ถ้าไฟล์ข้อมูลมีข้อมูลไบนารีที่ไม่ได้จัดกลุ่มแต่ละบรรทัดในไฟล์ข้อมูลหมายถึง แยกกันดังนั้น 30 บรรทัดประกอบด้วย 1 สำหรับโรคหัวใจและ 224 บรรทัดประกอบด้วย 0 สำหรับโรคหัวใจ ค่า ML และค่า SE จะเหมือนกันสำหรับไฟล์ข้อมูลทั้งสองประเภท การแปลงชุดข้อมูลที่ไม่จัดกลุ่ม (ขึ้นอยู่กับ 1 อิสระ 1) จะใช้เวลามากกว่า "บรรทัด" เพื่อรวมข้อมูลทั้งหมด! ในตัวอย่างต่อไปนี้ชุดข้อมูลแบบง่าย (ไม่สมจริง!) …

3
RMSE คืออะไรที่ทำให้เป็นมาตรฐานด้วยค่าเฉลี่ยที่สังเกตได้ที่เรียกว่า
ฉันใช้Root Mean Squared Error(RMSE) เพื่อวัดความแม่นยำของค่าที่ทำนายโดยใช้แบบจำลอง ฉันเข้าใจว่าค่าที่ส่งคืนใช้หน่วยวัดของฉัน (แทนที่จะเป็นเปอร์เซ็นต์) อย่างไรก็ตามฉันต้องการเสนอราคาเป็นเปอร์เซ็นต์ วิธีการที่ฉันใช้คือการทำให้RMSEค่าเฉลี่ยของการสังเกตของฉันเป็นมาตรฐาน มีคำศัพท์RMSE/meanหรือไม่?

3
auto.arima เตือน NaNs เกิดจากข้อผิดพลาด std
ข้อมูลของฉันเป็นอนุกรมเวลาของประชากรที่มีงานทำ, L และช่วงเวลา, ปี n.auto=auto.arima(log(L),xreg=year) summary(n.auto) Series: log(L) ARIMA(2,0,2) with non-zero mean Coefficients: ar1 ar2 ma1 ma2 intercept year 1.9122 -0.9567 -0.3082 0.0254 -3.5904 0.0074 s.e. NaN NaN NaN NaN 1.6058 0.0008 sigma^2 estimated as 1.503e-06: log likelihood=107.55 AIC=-201.1 AICc=-192.49 BIC=-193.79 In-sample error measures: ME RMSE MAE MPE MAPE -7.285102e-06 …
9 r  regression  arima 

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.