สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
วิธีการสุ่มตัวอย่างอนุกรมเวลา XTS ใน R ได้อย่างไร
ฉันมีXTSอนุกรมเวลาที่เว้นระยะผิดปกติ(มีPOSIXctค่าเป็นประเภทดัชนี) ฉันจะสร้างซีรีย์เวลาใหม่ที่สุ่มตัวอย่างในช่วงเวลา 10 นาทีได้อย่างไร แต่แต่ละช่วงเวลาตัวอย่างจะถูกจัดให้สอดคล้องกับรอบเวลา (13:00:00, 13:10:00, 13:20:00, ... ) . หากช่วงเวลาการสุ่มตัวอย่างไม่ตรงกับค่าซีรี่ส์ดั้งเดิมฉันต้องการใช้ช่วงเวลาก่อนหน้า

2
บังคับให้ชุดตัวเลขเป็นเส้นโค้งเบล - เกาส์
( สิ่งนี้เกี่ยวข้องกับคำถามการเขียนโปรแกรมของฉันเกี่ยวกับ Stack Overflow : อัลกอริทึม Bell Curve Gaussian (Python และ / หรือ C #) ) บน Answers.com ฉันพบตัวอย่างง่ายๆนี้: ค้นหาค่าเฉลี่ยเลขคณิต (ค่าเฉลี่ย) => ผลรวมของค่าทั้งหมดในชุดหารด้วยจำนวนองค์ประกอบในชุด ค้นหาผลรวมของกำลังสองของค่าทั้งหมดในชุด หารเอาท์พุทของ (2) กับจำนวนขององค์ประกอบในชุด ลบกำลังสองของค่าเฉลี่ย (1) จากผลลัพธ์ของ (3) นำสแควร์รูทของผลลัพธ์ของ (4) ตัวอย่าง: Set A = {1,3,4,5,7} (1 + 3 + 4 + 5 + 7) / 5 = …

4
อะไรคือสมมติฐานสำหรับการใช้แบบจำลองการถดถอยของ Tobit?
ความรู้พื้นฐานของฉันเกี่ยวกับแบบจำลองการถดถอยของ Tobit ไม่ได้มาจากชั้นเรียนอย่างที่ฉันต้องการ แต่ฉันได้รับข้อมูลบางส่วนที่นี่และผ่านการค้นหาทางอินเทอร์เน็ตหลายครั้ง เดาที่ดีที่สุดของฉันที่สมมติฐานสำหรับการถดถอยที่ถูกตัดทอนคือพวกเขาจะคล้ายกับสมมติฐานน้อยที่สุดธรรมดา (OLS) ฉันไม่รู้ว่ามันถูกต้องมั้ย ดังนั้นคำถามของฉัน: อะไรคือสมมติฐานที่ฉันควรตรวจสอบเมื่อดำเนินการถดถอย Tobit? หมายเหตุ: รูปแบบดั้งเดิมของคำถามนี้เรียกว่าการถดถอยที่ถูกตัดทอนซึ่งไม่ใช่รูปแบบที่ฉันใช้หรือถาม ฉันแก้ไขคำถามแล้ว

2
การสุ่มตัวอย่างจากการแจกแจงไบวาเรียที่มีความหนาแน่นเป็นที่รู้จักโดยใช้ MCMC
ฉันพยายามที่จะจำลองจากความหนาแน่นของ bivariate p(x,y)p(x,y)p(x,y)การใช้อัลกอริทึม Metropolis ใน R และไม่มีโชค ความหนาแน่นสามารถแสดงเป็น p(y|x)p(x)p(y|x)p(x)p(y|x)p(x)ที่ไหน p(x)p(x)p(x) คือการกระจาย Singh-Maddala p(x)=aqxa−1ba(1+(xb)a)1+qp(x)=aqxa−1ba(1+(xb)a)1+qp(x)=\dfrac{aq x^{a-1}}{b^a (1 + (\frac{x}{b})^a)^{1+q}} ด้วยพารามิเตอร์ aaa, qqq, bbbและ p(y|x)p(y|x)p(y|x) เป็นบันทึกปกติโดยมีค่าเฉลี่ยล็อกเป็นเศษส่วนของ xxxและ log-sd ค่าคงที่ เพื่อทดสอบว่าตัวอย่างของฉันเป็นสิ่งที่ฉันต้องการหรือไม่ฉันดูที่ความหนาแน่นของxxxซึ่งควรจะเป็น p(x)p(x)p(x). ฉันลองอัลกอริทึม Metropolis ที่แตกต่างจากแพ็คเกจ R MCMCpack, mcmc และความฝัน ฉันทิ้งการเบิร์นอินใช้การทำให้ผอมบางใช้ตัวอย่างที่มีขนาดสูงถึงล้าน แต่ความหนาแน่นส่วนเกินที่ได้นั้นไม่ได้เป็นอย่างที่ฉันให้ นี่คือรหัสสุดท้ายที่ฉันใช้: logvrls <- function(x,el,sdlog,a,scl,q.arg) { if(x[2]>0) { dlnorm(x[1],meanlog=el*log(x[2]),sdlog=sdlog,log=TRUE)+ dsinmad(x[2],a=a,scale=scl,q.arg=q.arg,log=TRUE) } else -Inf } …

2
คำนวณ ROC curve สำหรับข้อมูล
ดังนั้นฉันมีการทดลอง 16 ครั้งที่ฉันพยายามพิสูจน์ตัวตนบุคคลจากลักษณะทางชีวภาพโดยใช้ Hamming Distance เกณฑ์ของฉันถูกตั้งไว้ที่ 3.5 ข้อมูลของฉันอยู่ด้านล่างและเฉพาะการทดลองใช้ 1 เท่านั้นคือ True Positive: Trial Hamming Distance 1 0.34 2 0.37 3 0.34 4 0.29 5 0.55 6 0.47 7 0.47 8 0.32 9 0.39 10 0.45 11 0.42 12 0.37 13 0.66 14 0.39 15 0.44 16 0.39 จุดสับสนของฉันคือฉันไม่แน่ใจจริงๆเกี่ยวกับวิธีสร้าง ROC curve …
9 mathematical-statistics  roc  classification  cross-validation  pac-learning  r  anova  survival  hazard  machine-learning  data-mining  hypothesis-testing  regression  random-variable  non-independent  normal-distribution  approximation  central-limit-theorem  interpolation  splines  distributions  kernel-smoothing  r  data-visualization  ggplot2  distributions  binomial  random-variable  poisson-distribution  simulation  kalman-filter  regression  lasso  regularization  lme4-nlme  model-selection  aic  r  mcmc  dlm  particle-filter  r  panel-data  multilevel-analysis  model-selection  entropy  graphical-model  r  distributions  quantiles  qq-plot  svm  matlab  regression  lasso  regularization  entropy  inference  r  distributions  dataset  algorithms  matrix-decomposition  regression  modeling  interaction  regularization  expected-value  exponential  gamma-distribution  mcmc  gibbs  probability  self-study  normality-assumption  naive-bayes  bayes-optimal-classifier  standard-deviation  classification  optimization  control-chart  engineering-statistics  regression  lasso  regularization  regression  references  lasso  regularization  elastic-net  r  distributions  aggregation  clustering  algorithms  regression  correlation  modeling  distributions  time-series  standard-deviation  goodness-of-fit  hypothesis-testing  statistical-significance  sample  binary-data  estimation  random-variable  interpolation  distributions  probability  chi-squared  predictor  outliers  regression  modeling  interaction 

2
จะทดสอบได้อย่างไรว่าค่าความชันในโมเดลเชิงเส้นเท่ากับค่าคงที่หรือไม่?
สมมติว่าเรามีรูปแบบการถดถอยเชิงเส้นอย่างง่ายและต้องการทดสอบสมมติฐานกับทางเลือกทั่วไปZ=aX+bYZ=aX+bYZ = aX + bYH0:a=b=12H0:a=b=12H_0: a=b=\frac{1}{2} ฉันคิดว่าหนึ่งสามารถใช้การประมาณการของและและต่อไปใช้Z -test ที่จะได้รับช่วงความเชื่อมั่นทั่ว\ frac {1} {2} ตกลงไหมa^a^\hat{a}SE(a^)SE(a^)SE(\hat{a})ZZZ1212\frac{1}{2} คำถามอื่น ๆ ที่เกี่ยวข้องอย่างยิ่งกับคำถามนี้ สมมติว่าเรามีตัวอย่าง{(x1,y1,z1),…,(xn,yn,zn)}{(x1,y1,z1),…,(xn,yn,zn)}\{(x_1,y_1,z_1),\ldots ,(x_n,y_n,z_n) \}และเราคำนวณχ2χ2\chi^2สถิติ ∑i=1n(zi−xi+yi2)2xi+yi2.∑i=1n(zi−xi+yi2)2xi+yi2.\begin{equation} \sum_{i=1}^n \frac{(z_i-\frac{x_i+y_i}{2})^2}{\frac{x_i+y_i}{2}}. \end{equation} สามารถใช้สถิติเหล่านี้เพื่อทดสอบสมมติฐานว่างได้หรือไม่

3
การวิเคราะห์เมตาเกี่ยวกับการศึกษาด้วยเซลล์ความถี่ 0
ฉันคุ้นเคยกับการวิเคราะห์เมตาและเทคนิคการถดถอยของเมตาดาต้า (โดยใช้แพ็คเกจ R metaforจาก Viechtbauer) แต่เมื่อเร็ว ๆ นี้ฉันพบปัญหาฉันไม่สามารถแก้ไขได้อย่างง่ายดาย สมมติว่าเรามีโรคติดต่อจากแม่สู่ลูกที่ยังไม่เกิดและมีการศึกษามาหลายครั้งแล้ว แม่และเด็กได้รับการทดสอบไวรัสทันทีหลังคลอด ในขณะที่เด็กในครรภ์เป็นไปไม่ได้ที่จะได้รับเชื้อไวรัสชนิดอื่นนอกเหนือจากแม่ | neg kid | pos kid mother neg | A | C=0 -----------|---------|-------- mother pos | B | D เห็นได้ชัดว่าการใช้อัตราต่อรอง (OR) ให้ข้อผิดพลาดเป็นหนึ่งจะถูกหารด้วย 0 เหมือนกันสำหรับความเสี่ยงสัมพัทธ์: A / ( A + B )0 / ( 0 + D )A/(A+B)0/(0+D)\frac{A/(A+B)}{0/(0+D)} ตอนนี้นักวิจัยต้องการทดสอบสมมติฐาน (ไม่รู้สึก) …

2
การแก้ไขความต่อเนื่องของ Yates สำหรับตารางฉุกเฉิน 2 x 2
ฉันต้องการรวบรวมข้อมูลจากผู้คนในสนามเกี่ยวกับการแก้ไขความต่อเนื่องของ Yates สำหรับตารางฉุกเฉิน 2 x 2 บทความวิกิพีเดียกล่าวถึงว่ามันอาจปรับได้ไกลเกินไปและถูกนำมาใช้ในแง่ที่ จำกัด เท่านั้น โพสต์ที่เกี่ยวข้องกับที่นี่ไม่ได้มีข้อมูลเชิงลึกต่อไปมาก ดังนั้นสำหรับคนที่ใช้การทดสอบเหล่านี้เป็นประจำคุณมีความคิดเห็นอย่างไร? มันจะดีกว่าที่จะใช้การแก้ไขหรือไม่? และตัวอย่างโลกแห่งความจริงซึ่งจะให้ผลลัพธ์ที่แตกต่างกันในระดับความเชื่อมั่น 95% โปรดทราบว่านี่เป็นปัญหาการบ้าน แต่ชั้นเรียนของเราไม่ได้จัดการกับการแก้ไขความต่อเนื่องของ Yates เลยดังนั้นให้นอนหลับง่ายเพราะรู้ว่าคุณไม่ได้ทำการบ้านให้ฉัน samp <- matrix(c(13, 12, 15, 3), byrow = TRUE, ncol = 2) colnames(samp) <- c("No", "Yes") rownames(samp) <- c("Female", "Male") chisq.test(samp, correct = TRUE) chisq.test(samp, correct = FALSE)

3
วิธีการพยากรณ์สำหรับอนุกรมเวลา
ฉันไม่คุ้นเคยกับการวิเคราะห์ข้อมูลอนุกรมเวลา อย่างไรก็ตามฉันมีสิ่งที่ฉันคิดว่าเป็นงานทำนายง่าย ๆ ที่อยู่ ฉันมีข้อมูลประมาณห้าปีจากกระบวนการสร้างทั่วไป ในแต่ละปีแสดงถึงฟังก์ชั่นที่เพิ่มขึ้นแบบ monotonically โดยมีองค์ประกอบที่ไม่ใช่เชิงเส้น ฉันนับในแต่ละสัปดาห์ในรอบ 40 สัปดาห์ในแต่ละปี กระบวนการเริ่มต้นฟังก์ชั่นเริ่มต้นที่ศูนย์เพิ่มขึ้นอย่างรวดเร็วในช่วงครึ่งแรกของฟังก์ชั่นชะลอตัวในช่วงครึ่งหลังก่อนที่จะปรับระดับในช่วงห้าสัปดาห์ที่ผ่านมา กระบวนการนี้มีความสอดคล้องกันตลอดหลายปีที่ผ่านมาซึ่งมีความแตกต่างกันเล็กน้อยในเรื่องอัตราการเปลี่ยนแปลงและปริมาณของเซ็กเมนต์ต่าง ๆ ในแต่ละปี y1={0,Nt1,Nt2,...Nt39,Nt40}y1={0,Nt1,Nt2,...Nt39,Nt40} y_{1}=\{0, N_{t1}, N_{t2}, ... N_{t39}, N_{t40}\} ⋮⋮ \vdots y5={0,Nt1,Nt2,...Nt39,Nt40}y5={0,Nt1,Nt2,...Nt39,Nt40} y_{5}=\{0, N_{t1}, N_{t2}, ... N_{t39}, N_{t40}\} โดยที่เท่ากับจำนวน ณ เวลา xNtxNtxN_{tx} เป้าหมายคือการใช้ที่ (หรือดีกว่าเพื่อหรือลาดไปยังจุดนั้น) และคาดการณ์ที่t40ตัวอย่างเช่นถ้าคือ 5,000 ค่าที่คาดหวังของคืออะไรในปีนั้น ดังนั้นคำถามคือคุณจะสร้างแบบจำลองข้อมูลดังกล่าวอย่างไร ง่ายพอที่จะสรุปและมองเห็นได้ แต่ฉันต้องการแบบจำลองเพื่ออำนวยความสะดวกในการทำนายและรวมการวัดข้อผิดพลาดNNNtxtxtxt0t0t0txtxtxNNNt40t40t40Nt10Nt10N_{t10}Nt40Nt40N_{t40}

3
จะทำอย่างไรกับตัวแปรที่สับสน?
ฉันต้องทำการทดสอบ ก่อนอื่นให้ฉันอธิบายสถานการณ์ปัจจุบัน บริษัท ที่ฉันทำงานคือโรงภาพยนตร์ มีส่วนของเกมที่ผู้คนที่รอหนังสามารถผ่านเวลาโดยการเล่นเกม ผู้คนสามารถชำระเงินได้โดยใช้บัตรสมาชิกแบบชำระเงินล่วงหน้าเท่านั้น น่าเสียดายที่ส่วนเกมนี้ไม่ได้สร้างยอดขายมากพอ เรากำลังพยายามหาสาเหตุ สมมติฐานของฉันคือถ้าเรารับเงินสดเป็นเงินการขายจะเพิ่มขึ้น แผนของฉันคือการมีกลุ่มทดลองและกลุ่มควบคุม กลุ่มทดลองจะยอมรับการชำระเงินสดกลุ่มควบคุมไม่ ยอดขายของทั้งสองกลุ่มมีการนับก่อนและหลังการทดสอบ สิ่งที่ยากเกี่ยวกับเรื่องนี้คือฉันไม่สามารถหาวิธีแยกปัจจัย 'การจ่ายเงินสด' จากปัจจัยอื่น: เมื่อภาพยนตร์ที่เล่นในโรงภาพยนตร์ดีผู้คนจำนวนมากจะมาและยอดขายก็จะเพิ่มขึ้นเช่นกัน โรงภาพยนตร์แต่ละแห่งมีเพียงส่วนหนึ่งของการเล่นเกมเท่านั้นฉันไม่สามารถแยกมันออกเป็นสองส่วนได้ (ส่วนหนึ่งรับเงินสดและอีกส่วนไม่ได้) หากหลายเว็บไซต์ยอมรับเงินสดและหลายเว็บไซต์ไม่ทำฉันไม่คิดว่าฉันสามารถเปรียบเทียบผลลัพธ์ได้โดยตรงเนื่องจากผู้เข้าชมแตกต่างกันจำนวนหน่วยการเล่นเกมจะแตกต่างกัน ฉันกำลังมองหาข้อเสนอแนะเพื่อแยกตัวแปร 'การชำระเงินสด' หรืออาจเป็นแนวทางอื่นทั้งหมด

3
วิธีการพล็อตแฟนคลับ (Polar) Dendrogram ใน R
ล็อคแล้ว คำถามและคำตอบของคำถามนี้ถูกล็อคเนื่องจากคำถามอยู่นอกหัวข้อ แต่มีความสำคัญทางประวัติศาสตร์ ขณะนี้ไม่ยอมรับคำตอบหรือการโต้ตอบใหม่ ฉันหมายถึงสิ่งนี้: ชุดข้อมูลที่แนะนำสำหรับการแสดงวิธีแก้ไข: data(mtcars) plot(hclust(dist(mtcars)))

4
มัลติโนวาแบบหลายพารามิเตอร์
ฉันต้องวิเคราะห์การออกแบบแบบแฟกทอเรียลด้วยปัจจัยห้าประการ (หนึ่งในนั้นซ้อนอยู่ในอีกอันหนึ่ง) และการตอบสนองเชิงตัวเลข ฉันต้องการทำการวิเคราะห์ ANOVA แบบไม่ใช้พารามิเตอร์ แต่แน่นอนว่าฉันไม่สามารถใช้การทดสอบ Kruskall Wallis และ Friedman (ฉันใช้มาตรการจำลองแบบ) มีคำสั่งหรือรหัสใน R ที่สามารถช่วยฉันได้ไหม ขอบคุณ! Stefania

2
ฉันสามารถใช้การทดสอบการเปลี่ยนรูปแบบเพื่อหลีกเลี่ยงปัญหาการเปรียบเทียบหลายอย่างในบริบทของสัดส่วนได้หรือไม่
ฉันกำลังประเมินประสิทธิผลของวิธีการต่าง ๆ 5 วิธีเพื่อทำนายผลลัพธ์ไบนารีแบบใดแบบหนึ่ง (เรียกว่า 'ความสำเร็จ' และ 'ความล้มเหลว') ข้อมูลมีลักษณะดังนี้: Method Sample_Size Success Percent_Success 1 28 4 0.14 2 19 4 0.21 3 24 7 0.29 4 21 13 0.61 5 22 9 0.40 ฉันต้องการทำการทดสอบระหว่าง 5 วิธีเพื่อประเมินความเหนือกว่าของวิธีการ ในคำอื่น ๆ ฉันต้องการสั่งซื้อวิธีการในการปฏิบัติตามวิธีที่ 1> วิธีที่ 2> ... วิธีที่ 5 เพื่อหลีกเลี่ยงปัญหาของการเปรียบเทียบหลายฉันวางแผนที่จะทำแบบทดสอบการเปลี่ยนรูปตามบรรทัดต่อไปนี้: ขั้นตอนที่ 1: รวบรวมข้อมูลทั้งหมดเพื่อให้ขนาดตัวอย่างโดยรวมคือ 114 …

4
การถดถอยของ Cox และมาตราส่วนเวลา
ตัวแปร X (อันตราย) ในการวิเคราะห์การถดถอยอันตรายตามสัดส่วนที่คอคส์ต้องมีเวลาหรือไม่? ถ้าไม่คุณช่วยยกตัวอย่างได้ไหม อายุของผู้ป่วยมะเร็งสามารถเป็นตัวแปรอันตรายได้หรือไม่? ถ้าเป็นเช่นนั้นจะตีความได้ว่าเป็นความเสี่ยงของการเป็นมะเร็งในบางช่วงอายุได้หรือไม่? การถดถอยของ Cox จะเป็นการวิเคราะห์ที่ถูกต้องหรือไม่เพื่อศึกษาความสัมพันธ์ระหว่างการแสดงออกของยีนและอายุ

10
คุณจะวาดโมเดลสมการเชิงโครงสร้าง / MPLUS ได้อย่างไร
ฉันกำลังมองหาเครื่องมือซอฟต์แวร์ (โดยเฉพาะโอเพนซอร์ซ) เพื่อวาดสมการเชิงโครงสร้าง / แบบผสมอย่างมีประสิทธิภาพและสวยงาม หลังจากดูเป็น xfig และ graphviz ตอนนี้ฉันติดอยู่กับแพ็คเกจกราฟิกแบบเวกเตอร์ทั่วไปinkscapeเพราะดูเหมือนยืดหยุ่นที่สุด ฉันต้องการสำรวจชุมชน stat.stackexchange: คุณจะวาดสมการโครงสร้าง / ตัวแบบผสมได้อย่างไร คุณใช้ซอฟต์แวร์อะไร

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.