สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
จะคำนวณช่วงความมั่นใจสำหรับความสัมพันธ์อันดับของ Spearman ได้อย่างไร
Wikipediaมีการแปลง Fisher ของ the Spearman อันดับความสัมพันธ์กับคะแนน z โดยประมาณ บางทีคะแนน z คือความแตกต่างจากสมมติฐานว่าง (อันดับสหสัมพันธ์ 0)? หน้านี้มีตัวอย่างดังต่อไปนี้: 4, 10, 3, 1, 9, 2, 6, 7, 8, 5 5, 8, 6, 2, 10, 3, 9, 4, 7, 1 rank correlation 0.684848 "95% CI for rho (Fisher's z transformed)= 0.097085 to 0.918443" พวกเขาใช้ฟิชเชอร์เปลี่ยนรูปเพื่อให้ได้ช่วงความมั่นใจ 95% อย่างไร

5
lme4 หรือรหัสโอเพนซอร์ส R อื่น ๆ เทียบเท่ากับ asreml-R
ฉันต้องการที่จะพอดีกับรุ่นผสมโดยใช้ lme4, nlme, แพ็คเกจการถดถอยเบย์หรือที่มีอยู่ แบบผสมในแบบแผนการเข้ารหัส Asreml- R ก่อนที่จะลงรายละเอียดเฉพาะเราอาจต้องการรายละเอียดเกี่ยวกับการประชุม asreml-R สำหรับผู้ที่ไม่คุ้นเคยกับรหัส ASREML y = Xτ + Zu + e ........................(1) ; แบบผสมกับปกติ, y หมายถึง n × 1 เวกเตอร์ของการสังเกต, ที่τคือ p × 1 เวกเตอร์ของ fi xed e ff ects, X คือเมทริกซ์การออกแบบ n × p ของคอลัมน์เต็มอันดับที่เชื่อมโยงการสังเกตด้วยการรวมกันที่เหมาะสมของ fi xed e ff ects , u …
13 r 

3
จะทดสอบว่าเมทริกซ์ความแปรปรวนร่วมมีการเปลี่ยนแปลงในช่วงเวลาสองจุดได้อย่างไร?
งานของฉันคือการทดสอบว่ามีการเปลี่ยนแปลงในเมทริกซ์ความแปรปรวนร่วมของตัวแปร 6 ตัวหรือไม่ ค่าของตัวแปร 6 ตัวจะถูกวัดสองครั้งจากตัวแบบเดียวกัน (3 ปีระหว่างการวัด) ฉันจะทำสิ่งนั้นได้อย่างไร ฉันทำงานส่วนใหญ่ด้วย SAS

1
Quantiles จากการรวมการแจกแจงแบบปกติ
ฉันมีข้อมูลเกี่ยวกับการแจกแจงสัดส่วนมิติของร่างกาย (เช่นช่วงไหล่) สำหรับเด็กทุกวัย สำหรับแต่ละอายุและมิติฉันมีค่าเฉลี่ยส่วนเบี่ยงเบนมาตรฐาน (ฉันมีแปดควอนไทล์ แต่ฉันไม่คิดว่าฉันจะได้สิ่งที่ฉันต้องการจากพวกเขา) สำหรับแต่ละมิติฉันต้องการประเมินจำนวนเฉพาะของการกระจายความยาว หากฉันสมมติว่าแต่ละมิติมีการกระจายตามปกติฉันสามารถทำได้ด้วยค่าเฉลี่ยและส่วนเบี่ยงเบนมาตรฐาน มีสูตรสวยที่ฉันสามารถใช้เพื่อรับค่าที่เกี่ยวข้องกับ quantile เฉพาะของการกระจายหรือไม่ การย้อนกลับค่อนข้างง่าย: สำหรับค่าใดค่าหนึ่งให้หาพื้นที่ทางด้านขวาของค่าสำหรับการแจกแจงปกติ (อายุ) แต่ละค่า รวมผลลัพธ์และหารด้วยจำนวนการแจกแจง ปรับปรุง : นี่คือคำถามเดียวกันในรูปแบบกราฟิก สมมติว่าการแจกแจงสีแต่ละแบบนั้นปกติจะกระจาย นอกจากนี้ฉันเห็นได้ชัดว่าสามารถลองความยาวหลาย ๆ แบบและเปลี่ยนมันต่อไปเรื่อย ๆ จนกว่าฉันจะได้ค่าที่ใกล้เคียงกับควอนไทล์ที่ต้องการเพื่อความแม่นยำของฉัน ฉันสงสัยว่ามีวิธีที่ดีกว่านี้หรือไม่ และถ้านี่เป็นแนวทางที่ถูกต้องมีชื่อไหม?

2
การจัดการกับ multicollinearity
ฉันได้เรียนรู้ว่าการใช้vif()วิธีการcarบรรจุภัณฑ์เราสามารถคำนวณระดับของความหลากหลายของอินพุตในโมเดลได้ จากวิกิพีเดียถ้าvifค่ามากกว่า5นั้นเราสามารถพิจารณาได้ว่าข้อมูลที่ได้รับความทุกข์ทรมานจากปัญหาพหุนิยม ตัวอย่างเช่นฉันได้พัฒนาตัวแบบการถดถอยเชิงเส้นโดยใช้lm()วิธีการและvif()ให้ดังต่อไปนี้ ในฐานะที่เราสามารถมองเห็นปัจจัยการผลิตub, lbและtbกำลังทุกข์ทรมานจากพหุ vif(lrmodel) tb ub lb ma ua mb sa sb 7.929757 50.406318 30.826721 1.178124 1.891218 1.364020 2.113797 2.357946 เพื่อหลีกเลี่ยงปัญหาความสัมพันธ์แบบหลายจุดและเพื่อให้แบบจำลองของฉันแข็งแกร่งขึ้นฉันได้ดำเนินการระหว่างubและlbและตอนนี้ตาราง vif ของรูปแบบใหม่มีดังนี้: tb ub:lb ma mb sa sb ua 1.763331 1.407963 1.178124 1.327287 2.113797 1.860894 1.891218 มีค่าไม่แตกต่างกันมากR^2และไม่มีความแตกต่างในข้อผิดพลาดจากการทดสอบ CV แบบครั้งเดียวในทั้งสองกรณีข้างต้น คำถามของฉันคือ: มันเป็นการดีหรือไม่ที่จะหลีกเลี่ยงปัญหาความสัมพันธ์ระหว่างกันโดยการโต้ตอบตามที่แสดงด้านบน? มีวิธีการที่ดีกว่าในการนำเสนอปัญหาความสัมพันธ์หลายค่าเมื่อเทียบกับผลลัพธ์ของวิธี vif ข้างต้น กรุณาให้คำแนะนำของคุณ ขอบคุณ

6
แพ็คเกจ R สำหรับการระบุความสัมพันธ์ระหว่างตัวแปร [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้เป็นไปตามหัวข้อสำหรับการตรวจสอบข้าม ปิดให้บริการใน4 ปีที่แล้ว มีแพ็คเกจ R ที่ฉันสามารถใช้เพื่อสำรวจว่ามีความสัมพันธ์ระหว่างตัวแปรหรือไม่? โดยทั่วไปเมื่อฉันกำลังมองหารูปแบบที่ฉันดูที่ความสัมพันธ์แล้วพล็อตด้าน จากนั้นฉันใช้การแปลงบางอย่างกับตัวแปรในข้อมูลด้วยตนเอง ฉันสงสัยว่าฉันสามารถเร่งกระบวนการนี้ผ่านแพ็คเกจ R ได้หรือไม่

3
การกระจายความน่าจะเป็นแบบคลัสเตอร์ - วิธีการและตัวชี้วัด?
ฉันมีจุดข้อมูลบางอย่างซึ่งแต่ละอันประกอบด้วย 5 เวกเตอร์ของผลลัพธ์ที่ไม่ต่อเนื่องแบบจับกันเป็นกลุ่มผลของเวกเตอร์แต่ละตัวที่สร้างโดยการกระจายตัวที่แตกต่างกัน (ชนิดที่ฉันไม่แน่ใจการคาดเดาที่ดีที่สุดของฉันคือ Weibull กฎหมาย (1 ถึง 0, ประมาณ) ฉันกำลังมองหาที่จะใช้อัลกอริทึมการจัดกลุ่มเช่น K-Means เพื่อใส่แต่ละจุดข้อมูลลงในกลุ่มตามคุณลักษณะของการกระจายองค์ประกอบ 5 ฉันสงสัยว่ามีตัวชี้วัดระยะทางที่กำหนดไว้หรือไม่ซึ่งจะสวยงามสำหรับวัตถุประสงค์เหล่านี้ ฉันมีความคิดสามข้อ แต่ฉันไม่ใช่นักสถิติที่มีประสบการณ์ (เป็นนักวิทยาศาสตร์คอมพิวเตอร์การขุดข้อมูลเริ่มต้น) ดังนั้นฉันจึงมีความคิดเล็ก ๆ น้อย ๆ ว่าฉันอยู่ไกลแค่ไหน เนื่องจากฉันไม่รู้แน่ชัดว่าการแจกแจงแบบไหนฉันกำลังเข้าใกล้ปัญหาของฉันคือการสับการกระจายแต่ละครั้ง (ฉันมี 5 ต่อจุด) ลงในแต่ละค่าของข้อมูลที่ไม่ต่อเนื่อง (ฉันแพด แต่ละอันที่สอดคล้องกับความยาวเดียวกันกับศูนย์ที่ท้าย) และใช้แต่ละค่าเหล่านี้เป็นแอตทริบิวต์ที่แยกต่างหากสำหรับจุดข้อมูลเอง ฉันลองใช้ทั้งระยะทางแมนฮัตตันและระยะทางแบบยุคลิดเป็นตัวชี้วัดตามคุณลักษณะเหล่านี้สำหรับทั้ง PDF และ CDF อีกครั้งเนื่องจากฉันไม่ทราบว่ามีการแจกแจงแบบใดฉันจึงคิดว่าถ้าฉันจะวัดระยะห่างระหว่างการแจกแจงโดยรวมฉันสามารถใช้การทดสอบแบบไม่อิงพารามิเตอร์ระหว่างการแจกแจงเช่นการทดสอบ KS เพื่อค้นหาโอกาสที่การแจกแจงที่กำหนดถูกสร้างขึ้นโดย PDF ที่แตกต่างกัน ฉันคิดว่าตัวเลือกแรกของฉัน (ด้านบน) โดยใช้ระยะทางแมนฮัตตันจะเป็นขอบเขตบนของสิ่งที่ฉันอาจใช้วิธีนี้ (เนื่องจากสถิติ KS คือค่าสัมบูรณ์สูงสุดของความแตกต่างของ CDFs ซึ่งระยะทางแมนฮัตตันเป็น ผลรวมของค่าสัมบูรณ์ของความแตกต่างใน PDF) …

2
MCMC กำลังรวมเป็นค่าเดียวหรือไม่
ฉันกำลังพยายามปรับให้เข้ากับโมเดลลำดับชั้นโดยใช้ jags และแพ็คเกจ rjags ตัวแปรผลลัพธ์ของฉันคือ y ซึ่งเป็นลำดับของการทดลองเบอโนลลี ฉันมี 38 วิชามนุษย์ที่มีประสิทธิภาพภายใต้สองประเภท: P เมตรและจากการวิเคราะห์ของฉันลำโพงทุกคนมีความน่าจะเป็นของความสำเร็จในหมวดหมู่ของ Pและความน่าจะเป็นของความสำเร็จในหมวดหมู่ของ M \ฉันยังสมมติว่ามีบาง hyperparameter ระดับชุมชนของ P และ M:และ\θpθp\theta_pθp×θmθp×θm\theta_p\times\theta_mμpμp\mu_pμmμm\mu_m ดังนั้นสำหรับผู้พูดทุกคน: และที่และควบคุมวิธีแหลมกระจายอยู่รอบ ๆและ\θp∼beta(μp×κp,(1−μp)×κp)θp∼beta(μp×κp,(1−μp)×κp)\theta_p \sim beta(\mu_p\times\kappa_p, (1-\mu_p)\times\kappa_p)θm∼beta(μm×κm,(1−μm)×κm)θm∼beta(μm×κm,(1−μm)×κm)\theta_m \sim beta(\mu_m\times\kappa_m, (1-\mu_m)\times\kappa_m)κpκp\kappa_pκmκm\kappa_mμpμp\mu_pμmμm\mu_m นอกจากนี้ยัง ,B_m)μp∼beta(Ap,Bp)μp∼beta(Ap,Bp)\mu_p \sim beta(A_p, B_p)μm∼beta(Am,Bm)μm∼beta(Am,Bm)\mu_m \sim beta(A_m, B_m) นี่คือรูปแบบ jags ของฉัน: model{ ## y = N bernoulli trials ## Each speaker …

1
PCA และคะแนนองค์ประกอบขึ้นอยู่กับการผสมผสานของตัวแปรต่อเนื่องและไบนารี
ฉันต้องการใช้ PCA กับชุดข้อมูลซึ่งประกอบด้วยตัวแปรชนิดผสม (ต่อเนื่องและไบนารี) เพื่อแสดงขั้นตอนฉันวางตัวอย่างที่ทำซ้ำได้น้อยที่สุดใน R ด้านล่าง # Generate synthetic dataset set.seed(12345) n <- 100 x1 <- rnorm(n) x2 <- runif(n, -2, 2) x3 <- x1 + x2 + rnorm(n) x4 <- rbinom(n, 1, 0.5) x5 <- rbinom(n, 1, 0.6) data <- data.frame(x1, x2, x3, x4, x5) # Correlation matrix …
13 r  pca 

2
สูตรสำหรับความสัมพันธ์อัตโนมัติใน R กับ Excel
ฉันพยายามหาวิธีที่ R คำนวณความสัมพันธ์ระหว่าง lag-k (เห็นได้ชัดว่าเป็นสูตรเดียวกับที่ใช้โดย Minitab และ SAS) เพื่อให้ฉันสามารถเปรียบเทียบกับการใช้ฟังก์ชัน CORREL ของ Excel ที่ใช้กับซีรี่ส์และรุ่น k-lagged R และ Excel (ใช้ CORREL) ให้ค่าความสัมพันธ์อัตโนมัติที่แตกต่างกันเล็กน้อย ฉันสนใจที่จะทราบด้วยว่าการคำนวณหนึ่งนั้นถูกต้องมากกว่าอีกไหม
13 r  sas  autocorrelation  excel 

1
การตีความเอาต์พุตการถดถอยโลจิสติกใน R
ผมทำงานในการถดถอยโลจิสติกในหลาย R glmโดยใช้ ตัวแปรทำนายนั้นต่อเนื่องและจัดหมวดหมู่ แยกข้อมูลสรุปของแบบจำลองแสดงดังต่อไปนี้: Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 2.451e+00 2.439e+00 1.005 0.3150 Age 5.747e-02 3.466e-02 1.658 0.0973 . BMI -7.750e-02 7.090e-02 -1.093 0.2743 ... --- Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1 ช่วงความเชื่อมั่น: 2.5 % 97.5 % (Intercept) …

3
สูตรฟอร์มปิดสำหรับฟังก์ชั่นการกระจายรวมถึงความเบ้และความโด่ง
มีสูตรเช่นนี้หรือไม่? มีชุดของข้อมูลที่ทราบค่าเฉลี่ยความแปรปรวนความเบ้และความโด่งหรือสามารถวัดได้มีสูตรเดียวที่สามารถใช้ในการคำนวณความหนาแน่นของความน่าจะเป็นของค่าที่สันนิษฐานว่ามาจากข้อมูลข้างต้นหรือไม่

7
มาตรฐานทองคำมีความหมายอย่างไร?
ในขณะที่อ่านเอกสารไม่กี่ฉันเจอคำว่า "ชุดทองคำ" หรือ "มาตรฐานทองคำ" สิ่งที่ฉันไม่เข้าใจคือสิ่งที่ทำให้ชุดข้อมูลมาตรฐานทองคำ? การยอมรับจากคนรอบข้างการอ้างอิงและหากเสรีภาพของนักวิจัยและความเกี่ยวข้องกับปัญหาเขากำลังโจมตี?

1
ตีความแถบช่วงใน plot.stl ของ R?
ฉันมีปัญหาในการหาสิ่งที่แถบช่วงในความplot.stlหมายที่แท้จริง ฉันพบโพสต์ของ Gavin ในคำถามนี้และอ่านเอกสารเช่นกันฉันเข้าใจว่าพวกเขาบอกขนาดสัมพัทธ์ของส่วนประกอบที่สลายตัว แต่ฉันก็ยังไม่แน่ใจว่าพวกมันทำงานอย่างไร เช่น: ข้อมูล: บาร์เล็ก ๆ , ไม่มีสเกลตามฤดูกาล: เต็มบาร์, มีสเกลตั้งแต่ -0.6 ถึง 0.2 แนวโน้ม: บาร์เล็ก ๆ อีกอัน (ดูเหมือนจะเท่ากับข้อมูล), ไม่มีสเกลที่เหลือ: บาร์ขนาดกลางที่มีสเกลตั้งแต่ -1.5 ถึง 0.5 ฉันไม่เข้าใจว่าอะไรคือพื้นฐานของความสัมพันธ์และทำไมเทรนด์จึงไม่มีขนาด ฉันลองstlและdecomposeมีผลลัพธ์เหมือนกันสำหรับวิธีการคูณและการบวก
13 r  time-series 

1
คุณจะเลือกหน่วยการวิเคราะห์ (ระดับการรวม) ในอนุกรมเวลาได้อย่างไร
หากคุณสามารถวัดอนุกรมเวลาของการสังเกตที่ระดับใด ๆ ของความแม่นยำในเวลาและเป้าหมายของการศึกษาของคุณคือการระบุความสัมพันธ์ระหว่าง X และ Y จะมีเหตุผลเชิงประจักษ์ใด ๆ สำหรับการเลือกระดับการรวมที่เฉพาะเจาะจงมากกว่าหรือควร ทางเลือกนั้นขึ้นอยู่กับทฤษฎีและ / หรือข้อ จำกัด ในทางปฏิบัติ? ฉันมีคำถามย่อยสามคำถามสำหรับคำถามหลักนี้: การแปรผันที่ไม่ใช่แบบสุ่มใน X หรือ Y ในระดับที่มากกว่าเหตุผลเพียงพอที่จะเลือกการรวมกลุ่มที่เล็กกว่า (ที่ไม่ใช่แบบสุ่มใด ๆ เป็นรูปแบบชั่วคราวของการสังเกต)? การเปลี่ยนแปลงในความสัมพันธ์ระหว่าง X และ Y ในระดับที่เล็กกว่าของการรวมเหตุผลเพียงพอที่จะปรับหน่วยการวิเคราะห์ที่มีขนาดเล็กลงหรือไม่? หากรูปแบบบางรูปแบบเป็นที่ยอมรับได้ใครจะเป็นผู้ตัดสินว่ารูปแบบนั้นมากเกินไปเท่าใด ผู้คนสามารถอ้างถึงข้อโต้แย้งที่พวกเขารู้สึกว่าน่าสนใจ / ถูกนิยามไว้อย่างดีสำหรับการวิเคราะห์หนึ่งหน่วยเหนืออีกเรื่องหนึ่งไม่ว่าจะด้วยเหตุผลเชิงประจักษ์หรือเหตุผลเชิงทฤษฎี? ฉันตระหนักดีถึงปัญหาหน่วยพื้นที่ที่แก้ไขได้ในการวิเคราะห์เชิงพื้นที่ ( Openshaw 1984 ) ฉันไม่ได้อ้างว่าเป็นผู้เชี่ยวชาญเกี่ยวกับเนื้อหา แต่ทั้งหมดที่ฉันคิดว่าจนถึงตอนนี้ก็คือการวิเคราะห์หน่วยที่เล็กกว่านั้นดีกว่าเสมอเพราะมีโอกาสน้อยที่จะยอมรับการเข้าใจผิดทางนิเวศวิทยา ( Robinson 1950 ) หากมีการอ้างอิงหรือคำตอบที่เกี่ยวข้องโดยตรงกับหน่วยทางภูมิศาสตร์รวมฉันจะขอบคุณคำตอบนั้นเช่นกัน

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.