สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
วิธีการลงโทษสำหรับข้อมูลเด็ดขาด: การรวมระดับในปัจจัย
โมเดลที่ถูกปรับแต่งสามารถใช้เพื่อประเมินโมเดลที่มีจำนวนพารามิเตอร์เท่ากับหรือมากกว่าขนาดตัวอย่าง สถานการณ์นี้อาจเกิดขึ้นในตัวแบบบันทึกการเชิงเส้นของตารางกระจัดกระจายขนาดใหญ่ของข้อมูลเด็ดขาดหรือการนับ ในการตั้งค่าเหล่านี้มักเป็นที่ต้องการหรือเป็นประโยชน์ในการยุบตารางด้วยการรวมระดับของปัจจัยที่ระดับเหล่านั้นไม่สามารถแยกแยะในแง่ของวิธีที่พวกเขาโต้ตอบกับปัจจัยอื่น ๆ สองคำถาม: มีวิธีใช้แบบจำลองที่มีการลงโทษเช่น LASSO หรือ elastic net เพื่อทดสอบการยุบตัวของระดับภายในแต่ละปัจจัยหรือไม่? หากคำตอบสำหรับคำถามแรกคือใช่สามารถและควรตั้งค่านี้ในลักษณะที่การล่มสลายของระดับและการประมาณค่าสัมประสิทธิ์แบบเกิดขึ้นในขั้นตอนเดียว?

1
อคติของตัวประมาณความน่าจะเป็นสูงสุดสำหรับการถดถอยโลจิสติก
ฉันต้องการที่จะเข้าใจข้อเท็จจริงบางประการเกี่ยวกับตัวประมาณความน่าจะเป็นสูงสุด (MLEs) สำหรับการถดถอยโลจิสติก โดยทั่วไป MLE สำหรับการถดถอยโลจิสติกนั้นมีอคติหรือไม่? ฉันจะพูดว่า "ใช่" ตัวอย่างเช่นฉันรู้ว่ามิติของตัวอย่างนั้นเกี่ยวข้องกับอคติของ MLEs คุณรู้ตัวอย่างเบื้องต้นของปรากฏการณ์นี้หรือไม่? ถ้า MLE นั้นเอนเอียงเป็นจริงหรือไม่ที่เมทริกซ์ความแปรปรวนร่วมของ MLEs เป็นค่าผกผันของ Hessian ของฟังก์ชันความน่าจะเป็นสูงสุด? แก้ไข : ฉันได้พบสูตรนี้ค่อนข้างบ่อยและไม่มีหลักฐานใด ๆ ; ดูเหมือนจะเป็นทางเลือกที่ค่อนข้างอิสระสำหรับฉัน

1
ฉันควรเลือกรูปแบบการถดถอยแบบ Bootstrapped
ฉันมีรูปแบบการถดถอยโลจิสติกแบบไบนารีที่มี DV (โรค: ใช่ / ไม่ใช่) และ 5 ตัวทำนาย (ประชากร [อายุ, เพศ, การสูบบุหรี่ (ใช่ / ไม่ใช่)], ดัชนีทางการแพทย์ (ลำดับ) และหนึ่งการรักษาแบบสุ่ม [ใช่ / ไม่ใช่ ]) ฉันได้ทำแบบจำลองเงื่อนไขการโต้ตอบสองด้านทั้งหมดเช่นกัน ตัวแปรหลักอยู่กึ่งกลางและไม่มีสัญลักษณ์ของความสัมพันธ์หลายระดับ (VIF ทั้งหมด <2.5) ฉันมีคำถาม: การบูตสแตรปมีประโยชน์เหนือรุ่นเดียวของฉันหรือไม่ ถ้าเป็นเช่นนั้น ฉันควรเลือกรุ่น bootstrapped ใด ฉันแค่อยากจะดูว่าอัลกอริทึมการบูตสแตรปทำตามวิธีการสุ่มสำหรับการสร้างตัวอย่างใหม่หรือไม่หรือว่าพวกมันมีอัลกอริธึมที่เข้มงวด ดังนั้นฉันจึงลองใหม่อีกครั้ง 1,000 ครั้งในแต่ละครั้ง (ดังนั้นฉันจึงมีโมเดล bootstrapped หลายแบบแต่ละอันมีการทดลอง 1,000 ครั้ง) อย่างไรก็ตามแต่ละครั้งที่ค่าสัมประสิทธิ์ของรุ่น bootstrapped แตกต่างกัน (แม้ว่าจำนวนการทดลองจะ 1,000 ครั้งอย่างต่อเนื่อง) ดังนั้นฉันสงสัยว่าฉันควรเลือกอันไหนสำหรับรายงานของฉัน …

3
การวัดผู้ป่วยบางรายมากกว่าหนึ่งครั้ง
ฉันกำลังทำการศึกษาทางคลินิกที่ฉันกำหนดมาตรวัดสัดส่วนร่างกายของผู้ป่วย ฉันรู้วิธีจัดการสถานการณ์ที่ฉันมีหนึ่งการวัดต่อผู้ป่วย: ฉันสร้างแบบจำลองที่ฉันมีตัวอย่างแบบสุ่มจากความหนาแน่นและฉันทำสิ่งปกติ: เขียนความเป็นไปได้ของ ตัวอย่างการประมาณค่าพารามิเตอร์กำหนดความเชื่อมั่นและทดสอบสมมติฐานหรือทำการวิเคราะห์แบบเบย์หากเจ้านายไม่ได้ดู ;-)X1, … ,XnX1,...,XnX_1,\dots,X_nฉθฉθf_\theta ปัญหาของฉันคือว่าสำหรับผู้ป่วยบางรายเรามีมากกว่าหนึ่งมาตรการเพราะเราเชื่อว่าเป็นความคิดที่ดีที่จะมีนักวิจัยมากกว่าหนึ่งคนที่จัดการเครื่องมือวัดเมื่อเป็นไปได้ (บางครั้งเรามีนักวิจัยเพียงคนเดียวที่ทำงานที่คลินิก ) ดังนั้นสำหรับผู้ป่วยบางรายเรามีหนึ่งมาตรการที่ทำโดยนักวิจัยคนหนึ่งสำหรับหน่วยตัวอย่างอื่น ๆ เรามีสองมาตรการที่ทำโดยนักวิจัยสองคนที่แตกต่างกันและอื่น ๆ การวัดที่เป็นปัญหาคือความหนาของรอยพับผิวเฉพาะ คำถามของฉัน: แบบจำลองทางสถิติชนิดใดที่เพียงพอสำหรับปัญหาของฉัน
10 inference 

1
จำนวนที่คาดหวังของการทำซ้ำ (triplicates ฯลฯ ) เมื่อวาดด้วยการแทนที่
ฉันมีปัญหาดังต่อไปนี้: ฉันมี 100 รายการที่ไม่ซ้ำกัน (n) และฉันเลือก 43 (m) ของพวกเขาทีละรายการ (มีการแทนที่) ฉันจำเป็นต้องแก้ปัญหาสำหรับจำนวนที่ไม่ซ้ำกันที่คาดหวัง (เลือกเพียงครั้งเดียว, k = 1), คู่ผสม (เลือกอย่างแน่นอนสองครั้ง k = 2), tripples (ตรง k = 3), ล่าม ฯลฯ ... ฉันสามารถค้นหาผลลัพธ์มากมายเกี่ยวกับความน่าจะเป็นที่มีอย่างน้อยหนึ่งคู่ (วันเกิดความขัดแย้ง) แต่ไม่ได้อยู่ในจำนวนคู่ที่คาดหวังในประชากร

4
รูปแบบประวัติเหตุการณ์แบบไม่ต่อเนื่อง (การอยู่รอด) ใน R
ฉันกำลังพยายามปรับโมเดลที่ไม่ต่อเนื่องใน R แต่ฉันไม่แน่ใจว่าจะทำอย่างไร ฉันได้อ่านแล้วว่าคุณสามารถจัดระเบียบตัวแปรตามในแถวต่างกันหนึ่งตัวสำหรับแต่ละการสังเกตเวลาและการใช้glmฟังก์ชั่นที่มีลิงค์ logit หรือ cloglog ในแง่นี้ฉันมีสามคอลัมน์: ID, Event(1 หรือ 0 ในแต่ละช่วงเวลา) และTime Elapsed(ตั้งแต่จุดเริ่มต้นของการสังเกต) รวมทั้ง covariates อื่น ๆ ฉันจะเขียนรหัสเพื่อให้พอดีกับรุ่นได้อย่างไร ตัวแปรตามคืออะไร ฉันเดาว่าฉันสามารถใช้Eventเป็นตัวแปรตามและรวมTime Elapsedอยู่ใน covariates แต่สิ่งที่เกิดขึ้นกับID? ฉันต้องการมันไหม ขอบคุณ
10 r  survival  pca  sas  matlab  neural-networks  r  logistic  spatial  spatial-interaction-model  r  time-series  econometrics  var  statistical-significance  t-test  cross-validation  sample-size  r  regression  optimization  least-squares  constrained-regression  nonparametric  ordinal-data  wilcoxon-signed-rank  references  neural-networks  jags  bugs  hierarchical-bayesian  gaussian-mixture  r  regression  svm  predictive-models  libsvm  scikit-learn  probability  self-study  stata  sample-size  spss  wilcoxon-mann-whitney  survey  ordinal-data  likert  group-differences  r  regression  anova  mathematical-statistics  normal-distribution  random-generation  truncation  repeated-measures  variance  variability  distributions  random-generation  uniform  regression  r  generalized-linear-model  goodness-of-fit  data-visualization  r  time-series  arima  autoregressive  confidence-interval  r  time-series  arima  autocorrelation  seasonality  hypothesis-testing  bayesian  frequentist  uninformative-prior  correlation  matlab  cross-correlation 

1
คำถามเกี่ยวกับฟังก์ชั่นการเปลี่ยนแปลงตัวอย่างอัตโนมัติ
ฉันกำลังอ่านหนังสือการวิเคราะห์อนุกรมเวลาและสูตรสำหรับการคำนวณค่าตัวอย่างอัตโนมัติถูกกำหนดในหนังสือเป็น: γˆ(h)=n−1∑t=1n−h(xt+h−x¯)(xt−x¯)γ^(ชั่วโมง)=n-1Σเสื้อ=1n-ชั่วโมง(xเสื้อ+ชั่วโมง-x¯)(xเสื้อ-x¯)\widehat{\gamma}(h) = n^{-1}\displaystyle\sum_{t=1}^{n-h}(x_{t+h}-\bar{x})(x_t-\bar{x}) กับ γˆ(−h)=γˆ(h)γ^(-ชั่วโมง)=γ^(ชั่วโมง)\widehat{\gamma}(-h) = \widehat{\gamma}(h)\; สำหรับ h=0,1,...,n−1ชั่วโมง=0,1,...,n-1\;h = 0,1, ..., n-1. x¯x¯\bar{x} คือค่าเฉลี่ย ใครสามารถอธิบายได้โดยสัญชาตญาณว่าทำไมเราหารผลรวมด้วย nnn และไม่ได้โดย n−hn-ชั่วโมงn-h? หนังสือเล่มนี้อธิบายว่าเป็นเพราะสูตรข้างต้นเป็นฟังก์ชันที่ไม่เป็นลบแน่นอนและหารด้วยnnnเป็นที่ต้องการ แต่ไม่ชัดเจนสำหรับฉัน บางคนสามารถพิสูจน์สิ่งนี้หรือแสดงตัวอย่างหรือบางสิ่งได้ สำหรับฉันสิ่งที่ใช้งานง่ายในตอนแรกจะแบ่งโดย n−hn-ชั่วโมงn-h. นี่เป็นตัวประมาณค่าแบบเอนเอียงหรือเอนเอียงของ autocovariance หรือไม่?

2
ทรัพยากรที่ดีสำหรับการวิเคราะห์อนุกรมเวลามีอะไรบ้าง
ฉันได้ตรวจสอบคำตอบสำหรับคำถามนี้ใน stats.stackexchange: แหล่งข้อมูลที่ดีที่ให้ประวัติของสถิติคืออะไร แน่นอนหนังสือ Stigler "Statistics on the Table" ดูยอดเยี่ยมและฉันรอคอยที่จะอ่านมัน แต่ฉันสนใจที่จะพัฒนาโมเดล ARIMA ที่ทันสมัยมากขึ้น ฉันคิดว่าฉันจำได้ว่าได้ยินว่ามีความคืบหน้ามากมายในการพยายามทำนายความไม่ถูกต้องแบบสุ่มด้วยปืนใหญ่รอบสงครามโลกครั้งที่สอง และแน่นอนว่านักดาราศาสตร์ในช่วงครึ่งปีหลังของสหัสวรรษได้ใช้อนุกรมเวลาเพื่อทำความเข้าใจการเคลื่อนที่ของวัตถุสวรรค์ อย่างไรก็ตามฉันไม่สามารถจำได้ว่าฉันได้ยินเกี่ยวกับการใช้ปืนใหญ่ของอนุกรมเวลาและฉันมีพื้นหลังในวิชาฟิสิกส์และฉันไม่รู้จริง ๆ ว่าวิธีการทางสถิติใดที่นักดาราศาสตร์ทำงานด้วย ดังนั้นฉันชอบที่จะได้ยินสิ่งที่คุณคิดว่าเป็นอิทธิพลทางประวัติศาสตร์ที่เกี่ยวข้องมากที่สุดในการพัฒนาวิธีการอนุกรมเวลาเช่นพวกเขาถูกกระตุ้นโดยการเงินการป้องกันธรณีวิทยา / ธรณีฟิสิกส์หรือการรวมกันของสิ่งเหล่านี้และอื่น ๆ ? มีหนังสือหรือเว็บไซต์ที่ให้ข้อมูลเกี่ยวกับประวัติของ ARIMA หรือไม่?

2
ตัวแปรสำคัญแบบสุ่มค่าลบของป่า
ฉันถามตัวเองว่าควรลบตัวแปรเหล่านั้นด้วยค่าความสำคัญของตัวแปรเชิงลบ ("% IncmsE") ในบริบทการถดถอยหรือไม่ และถ้ามันให้คำทำนายที่ดีกว่า คุณคิดอย่างไร?

1
การระบุคำ Error () ในการวัด ANOVA ซ้ำ ๆ ใน R
ฉันกำลังมีปัญหากับการกำหนดเงื่อนไขข้อผิดพลาดสำหรับการวัด ANOVA แบบสองทางซ้ำ ๆ ในอาร์ข้อมูลของฉันประกอบด้วยการประเมินความหนาแน่นของไม้สำหรับตำแหน่งรัศมีสามตำแหน่ง (ด้านในกลางและด้านนอก) ตามแกนกลางที่สกัดจากต้นไม้ มีต้นไม้ทั้งหมด 20 ชนิด 6 บุคคลในแต่ละเผ่าพันธุ์และสองแกนจากต้นไม้แต่ละต้น ในการทดสอบผลกระทบของตำแหน่งรัศมีต่อความหนาแน่นของไม้ฉันใช้ ANOVA แบบสองทางต่อไปนี้พร้อมกับข้อความแสดงข้อผิดพลาดที่อธิบายถึงความแปรปรวนระหว่างบุคคล: radpos.aov <- aov(WD ~ Species*Radialposition + Error(Individual), data=Radpos) อย่างไรก็ตามฉันไม่แน่ใจว่าข้อกำหนดคุณสมบัติของข้อผิดพลาดเพียงพอหรือไม่ ฉันควรที่จะคำนึงถึงความแปรปรวนภายในคอร์ด้วยหรือไม่? สำหรับฉันความแปรปรวนนี้เป็นแบบเดียวกันเนื่องจากตำแหน่งในแนวรัศมีซึ่งเป็นปัจจัยหลักที่ฉันสนใจ แม้ว่าฉันจะทุ่มเทเวลาในการอ่านเกี่ยวกับการระบุคำผิดในมาตรการ ANOVA ซ้ำหลายครั้งฉันยังคงมีปัญหากับการระบุคำผิดพลาดจริง ฉันจะขอบคุณความช่วยเหลือเกี่ยวกับเรื่องนี้

2
หนังสือสำหรับสถิติที่ไม่ใช่พารามิเตอร์
สิ่งที่จะเป็นหนังสือที่ดีสำหรับสถิติที่ไม่ใช่พารามิเตอร์ ไม่เพียงแค่การแนะนำ แต่ระดับสูง นอกจากนี้ฉันกำลังมองหาสิ่งที่ฉันสามารถใช้สำหรับการเรียนรู้และไม่ได้สำหรับการอ้างอิง โดยเฉพาะฉันกำลังมองหาหนังสือที่มีพื้นฐานอยู่เบื้องหลังวิธีการที่ไม่ใช้พารามิเตอร์, การอนุมานที่ไม่ใช่พารามิเตอร์, วิธีการประเมิน parametrics ที่ไม่ใช่เช่นการทดสอบ KS, การทดสอบ , ฯลฯ , bootstrapping ....เสื้อtt


3
อัลกอริทึมการเรียนรู้ของเครื่องเพื่อการจัดอันดับ
ฉันมีชุดขององค์ประกอบ XXX ซึ่งฉันสามารถอธิบายตาม nnnลักษณะเฉพาะ. ดังนั้น: xi:{ci1,ci2,…,cin}∣xi∈Xxi:{ci1,ci2,…,cin}∣xi∈Xx_i: \{c_{i1}, c_{i2}, \ldots, c_{in}\} \mid x_i \in X ที่ไหน cijcijc_{ij} เป็นการประเมิน (ตัวเลข) สำหรับองค์ประกอบ iii ตามลักษณะ jjj. ดังนั้นองค์ประกอบของฉันสามารถดูได้เป็นคะแนนในnnn พื้นที่มิติ จากการอ่านของฉันมีอัลกอริทึมเช่น "ตัวแยกประเภทเบย์" ซึ่งสามารถให้คำตอบประเภท "ใช่" หรือ "ไม่" ในองค์ประกอบใด ๆ ของชุดของฉันหากว่าฉันใช้ "ชุดฝึกอบรม" ซึ่งประกอบด้วย องค์ประกอบของชุดของฉันและผลลัพธ์ที่คาดหวังของอัลกอริทึม จากข้อมูลนั้นอัลกอริทึมควรสามารถใช้องค์ประกอบอื่น ๆ ไม่ใช่ส่วนหนึ่งของชุดการฝึกอบรมและให้คำตอบ "ใช่" หรือ "ไม่" ตามสิ่งที่เรียนรู้ด้วยชุดฝึกอบรม นี่เป็นสิ่งที่ดีถ้าคุณมีความคิดบางอย่างเกี่ยวกับสิ่งที่คุณคาดหวัง (ชุดฝึกอบรม) แต่คุณไม่แน่ใจเกี่ยวกับกฎเฉพาะที่ให้ผลตามนั้น สิ่งที่ฉันต้องการจะทำกับข้อมูลของฉันไม่ได้รับคำตอบประเภท "ใช่" หรือ "ไม่" …

2
ขนาดตัวอย่างที่เล็กและไม่สมดุลสำหรับสองกลุ่ม - จะทำอย่างไร?
ฉันมีข้อมูลสำหรับสองกลุ่ม (ตัวอย่างเช่น) ฉันต้องการเปรียบเทียบ แต่ขนาดตัวอย่างทั้งหมดมีขนาดเล็ก (n = 29) และไม่สมดุลอย่างยิ่ง (n = 22 vs n = 7) ข้อมูลเหล่านี้ยากต่อการรวบรวมและมีราคาแพงดังนั้นในขณะที่ 'รวบรวมข้อมูลเพิ่มเติม' เนื่องจากวิธีการแก้ปัญหาที่ชัดเจนนั้นไม่มีประโยชน์ในกรณีนี้ มีการวัดตัวแปรที่แตกต่างกันจำนวนหนึ่ง (วันที่ออกเดินทางวันที่เดินทางมาถึงระยะเวลาของการย้ายถิ่นเป็นต้น) ดังนั้นจึงมีการทดสอบหลายรายการซึ่งบางส่วนของผลต่างนั้นแตกต่างกันมาก (ตัวอย่างขนาดเล็กที่มีความแปรปรวนสูงกว่า) ในขั้นต้นเพื่อนร่วมงานได้ทำการทดสอบแบบ t บนข้อมูลเหล่านี้และบางรายการมีนัยสำคัญทางสถิติกับ P <0.001 และอีกอันไม่สำคัญกับ P = 0.069 ตัวอย่างบางส่วนถูกแจกจ่ายตามปกติ แต่บางกลุ่มก็ไม่ได้ การทดสอบบางอย่างเกี่ยวข้องกับการออกเดินทางครั้งใหญ่จากความแปรปรวน 'เท่ากัน' ฉันมีคำถามหลายข้อ: การทดสอบ t เหมาะสมที่นี่ ถ้าไม่ทำไม สิ่งนี้ใช้เฉพาะกับการทดสอบที่สมมติฐานของความปกติและความเสมอภาคของผลต่างมีความพึงพอใจหรือไม่ ทางเลือกที่เหมาะสมคืออะไร บางทีการทดสอบการเปลี่ยนรูป? ความแปรปรวนไม่เท่ากันทำให้เกิดข้อผิดพลาด Type I ได้อย่างไร แต่อย่างไร และขนาดตัวอย่างที่เล็กและไม่สมดุลนั้นมีผลกระทบอย่างไรกับข้อผิดพลาด Type …


โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.