สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
การเปรียบเทียบการแจกแจงของประสิทธิภาพการวางนัยทั่วไป
บอกว่าฉันมีวิธีการเรียนรู้สองวิธีสำหรับปัญหาการจัดหมวดหมู่และและฉันประเมินประสิทธิภาพการวางนัยทั่วไปด้วยบางอย่างเช่นการตรวจสอบความถูกต้องแบบไขว้ซ้ำหรือการบูตแบบสแตรป จากกระบวนการนี้ฉันได้รับการแจกแจงคะแนนและสำหรับแต่ละวิธีในการทำซ้ำเหล่านี้ (เช่นการกระจายของค่า ROC AUC สำหรับแต่ละรุ่น)AAABBB PAPAP_APBPBP_B เมื่อมองไปที่การแจกแจงเหล่านี้อาจเป็นได้ว่า แต่ (เช่นประสิทธิภาพการวางนัยทั่วไปที่คาดไว้ของสูงกว่าแต่มีความไม่แน่นอนเกี่ยวกับการประมาณนี้)μA≥μBμA≥μB\mu_A \ge \mu_BσA≥σBσA≥σB\sigma_A \ge \sigma_BAAABBB ฉันคิดว่าสิ่งนี้เรียกว่าภาวะที่กลืนไม่เข้าคายไม่ออกอคติในการถดถอย อะไรวิธีการทางคณิตศาสตร์ที่ฉันสามารถใช้เพื่อเปรียบเทียบและและในที่สุดก็ทำให้การตัดสินใจเกี่ยวกับรูปแบบการใช้งาน?PAPAP_APBPBP_B หมายเหตุ:เพื่อความเรียบง่ายฉันหมายถึงสองวิธีและที่นี่ แต่ฉันสนใจวิธีที่สามารถนำมาใช้เพื่อเปรียบเทียบการแจกแจงคะแนนของวิธีการเรียนรู้ ~ 1000 วิธี (เช่นจากการค้นหากริด) และในที่สุดก็สร้าง การตัดสินใจขั้นสุดท้ายเกี่ยวกับรูปแบบที่จะใช้AAABBB

1
การปรับค่า p สำหรับสถิติ Local Moran I (LISA)
ฉันทำงานกับการวิเคราะห์เชิงพื้นที่เชิงสำรวจใน R โดยใช้แพ็คเกจ spdep ฉันเจอตัวเลือกในการปรับค่าpของตัวบ่งชี้ท้องถิ่นของการเชื่อมโยงเชิงพื้นที่ (LISA) ที่คำนวณโดยใช้localmoranฟังก์ชัน ตามเอกสารนั้นมีวัตถุประสงค์เพื่อ: ... การปรับค่าความน่าจะเป็นสำหรับการทดสอบหลายครั้ง เพิ่มเติมในเอกสารของp.adjustSPฉันอ่านว่าตัวเลือกที่ใช้ได้คือ: วิธีการปรับรวมถึงการแก้ไข Bonferroni ('"bonferroni"') ซึ่งค่า p ถูกคูณด้วยจำนวนการเปรียบเทียบ การแก้ไขจารีตน้อยกว่าสี่ประการรวมอยู่ใน Holm (1979) ('' holm ''), Hochberg (1988) ('"hochberg"'), Hommel (1988) ('hommel "') และ Benjamini & Hochberg (1995) ('"fdr"') ตามลำดับ ตัวเลือก pass-through ('"none"') รวมอยู่ด้วย สี่วิธีแรกถูกออกแบบมาเพื่อให้สามารถควบคุมอัตราความผิดพลาดที่เหมาะสำหรับครอบครัวได้ ดูเหมือนว่าไม่มีเหตุผลที่จะใช้การแก้ไข Bonferroni ที่ไม่ได้แก้ไขเพราะมันถูกครอบงำโดยวิธีการของ Holm ซึ่งก็ใช้ได้ภายใต้สมมติฐานโดยพลการ วิธีการของ Hochberg และ …

2
สำรวจเมทริกซ์กระจาย - พล็อตสำหรับตัวแปรมากมาย
ฉันกำลังวิเคราะห์ชุดข้อมูลที่มีพารามิเตอร์หลายตัว (เช่น 50-200) และฉันสนใจที่จะดูความสัมพันธ์ระหว่างตัวแปร (เช่นในแง่ของแผนการกระจาย 2 ตัวแปรหรือ 2d ฮิสโทแกรม) อย่างไรก็ตามสำหรับพารามิเตอร์จำนวนนี้ดูเหมือนว่าเป็นไปไม่ได้ที่จะวาดพล็อตอาเรย์ 200x200 (เว้นแต่ฉันจะพิมพ์และแขวนบนผนัง) ในทางตรงกันข้ามการทำเพียงแค่เมทริกซ์สหสัมพันธ์นั้นไม่ได้ให้ข้อมูลทั้งหมดเกี่ยวกับความสัมพันธ์ 2 ตัวแปร มีวิธี (ไลบรารีหรือเวิร์กโฟลว์) ในการสำรวจความสัมพันธ์ 2 ตัวแปรสำหรับตัวแปรหลายตัวหรือไม่ ฉันสนใจที่จะแสดงผลลัพธ์ให้ผู้อื่นโดยเฉพาะอย่างยิ่ง (บางทีหลังจากการประมวลผลข้อมูลล่วงหน้า) เช่นสิ่งที่มีการโต้ตอบใน JavaScript ฉันสามารถเห็นเมทริกซ์กระจาย - พล็อตสำหรับเขตข้อมูลที่เลือกจากเมทริกซ์สหสัมพันธ์ โดยเมทริกซ์การกระจาย - พล็อตฉันหมายถึงสิ่งที่ต้องการ: (นำมาจากบล็อก pandasplotting ; สามารถใช้งานได้ในPython / Pandas , R , D3.jsฯลฯ )

1
อะไรทำให้ความไม่เท่าเทียมของ Hoeffding เป็นแนวคิดทางสถิติที่สำคัญ
ในบล็อกของเขา Larry Wasserman มีโพสต์เกี่ยวกับสิ่งที่เขาวางแผนที่จะครอบคลุมในหลักสูตรของเขาเมื่อฤดูใบไม้ร่วงที่ผ่านมา เขาตั้งข้อสังเกตว่าเขากำลังละทิ้งหัวข้อคลาสสิกบางประเด็นเพื่อให้ทันสมัยยิ่งขึ้น หนึ่งหัวข้อที่เขากล่าวถึงคือความไม่เท่าเทียมของ Hoeffding อะไรทำให้ผลลัพธ์นี้สำคัญอย่างยิ่งสำหรับนักเรียนและผู้ปฏิบัติงาน

3
แบบหลายระดับกับรุ่นที่แยกต่างหากสำหรับแต่ละระดับ
อะไรคือข้อดีและข้อเสียของการใช้ตัวแบบแยกกับแบบจำลองหลายระดับ? โดยเฉพาะอย่างยิ่งสมมติว่าการศึกษาตรวจสอบผู้ป่วยที่ซ้อนกันภายในการปฏิบัติของแพทย์ที่ซ้อนอยู่ภายในประเทศ ข้อดี / ข้อเสียของการใช้โมเดลแยกกันสำหรับแต่ละประเทศเทียบกับแบบจำลองซ้อนสามระดับคืออะไร

3
อะไรคือเหตุผลที่อยู่เบื้องหลังสถิติการกำหนดดัชนีค่าดัชนีมวลกายเป็นน้ำหนัก / ส่วนสูง ?
บางทีคำถามนี้อาจมีคำตอบทางการแพทย์ แต่มีเหตุผลทางสถิติใดบ้างที่คำนวณดัชนี BMIเป็น ? ทำไมไม่ยกตัวอย่างเพียง ? ความคิดแรกของฉันคือมันมีส่วนเกี่ยวข้องกับการถดถอยแบบสมการกำลังสองน้ำหนัก/ ส่วนสูง2weight/height2\text{weight}/\text{height}^2น้ำหนัก/ ส่วนสูงweight/height\text{weight}/\text{height} ตัวอย่างข้อมูลจริง (200 คนที่มีน้ำหนักส่วนสูงอายุและเพศ): structure(list(Age = c(18L, 21L, 17L, 20L, 19L, 53L, 27L, 22L, 19L, 27L, 19L, 20L, 19L, 20L, 42L, 17L, 23L, 20L, 20L, 19L, 20L, 19L, 19L, 18L, 19L, 15L, 19L, 15L, 19L, 21L, 60L, 19L, 17L, 23L, 60L, 33L, …

1
การประมาณค่าสัมประสิทธิ์การถดถอยโลจิสติกในการออกแบบตัวควบคุมเคสเมื่อตัวแปรผลลัพธ์ไม่ใช่สถานะตัวควบคุม / ตัวควบคุม
พิจารณาการสุ่มตัวอย่างข้อมูลจากประชากรขนาดด้วยวิธีต่อไปนี้: สำหรับNNNk=1,...,Nk=1,...,Nk=1, ..., N สังเกตบุคคล 'โรค' สถานะ 'skkk หากพวกเขามีโรครวมพวกเขาในตัวอย่างที่มีความน่าจะเป็นpk1pk1p_{k1} หากพวกเขาไม่ได้มีโรคที่รวมไว้ด้วยความน่าจะ{K0}pk0pk0p_{k0} สมมติว่าคุณสังเกตตัวแปรและไบนารี่เวกเตอร์ทำนายผล , สำหรับอาสาสมัครทดลองด้วยวิธีนี้ ตัวแปรผลลัพธ์ไม่ใช่สถานะ "โรค" ฉันต้องการประเมินพารามิเตอร์ของตัวแบบการถดถอยโลจิสติก:YiYiY_iXiXi{\bf X}_ii=1,...,ni=1,...,ni=1, ..., n log(P(Yi=1|Xi)P(Yi=0|Xi))=α+Xiβlog⁡(P(Yi=1|Xi)P(Yi=0|Xi))=α+Xiβ \log \left( \frac{ P(Y_i = 1 | {\bf X}_i) }{ P(Y_i = 0 | {\bf X}_i) } \right) = \alpha + {\bf X}_i {\boldsymbol \beta} ทั้งหมดที่ฉันดูแลเกี่ยวกับการเป็นอัตราส่วน (log) ต่อรองββ{\boldsymbol \beta}เบต้า} การสกัดกั้นไม่เกี่ยวข้องกับฉัน …

3
การพยากรณ์ฟังก์ชันความหนาแน่น
ฉันกำลังทำการวิจัยเกี่ยวกับการทำนายอนุกรมเวลาของฟังก์ชันความหนาแน่นของความน่าจะเป็น เรากำลังตั้งเป้าที่จะคาดการณ์ PDF ที่ได้รับจากการสังเกตในอดีต (ปกติแล้วโดยประมาณ) PDF วิธีการพยากรณ์ที่เรากำลังพัฒนานั้นทำได้ค่อนข้างดีในการศึกษาแบบจำลอง อย่างไรก็ตามฉันต้องการตัวอย่างตัวเลขจากแอปพลิเคชันจริงเพื่อแสดงวิธีการของเราเพิ่มเติม ดังนั้นมีตัวอย่างที่เหมาะสมในแอปพลิเคชัน (การเงินเศรษฐศาสตร์ชีววิทยาวิศวกรรม ฯลฯ ) ที่มีการรวบรวมอนุกรมเวลาของ PDF และเป็นสิ่งสำคัญและยากที่จะคาดเดาชุดเวลาดังกล่าวหรือไม่

1
การตรวจสอบความทนทานของการถดถอยโลจิสติกกับการละเมิดความเป็นเชิงเส้นของ logit
ฉันกำลังทำการถดถอยโลจิสติกด้วยผลลัพธ์ไบนารี (เริ่มต้นและไม่เริ่ม) การผสมผสานของผู้ทำนายของฉันนั้นล้วน แต่เป็นตัวแปรแบบต่อเนื่องหรือแบบแบ่งขั้ว การใช้วิธี Box-Tidwell หนึ่งในเครื่องมือทำนายอย่างต่อเนื่องของฉันอาจละเมิดสมมติฐานของความเป็นเชิงเส้นของ logit ไม่มีข้อบ่งชี้จากสถิติความดีพอดีว่าเป็นปัญหา ฉันได้เรียกใช้โมเดลการถดถอยอีกครั้งโดยแทนที่ตัวแปรต่อเนื่องดั้งเดิมด้วย: ประการแรกการแปลงรากที่สองและที่สองคือตัวแปรที่มีการแบ่งขั้ว ในการตรวจสอบผลลัพธ์ดูเหมือนว่าความดีของพอดีช่วยปรับปรุงเล็กน้อย แต่เศษเหลือเป็นปัญหา การประมาณพารามิเตอร์, ข้อผิดพลาดมาตรฐานและยังคงคล้ายกัน การตีความข้อมูลไม่เปลี่ยนแปลงตามสมมติฐานของฉันทั้ง 3 แบบประสบการณ์( β)ประสบการณ์⁡(β)\exp(\beta) ดังนั้นในแง่ของประโยชน์ของผลลัพธ์และความหมายในการตีความข้อมูลของฉันมันดูเหมือนว่าจะเหมาะสมที่จะรายงานตัวแบบการถดถอยโดยใช้ตัวแปรต่อเนื่องดั้งเดิม ฉันสงสัยว่านี้: การถดถอยโลจิสติกส์แข็งแกร่งเมื่อใดเมื่อเปรียบเทียบกับการละเมิดความเป็นเส้นตรงของข้อสมมติฐาน logit จากตัวอย่างข้างต้นของฉันดูเหมือนจะยอมรับได้หรือไม่ที่จะรวมตัวแปรต่อเนื่องดั้งเดิมไว้ในโมเดล มีการอ้างอิงหรือคำแนะนำสำหรับการแนะนำเมื่อเป็นที่พอใจหรือไม่ที่จะยอมรับว่าแบบจำลองนั้นมีความทนทานต่อการละเมิดความเป็นเส้นตรงของ logit หรือไม่?

1
ทั่วไปกำลังสองน้อยที่สุด: จากสัมประสิทธิ์การถดถอยถึงสัมประสิทธิ์สหสัมพันธ์?
อย่างน้อยกำลังสองที่มีตัวทำนายหนึ่งตัว: Y= βx + ϵY=βx+εy = \beta x + \epsilon หากและเป็นมาตรฐานก่อนการประกอบ (เช่น ) ดังนั้น:y ∼ N ( 0 , 1 )xxxYYy∼ N( 0 , 1 )~ยังไม่มีข้อความ(0,1)\sim N(0,1) rββ\beta RRRr x = β y + ϵββ\betaเหมือนกันในการถดถอยที่สะท้อน:x = βY+ ϵx=βY+εx = \beta y + \epsilon สำหรับทั่วไปกำลังสองน้อยที่สุด (GLS), เดียวกันนำไปใช้? คือถ้าฉันสร้างมาตรฐานข้อมูลของฉันฉันจะได้ค่าสัมประสิทธิ์สหสัมพันธ์โดยตรงจากค่าสัมประสิทธิ์การถดถอยหรือไม่? จากการทดสอบกับข้อมูล GLS ที่สะท้อนจะนำไปสู่ค่าสัมประสิทธิ์แตกต่างกันและฉันไม่แน่ใจว่าฉันเชื่อว่าค่าสัมประสิทธิ์การถดถอยนั้นสอดคล้องกับค่าที่ฉันคาดหวังสำหรับค่าสหสัมพันธ์ …

3
วิธีรับช่วงความมั่นใจในการเปลี่ยนแปลงประชากร r-square
ตัวอย่างง่ายๆสมมติว่ามีตัวแบบถดถอยเชิงเส้นสองแบบ รุ่นที่ 1 มีสามทำนาย, x1a, x2bและx2c แบบจำลอง 2 มีตัวทำนายสามตัวจากแบบจำลอง 1 และสองตัวทำนายเพิ่มเติมx2aและx2b มีสมการถดถอยที่ประชากรประชากรแปรปรวนอธิบายคือเป็น สำหรับรุ่นที่ 1 และρ 2 ( 2 )สำหรับรุ่น 2. แปรปรวนเพิ่มขึ้นอธิบายโดยรุ่น 2 ในประชากรที่อยู่Δ ρ 2 = ρ 2 ( 2 ) - ρ 2 ( 1 )ρ2(1)ρ(1)2\rho^2_{(1)}ρ2(2)ρ(2)2\rho^2_{(2)}Δρ2=ρ2(2)−ρ2(1)Δρ2=ρ(2)2−ρ(1)2\Delta\rho^2 = \rho^2_{(2)} - \rho^2_{(1)} ฉันสนใจในการได้รับข้อผิดพลาดมาตรฐานและช่วงความเชื่อมั่นสำหรับประมาณการของ 2 ในขณะที่ตัวอย่างเกี่ยวข้องกับตัวทำนาย 3 และ 2 ตามลำดับความสนใจงานวิจัยของฉันเกี่ยวข้องกับตัวทำนายจำนวนต่าง ๆ (เช่น …

1
ฉันจะรวมเอานวัตกรรมล้ำสมัยที่การสังเกตที่ 48 ในโมเดล ARIMA ของฉันได้อย่างไร
ฉันกำลังทำงานกับชุดข้อมูล หลังจากใช้เทคนิคการระบุตัวแบบบางอย่างฉันก็ออกมาพร้อมกับแบบจำลอง ARIMA (0,2,1) ผมใช้detectIOฟังก์ชั่นในแพคเกจTSAในการวิจัยที่จะตรวจพบนวัตกรรมขอบเขต (IO) ที่สังเกต 48th ของชุดข้อมูลเดิมของฉัน ฉันจะรวมค่าผิดปกตินี้ไว้ในแบบจำลองของฉันเพื่อที่ฉันจะสามารถใช้เพื่อวัตถุประสงค์ในการพยากรณ์ได้อย่างไร ฉันไม่ต้องการใช้แบบจำลอง ARIMAX เนื่องจากฉันอาจไม่สามารถคาดการณ์ได้จากสิ่งนั้นใน R มีวิธีอื่นที่ฉันสามารถทำได้หรือไม่ นี่คือค่านิยมของฉันตามลำดับ: VALUE <- scan() 4.6 4.5 4.4 4.5 4.4 4.6 4.7 4.6 4.7 4.7 4.7 5.0 5.0 4.9 5.1 5.0 5.4 5.6 5.8 6.1 6.1 6.5 6.8 7.3 7.8 8.3 8.7 9.0 9.4 9.5 9.5 …
10 r  time-series  arima  outliers  hypergeometric  fishers-exact  r  time-series  intraclass-correlation  r  logistic  glmm  clogit  mixed-model  spss  repeated-measures  ancova  machine-learning  python  scikit-learn  distributions  data-transformation  stochastic-processes  web  standard-deviation  r  machine-learning  spatial  similarities  spatio-temporal  binomial  sparse  poisson-process  r  regression  nonparametric  r  regression  logistic  simulation  power-analysis  r  svm  random-forest  anova  repeated-measures  manova  regression  statistical-significance  cross-validation  group-differences  model-comparison  r  spatial  model-evaluation  parallel-computing  generalized-least-squares  r  stata  fitting  mixture  hypothesis-testing  categorical-data  hypothesis-testing  anova  statistical-significance  repeated-measures  likert  wilcoxon-mann-whitney  boxplot  statistical-significance  confidence-interval  forecasting  prediction-interval  regression  categorical-data  stata  least-squares  experiment-design  skewness  reliability  cronbachs-alpha  r  regression  splines  maximum-likelihood  modeling  likelihood-ratio  profile-likelihood  nested-models 

1
การทำความเข้าใจผลกระทบของปัจจัยสุ่มต่อเนื่องในรูปแบบเอฟเฟกต์ผสม
ฉันเข้าใจถึงผลกระทบของการสุ่มอย่างมีนัยสำคัญต่อแบบจำลองเอฟเฟกต์แบบผสมซึ่งจะทำการรวมบางส่วนของการสังเกตตามระดับในเอฟเฟกต์สุ่มโดยสมมติว่าการสังเกตไม่ได้เป็นอิสระ แต่มีเพียงบางส่วนเท่านั้น นอกจากนี้สำหรับความเข้าใจของฉันในการสังเกตแบบจำลองที่ใช้ระดับเอฟเฟกต์แบบสุ่มเหมือนกัน แต่ความแตกต่างในระดับเอฟเฟกต์แบบคงที่จะมีค่ามากกว่าการสังเกตที่ต่างกันทั้งในเอฟเฟกต์แบบสุ่มและระดับเอฟเฟกต์คงที่ อะไรคือผลกระทบของปัจจัยสุ่มต่อเนื่อง เนื่องจากโมเดลที่ไม่มีเอฟเฟกต์แบบสุ่มแสดงให้เห็นว่าเอฟเฟกต์คงที่มีขนาดเอฟเฟกต์ X ฉันควรคาดหวังว่าหากการสังเกตในระดับต่าง ๆ ของเอฟเฟกต์คงที่มาจากปลายสุดของเอฟเฟกต์สุ่ม แบบจำลองซึ่งรวมถึงปัจจัยสุ่มในขณะที่ถ้าการสังเกตในระดับปัจจัยคงที่แตกต่างกันมีค่าเอฟเฟกต์แบบสุ่มที่ใกล้เคียงกันขนาดของเอฟเฟกต์จะเพิ่มขึ้น?

1
แบนด์วิดธ์หมายถึงอะไร
ฉันพล็อตฟังก์ชันความหนาแน่นใน R และภายใต้พล็อตคือจำนวนแบนด์วิดท์ หมายเลขนี้หมายถึงอะไร
10 r 

2
ความแตกต่างในนิยามของเคิร์ตซีสและการตีความ
ฉันเพิ่งรู้ว่ามีความแตกต่างในค่าเคิร์ตซีให้ SPSS และ Stata ดูhttp://www.ats.ucla.edu/stat/mult_pkg/faq/general/kurtosis.htm ความเข้าใจของฉันคือการตีความที่เหมือนกันจึงจะแตกต่างกัน คำแนะนำเกี่ยวกับวิธีการจัดการกับเรื่องนี้?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.