สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
การมอบหมายแบบสุ่ม: ทำไมต้องกังวล
การมอบหมายแบบสุ่มมีค่าเพราะช่วยให้มั่นใจได้ถึงความเป็นอิสระในการรักษาจากผลลัพธ์ที่อาจเกิดขึ้น นั่นคือวิธีที่จะนำไปสู่การประมาณการแบบไม่เอนเอียงของผลการรักษาโดยเฉลี่ย แต่รูปแบบการมอบหมายอื่น ๆ สามารถมั่นใจได้อย่างเป็นระบบในการรักษาจากผลลัพธ์ที่เป็นไปได้อย่างเป็นระบบ แล้วทำไมเราต้องสุ่มมอบหมาย? กล่าวอีกนัยหนึ่งอะไรคือข้อดีของการมอบหมายแบบสุ่มเหนือแผนการมอบหมายที่ไม่ใช่การสุ่มที่นำไปสู่การอนุมานที่ไม่เอนเอียง? ให้เป็นเวกเตอร์ของการกำหนดการรักษาซึ่งแต่ละองค์ประกอบคือ 0 (หน่วยที่ไม่ได้รับมอบหมายให้ทำการรักษา) หรือ 1 (หน่วยที่กำหนดให้การรักษา) ในบทความ JASA, Angrist, Imbens และ Rubin (1996, 446-47)บอกว่าการมอบหมายการรักษานั้นเป็นการสุ่มถ้าสำหรับ\ mathbf {c}และ\ mathbf {c'} ทุกอย่างที่\ iota ^ T \ mathbf {c} = \ iota ^ T \ mathbf {c '}โดยที่\ iotaเป็น เวกเตอร์คอลัมน์ที่มีองค์ประกอบทั้งหมดเท่ากับ 1ZZ\mathbf{Z}ZiZiZ_iPr(Z=c)=Pr(Z=c′)Pr(Z=c)=Pr(Z=c′)\Pr(\mathbf{Z} = \mathbf{c}) = \Pr(\mathbf{Z} = \mathbf{c'})cc\mathbf{c}c′c′\mathbf{c'}ιTc=ιTc′ιTc=ιTc′\iota^T\mathbf{c} …

1
การควบคุมอัตราการค้นพบที่ผิดพลาดในขั้นตอน
ผมมีตารางสามมิติของขนาด6แต่ละเซลล์ของตารางเป็นการทดสอบสมมติฐาน การแบ่งตารางในมิติที่สามสร้างการทดสอบสมมติฐานชุดซึ่งเป็นอิสระจากชุด แต่ขึ้นอยู่กับชุด เดิมทีฉันคิดว่าฉันสามารถควบคุมอัตราการค้นพบที่ผิดพลาดได้โดยใช้กระบวนการ Benjamini-Hochberg ในการทดสอบสมมติฐานทั้งหมดพร้อมกัน นั่นเป็นวิธีที่เหมาะสมในการโจมตีปัญหานี้หรือไม่? ความคิดที่สองของฉันคือการควบคุมอัตราการค้นพบที่ผิดพลาดภายในแต่ละส่วนตามมิติที่สามของตารางจากนั้นใช้การแก้ไขประเภทอื่นหลังจากนั้น ใครบ้างมีข้อมูลเพิ่มเติมเกี่ยวกับขั้นตอนประเภทนี้?6 × 6 × 816×6×816\times6\times81818181

3
วิธีการใช้ R gbm with distribution =“ adaboost”?
เอกสารระบุว่า R gbm พร้อมด้วยการแจกจ่าย = "adaboost" สามารถใช้สำหรับปัญหาการจำแนกประเภท 0-1 พิจารณาส่วนรหัสต่อไปนี้: gbm_algorithm <- gbm(y ~ ., data = train_dataset, distribution = "adaboost", n.trees = 5000) gbm_predicted <- predict(gbm_algorithm, test_dataset, n.trees = 5000) มันสามารถพบได้ในเอกสารที่ทำนาย. ggb ส่งคืนเวกเตอร์การทำนาย ตามค่าเริ่มต้นการคาดการณ์จะอยู่ในระดับของ f (x) อย่างไรก็ตามสเกลเฉพาะนั้นไม่ชัดเจนสำหรับกรณีของการแจกจ่าย = "adaboost" ใครสามารถช่วยในการตีความของผลตอบแทนที่คาดการณ์ไว้ .gbm และให้ความคิดของการแปลงไปยังเอาต์พุต 0-1?
9 r  gbm 

4
ควรใช้การถดถอยแบบไม่อิงพารามิเตอร์เมื่อใด
ฉันใช้ PROC GLM ใน SAS เพื่อให้สมการถดถอยของแบบฟอร์มต่อไปนี้ Y=ข0+ข1X1+ข2X2+ข3X3+ข4เสื้อY=b0+b1X1+b2X2+b3X3+b4t Y = b_0 + b_1X_1 + b_2X_2 + b_3X_3 + b_4t พล็อต QQ ของ redsiduals ที่เกิดขึ้นบ่งบอกถึงการเบี่ยงเบนจากปกติ การเปลี่ยนแปลงของใด ๆจะไม่เป็นประโยชน์ในการทำให้ส่วนที่เหลือเป็นปกติYYY ณ จุดนี้ฉันสามารถเปลี่ยนเป็นวิธีที่ไม่ใช่พารามิเตอร์อย่างปลอดภัยเช่น PROC LOESS ฉันใช้ PROC LOESS แล้วและแบบที่ดูดีกว่า PROC GLM แต่ฉันไม่มีความรู้มากนักในการถดถอยแบบไม่อิงพารามิเตอร์ ฉันไม่ทราบว่าเมื่อใดควรเลือกการถดถอยแบบไม่อิงพารามิเตอร์ในการถดถอยแบบพารามิเตอร์ มีคนช่วยฉันได้ไหม ฉันจะดำเนินการต่อและเพิ่มคำถามอื่น ต่อไปนี้เป็นคำอธิบายของตัวแปรของฉันในรูปแบบ บางครั้งฉันได้รับค่าใช้จ่ายคาดการณ์เชิงลบ สิ่งนี้ไม่สมเหตุสมผล ฉันจะแก้ไขปัญหานี้ได้อย่างไรY= ค่ารักษาพยาบาลX1= จำนวนการฉีดX2= จำนวนการผ่าตัดX3= จำนวนการบำบัดทางกายภาพt = เวลาY=cost of …

2
ทำไมปริมาณความแปรปรวนอธิบายโดยคอมพิวเตอร์เครื่องที่ 1 ของฉันจึงใกล้เคียงกับค่าสหสัมพันธ์แบบคู่เฉลี่ย?
อะไรคือความสัมพันธ์ระหว่างองค์ประกอบหลักแรกและความสัมพันธ์เฉลี่ยในเมทริกซ์ความสัมพันธ์ ตัวอย่างเช่นในแอปพลิเคชันเชิงประจักษ์ฉันสังเกตว่าความสัมพันธ์โดยเฉลี่ยเกือบจะเหมือนกับอัตราส่วนของความแปรปรวนขององค์ประกอบหลักตัวแรก (ค่าเริ่มต้นแรก) ต่อความแปรปรวนทั้งหมด (ผลรวมของค่าลักษณะเฉพาะทั้งหมด) มีความสัมพันธ์ทางคณิตศาสตร์หรือไม่? ด้านล่างคือแผนภูมิของผลลัพธ์เชิงประจักษ์ โดยที่ correlation คือค่าสหสัมพันธ์โดยเฉลี่ยระหว่างองค์ประกอบดัชนีหุ้น DAX ที่คำนวณได้จากการคำนวณในช่วงเวลา 15 วันและความแปรปรวนที่อธิบายคือส่วนแบ่งความแปรปรวนที่อธิบายโดยองค์ประกอบหลักตัวแรกที่คำนวณด้วยหน้าต่างกลิ้ง 15 วัน สิ่งนี้สามารถอธิบายได้ด้วยตัวแบบปัจจัยความเสี่ยงทั่วไปเช่น CAPM หรือไม่?

1
“ เนื่องจากใกล้เคียงกับเกาส์เซียนไฟล์ PDF จึงสามารถเขียนเป็น…”
คำถามสั้น ๆ :ทำไมถึงเป็นจริง คำถามยาว: ง่ายมากฉันพยายามหาว่าอะไรที่ทำให้สมการแรกนี้เป็นจริง ผู้เขียนหนังสือที่ฉันกำลังอ่าน (บริบทที่นี่หากคุณต้องการ แต่ไม่จำเป็น) อ้างสิทธิ์ดังต่อไปนี้: เนื่องจากข้อสันนิษฐานว่าใกล้ - เกาส์เซียเราสามารถเขียน: p0(ξ)=Aϕ(ξ)exp(an+1ξ+(an+2+12)ξ2+∑i=1naiGi(ξ))p0(ξ)=Aϕ(ξ)exp(an+1ξ+(an+2+12)ξ2+∑i=1naiGi(ξ)) p_0(\xi) = A \; \phi(\xi) \; exp( a_{n+1}\xi + (a_{n+2} + \frac{1}{2})\xi^2 + \sum_{i=1}^{n} a_i G_i(\xi)) โดยที่เป็น PDF ของข้อมูลที่คุณสังเกตเห็นซึ่งมีค่าเอนโทรปีสูงสุดเนื่องจากคุณสังเกตเห็นชุดของความคาดหวัง (ตัวเลขง่าย) , ที่และเป็น PDF ของตัวแปร gaussian ที่ได้มาตรฐานนั่นคือ 0 หมายถึงและความแปรปรวนของหน่วยp0(ξ)p0(ξ)p_0(\xi)ci,i=1...nci,i=1...nc_i, i = 1 ... nci=E{Gi(ξ)}ci=E{Gi(ξ)}c_i = \mathbb{E}\{G_i(\xi)\}ϕ(ξ)ϕ(ξ)\phi(\xi) สิ่งที่เกิดขึ้นคือเขาใช้สมการข้างต้นเป็นจุดเริ่มต้นในการสร้าง PDF,ง่ายขึ้นและฉันเข้าใจว่าเขาทำได้ …

1
จะเปรียบเทียบเหตุการณ์ที่สังเกตได้กับเหตุการณ์ที่คาดหวังได้อย่างไร
สมมติว่าฉันมีตัวอย่างหนึ่งความถี่ของเหตุการณ์ที่เป็นไปได้ 4 เหตุการณ์: Event1 - 5 E2 - 1 E3 - 0 E4 - 12 และฉันมีโอกาสที่จะเกิดเหตุการณ์ที่คาดหวัง: p1 - 0.2 p2 - 0.1 p3 - 0.1 p4 - 0.6 ด้วยผลรวมของความถี่ที่สังเกตได้จากเหตุการณ์ทั้งสี่ของฉัน (18) ฉันสามารถคำนวณความถี่ที่คาดหวังของเหตุการณ์ได้ใช่ไหม expectedE1 - 18 * 0.2 = 3.6 expectedE2 - 18 * 0.1 = 1.8 expectedE1 - 18 * 0.1 …
9 r  statistical-significance  chi-squared  multivariate-analysis  exponential  joint-distribution  statistical-significance  self-study  standard-deviation  probability  normal-distribution  spss  interpretation  assumptions  cox-model  reporting  cox-model  statistical-significance  reliability  method-comparison  classification  boosting  ensemble  adaboost  confidence-interval  cross-validation  prediction  prediction-interval  regression  machine-learning  svm  regularization  regression  sampling  survey  probit  matlab  feature-selection  information-theory  mutual-information  time-series  forecasting  simulation  classification  boosting  ensemble  adaboost  normal-distribution  multivariate-analysis  covariance  gini  clustering  text-mining  distance-functions  information-retrieval  similarities  regression  logistic  stata  group-differences  r  anova  confidence-interval  repeated-measures  r  logistic  lme4-nlme  inference  fiducial  kalman-filter  classification  discriminant-analysis  linear-algebra  computing  statistical-significance  time-series  panel-data  missing-data  uncertainty  probability  multivariate-analysis  r  classification  spss  k-means  discriminant-analysis  poisson-distribution  average  r  random-forest  importance  probability  conditional-probability  distributions  standard-deviation  time-series  machine-learning  online  forecasting  r  pca  dataset  data-visualization  bayes  distributions  mathematical-statistics  degrees-of-freedom 

3
รูปแบบใดที่สามารถใช้เมื่อมีการละเมิดสมมติฐานความแปรปรวนคงที่
เนื่องจากเราไม่สามารถพอดีกับแบบจำลอง ARIMA เมื่อมีการละเมิดสมมติฐานความแปรปรวนคงที่รูปแบบใดที่สามารถใช้เพื่อให้พอดีกับอนุกรมเวลาแบบไม่แปร

1
Parametrizing การแจกแจงของเบห์น - ฟิชเชอร์
"ปัญหา Behrens - Fisher: บทวิจารณ์" โดย Seock-Ho Kim และ Allen S. Cohen วารสารสถิติการศึกษาและพฤติกรรมเล่ม 23 หมายเลข 4 ฤดูหนาว 2541 หน้า 356–377 ฉันกำลังดูสิ่งนี้และมันบอกว่า: ฟิชเชอร์ (1935, 1939) เลือกสถิติ τ=δ- (x¯2-x¯1)s21/n1+s22/n2-----------√=เสื้อ2cosθ -เสื้อ1บาปθτ=δ-(x¯2-x¯1)s12/n1+s22/n2=เสื้อ2cos⁡θ-เสื้อ1บาป⁡θ \tau = \frac{\delta-(\bar x_2 - \bar x_1)}{\sqrt{s_1^2/n_1+s_2^2/n_2}} = t_2\cos\theta - t_1\sin\theta [ที่ เสื้อผมเสื้อผมt_i เป็นหนึ่งตัวอย่างปกติ เสื้อเสื้อt- สถิติสำหรับ i = 1 , 2ผม=1,2i=1,2] ที่ไหน …

6
ทำไมความผันผวนจึงเป็นหัวข้อสำคัญในเศรษฐศาสตร์การเงิน?
ฉันไม่ทราบว่าเป็นหัวข้อนอกเรื่องทั้งหมดหรือไม่ แต่ฉันคิดว่ามันอาจมีประโยชน์ในการมีความคิดเห็นและคำตอบโดยรวมเกี่ยวกับสาเหตุที่ความผันผวนเป็นหัวข้อสำคัญในเศรษฐศาสตร์การเงิน ฉันคิดว่ามันเริ่มต้นด้วยทฤษฎีพอร์ตโฟลิโอและความต้องการที่จะเข้าใจคุณสมบัติของช่วงเวลาที่สองพื้นฐานของผลตอบแทนสินทรัพย์ ต่อมาสูตร Black-Scholes และความนิยมของตราสารอนุพันธ์ทำให้เอนทิตีนี้สำคัญมากในด้านการเงิน

2
การปรับสถาปัตยกรรม NN แบบไดนามิก: การประดิษฐ์สิ่งที่ไม่จำเป็น?
ฉันเริ่มต้นการเดินทางในระดับปริญญาเอกของฉันและเป้าหมายสูงสุดที่ฉันตั้งไว้ก่อนหน้านี้คือการพัฒนา ANNs ที่จะคอยตรวจสอบสภาพแวดล้อมที่พวกเขาทำงานและปรับสถาปัตยกรรมของพวกเขาให้เข้ากับปัญหาในมือ ความหมายที่ชัดเจนคือข้อมูลชั่วคราว: ถ้าชุดข้อมูลไม่ต่อเนื่องและไม่เปลี่ยนแปลงตลอดเวลาทำไมต้องปรับเลย คำถามใหญ่คือด้วยการเรียนรู้ที่เพิ่มขึ้นเมื่อเร็ว ๆ นี้มันยังคงเป็นหัวข้อที่เกี่ยวข้องหรือไม่? FFNNs มีโอกาสที่จะพบว่าตัวเองมีปัญหาในการดริฟท์แนวคิดหรือไม่? ฉันกลัวที่จะโอเวอร์โหลดเธรดที่มีคำถามมากเกินไป แต่คำถามนี้ไม่ได้อยู่นอกหัวข้อทั้งหมด: ฉันทราบถึง RNNs แต่ฉันมีประสบการณ์ จำกัด (ไม่เป็นไรไม่มีเหตุผลหรือเชิงทฤษฎี) กับพวกเขา ฉันเชื่อว่าการปรับสถาปัตยกรรมแบบไดนามิกต้องเป็นหัวข้อที่เกี่ยวข้องในบริบทของ RNN คำถามคือมันได้รับคำตอบแล้วและฉันจะคิดค้นล้อใหม่หรือไม่ PS ข้ามโพสต์ไปยังMetaOptimize

4
การเลือกแบบจำลองและสมรรถนะของแบบจำลองในการถดถอยโลจิสติกส์
ฉันมีคำถามเกี่ยวกับการเลือกแบบจำลองและประสิทธิภาพของตัวแบบในการถดถอยโลจิสติก ฉันมีสามแบบซึ่งตั้งอยู่บนสมมติฐานที่แตกต่างกันสามแบบ สองรุ่นแรก (ให้ตั้งชื่อพวกเขาว่า z และ x) จะมีตัวแปรอธิบายเพียงตัวเดียวในแต่ละรุ่นและรุ่นที่สาม (ให้ชื่อมันด้วย) มีความซับซ้อนมากขึ้น ฉันใช้ AIC สำหรับการเลือกตัวแปรสำหรับรุ่น w แล้ว AIC เพื่อเปรียบเทียบว่าสามรุ่นใดที่อธิบายตัวแปรตามได้ดีที่สุด ฉันพบว่าโมเดล w มีค่า AIC ต่ำที่สุดและตอนนี้ต้องการทำสถิติประสิทธิภาพสำหรับโมเดลนั้นเพื่อให้ได้แนวคิดเกี่ยวกับพลังการทำนายของโมเดล เนื่องจากทั้งหมดที่ฉันรู้คือว่ารุ่นนี้ดีกว่าอีกสองคน แต่ไม่ดีเท่าไหร่ เนื่องจากฉันใช้ข้อมูลทั้งหมดเพื่อเรียนรู้รูปแบบ (เพื่อให้สามารถเปรียบเทียบทั้งสามรุ่น) ฉันจะทำอย่างไรกับประสิทธิภาพของโมเดล จากสิ่งที่ฉันรวบรวมฉันไม่สามารถทำการตรวจสอบความถูกต้องไขว้กันของ k-fold ในรุ่นสุดท้ายที่ฉันได้รับจากการเลือกแบบจำลองโดยใช้ AIC แต่ต้องเริ่มจากจุดเริ่มต้นด้วยตัวแปรอธิบายรวมอยู่ด้วยใช่ไหม ฉันคิดว่ามันเป็นรุ่นสุดท้ายที่ฉันเลือกกับ AIC ที่ฉันต้องการทราบว่ามันทำงานได้ดีเพียงใด แต่ตระหนักว่าฉันได้รับการฝึกอบรมเกี่ยวกับข้อมูลทั้งหมดเพื่อให้โมเดลนั้นมีความลำเอียง ดังนั้นถ้าฉันควรเริ่มจากจุดเริ่มต้นด้วยตัวแปรอธิบายทั้งหมดในทุกเท่าฉันจะได้แบบจำลองขั้นสุดท้ายที่แตกต่างกันสำหรับบางเท่าฉันสามารถเลือกแบบจำลองจากการพับซึ่งให้พลังการทำนายที่ดีที่สุดและนำไปใช้กับชุดข้อมูลแบบเต็มเพื่อเปรียบเทียบ AIC กับอีกสองรุ่น (z และ x)? หรือมันทำงานอย่างไร ส่วนที่สองของคำถามของฉันคือคำถามพื้นฐานเกี่ยวกับการกำหนดพารามิเตอร์มากเกินไป ฉันมี 156 จุดข้อมูล 52 เป็น 1 …

2
ฉันจะหาชุดข้อมูลที่มีประโยชน์สำหรับการทดสอบการใช้งานการเรียนรู้ด้วยตนเองได้อย่างไร [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามดังนั้นจึงเป็นหัวข้อสำหรับการตรวจสอบข้าม ปิดให้บริการใน6 ปีที่ผ่านมา ฉันกำลังพยายามใช้อัลกอริทึมการเรียนรู้ด้วยตนเองบางอย่างด้วยตัวเอง หลายคนมีคุณสมบัติที่น่ารังเกียจในการแก้ไขข้อบกพร่องบางข้อไม่ทำให้โปรแกรมขัดข้อง แต่ทำงานไม่ได้ตามที่ต้องการและดูเหมือนว่าอัลกอริธึมให้ผลลัพธ์ที่อ่อนแอกว่า ฉันต้องการเพิ่มความมั่นใจในการใช้งานเช่นถ้าฉันมีชุดข้อมูลขนาดเล็กบางส่วนพร้อมข้อมูลเพิ่มเติม "อัลกอริทึม X ทำงานสำหรับการทำซ้ำ Y และให้ผลลัพธ์ Z ในชุดข้อมูลนี้" ซึ่งจะเป็นประโยชน์จริง ๆ มีใครเคยได้ยินชุดข้อมูลดังกล่าวบ้างไหม
9 dataset 

3
การแก้ไข Bonferroni ด้วยความสัมพันธ์ของ Pearson และการถดถอยเชิงเส้น
ฉันกำลังใช้งานสถิติใน 5 IVs (5 ลักษณะบุคลิกภาพ, การพาหิรวัฒน์, ความสอดคล้อง, ความมีสติ, ความมั่นคงทางอารมณ์, การเปิดกว้าง) กับ 3 DVs ทัศนคติต่อ PCT, ทัศนคติต่อ CBT, ทัศนคติต่อ PCT เทียบกับ CBT ฉันยังเพิ่มอายุและเพศเพื่อดูว่ามีเอฟเฟกต์อะไรอีกบ้าง ฉันกำลังทดสอบเพื่อดูว่าลักษณะบุคลิกภาพสามารถทำนายทัศนคติของ DV ได้หรือไม่ ฉันเริ่มใช้เพียร์สันสหสัมพันธ์สำหรับตัวแปรทั้งหมด (45 การทดสอบ) การค้นพบที่สำคัญคือการพาหิรวัฒน์สัมพันธ์กับทัศนคติของ PCT ที่ p = 0.05 แต่เมื่อฉันทำการทดสอบ 45 ครั้งฉันได้ทำการแก้ไข Bonferroni ที่ alpha = 0.05 / 45 = 0.001 ดังนั้นการค้นพบนี้จึงไม่มีนัยสำคัญ จากนั้นฉันก็ทำการถดถอยเชิงเส้นอย่างง่าย ๆ ในตัวแปรทั้งหมดอีกครั้งการพาหิรวัฒน์อีกครั้งสำคัญกับทัศนคติต่อ …

2
ตัวทำนายบางตัวของฉันอยู่ในสเกลที่แตกต่างกันมาก - ฉันต้องเปลี่ยนพวกมันก่อนที่จะปรับตัวแบบถดถอยเชิงเส้นหรือไม่?
ฉันต้องการรันการถดถอยเชิงเส้นบนชุดข้อมูลแบบหลายมิติ มีความแตกต่างระหว่างมิติต่าง ๆ ในแง่ของขนาดของระเบียบ ตัวอย่างเช่นโดยทั่วไปส่วนข้อมูล 1 มีช่วงค่า [0, 1] และส่วนข้อมูล 2 มีช่วงค่า [0, 1,000] ฉันจำเป็นต้องทำการแปลงใด ๆ เพื่อให้แน่ใจว่าช่วงข้อมูลสำหรับมิติข้อมูลที่แตกต่างกันอยู่ในระดับเดียวกันหรือไม่ ถ้ามีจะมีแนวทางใดสำหรับการเปลี่ยนแปลงเช่นนี้หรือไม่?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.