สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
ทำไมการบรรจุถุงถึงใช้ตัวอย่างบูตสแตรป
การห่อเป็นกระบวนการในการสร้างผู้เรียน N คนในกลุ่มตัวอย่างรองเท้าบู๊ต N ที่แตกต่างกันจากนั้นนำค่าเฉลี่ยของการทำนาย คำถามของฉันคือทำไมไม่ใช้การสุ่มตัวอย่างแบบอื่น ทำไมต้องใช้ตัวอย่างบูตสแตรป?
10 bagging 

2
Caret varImp สำหรับรุ่นสุ่มป่าไม้
ฉันมีปัญหาในการทำความเข้าใจเกี่ยวกับวิธีการvarImpทำงานของโมเดลสุ่มป่าด้วยcaretแพคเกจ ในตัวอย่างด้านล่างนี้คุณลักษณะ var3 ได้รับความสำคัญเป็นศูนย์โดยใช้varImpฟังก์ชั่นของคาเร็ต แต่โมเดลขั้นสุดท้ายแบบสุ่มพื้นฐานที่มีความสำคัญไม่เป็นศูนย์สำหรับคุณลักษณะ var3 เหตุใดจึงเป็นเช่นนี้ require(randomForest) require(caret) rf <- train(x, y, method = "rf", trControl = trainControl(method = "oob"), importance = TRUE, verbose = TRUE, tuneGrid = data.frame(mtry = num.predictors) ) fm <- rf$finalModel > varImp(f) rf variable importance Overall var1 100.00 var2 80.14 var3 0.00 > importance(fm) …
10 r  caret  random-forest 

2
การแทรกแซงด้วยความแตกต่าง
เมื่อทำการวิเคราะห์การแทรกแซงด้วยข้อมูลอนุกรมเวลา (อนุกรมเวลาขัดจังหวะ aka) ดังที่กล่าวไว้ที่นี่ตัวอย่างหนึ่งข้อกำหนดที่ฉันมีคือการประเมินผลรวม (หรือการสูญเสีย) เนื่องจากการแทรกแซง - จำนวนหน่วยที่ได้รับหรือสูญหาย (ตัวแปร Y ) ไม่เข้าใจวิธีการประมาณฟังก์ชั่นการแทรกแซงโดยใช้ฟังก์ชั่นตัวกรองภายใน R ฉันไปเกี่ยวกับมันในลักษณะเดรัจฉานแรงหวังว่านี่เป็นเรื่องทั่วไปพอที่จะทำงานในสถานการณ์ใด ๆ ให้บอกว่าได้รับข้อมูล cds<- structure(c(2580L, 2263L, 3679L, 3461L, 3645L, 3716L, 3955L, 3362L, 2637L, 2524L, 2084L, 2031L, 2256L, 2401L, 3253L, 2881L, 2555L, 2585L, 3015L, 2608L, 3676L, 5763L, 4626L, 3848L, 4523L, 4186L, 4070L, 4000L, 3498L), .Dim = c(29L, 1L), …

1
การตรวจสอบแบบโฮลด์เอ้าท์เป็นการประมาณที่ดีกว่าสำหรับการรับข้อมูลใหม่กว่า k-fold CV หรือไม่?
ฉันคิดทบทวนคำตอบอีกครั้งเมื่อสองสามสัปดาห์ที่แล้ว การตรวจสอบความถูกต้องไขว้ของ Hold-out สร้างชุดการทดสอบเดี่ยวที่สามารถใช้ซ้ำ ๆ เพื่อสาธิตได้ เราทุกคนต่างก็เห็นด้วยว่านี่เป็นคุณลักษณะเชิงลบหลายประการเนื่องจากชุดที่ถูกชูไว้อาจกลายเป็นตัวแทนที่ไม่ใช่แบบสุ่มได้ ยิ่งไปกว่านั้นคุณสามารถสรุปข้อมูลการทดสอบในแบบเดียวกับที่คุณสามารถประเมินข้อมูลการฝึกอบรมได้ อย่างไรก็ตามสำหรับฉันแล้วดูเหมือนว่าลักษณะคงที่ของตัวอย่างที่ถูกจัดเก็บออกมานั้นเป็นการประมาณที่ดีกว่าในการ "รับข้อมูลเพิ่มเติม" กว่า k-fold CV และหลีกเลี่ยงปัญหาการเฉลี่ยข้ามครึ่ง อย่างไรก็ตามฉันไม่สามารถคิดสถิติพื้นฐานสำหรับความรู้สึกนี้ได้ มีเหตุผลอะไรบ้างในสัญชาตญาณของฉัน ตัวอย่างเช่นสิ่งที่ฉันมีอยู่ในใจสำหรับโครงการที่จะเกิดขึ้นเป็นครั้งแรกโดยใช้การตรวจสอบความถูกต้องในการสร้างและทดสอบแบบจำลองจากนั้นเป็นขั้นตอนการตรวจสอบความถูกต้องอีกครั้งการวาดภาพที่ค้างไว้ตั้งหลายครั้ง ในชุดทดสอบ) มีความทนทานต่อการสุ่มตัวอย่างข้อผิดพลาดในชุดทดสอบ นี่เป็นความคิดที่ดีไม่ว่าด้วยเหตุผลใด ๆ คำถามนี้ถูกถามมาก่อนแต่ไม่เคยได้รับคำตอบ

4
การแปรปรวนเวลาแบบไดนามิกสำหรับอนุกรมเวลาที่ผิดปกติ
ฉันได้อ่านเกี่ยวกับ Dynamic Time Warping (DTW) เมื่อไม่นานมานี้ ฉันประหลาดใจมากที่ไม่มีวรรณกรรมเลยในการใช้ DTW กับซีรี่ย์เวลาที่ผิดปกติหรืออย่างน้อยฉันก็หาไม่เจอ ใครช่วยให้ฉันอ้างอิงถึงบางสิ่งที่เกี่ยวข้องกับปัญหานั้นหรือแม้กระทั่งการใช้งานได้หรือไม่

2
ควรจำแนกประเภทของข้อมูล (ชื่อ / ลำดับ / ช่วงเวลา / อัตราส่วน) จริงหรือไม่?
ตัวอย่างเช่นนี่คือคำจำกัดความที่ฉันได้รับจากหนังสือเรียนมาตรฐาน Variable - ลักษณะของประชากรหรือกลุ่มตัวอย่าง อดีต ราคาหุ้นหรือเกรดจากการทดสอบ ข้อมูล - ค่าที่สังเกตได้จริง ดังนั้นสำหรับรายงานสองคอลัมน์ [ชื่อ | รายได้] ชื่อคอลัมน์จะเป็นตัวแปรและค่าที่สังเกตได้จริง {dave | 100K}, {jim | 200K} จะเป็นข้อมูล ดังนั้นถ้าฉันบอกว่าคอลัมน์ [ชื่อ] เป็นข้อมูลที่ระบุและ [รายได้] เป็นข้อมูลอัตราส่วนฉันจะไม่ถูกต้องมากกว่าที่จะอธิบายว่ามันเป็นตัวแปรชนิดหนึ่งแทนที่จะเป็นประเภทข้อมูลที่ตำราเรียนส่วนใหญ่ทำหรือไม่ ฉันเข้าใจว่านี่อาจเป็นความหมายและก็ไม่เป็นไรนั่นคือทั้งหมดที่มีเช่นกัน แต่ฉันกลัวว่าฉันอาจจะพลาดบางสิ่งบางอย่างที่นี่

3
เป็นไปได้ใน R (หรือโดยทั่วไป) เพื่อบังคับให้สัมประสิทธิ์การถดถอยเป็นสัญญาณที่แน่นอน?
ฉันกำลังทำงานกับข้อมูลโลกแห่งความจริงและตัวแบบการถดถอยกำลังให้ผลลัพธ์ที่ตรงข้าม โดยปกติฉันเชื่อถือสถิติ แต่ในความเป็นจริงสิ่งเหล่านี้ไม่สามารถเป็นจริงได้ ปัญหาหลักที่ฉันเห็นคือการเพิ่มขึ้นของตัวแปรหนึ่งทำให้การตอบสนองเพิ่มขึ้นเมื่อในความเป็นจริงในความเป็นจริงพวกเขาจะต้องมีความสัมพันธ์เชิงลบ มีวิธีการบังคับให้ลงชื่อเฉพาะสำหรับแต่ละสัมประสิทธิ์การถดถอยหรือไม่? รหัส R ใด ๆ ในการทำเช่นนี้ก็จะได้รับการชื่นชมเช่นกัน ขอบคุณสำหรับความช่วยเหลือใด ๆ !

2
เหรียญที่ยุติธรรมจะถูกโยนจนกระทั่งหัวขึ้นมาเป็นครั้งแรก ความน่าจะเป็นที่จะเกิดขึ้นกับการโยนเลขคี่นั้นคืออะไร?
เหรียญที่ยุติธรรมจะถูกโยนจนกระทั่งหัวขึ้นมาเป็นครั้งแรก ความน่าจะเป็นที่จะเกิดขึ้นกับการโยนเลขคี่นั้นคืออะไร? ฉันจะแก้ไขปัญหานี้ได้อย่างไร

2
การแจกแจงเสถียรที่สามารถคูณได้หรือไม่
การแจกแจงที่เสถียรมีค่าคงที่ภายใต้การโน้มน้าวใจ ครอบครัวย่อยของการแจกแจงที่เสถียรจะถูกปิดภายใต้การคูณ ในแง่ที่ว่าถ้าและแล้วน่าจะเป็นสินค้าที่มีฟังก์ชั่นความหนาแน่น (ได้ถึงคงฟื้นฟู) ยังเป็น ?f ∈ F g ∈ F f ⋅ g FFFFฉ∈ Ff∈Ff\in Fก.∈ Fg∈Fg\in F ฉ⋅ กรัมf⋅gf \cdot gFFF หมายเหตุ:ฉันเปลี่ยนเนื้อหาของคำถามนี้อย่างมาก แต่ความคิดนั้นก็เหมือนกันและตอนนี้มันง่ายกว่ามาก ฉันมีคำตอบเพียงบางส่วนเท่านั้นดังนั้นฉันคิดว่าไม่เป็นไร

4
การกำหนดพารามิเตอร์ (p, d, q) สำหรับการสร้างแบบจำลอง ARIMA
ฉันค่อนข้างใหม่สำหรับสถิติและอาร์ฉันต้องการทราบกระบวนการในการกำหนดพารามิเตอร์ ARIMA สำหรับชุดข้อมูลของฉัน คุณสามารถช่วยฉันคิดโดยใช้ R และในทางทฤษฎี (ถ้าเป็นไปได้)? ช่วงข้อมูลตั้งแต่ Jan-12 ถึง Mar-14 และแสดงยอดขายรายเดือน นี่คือชุดข้อมูล: 99 58 52 83 94 73 97 83 86 63 77 70 87 84 60 105 87 93 110 71 158 52 33 68 82 88 84 และนี่คือแนวโน้ม: ข้อมูลไม่แสดงแนวโน้มพฤติกรรมตามฤดูกาลหรือความเป็นวงจร
10 r  arima  box-jenkins 

1
ฟังก์ชันการสร้างช่วงเวลาและการแปลงฟูริเยร์?
ฟังก์ชันสร้างโมเมนต์คือการแปลงฟูริเยร์ของฟังก์ชันความหนาแน่นของความน่าจะเป็นหรือไม่? อีกนัยหนึ่งคือช่วงเวลาที่สร้างฟังก์ชั่นเพียงความละเอียดสเปกตรัมของการแจกแจงความหนาแน่นของความน่าจะเป็นของตัวแปรสุ่มนั่นคือวิธีที่เท่าเทียมกันในการจำแนกลักษณะของฟังก์ชั่นในแง่ของความกว้างเฟสและความถี่แทนที่จะเป็นพารามิเตอร์ ถ้าเป็นเช่นนั้นเราสามารถให้การตีความทางกายภาพกับสัตว์ร้ายนี้ได้หรือไม่? ฉันถามเพราะในฟังก์ชั่นการสร้างจำนวนสะสมทางฟิสิกส์เชิงสถิติลอการิทึมของฟังก์ชันสร้างโมเมนต์เป็นปริมาณสารเติมแต่งที่อธิบายลักษณะของระบบทางกายภาพ หากคุณคิดว่าพลังงานเป็นตัวแปรแบบสุ่มฟังก์ชันการสร้างแบบสะสมจะมีการตีความอย่างง่าย ๆ เมื่อการกระจายพลังงานไปทั่วทั้งระบบ มีการตีความที่ใช้งานง่ายคล้ายกันสำหรับฟังก์ชั่นการสร้างช่วงเวลาหรือไม่? ฉันเข้าใจยูทิลิตี้ทางคณิตศาสตร์ของมัน แต่มันไม่ใช่แค่แนวคิดหลอกลวงแน่นอนว่ามันมีความหมายอยู่เบื้องหลัง
10 moments  mgf  cumulants 

2
การแสดงออกของรูปแบบปิดสำหรับการกระจายตัวของตัวอย่างความเค็มของการแจกแจงเกาส์
มีนิพจน์แบบปิดสำหรับการแจกตัวอย่าง Kurtosis ของข้อมูลจากการแจกแจงแบบเกาส์หรือไม่? กล่าวคือ ที่ Kคือโด่งตัวอย่างP(K^&lt;a)P(K^&lt;a)P(\hat{K}<a)K^K^\hat{K}

1
การตีความของพื้นที่ภายใต้เส้นโค้ง PR
ขณะนี้ฉันกำลังเปรียบเทียบสามวิธีและฉันมีความแม่นยำ auROC และ auPR เป็นตัวชี้วัด และฉันมีผลลัพธ์ต่อไปนี้: วิธี A - acc: 0.75, auROC: 0.75, auPR: 0.45 วิธี B - acc: 0.65, auROC: 0.55, auPR: 0.40 วิธี C - acc: 0.55, auROC: 0.70, auPR: 0.65 ฉันมีความเข้าใจที่ถูกต้องและ auROC (จำได้ดีฉันมักจะพยายามหาประโยคเช่น "auROC = ลักษณะความสามารถในการทำนายชั้นบวกได้ดี" ในขณะที่ไม่ถูกต้องแม่นยำช่วยให้ฉันจำได้) ฉันไม่เคยมีข้อมูล auPR มาก่อนและในขณะที่ฉันเข้าใจว่ามันถูกสร้างขึ้นมาได้อย่างไรฉันไม่สามารถ "รู้สึก" อยู่ข้างหลังได้ ในความเป็นจริงฉันไม่เข้าใจว่าทำไมวิธี C มีคะแนนสูงอย่างไม่น่าเชื่อสำหรับ auPR ในขณะที่ไม่ดี …

2
ตัวชี้วัดที่ดีในการประเมินคุณภาพของ PCA คืออะไรเพื่อเลือกจำนวนขององค์ประกอบ
อะไรคือการวัดที่ดีสำหรับการประเมินคุณภาพของการวิเคราะห์องค์ประกอบหลัก (PCA) ฉันใช้อัลกอริทึมนี้กับชุดข้อมูล วัตถุประสงค์ของฉันคือลดจำนวนฟีเจอร์ (ข้อมูลซ้ำซ้อนมาก) ฉันรู้ว่าเปอร์เซ็นต์ของความแปรปรวนที่เก็บไว้เป็นตัวบ่งชี้ที่ดีว่าเราเก็บข้อมูลไว้มากน้อยเพียงใดจะมีตัวชี้วัดข้อมูลอื่นที่ฉันสามารถใช้เพื่อให้แน่ใจว่าฉันลบข้อมูลซ้ำซ้อนและไม่สูญเสียข้อมูลดังกล่าวหรือไม่

2
การคำนวณความสม่ำเสมอในการถ่ายภาพของ NBA
อะไรคือวิธีที่เหมาะสมในการประเมิน / กำหนดความสอดคล้องในการถ่ายภาพ 3 จุดของผู้เล่น NBA? ตัวอย่างเช่นฉันมีผู้เล่นที่ยิง 37% จากช่วง 3 จุดและใช้เวลา 200 ครั้งตลอดทั้งปี ฉันกำลังพิจารณาที่จะถ่ายภาพ 3% โดยเฉลี่ยของจำนวนนัดโดยพลการ (พูด 20) จากนั้นใช้ค่าเฉลี่ยเหล่านั้นเพื่อกำหนดค่าเบี่ยงเบนมาตรฐานจากค่าเฉลี่ย 37% การใช้ขนาดตัวอย่างที่หมุนได้ 20 นัดจะช่วยให้ความแม่นยำ 5% ในอัตราการถ่ายภาพ แต่ฉันกังวลว่าการใช้ภาพมากเกินไปจะไม่แสดงให้เห็นถึงความไม่สอดคล้องของประสิทธิภาพการทำงาน มีวิธีที่ดีกว่าในการพิจารณาความสอดคล้องหรือไม่

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.