สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
ความน่าจะเป็นในการวาดสี่ชนิดคืออะไรเมื่อดึงไพ่ 20 ใบจากสำรับ 52 ใบ
เมื่อวานนี้เพื่อนบ้านของฉันและฉันเล่นเกมไพ่และมีคนโผล่คำถามนี้ เราพยายามที่จะแก้ปัญหา แต่เราไม่สามารถเข้าใจได้ เช้านี้ฉันตื่นขึ้นมาและฉันก็ยังสงสัยว่าจะแก้มันอย่างไร คุณช่วยฉันหน่อยได้ไหม?

4
อะไรคือวิธีที่เหมาะสมกว่าในการสร้างชุดการค้างเอาไว้: เพื่อลบบางวิชาหรือเพื่อลบการสังเกตออกจากแต่ละวิชา
ฉันมีชุดข้อมูลที่มี 26 คุณสมบัติและ 31,000 แถว มันเป็นชุดข้อมูลของ 38 วิชา มันเป็นระบบไบโอเมตริกซ์ ดังนั้นฉันต้องการที่จะสามารถระบุวิชา เพื่อให้มีชุดทดสอบฉันรู้ว่าฉันต้องลบค่าบางอย่าง แล้วจะทำอย่างไรดีและทำไม (a) รักษา 30 ชุดของชุดฝึกอบรมและลบ 8 ชุดเป็นชุดทดสอบ (b) รักษาอาสาสมัคร 38 คน แต่ลบบางแถวออกจากกัน ในตอนท้ายฉันจะจบด้วยชุดฝึกอบรม: 24800 แถวจาก 38 วิชาและชุดทดสอบ: 6200 แถวจาก 38 วิชา

4
ผลรวมของตัวแปรสุ่ม lognormal อิสระปรากฏขึ้น lognormal?
ฉันพยายามที่จะเข้าใจว่าทำไมผลรวมของตัวแปรสุ่มสองตัว (หรือมากกว่า) เข้าสู่การแจกแจงแบบปกติขณะที่คุณเพิ่มจำนวนการสังเกต ฉันดูออนไลน์และไม่พบผลลัพธ์ใด ๆ ที่เกี่ยวข้องกับสิ่งนี้ เห็นได้ชัดว่าถ้าและเป็นตัวแปร lognormal ที่เป็นอิสระจากนั้นด้วยคุณสมบัติของ exponents และตัวแปรสุ่ม gaussianก็เป็น lognormal เช่นกัน อย่างไรก็ตามไม่มีเหตุผลที่จะแนะนำว่าเป็น lognormal เช่นกันY X × Y X + YXXXYYYX× YX×YX \times YX+ YX+YX+Y อย่างไรก็ตาม หากคุณสร้างตัวแปรสุ่มสุ่มอิสระ lognormalและและปล่อยให้และทำซ้ำขั้นตอนนี้หลายครั้งการกระจายของจะปรากฏขึ้น lognormal ดูเหมือนว่ามันจะเข้าใกล้การแจกแจงแบบปกติมากขึ้นเมื่อคุณเพิ่มจำนวนการสังเกตY Z = X + Y ZXXXYYYZ= X+ YZ=X+YZ=X+YZZZ ตัวอย่างเช่น: หลังจากสร้าง 1 ล้านคู่การแจกแจงบันทึกธรรมชาติของ Zจะได้รับในฮิสโตแกรมด้านล่าง สิ่งนี้มีความคล้ายคลึงกับการแจกแจงแบบปกติมากโดยชัดแจ้งว่าเป็น lognormal แน่นอนZZZ ใครบ้างมีความเข้าใจหรือการอ้างอิงถึงข้อความที่อาจใช้ในการทำความเข้าใจนี้

1
เหตุใด K ตัวเลือกจำนวนมากจึงลดคะแนนการตรวจสอบความถูกต้องไขว้ของฉัน
การเล่นกับBoston Housing DatasetและRandomForestRegressor(w / พารามิเตอร์เริ่มต้น) ใน scikit-Learn ฉันสังเกตเห็นบางสิ่งที่แปลก: ค่าเฉลี่ยการตรวจสอบความถูกต้องลดลงเมื่อฉันเพิ่มจำนวน folds เกิน 10 กลยุทธ์การตรวจสอบข้ามของฉันมีดังนี้: cv_met = ShuffleSplit(n_splits=k, test_size=1/k) scores = cross_val_score(est, X, y, cv=cv_met) ... ที่num_cvsหลากหลาย ฉันตั้งค่าtest_sizeเป็น1/num_cvsกระจกจำลองพฤติกรรมการแยกขนาดของรถไฟ / ทดสอบของ k-fold CV โดยทั่วไปฉันต้องการบางสิ่งบางอย่างเช่น k-fold CV แต่ฉันต้องการการสุ่มด้วย (เช่น ShuffleSplit) การทดลองนี้ซ้ำหลายครั้งแล้วคะแนนเฉลี่ยและส่วนเบี่ยงเบนมาตรฐานถูกวางแผนแล้ว (โปรดทราบว่าขนาดของkถูกระบุโดยพื้นที่ของวงกลมโดยค่าเบี่ยงเบนมาตรฐานอยู่บนแกน Y) การเพิ่มขึ้นอย่างต่อเนื่องk(จาก 2 เป็น 44) จะให้คะแนนเพิ่มขึ้นเล็กน้อยตามด้วยการลดลงอย่างต่อเนื่องเมื่อkเพิ่มขึ้นอีก (เกิน ~ 10 เท่า)! ถ้ามีอะไรฉันคาดหวังว่าข้อมูลการฝึกอบรมเพิ่มเติมจะนำไปสู่คะแนนเพิ่มขึ้นเล็กน้อย! ปรับปรุง …

2
การพิสูจน์ทฤษฎีบทขีด จำกัด กลางไม่ได้ใช้ฟังก์ชันลักษณะพิเศษ
มีข้อพิสูจน์ใด ๆ เกี่ยวกับ CLT ที่ไม่ได้ใช้ฟังก์ชั่นคุณสมบัติเป็นวิธีที่ง่ายกว่าหรือไม่ อาจจะเป็นวิธี Tikhomirov หรือสไตน์? มีบางอย่างในตัวที่คุณสามารถอธิบายให้นักศึกษามหาวิทยาลัย (ปีแรกของคณิตศาสตร์หรือฟิสิกส์) และใช้เวลาน้อยกว่าหนึ่งหน้า

3
อะไรคือข้อได้เปรียบของเครื่องกำเนิดไฟฟ้าแบบเอกซ์โพเนนเชียลแบบสุ่มโดยใช้วิธีของ Ahrens และ Dieter (1972) แทนที่จะใช้การแปลงผกผัน?
คำถามของฉันเป็นแรงบันดาลใจR 's rexp()ในตัวเครื่องกำเนิดไฟฟ้าจำนวนสุ่มชี้แจงฟังก์ชั่น เมื่อพยายามที่จะสร้างการกระจายชี้แจงตัวเลขสุ่มตำราหลายแนะนำผกผันเปลี่ยนวิธีการตามที่ระบุไว้ในหน้านี้วิกิพีเดีย ฉันรู้ว่ามีวิธีการอื่นเพื่อให้งานนี้สำเร็จ โดยเฉพาะอย่างยิ่งR 's รหัสที่มาใช้วิธีการที่ระบุไว้ในกระดาษโดย Ahrens & หิวโหย (1972) ฉันมั่นใจว่าวิธี Ahrens-Dieter (AD) นั้นถูกต้อง ยังฉันไม่เห็นประโยชน์ของการใช้วิธีการของพวกเขาเมื่อเทียบกับวิธีการแปลงผกผัน (IT) โฆษณาไม่เพียง แต่ซับซ้อนในการติดตั้งมากกว่าไอที ดูเหมือนจะไม่ได้รับประโยชน์ความเร็วอย่างใดอย่างหนึ่ง นี่คือรหัสRของฉันที่จะเปรียบเทียบทั้งสองวิธีแล้วตามด้วยผลลัพธ์ invTrans <- function(n) -log(runif(n)) print("For the inverse transform:") print(system.time(invTrans(1e8))) print("For the Ahrens-Dieter algorithm:") print(system.time(rexp(1e8))) ผล: [1] "For the inverse transform:" user system elapsed 4.227 0.266 4.597 [1] "For …

2
เป็นความผิดหรือไม่ที่จะใช้ ANOVA แทนที่จะใช้ t-test เพื่อเปรียบเทียบสองวิธี?
ฉันมีการกระจายเงินเดือนและฉันต้องการเปรียบเทียบความแตกต่างของค่าเฉลี่ยสำหรับชายและหญิง ฉันรู้ว่ามีนักเรียน T-test สำหรับเปรียบเทียบสองวิธี แต่หลังจากแนะนำ ANOVA ฉันได้รับการวิจารณ์ว่า ANOVA นั้นสำหรับเปรียบเทียบมากกว่าสองวิธี มีอะไรผิดพลาดในการใช้มันเพื่อเปรียบเทียบเพียง 2 หมายความว่าอย่างไร

1
การเลือกรูปแบบ Mclust
แพ็คเกจ R mclustใช้ BIC เป็นเกณฑ์สำหรับการเลือกรูปแบบคลัสเตอร์ จากความเข้าใจของฉันควรเลือกรุ่นที่มี BIC ต่ำที่สุดเหนือรุ่นอื่น ๆ (ถ้าคุณสนใจเฉพาะ BIC เท่านั้น) อย่างไรก็ตามเมื่อค่า BIC เป็นลบทั้งหมดMclustฟังก์ชันจะใช้ค่าเริ่มต้นเป็นแบบจำลองที่มีค่า BIC สูงสุด เข้าใจโดยรวมของฉันจากการทดลองต่างๆที่mclustระบุ "ดีที่สุด" รุ่นที่เป็นผู้ที่มี\}max{BICi}max{BICi}max\{BIC_i\} ฉันพยายามที่จะเข้าใจว่าทำไมผู้เขียนตัดสินใจนี้ มันแสดงให้เห็นในเว็บไซต์ CRAN: https://cran.r-project.org/web/packages/mclust/vignettes/mclust.html นอกจากนี้ผู้เขียนของmclustบรรจุภัณฑ์ยังจดบันทึกสิ่งนี้ไว้ในวิธีการจำแนกประเภทแบบจำลองโดยใช้กระดาษ: การใช้ซอฟต์แวร์ mclust ในเคมีประยุกต์ในหน้า 5 โมเดล 'ที่ดีที่สุด' นั้นถูกนำมาใช้เป็นรุ่นที่มี BIC สูงที่สุดในบรรดารุ่นที่ติดตั้งไว้ ทุกคนสามารถเปล่งแสงในปัญหานี้ได้หรือไม่? ถ้า BIC ที่ต่ำกว่าดีกว่าอยู่เสมอทำไมผู้เขียนถึงไม่เลือกรุ่นที่มี BIC ต่ำสุด แต่แทนที่จะเป็นรุ่นที่มี BIC ที่เล็กที่สุด? ถ้าเป็นไปได้ให้อ้างอิง

3
ฉันควรใช้การชดเชยสำหรับ Poisson GLM ของฉันหรือไม่
ฉันกำลังทำการวิจัยเพื่อดูความแตกต่างของความหนาแน่นของปลาและความร่ำรวยของสายพันธุ์ปลาเมื่อใช้วิธีการสำรวจสำมะโนประชากรด้วยภาพใต้น้ำสองวิธี เดิมข้อมูลของฉันถูกนับข้อมูล แต่โดยทั่วไปแล้วนี่จะเปลี่ยนเป็นความหนาแน่นของปลา แต่ฉันยังคงตัดสินใจใช้ Poisson GLM ซึ่งฉันหวังว่าถูกต้อง model1 <- glm(g_den ~ method + site + depth, poisson) ตัวแปรทำนาย 3 ตัวของฉันคือวิธีเว็บไซต์และความลึกซึ่งฉันสั่งเป็นปัจจัยเมื่อฉันป้อนพวกเขา ตัวแปรการตอบสนองของฉันคือความอุดมสมบูรณ์ของปลากะรัง, ความหนาแน่นของปลาเก๋าและเหมือนกันสำหรับกลุ่มปลาอื่น ๆ ฉันทราบว่าความหนาแน่นไม่ใช่จำนวนเต็มและเป็นข้อมูลตัวเลขเช่น 1.34849 ตอนนี้ฉันได้รับข้อผิดพลาดนี้: In dpois(y, mu, log = TRUE) : non-integer x = 0.037500 ฉันอ่านมาแล้วหลายคนแนะนำให้ใช้การชดเชยนี่เป็นสิ่งที่แนะนำให้ทำมากที่สุดหรือไม่?

2
การถดถอยเชิงเส้นหลายครั้งใน 3 มิติเป็นระนาบที่พอดีที่สุดหรือเป็นเส้นที่พอดีที่สุดหรือไม่?
ศาสตราจารย์ของเราไม่ได้เข้าสู่คณิตศาสตร์หรือแม้แต่การแสดงเชิงเรขาคณิตของการถดถอยเชิงเส้นหลายเส้นและสิ่งนี้ทำให้ฉันสับสนเล็กน้อย ในอีกด้านหนึ่งก็ยังคงเรียกว่าการถดถอยเชิงเส้นหลายครั้งแม้ในมิติที่สูงขึ้น ในทางกลับกันถ้าเรามีตัวอย่างเช่นY = ข0 + ข1 X 1 + B 2 X 2และเราสามารถเสียบค่าใด ๆ ที่เราต้องการสำหรับX 1และX 2จะไม่ให้นี้เรา ระนาบของการแก้ปัญหาที่เป็นไปได้และไม่ใช่เส้น?Y^= b0+ b1X1+ b2X2Y^=b0+b1X1+b2X2\hat{Y} = b_0 + b_1 X_1 + b_2 X_2X1X1X_1X2X2X_2 โดยทั่วไปแล้วพื้นผิวของการทำนายของเราจะเป็นไฮเปอร์เพลทมิติสำหรับตัวแปรอิสระkkkkkkk

2
การเรียนรู้ที่เพิ่มขึ้นสำหรับแบบจำลองการจำแนกใน R
สมมติว่าฉันมีตัวจําแนก(อาจเป็นตัวจําแนกมาตรฐานใด ๆ เช่นต้นไม้ตัดสินใจ, ฟอเรสต์แบบสุ่ม, การถดถอยโลจิสติกและอื่น ๆ )สำหรับการตรวจจับการฉ้อโกงโดยใช้รหัสด้านล่าง library(randomForest) rfFit = randomForest(Y ~ ., data = myData, ntree = 400) # A very basic classifier Say, Y is a binary outcome - Fraud/Not-Fraud ตอนนี้ฉันได้คาดการณ์ชุดข้อมูลที่มองไม่เห็น pred = predict(rfFit, newData) แล้วฉันจะได้รับการตอบรับจากทีมสืบสวนเกี่ยวกับการจำแนกของฉันและพบว่าฉันได้ทำผิดพลาดของการจำแนกประเภทที่หลอกลวงไม่ทุจริต (เช่นหนึ่งลบเท็จ ) มีอยู่หรือไม่ที่ฉันสามารถให้อัลกอริทึมของฉันเข้าใจว่ามันทำผิดพลาดหรือไม่? เช่นวิธีใดในการเพิ่มลูปข้อเสนอแนะไปยังอัลกอริทึมเพื่อให้สามารถแก้ไขข้อผิดพลาดได้ ทางเลือกหนึ่งที่ฉันสามารถนึกได้จากส่วนบนของหัวคือการสร้างตัวadaboost classifierแยกประเภทใหม่เพื่อแก้ไขข้อผิดพลาดของตัวเก่า หรือผมเคยได้ยินอะไรบางอย่างหรือIncremental Learning Online learningมีการใช้งาน (แพ็คเกจ) ที่มีอยู่Rหรือไม่? …

2
ความแตกต่างในความแตกต่างกับข้อมูลแผงระดับบุคคล
วิธีที่ถูกต้องในการระบุความแตกต่างในรูปแบบที่แตกต่างกับข้อมูลแผงระดับบุคคลคืออะไร? นี่คือการตั้งค่า: สมมติว่าฉันมีข้อมูลแผงระดับบุคคลที่ฝังอยู่ในเมืองเป็นเวลาหลายปีและการรักษาแตกต่างกันไปในระดับเมืองปี อย่างเป็นทางการให้เป็นผลสำหรับแต่ละในเมืองและในปีและเป็นหุ่นสำหรับว่าแทรกแซงได้รับผลกระทบเมืองในปีทีตัวประมาณ DiD ทั่วไปเช่นที่ระบุไว้ใน Bertrand et al (2004, p. 250) ขึ้นอยู่กับแบบจำลอง OLS แบบง่าย ๆ ที่มีคำที่มีผลคงที่สำหรับเมืองและปี:ฉันs T D s T s TYฉันเป็นคนทีYผมsเสื้อy_{ist}ผมผมisssเสื้อเสื้อtDs TDsเสื้อD_{st}sssเสื้อเสื้อt Yฉันเป็นคนที= As+ Bเสื้อ+ c Xฉันเป็นคนที+ βDs T+ ϵฉันเป็นคนทีYผมsเสื้อ=As+Bเสื้อ+คXผมsเสื้อ+βDsเสื้อ+εผมsเสื้อ y_{ist} = A_{s} + B_t + cX_{ist} + \beta D_{st} + \epsilon_{ist} แต่ผู้ประมาณนั้นเพิกเฉยต่อโครงสร้างพาเนลระดับบุคคล (เช่นการสังเกตหลายอย่างสำหรับแต่ละคนในเมือง) หรือไม่? มันสมเหตุสมผลไหมที่จะขยายโมเดลนี้ด้วยเอฟเฟกต์คำคงที่แต่ละระดับ ? แอปพลิเคชั่น …

1
วิธีการตีความผลลัพธ์ของรุ่น TBATS และการวิเคราะห์แบบจำลอง
ฉันได้รับข้อมูลความต้องการรายครึ่งชั่วโมงซึ่งเป็นช่วงเวลาตามฤดูกาล ฉันใช้tbatsในforecastแพ็คเกจใน R และได้ผลลัพธ์ดังนี้: TBATS(1, {5,4}, 0.838, {<48,6>, <336,6>, <17520,5>}) หมายความว่าชุดข้อมูลไม่จำเป็นต้องใช้การแปลง Box-Cox หรือไม่และมีข้อผิดพลาดคือ ARMA (5, 4) และคำ 6, 6 และ 5 ใช้เพื่ออธิบายฤดูกาล พารามิเตอร์ที่ทำให้ชื้นคือ 0.8383 หมายความว่ามันคือการแปลงด้วยหรือไม่ ต่อไปนี้เป็นพล็อตการสลายตัวของรุ่น: ฉันสงสัยว่าจะทำอย่างไรlevelและslopeบอกเกี่ยวกับตัวแบบ 'ความชัน' บอกแนวโน้ม แต่จะเป็นlevelอย่างไร วิธีการรับพล็อตที่ชัดเจนสำหรับsession 1และsession 2ซึ่งเป็นฤดูกาลรายวันและรายสัปดาห์ตามลำดับ ฉันยังต้องรู้วิธีการวินิจฉัยแบบจำลองtbatsเพื่อประเมินโมเดลยกเว้นค่า RMSE วิธีปกติคือการตรวจสอบว่าข้อผิดพลาดเป็นสัญญาณรบกวนสีขาว แต่ที่นี่ข้อผิดพลาดควรจะเป็นซีรีส์ ARMA ฉันพล็อตข้อผิดพลาด 'acf' และ 'pacf' และฉันไม่คิดว่ามันจะดูเหมือน ARMA (5,4) หมายความว่าแบบจำลองของฉันไม่ดีหรือไม่? acf(resid(model1),lag.max = 1000) pacf(resid(model1),lag.max=1000) …

2
เทคนิคการเรียนรู้ของเครื่องสำหรับข้อมูลระยะยาว
ฉันสงสัยว่ามีเทคนิคการเรียนรู้ด้วยเครื่อง (ไม่ได้รับอนุญาต) สำหรับการสร้างแบบจำลองข้อมูลระยะยาวหรือไม่? ฉันเคยใช้โมเดลเอฟเฟ็กต์แบบผสม (ส่วนใหญ่ไม่ใช่แบบเส้นตรง) แต่ฉันสงสัยว่ามีวิธีอื่นในการทำเช่นนี้ (โดยใช้การเรียนรู้ของเครื่อง) โดยการเรียนรู้ของเครื่องผมหมายถึงป่าสุ่มการจำแนก / การจัดกลุ่มต้นไม้การตัดสินใจและแม้แต่การเรียนรู้ลึก ฯลฯ

1
เมื่อใดที่ฉันจะหยุดมองหานางแบบ?
ฉันกำลังมองหาแบบจำลองระหว่างการสะสมพลังงานและสภาพอากาศ ฉันมีราคา MWatt ที่ซื้อระหว่างประเทศในยุโรปและมีค่ามากมายในสภาพอากาศ (ไฟล์ Grib) แต่ละชั่วโมงในระยะเวลา 5 ปี (2554-2558) ราคา / วัน นี่คือต่อวันเป็นเวลาหนึ่งปี ฉันมีสิ่งนี้ต่อชั่วโมงใน 5 ปี ตัวอย่างของสภาพอากาศ 3Dscatterplot ในเคลวินเป็นเวลาหนึ่งชั่วโมง ฉันมี 1,000 ค่าต่อข้อมูลต่อชั่วโมงและ 200 ข้อมูลเช่น klevin, ลม, geopential ฯลฯ ฉันพยายามที่จะคาดการณ์ราคาเฉลี่ยต่อชั่วโมงของ Mwatt ข้อมูลของฉันบนอากาศมีความหนาแน่นสูงมากค่ามากกว่า 10,000 ค่า / ชั่วโมงและมีความสัมพันธ์สูง มันเป็นปัญหาของข้อมูลขนาดใหญ่ระยะสั้น ฉันได้ลองใช้วิธี Lasso, Ridge และ SVR ด้วยราคาเฉลี่ยของ MWatt ตามผลลัพธ์และข้อมูลสภาพอากาศของฉันเป็นรายได้ ฉันใช้ข้อมูลการฝึกอบรม 70% และทดสอบ 30% หากข้อมูลการทดสอบของฉันไม่ได้คาดการณ์ …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.