สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
จะประเมินควอไทล์ที่สามของข้อมูลที่ถูกรวมเป็นอย่างไร
มีเคล็ดลับทางเทคนิคในการกำหนดควอไทล์ที่สามหรือไม่ถ้ามันเป็นช่วงเวลาเปิดซึ่งมีจำนวนมากกว่าหนึ่งในสี่ของประชากร (ดังนั้นฉันจึงไม่สามารถปิดช่วงเวลาและใช้สูตรมาตรฐานได้) แก้ไข ในกรณีที่ฉันเข้าใจผิดบางสิ่งฉันจะให้บริบทเต็มรูปแบบไม่มากก็น้อย ฉันมีข้อมูลที่จัดเรียงในตารางที่มีสองคอลัมน์และพูดว่า 6 แถว ด้วยแต่ละคอลัมน์จะสอดคล้องกับช่วงเวลา (ในคอลัมน์แรก) และปริมาณของประชากรที่ "เป็น" กับช่วงเวลานั้น ช่วงเวลาสุดท้ายเปิดและมีประชากรมากกว่า 25% ช่วงเวลาทั้งหมด (ยกเว้นช่วงสุดท้าย) มีช่วงเดียวกัน ข้อมูลตัวอย่าง (แสดงเพื่อการนำเสนอ): Column 1: (6;8),(8;10),(10;12),(12;14),(14;16),(16;∞) Column 2: 51, 65, 68, 82, 78, 182 คอลัมน์แรกจะถูกตีความเป็นช่วงระดับรายได้ ที่สองคือการตีความว่าเป็นจำนวนพนักงานที่มีรายได้เป็นช่วงเวลา สูตรมาตรฐานที่ฉันคิดคือ{3}}Q3=xQ3+3N4−∑k−1i=1ninQ3rQ3Q3=xQ3+3N4−∑i=1k−1ninQ3rQ3\mathbb{Q}_{3}=x_{Q_{3}}+ \frac{\frac{3N}{4}- \sum_{i=1}^{k-1}n_{i}}{n_{Q_{3}}}r_{Q_{3}}

4
สามารถทำนายความน่าจะเป็นของการถดถอยโลจิสติกสามารถตีความเป็นความเชื่อมั่นในการจัดหมวดหมู่
เราสามารถตีความความน่าจะเป็นหลังที่ได้จากตัวจําแนกที่ส่งออกค่าคลาสที่ทำนายไว้และความน่าจะเป็น (ตัวอย่างเช่นการถดถอยโลจิสติกหรือ Naive Bayes) เป็นคะแนนความเชื่อมั่นบางอย่างที่กำหนดให้กับค่า

3
STL ตรงเวลาที่มีค่าขาดหายไปสำหรับการตรวจจับความผิดปกติ
ฉันพยายามตรวจจับค่าที่ผิดปกติในอนุกรมเวลาของข้อมูลภูมิอากาศพร้อมกับการสังเกตที่หายไป ค้นหาเว็บฉันพบวิธีการมากมาย ในบรรดาเหล่านั้น stl การสลายตัวดูเหมือนน่าสนใจในแง่ของการลบแนวโน้มและองค์ประกอบตามฤดูกาล อ่านSTL: ฤดูกาล-Trend สลายตัวขั้นตอนบนพื้นฐานของดินเหลือง , stlดูเหมือนจะมีความยืดหยุ่นในการกำหนดค่าการตั้งค่าสำหรับการกำหนดแปรปรวนรับผลกระทบจากค่าผิดปกติและเป็นไปได้ที่จะใช้แม้จะมีค่าหายไป แต่พยายามที่จะใช้มันในRกับสี่ปีของการสังเกตและการกำหนดค่าพารามิเตอร์ทั้งหมดตามhttp://stat.ethz.ch/R-manual/R-patched/library/stats/html/stl.html , พบฉัน ข้อผิดพลาด: "time series contains internal NAs"(เมื่อna.action=na.omit) และ "series is not periodic or has less than two periods"(เมื่อna.action=na.exclude) ฉันตรวจสอบซ้ำแล้วซ้ำอีกว่าความถี่นั้นถูกต้องแล้ว ฉันเห็นคำถามที่เกี่ยวข้องในบล็อก แต่ไม่พบข้อเสนอแนะใด ๆ ที่สามารถแก้ปัญหานี้ได้ เป็นไปไม่ได้ที่จะใช้stlกับซีรี่ส์ที่มีค่าขาดหายไปหรือไม่? ฉันลังเลที่จะสอดแทรกพวกเขาเนื่องจากฉันไม่ต้องการที่จะแนะนำสิ่งประดิษฐ์ (และการตรวจจับ ... ) ด้วยเหตุผลเดียวกันฉันไม่ทราบว่าจะแนะนำให้ใช้วิธี ARIMA แทนอย่างไร (และหากค่าที่หายไปยังคงเป็นปัญหา) กรุณาแบ่งปันหากคุณรู้วิธีที่จะใช้stlในซีรีส์ที่มีค่าที่หายไปหรือถ้าคุณเชื่อว่าตัวเลือกของฉันไม่เป็นระเบียบแบบแผนหรือหากคุณมีข้อเสนอแนะที่ดีกว่านี้ ฉันค่อนข้างใหม่ในสนามและถูกครอบงำด้วยกองข้อมูลที่เกี่ยวข้อง (ดูเหมือน ... )

4
การเลือกรุ่น PCA โดยใช้ AIC (หรือ BIC)
ฉันต้องการใช้ Akaike Information Criterion (AIC) เพื่อเลือกจำนวนปัจจัยที่เหมาะสมในการแยก PCA ปัญหาเดียวคือฉันไม่แน่ใจว่าจะกำหนดจำนวนพารามิเตอร์ได้อย่างไร พิจารณาเมทริกซ์ที่หมายถึงจำนวนของตัวแปรและจำนวนของการสังเกตเช่นว่าขวา) ตั้งแต่เมทริกซ์ความแปรปรวนเป็นสมมาตรแล้วประมาณการความน่าจะเป็นสูงสุดของสามารถกำหนดจำนวนของพารามิเตอร์ใน AIC เท่ากับ{2}X N T X ∼ N ( 0 , Σ ) Σ N ( N + 1 )T×NT×NT\times NXXXNNNTTTX∼N(0,Σ)X∼N(0,Σ)X\sim \mathcal N\left(0,\Sigma\right)ΣΣ\SigmaN(N+1)2N(N+1)2\frac{N\left(N+1\right)}{2} อีกวิธีหนึ่งใน PCA คุณสามารถแยกeigenvectorและค่าลักษณะเฉพาะของแรกเรียกพวกเขาและแล้วคำนวณ โดยที่เป็นความแปรปรวนที่เหลือโดยเฉลี่ย โดยการนับของฉันถ้าคุณมีปัจจัยแล้วคุณจะพารามิเตอร์ใน ,พารามิเตอร์ในและพารามิเตอร์ใน{2}Σ β ฉ Λ ฉ Σ = β ฉ Λ ฉ β ' …

3
ฐานคณิตศาสตร์สำหรับการขุดข้อมูลและอัลกอริทึมปัญญาประดิษฐ์
คุณช่วยอธิบายเกี่ยวกับการขุดข้อมูลและอัลกอริทึมปัญญาประดิษฐ์ให้ฉันได้ไหม พวกเขาใช้คณิตศาสตร์อะไร คุณช่วยบอกจุดเริ่มต้นในคณิตศาสตร์ให้ฉันเข้าใจอัลกอริธึมเหล่านี้ได้ไหม

1
เหตุใดจึงมีการสลายตัว eigen และ svd ของเมทริกซ์ความแปรปรวนร่วมที่อิงจากข้อมูลที่กระจัดกระจายซึ่งให้ผลลัพธ์ที่แตกต่างกัน?
ฉันกำลังพยายามสลายเมทริกซ์ความแปรปรวนร่วมโดยยึดตามชุดข้อมูลที่กระจัดกระจาย / มีความสุข ฉันสังเกตเห็นว่าผลรวมของแลมบ์ดา (อธิบายความแปรปรวน) ตามที่คำนวณด้วยsvdกำลังถูกขยายด้วยข้อมูลที่มีความสุขมากขึ้น โดยไม่มีช่องว่างsvdและeigenผลลัพธ์ที่เหมือนกัน ดูเหมือนจะไม่เกิดขึ้นกับการeigenสลายตัว ฉันโน้มตัวไปใช้svdเพราะค่าแลมบ์ดาเป็นบวกอยู่เสมอ แต่แนวโน้มนี้น่าเป็นห่วง มีการแก้ไขบางอย่างที่ต้องนำไปใช้หรือฉันควรหลีกเลี่ยงsvdปัญหาดังกล่าวทั้งหมด ###Make complete and gappy data set set.seed(1) x <- 1:100 y <- 1:100 grd <- expand.grid(x=x, y=y) #complete data z <- matrix(runif(dim(grd)[1]), length(x), length(y)) image(x,y,z, col=rainbow(100)) #gappy data zg <- replace(z, sample(seq(z), length(z)*0.5), NaN) image(x,y,zg, col=rainbow(100)) ###Covariance matrix decomposition …
12 r  svd  eigenvalues 

2
RandomForest เลือกการถดถอยแทนการจัดหมวดหมู่
ฉันใช้แพคเกจrandomForestใน R และใช้ข้อมูล iris ป่าสุ่มที่สร้างขึ้นเป็นการจัดหมวดหมู่ แต่เมื่อฉันใช้ชุดข้อมูลที่มีคุณสมบัติประมาณ 700 รายการ (คุณสมบัติคือแต่ละพิกเซลในภาพขนาด 28x28 พิกเซล) และคอลัมน์ชื่อมีชื่อlabelที่randomForestสร้างขึ้นคือการถดถอย ฉันใช้บรรทัดต่อไปนี้: rf <- randomForest(label ~ ., data=train) ทำไมการถดถอยจึงถูกนำมาใช้แทนการจำแนก? read.csv()ข้อมูลจะถูกอ่านผ่าน
12 r  random-forest 

1
แบบจำลองเบย์แบบลำดับชั้นเปรียบเทียบกับเบย์เชิงประจักษ์
คุณจะพิจารณา HBM กับ EB เป็นสองทางเลือกซึ่งไฮเปอร์พารามิเตอร์คือ "ในเกม" ที่มีการสุ่มตัวอย่าง / โดยประมาณ / ฯลฯ มีการเชื่อมโยงอย่างชัดเจนระหว่างสองสิ่งนี้ คุณจะพิจารณา HBM ว่า "Bayesian อย่างเต็มที่" มากกว่า EB หรือไม่ มีบางที่ที่ฉันเห็นความแตกต่างระหว่างการเป็น "Bayesian เต็มที่" และทางเลือกอื่น ๆ หรือไม่? ขอบคุณ

2
ความสัมพันธ์เชิงบวกและเครื่องหมายสัมประสิทธิ์การถดถอยเชิงลบ
เป็นไปได้ไหมที่จะได้ความสัมพันธ์เชิงบวกระหว่าง regressor กับการตอบสนอง ( +0,43) และหลังจากนั้นจะได้สัมประสิทธิ์เชิงลบในตัวแบบการถดถอยแบบพอดีสำหรับ regressor นี้หรือไม่? ฉันไม่ได้พูดถึงการเปลี่ยนแปลงในเครื่องหมายของ regressor ในบางรุ่น เครื่องหมายสัมประสิทธิ์ยังคงอยู่เสมอ ตัวแปรที่เหลือของรุ่นที่ติดตั้งสามารถมีอิทธิพลต่อการเปลี่ยนแปลงของสัญญาณได้หรือไม่?

1
ความสัมพันธ์ระหว่างจำนวนเวกเตอร์สนับสนุนและจำนวนของคุณสมบัติ
ฉันใช้ SVM กับชุดข้อมูลที่กำหนดและทำการสังเกตต่อไปนี้: ถ้าฉันเปลี่ยนจำนวนของคุณสมบัติสำหรับการสร้างตัวจําแนก ฉันต้องการทราบวิธีอธิบายสถานการณ์ประเภทนี้

1
เหตุใดจึงต้องใช้ตัวแปรที่บันทึกไว้
อาจเป็นคำถามพื้นฐานมาก แต่ฉันดูเหมือนจะไม่สามารถหาคำตอบที่ชัดเจนสำหรับมัน ฉันหวังว่าที่นี่ฉันสามารถ ตอนนี้ฉันกำลังอ่านเอกสารเพื่อเตรียมสำหรับวิทยานิพนธ์ปริญญาโทของฉันเอง ขณะนี้ฉันกำลังอ่านกระดาษที่ค้นคว้าความสัมพันธ์ระหว่างทวีตและคุณลักษณะของตลาดหุ้น หนึ่งในสมมติฐานของพวกเขาพวกเขาเสนอว่า "ปริมาณทวีตที่เพิ่มขึ้นนั้นเกี่ยวข้องกับปริมาณการซื้อขายที่เพิ่มขึ้น" ผมจะคาดหวังให้พวกเขาในความสัมพันธ์คู่ที่จะมีความสัมพันธ์tweetVolumeกับtradingVolume, แต่พวกเขารายงานโดยใช้รุ่นเข้าสู่ระบบ: และLN(tweetVolume)LN(tradingVolume) สำหรับวิทยานิพนธ์ของฉันฉันได้ทำซ้ำเอกสารนี้ ฉันรวบรวมทวีตประมาณ 100 บริษัท มานานกว่า 6 เดือน ( tweetVolume) และปริมาณการซื้อขายหุ้นในช่วงเวลาเดียวกัน ถ้าฉันมีความสัมพันธ์ตัวแปรแน่นอนผมพบr=.282, p.000แต่เมื่อผมใช้ verions r=.488, p=.000ทะเบียนผมพบ ฉันไม่เข้าใจว่าทำไมนักวิจัยบางครั้งใช้ตัวแปรที่บันทึกไว้และทำไมความสัมพันธ์จึงดูสูงขึ้นมากถ้าคุณทำเช่นนั้น อะไรคือเหตุผลที่นี่และทำไมจึงใช้ตัวแปรที่บันทึกไว้ ความช่วยเหลือของคุณได้รับการชื่นชมอย่างมาก :-)

2
ปัญหา Behrens - Fisher
มีบัญชี expository ที่ดีเผยแพร่ด้วยรายละเอียดทางคณิตศาสตร์ของวิธีการต่าง ๆ ที่นำไปสู่ปัญหา Behrens - Fisher?

5
Bayesians เคยโต้แย้งว่ามีกรณีที่วิธีการของพวกเขาสรุป / ทับซ้อนกับวิธีการที่ใช้บ่อยหรือไม่?
Bayesians เคยยืนยันว่าวิธีการของพวกเขาทำให้วิธีการทั่วไปเป็นปกติหรือไม่เพราะเราสามารถใช้นักบวชที่ไม่ให้ข้อมูลได้และดังนั้นจึงสามารถกู้คืนโครงสร้างแบบจำลองของนักสะสมทั่วไปได้หรือไม่? ใครช่วยแนะนำฉันไปยังสถานที่ที่ฉันสามารถอ่านเกี่ยวกับเรื่องนี้ถ้ามันถูกใช้จริง? แก้ไข: คำถามนี้อาจจะเป็นประโยคที่ไม่ตรงกับที่ฉันตั้งใจจะพูด คำถามคือ: "มีการอ้างอิงใด ๆ เกี่ยวกับการอภิปรายของกรณีที่วิธีการแบบเบย์และวิธีการที่พบบ่อยซ้อนทับกัน / ตัด / มีบางสิ่งที่เหมือนกันผ่านการใช้บางอย่างมาก่อนหรือไม่" ตัวอย่างหนึ่งจะใช้ที่ไม่เหมาะสมก่อนนี้ แต่ฉันค่อนข้างแน่ใจว่านี่เป็นเพียงส่วนปลายสุดของภูเขาน้ำแข็งp(θ)=1p(θ)=1p(\theta) = 1

3
SVD ของเมทริกซ์ที่มีค่าหายไป
สมมติว่าฉันมีเมทริกซ์การแนะนำสไตล์ Netflix และฉันต้องการสร้างแบบจำลองที่ทำนายการจัดอันดับภาพยนตร์ในอนาคตสำหรับผู้ใช้ที่กำหนด การใช้วิธีการของ Simon Funk เราจะใช้การไล่ระดับสีแบบสุ่มสุ่มเพื่อลดบรรทัดฐาน Frobenius ระหว่างเมทริกซ์เต็มและเมทริกซ์ item-by-item * user-by-user ในทางปฏิบัติผู้คนทำอะไรกับค่าที่หายไปจากเมทริกซ์การแนะนำซึ่งเป็นจุดรวมของการคำนวณ ฉันเดาจากการอ่านโพสต์บล็อกของ Simon คือเขาใช้คำที่ไม่หายไปเท่านั้น (ซึ่งประกอบด้วย (พูด) ~ 1% ของเมทริกซ์คำแนะนำ) เพื่อสร้างแบบจำลอง อีก 99% ของเมทริกซ์? ในทางปฏิบัติคุณจะข้ามค่าเหล่านั้นทั้งหมดหรือไม่? หรือคุณสรุปให้มากที่สุดเท่าที่จะทำได้ก่อนที่จะทำการไล่ระดับสีแบบสุ่มสุ่ม? แนวปฏิบัติที่ดีที่สุดมาตรฐานบางประการสำหรับการจัดการกับค่าที่หายไปคืออะไร

2
PCA และฟอเรสต์แบบสุ่ม
สำหรับการแข่งขัน Kaggle เมื่อเร็ว ๆ นี้ฉัน (กำหนดเอง) กำหนดคุณสมบัติเพิ่มเติมอีก 10 รายการสำหรับชุดการฝึกอบรมของฉันซึ่งจะใช้ในการฝึกอบรมตัวจําแนกป่าแบบสุ่ม ฉันตัดสินใจเรียกใช้ PCA บนชุดข้อมูลด้วยคุณสมบัติใหม่เพื่อดูว่าพวกเขาเปรียบเทียบกันอย่างไร ฉันพบว่าประมาณ 98% ของความแปรปรวนดำเนินการโดยองค์ประกอบแรก (eigenvector แรก) จากนั้นฉันฝึกตัวจําแนกหลายครั้งเพิ่มคุณสมบัติทีละรายการและใช้การตรวจสอบข้ามและข้อผิดพลาด RMS เพื่อเปรียบเทียบคุณภาพของการจําแนก ฉันพบว่าการจัดหมวดหมู่ได้รับการปรับปรุงด้วยคุณสมบัติเพิ่มเติมแต่ละรายการและผลลัพธ์สุดท้าย (พร้อมคุณสมบัติใหม่ทั้ง 10 รายการ) นั้นดีกว่าการเรียกใช้ครั้งแรกด้วย (พูด) คุณสมบัติ 2 อย่าง เนื่องจาก PCA อ้างว่า ~ 98% ของความแปรปรวนอยู่ในองค์ประกอบแรกของชุดข้อมูลของฉันทำไมคุณภาพของการจำแนกประเภทจึงพัฒนาขึ้นมาก สิ่งนี้จะเป็นจริงสำหรับตัวแยกประเภทอื่นหรือไม่ RF ปรับข้ามหลายคอร์ดังนั้นจึงเร็วกว่าในการฝึกอบรม (พูด) SVM ถ้าฉันแปลงชุดข้อมูลไปเป็นพื้นที่ "PCA" แล้วเรียกใช้ตัวจําแนกในพื้นที่แปลง ผลลัพธ์ของฉันจะเปลี่ยนแปลงอย่างไร

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.