สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
ขนาดตัวอย่างที่มีประสิทธิภาพสำหรับการอนุมานหลังจากการสุ่มตัวอย่าง MCMC
เมื่อได้รับตัวอย่าง MCMC เพื่อทำการอนุมานพารามิเตอร์ที่เฉพาะเจาะจงอะไรคือคำแนะนำที่ดีสำหรับจำนวนตัวอย่างที่มีประสิทธิภาพขั้นต่ำที่เราควรตั้งเป้าหมายไว้? และคำแนะนำนี้เปลี่ยนไปเมื่อแบบจำลองมีความซับซ้อนมากขึ้นหรือน้อยลงหรือไม่?

2
การจัดการกับความสัมพันธ์อัตโนมัติคืออะไร
เพื่อนำหน้าสิ่งนี้ฉันมีพื้นฐานทางคณิตศาสตร์ค่อนข้างลึก แต่ฉันไม่เคยจัดการกับอนุกรมเวลาหรือการสร้างแบบจำลองทางสถิติ ดังนั้นคุณไม่ต้องอ่อนโยนกับฉัน :) ฉันกำลังอ่านกระดาษนี้เกี่ยวกับการสร้างแบบจำลองการใช้พลังงานในอาคารพาณิชย์และผู้เขียนทำให้การเรียกร้องนี้: [สถานะของความสัมพันธ์อัตโนมัติเกิดขึ้น] เนื่องจากตัวแบบได้รับการพัฒนาจากข้อมูลอนุกรมเวลาของการใช้พลังงานซึ่งมีความสัมพันธ์โดยอัตโนมัติ รูปแบบที่กำหนดอย่างหมดจดสำหรับข้อมูลอนุกรมเวลาจะมีความสัมพันธ์อัตโนมัติ พบว่าความสัมพันธ์อัตโนมัติลดลงหากรวมค่าสัมประสิทธิ์ฟูริเยร์มากขึ้นในโมเดล อย่างไรก็ตามในกรณีส่วนใหญ่แบบจำลองฟูริเยร์มี CV ต่ำดังนั้นแบบจำลองจึงอาจเป็นที่ยอมรับได้สำหรับวัตถุประสงค์ในทางปฏิบัติที่ (sic) ไม่ต้องการความแม่นยำสูง 0. ) "รูปแบบใด ๆ ที่กำหนดอย่างหมดจดสำหรับข้อมูลอนุกรมเวลาจะมีความสัมพันธ์อัตโนมัติ" หมายความว่าอะไร? ฉันสามารถเข้าใจความหมายของสิ่งนี้ได้อย่างชัดเจน - ตัวอย่างเช่นคุณคาดหวังว่าจะทำนายประเด็นต่อไปในอนุกรมเวลาของคุณอย่างไรถ้าคุณมี 0 ความสัมพันธ์อัตโนมัติ? นี่ไม่ใช่อาร์กิวเมนต์ทางคณิตศาสตร์เพื่อให้แน่ใจว่าเป็นเพราะเหตุใดนี่คือ 0 :) 1. ) ฉันอยู่ภายใต้การแสดงความคิดเห็นที่ความสัมพันธ์อัตโนมัติฆ่าโมเดลของคุณโดยทั่วไป แต่เมื่อคิดถึงมันฉันไม่เข้าใจว่าทำไมจึงเป็นเช่นนั้น ดังนั้นความสัมพันธ์อัตโนมัติทำไมจึงเป็นสิ่งที่ไม่ดี (หรือดี) 2. ) วิธีแก้ปัญหาที่ฉันเคยได้ยินเกี่ยวกับออโตคอร์เรชั่นคือการแตกต่างของอนุกรมเวลา หากไม่ได้พยายามอ่านใจผู้เขียนเหตุใดจึงไม่แตกต่างกันถ้าความสัมพันธ์อัตโนมัติที่ไม่มีความสำคัญมีอยู่จริง 3. ) ข้อ จำกัด อะไรที่ทำให้ไม่มีข้อมูลที่เกี่ยวข้องโดยอัตโนมัติในโมเดล? นี่เป็นข้อสันนิษฐานบางแห่งหรือไม่ (เช่นปกติจะมีการกระจายของเสียเมื่อสร้างโมเดลด้วยการถดถอยเชิงเส้นอย่างง่าย) หรือไม่? อย่างไรก็ตามขออภัยหากคำถามเหล่านี้เป็นคำถามพื้นฐานและขอบคุณล่วงหน้าสำหรับความช่วยเหลือ

1
ทำความเข้าใจเกี่ยวกับการทำนายจากการถดถอยโลจิสติก
การคาดการณ์ของฉันมาจากแบบจำลองการถดถอยโลจิสติก (glm ใน R) ไม่ได้ล้อมรอบระหว่าง 0 ถึง 1 เหมือนที่ฉันคาดไว้ ความเข้าใจของฉันเกี่ยวกับการถดถอยโลจิสติกคือพารามิเตอร์อินพุตและโมเดลของคุณรวมกันเป็นเส้นตรงและการตอบสนองจะเปลี่ยนเป็นความน่าจะเป็นโดยใช้ฟังก์ชั่นลิงค์ logit เนื่องจากฟังก์ชั่น logit มีขอบเขตระหว่าง 0 ถึง 1 ฉันคาดว่าการคาดการณ์ของฉันจะถูกล้อมรอบระหว่าง 0 ถึง 1 อย่างไรก็ตามนั่นไม่ใช่สิ่งที่ฉันเห็นเมื่อฉันใช้การถดถอยโลจิสติกใน R: data(iris) iris.sub <- subset(iris, Species%in%c("versicolor","virginica")) model <- glm(Species ~ Sepal.Length + Sepal.Width, data = iris.sub, family = binomial(link = "logit")) hist(predict(model)) หากสิ่งใดผลลัพธ์ของการทำนาย (รุ่น) ดูเป็นเรื่องปกติสำหรับฉัน ใครสามารถอธิบายให้ฉันฟังได้ว่าทำไมค่าที่ฉันได้รับไม่ใช่ความน่าจะเป็น

2
สำหรับเมทริกซ์แบบสุ่ม SVD ไม่ควรอธิบายอะไรเลยหรือ ผมทำอะไรผิดหรือเปล่า?
ถ้าฉันสร้างเมทริกซ์ 2 มิติที่ประกอบด้วยข้อมูลสุ่มทั้งหมดฉันคาดว่าส่วนประกอบ PCA และ SVD จะไม่อธิบายอะไรเลย แต่ดูเหมือนว่าคอลัมน์ SVD แรกจะปรากฏขึ้นเพื่ออธิบาย 75% ของข้อมูล วิธีนี้สามารถเป็นไปได้จะเป็นอย่างไร? ผมทำอะไรผิดหรือเปล่า? นี่คือพล็อต: นี่คือรหัส R: set.seed(1) rm(list=ls()) m <- matrix(runif(10000,min=0,max=25), nrow=100,ncol=100) svd1 <- svd(m, LINPACK=T) par(mfrow=c(1,4)) image(t(m)[,nrow(m):1]) plot(svd1$d,cex.lab=2, xlab="SVD Column",ylab="Singluar Value",pch=19) percentVarianceExplained = svd1$d^2/sum(svd1$d^2) * 100 plot(percentVarianceExplained,ylim=c(0,100),cex.lab=2, xlab="SVD Column",ylab="Percent of variance explained",pch=19) cumulativeVarianceExplained = cumsum(svd1$d^2/sum(svd1$d^2)) * 100 plot(cumulativeVarianceExplained,ylim=c(0,100),cex.lab=2, …
13 r  pca  svd 

1
AIC / BIC: การเปลี่ยนลำดับของพารามิเตอร์จะมีจำนวนเท่าใด?
สมมติว่าฉันมีปัญหาในการเลือกรุ่นและฉันพยายามใช้AICหรือBICเพื่อประเมินโมเดล ตรงไปตรงมาสำหรับรุ่นที่มีบางส่วนจำนวนของพารามิเตอร์ค่าจริงkkk อย่างไรก็ตามจะเกิดอะไรขึ้นถ้าหนึ่งในโมเดลของเรา (ตัวอย่างเช่นโมเดล Mallows ) มีการเปลี่ยนแปลงรวมถึงพารามิเตอร์ที่มีมูลค่าจริงแทนที่จะเป็นพารามิเตอร์ที่มีมูลค่าจริง ผมยังสามารถเพิ่มความเป็นไปได้มากกว่าพารามิเตอร์แบบเช่นการได้รับการเปลี่ยนแปลงและพารามิเตอร์พี แต่วิธีการที่หลายพารามิเตอร์ไม่πนับรวมในการคำนวณ AIC / BIC?ππ\piพีppππ\pi

2
การศึกษาด้วยตนเองจะได้รับไกลแค่ไหน
ฉันไม่เคยมีส่วนร่วมในการวิเคราะห์ข้อมูลอย่างเป็นทางการหรือมีโครงสร้างหรือหลักสูตรการเรียนรู้ด้วยเครื่อง (นอกเหนือจากข้อเสนอออนไลน์ล่าสุด) และได้เรียนรู้สิ่งที่ฉันรู้จากการอ่านและทดลองใช้มากที่สุด ฉันรู้ว่าฉันอยู่ห่างไกลจากความสามารถในการหางาน คำถามของฉันไม่ใช่สิ่งที่ดีกว่า ( เช่นคำถามนี้ ) แต่ฉันสามารถไปถึงระดับที่ฉันสามารถสมัครงานและมีโอกาสเรียนรู้ด้วยตนเองได้หรือไม่ นอกจากนี้เป็นไปได้ไหมที่จะทำสิ่งนี้ภายในกรอบเวลาที่เหมาะสม (อาจจะเป็น 10 ปีหรือไม่ตอนนี้ฉันอายุ 31 แล้ว ... )? หรือฉันจะต้องไปหาวิธีที่จะเข้าร่วมการจัดเรียงของวิทยาลัย / สถาบันการบางอย่าง?

1
พีชคณิตของ LDA อำนาจการแยกแยะฟิชเชอร์ของตัวแปรและการวิเคราะห์จำแนกเชิงเส้น
เห็นได้ชัดว่า การวิเคราะห์แบบฟิชเชอร์มีจุดมุ่งหมายที่จะเพิ่มการแยกระหว่างคลาสให้สูงสุดพร้อม ๆ กับลดการกระจายตัวของคลาสภายใน วัดที่มีประโยชน์ของอำนาจจำแนกของตัวแปรจึงจะได้รับโดยปริมาณเส้นทแยงมุม: ฉันBฉันฉัน/ WฉันฉันBii/WiiB_{ii}/W_{ii} http://root.cern.ch/root/htmldoc/TMVA__MethodFisher.html ผมเข้าใจว่าขนาด ( p x p) ของระหว่าง ( B ) และภายใน-Class ( W ) pการฝึกอบรมจะได้รับจากจำนวนของตัวแปรการป้อนข้อมูล ให้นี้วิธีที่สามารถจะเป็น "วัดที่มีประโยชน์ของอำนาจจำแนก" ของตัวแปรเดียว? ต้องมีตัวแปรอย่างน้อยสองตัวในการสร้างเมทริกซ์ B และ W ดังนั้นการติดตามที่เกี่ยวข้องจะเป็นตัวแทนของตัวแปรมากกว่าหนึ่งตัวBฉันฉัน/ WฉันฉันBii/WiiB_{ii}/W_{ii} ปรับปรุง: ฉันขวาในการคิดว่าไม่ได้เป็นร่องรอยกว่าร่องรอยที่รวมเป็นนัย แต่องค์ประกอบเมทริกซ์B ฉันฉันBฉันฉัน/ WฉันฉันBii/WiiB_{ii}/W_{ii}BฉันฉันBiiB_{ii}หารด้วย ? ปัจจุบันเป็นวิธีเดียวที่ฉันสามารถปรับการแสดงออกด้วยแนวคิดWฉันฉันWiiW_{ii}

1
เทคนิคการวิเคราะห์อัตราส่วน
ฉันกำลังมองหาคำแนะนำและความคิดเห็นที่เกี่ยวข้องกับการวิเคราะห์อัตราส่วนและอัตรา ในสาขาที่ฉันทำงานวิเคราะห์อัตราส่วนโดยเฉพาะอย่างยิ่งเป็นที่แพร่หลาย แต่ฉันได้อ่านเอกสารสองสามฉบับที่แนะนำว่านี่อาจเป็นปัญหาได้ฉันกำลังคิดถึง: Kronmal, Richard A. 1993. ความสัมพันธ์ปลอมและการเข้าใจผิดของมาตรฐานอัตราส่วนที่มาเยือน วารสารสมาคมสถิติราชวงศ์ A 156 (3): 379-392 และเอกสารที่เกี่ยวข้อง จากสิ่งที่ฉันได้อ่านจนถึงขณะนี้ก็ดูเหมือนว่าอัตราส่วนสามารถสร้างความสัมพันธ์ปลอมเส้นแรงถดถอยผ่านต้นกำเนิด (ซึ่งเป็นสิ่งที่ไม่เหมาะสมเสมอ) และการสร้างแบบจำลองพวกเขาอาจละเมิดหลักการของขอบเขตหากไม่ได้ทำอย่างถูกต้อง ( ใช้อัตราส่วนในการถดถอยโดยริชาร์ดโกลด์สไตน์ ) อย่างไรก็ตามจะต้องมีโอกาสเมื่อการใช้อัตราส่วนเป็นธรรมและฉันต้องการความคิดเห็นจากนักสถิติในหัวข้อนี้

2
ฉันจะตีความโมเดล probit ใน Stata ได้อย่างไร
ฉันไม่แน่ใจว่าจะตีความการถดถอยของโปรบิตนี้ได้อย่างไรฉันวิ่งบน Stata ข้อมูลอยู่ในการอนุมัติสินเชื่อและสีขาวเป็นตัวแปรจำลองที่ = 1 หากบุคคลเป็นสีขาวและ = 0 หากบุคคลนั้นไม่ใช่ ความช่วยเหลือเกี่ยวกับวิธีการอ่านนี้จะได้รับการชื่นชมอย่างมาก สิ่งที่ฉันกำลังมองหาส่วนใหญ่คือวิธีการค้นหาความน่าจะเป็นโดยประมาณของการอนุมัติสินเชื่อสำหรับทั้งขาวและไม่ใช่ขาว บางคนสามารถช่วยฉันด้วยข้อความที่นี่และวิธีการทำให้เป็นเรื่องปกติได้หรือไม่? ฉันขอโทษฉันไม่รู้วิธีการทำเช่นนี้ . probit approve white Iteration 0: log likelihood = -740.34659 Iteration 1: log likelihood = -701.33221 Iteration 2: log likelihood = -700.87747 Iteration 3: log likelihood = -700.87744 Probit regression Number of obs = 1989 LR chi2(1) …

2
ปัวซองกับการถดถอยโลจิสติก
ฉันมีกลุ่มคนไข้ที่มีระยะเวลาการติดตามผลต่างกัน จนถึงตอนนี้ฉันไม่สนใจแง่มุมเวลาและเพียงแค่ต้องการสร้างแบบจำลองผลลัพธ์ไบนารีโรค - / ไม่มีโรค ฉันมักจะถดถอยโลจิสติกในการศึกษาเหล่านี้ แต่เพื่อนร่วมงานอีกคนของฉันถามว่าปัวซองการถดถอยจะเหมาะสมหรือไม่ ฉันไม่ได้อยู่ในปัวส์ซองและไม่แน่ใจว่าประโยชน์และข้อเสียของการทำปัวซองในสภาพแวดล้อมแบบนี้จะเปรียบเทียบการถดถอยโลจิสติกได้อย่างไร ฉันอ่านการถดถอยปัวซงเพื่อประเมินความเสี่ยงสัมพัทธ์สำหรับผลลัพธ์ไบนารีและฉันยังคงไม่แน่ใจว่าเป็นข้อดีของการถดถอยปัวซองในสถานการณ์นี้

2
รู้จัก Var (X), วิธีคำนวณ Var (1 / X)?
หากฉันมีเพียงฉันจะคำนวณอย่างไรV a r ( 1)Var(X)Var(X)\mathrm{Var}(X)Var(1X)Var(1X)\mathrm{Var}(\frac{1}{X}) ฉันไม่ได้มีข้อมูลใด ๆ เกี่ยวกับการกระจายของดังนั้นผมจึงไม่สามารถใช้การเปลี่ยนแปลงหรือวิธีการอื่นใดที่ใช้น่าจะเป็นของการกระจายXXXXXXX


2
มีแพ็คเกจ R สำหรับการตอบสนองแบบไบนารีตามยาวหรือไม่?
bildแพคเกจที่ดูเหมือนจะเป็นแพคเกจที่ยอดเยี่ยมสำหรับการตอบสนองไบนารีแบบอนุกรม แต่มันเป็นเวลาที่ไม่ต่อเนื่อง ฉันต้องการระบุฟังก์ชั่นที่ราบรื่นของเวลาสำหรับการเชื่อมต่ออัตราส่วนอัตราต่อรองของการตอบสนองปัจจุบัน Y ด้วยการตอบสนองแบบไบนารีที่วัดได้ในเวลาก่อนหน้าหรืออย่างน้อยรุ่นมาร์คอฟอันดับหนึ่งของสิ่งนี้ ฉันเชื่อว่าสิ่งนี้เรียกว่าการถดถอยโลจิสติกสำรอง ไม่มีใครรู้ว่าแพคเกจ R ที่จัดการเวลาอย่างต่อเนื่องคือเวลาการวัดสามารถติดตามเวลาใด ๆ ? ฉันไม่ต้องการเอฟเฟกต์แบบสุ่มในโมเดล

1
การสร้างคุณสมบัติและการปรับสภาพในการเรียนรู้ของเครื่อง
ให้บอกว่าฉันต้องการสร้างลอจิสติกลอจิสติกสำหรับภาพยนตร์เอ็มคุณสมบัติของฉันจะเป็นเช่นอายุของบุคคลเพศอาชีพสถานที่ ดังนั้นชุดฝึกอบรมจะเป็นอย่างไร: อายุเพศอาชีพตำแหน่งชอบ (1) / ไม่ชอบ (0) 23 M ซอฟต์แวร์ US 1 24 F Doctor UK 0 และอื่น ๆ .... ตอนนี้คำถามของฉันคือฉันควรปรับขนาดและแสดงคุณสมบัติของฉันอย่างไร วิธีหนึ่งที่ฉันคิดว่า: แบ่งอายุเป็นกลุ่มอายุดังนั้น 18-25, 25-35, 35- ข้างต้นเพศเป็น M, F, สถานที่เช่นสหรัฐอเมริกา, อังกฤษ, อื่น ๆ ตอนนี้สร้างคุณสมบัติไบนารีสำหรับค่าเหล่านี้ดังนั้นอายุจะมี 3 คุณลักษณะไบนารีแต่ละที่สอดคล้องกับกลุ่มอายุและอื่น ๆ ดังนั้นผู้ชายอายุ 28 ปีจากสหรัฐอเมริกาจะถูกแสดงเป็น 010 10 100 (010-> กลุ่มอายุ 25-35, 10 -> ชาย, 100 …

2
ตัวแก้ตัวเลขสำหรับสมการอนุพันธ์เชิงสุ่มใน R: มีอะไรบ้าง?
ฉันกำลังมองหาแพคเกจ R ทั่วไปทั่วไปที่สะอาดและรวดเร็ว (เช่นการใช้ C ++) สำหรับการจำลองเส้นทางจากการแพร่กระจายแบบไม่เชิงเส้นที่ไม่เป็นเอกพันธ์อย่างเช่น (1) โดยใช้รูปแบบ Euler-Maruyama รูปแบบ Milstein (หรืออื่น ๆ ) สิ่งนี้ถูกกำหนดให้ฝังลงในรหัสการประมาณที่ใหญ่กว่าและสมควรได้รับการปรับปรุง dXt=f(θ,t,Xt)dt+g(θ,t,Xt)dWt,(1)(1)dXt=f(θ,t,Xt)dt+g(θ,t,Xt)dWt,dX_t = f(\theta, t, X_t)\, dt + g(\theta, t, X_t)\, dW_t, \tag{1} ด้วยการเคลื่อนไหว Brownian มาตรฐาน WtWtW_t

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.