สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
ทำความเข้าใจกับหนวดของ boxplot
ฉันมีคำถามเกี่ยวกับการแปลความหมายของเคราของกล่องสี่เหลี่ยม ฉันได้อ่านข้อความต่อไปนี้: "ที่ด้านบนและด้านล่างของสี่เหลี่ยม" หนวด "แสดงช่วง 1.5 เท่าของระยะห่างระหว่าง 0.25- และ 0.75- ควอนไทล์" แต่ไม่เข้าใจความหมายของ "ระยะทาง" ทั้งหมด . เป็นไปไม่ได้ที่มวลความน่าจะเป็นมีความหมายเนื่องจากระหว่าง 0.25 และ 0.75 quantile เราเห็นได้ชัดว่ามีเปอร์เซ็นต์ของข้อมูลเท่ากันเสมอ แล้วความคิดคืออะไร?

2
สมมติฐานของโมเดลเชิงเส้นทั่วไป
ในหน้า 232 ของ "คู่หู R เพื่อนำไปใช้การถดถอย" โน้ต Fox และ Weisberg มีเพียงตระกูลเกาส์เซียนเท่านั้นที่มีความแปรปรวนคงที่และใน GLM อื่น ๆ ทั้งหมดความแปรปรวนแบบมีเงื่อนไขของ y ที่ขึ้นอยู่กับxx\bf{x}μ(x)μ(x)\mu(x) ก่อนหน้านี้พวกเขาทราบว่าเงื่อนไขความแปรปรวนของ Poisson เป็นและที่ของทวินามคือ{N}μμ\muμ(1−μ)Nμ(1−μ)N\frac{\mu(1-\mu)}{N} สำหรับเกาส์เซียนนี่เป็นข้อสันนิษฐานที่คุ้นเคยและตรวจสอบบ่อยครั้ง (homoscedasticity) ในทำนองเดียวกันฉันมักจะเห็นความแปรปรวนแบบมีเงื่อนไขของปัวซองที่กล่าวถึงเป็นข้อสันนิษฐานของการถดถอยปัวซองพร้อมกับการเยียวยาสำหรับกรณีที่มีการละเมิด (เช่นลบทวินามลบศูนย์ศูนย์ ฯลฯ ) แต่ฉันไม่เคยเห็นความแปรปรวนแบบมีเงื่อนไขสำหรับทวินามที่กล่าวถึงเป็นข้อสันนิษฐานในการถดถอยโลจิสติก Googling เล็กน้อยไม่พบสิ่งที่กล่าวถึง ฉันหายไปนี่อะไร แก้ไขตามความคิดเห็นของ @whuber: ตามที่แนะนำฉันกำลังดู Hosmer & Lemeshow มันน่าสนใจและฉันคิดว่ามันแสดงให้เห็นว่าทำไมฉัน (และบางทีคนอื่น ๆ ) สับสน ตัวอย่างเช่นคำว่า "สมมติฐาน" ไม่ได้อยู่ในดัชนีของหนังสือ นอกจากนี้เรามีสิ่งนี้ (หน้า 175) ในการถดถอยโลจิสติกเราจะต้องพึ่งพาการประเมินภาพเป็นหลักเนื่องจากการกระจายของการวินิจฉัยภายใต้สมมติฐานที่ว่ารูปแบบที่เหมาะเป็นที่รู้จักกันเฉพาะในการตั้งค่า จำกัด บางอย่าง …

1
การจำลองข้อมูลสำหรับการถดถอยโลจิสติกด้วยตัวแปรเด็ดขาด
ฉันพยายามสร้างข้อมูลทดสอบสำหรับการถดถอยโลจิสติกส์และพบบทความนี้จะจำลองข้อมูลปลอมสำหรับการถดถอยโลจิสติกอย่างไร มันเป็นคำตอบที่ดี แต่มันสร้างตัวแปรต่อเนื่องเท่านั้น สิ่งที่เกี่ยวกับตัวแปรเด็ดขาด x3 ที่มี 5 ระดับ (ABCDE) ที่เกี่ยวข้องกับ y สำหรับตัวอย่างเช่นเดียวกับในลิงค์?

1
หนังสือที่แนะนำเกี่ยวกับสถิติเชิงพื้นที่
อะไรคือหนังสือที่ดีที่สุดสำหรับการศึกษา i) ความแปรปรวนของตัวแปร univariate และหลายตัวแปร (ข้อมูลจริงนับจำนวน) ทั่วโดเมนเชิงพื้นที่ ii) การสุ่มตัวอย่างตัวแปร univariate หรือตัวแปรหลายตัวแปรตามการกระจายข้ามพื้นที่เชิงพื้นที่ (การสุ่มตัวอย่างเชิงพื้นที่ในระยะสั้น)

2
เคอร์เนล SVM ใดที่จะใช้สำหรับปัญหาการจำแนกประเภทไบนารี
ฉันเป็นผู้เริ่มต้นเมื่อพูดถึงการสนับสนุนเครื่องเวกเตอร์ มีแนวทางบางอย่างที่บอกว่าเคอร์เนลใด (เช่นเส้นตรงพหุนาม) เหมาะที่สุดสำหรับปัญหาเฉพาะหรือไม่? ในกรณีของฉันฉันต้องจำแนกหน้าเว็บตามว่ามีข้อมูลเฉพาะหรือไม่เช่นฉันมีปัญหาการจำแนกเลขฐานสอง คุณสามารถพูดโดยทั่วไปว่าเคอร์เนลใดเหมาะที่สุดสำหรับงานนี้? หรือฉันต้องลองหลายชุดในชุดข้อมูลเฉพาะของฉันเพื่อค้นหาชุดที่ดีที่สุด โดยวิธีการที่ฉันใช้ห้องสมุดหลามscikit เรียนรู้ที่ใช้ประโยชน์จากห้องสมุด libSVM

3
การคำนวณ Jaccard หรือสัมประสิทธิ์การเชื่อมโยงอื่น ๆ สำหรับข้อมูลไบนารีโดยใช้การคูณเมทริกซ์
ฉันต้องการทราบว่ามีวิธีใดที่เป็นไปได้ในการคำนวณสัมประสิทธิ์ Jaccard โดยใช้การคูณเมทริกซ์ ฉันใช้รหัสนี้ jaccard_sim <- function(x) { # initialize similarity matrix m <- matrix(NA, nrow=ncol(x),ncol=ncol(x),dimnames=list(colnames(x),colnames(x))) jaccard <- as.data.frame(m) for(i in 1:ncol(x)) { for(j in i:ncol(x)) { jaccard[i,j]= length(which(x[,i] & x[,j])) / length(which(x[,i] | x[,j])) jaccard[j,i]=jaccard[i,j] } } มันค่อนข้างโอเคที่จะนำไปใช้ในอาร์ฉันได้ทำลูกเต๋าที่มีความคล้ายคลึงกัน แต่ติดกับ Tanimoto / Jaccard ใครช่วยได้บ้าง

5
เป็นตัวแทนของข้อมูลการทดลอง
ฉันมีข้อโต้แย้งกับที่ปรึกษาของฉันเกี่ยวกับการสร้างภาพข้อมูล เขาอ้างว่าเมื่อแสดงผลการทดลองค่าควรพล็อตด้วย " เครื่องหมาย " เท่านั้นตามที่แสดงในภาพร้อง ในขณะที่เส้นโค้งควรแสดง " แบบจำลอง " เท่านั้น ในทางกลับกันฉันเชื่อว่าเส้นโค้งไม่จำเป็นในหลายกรณีเพื่อความสะดวกในการอ่านตามที่แสดงในภาพที่สองร้อง: ฉันผิดหรืออาจารย์ของฉัน หากภายหลังเป็นกรณีฉันจะไปรอบ ๆ เพื่ออธิบายสิ่งนี้กับเขาได้อย่างไร

1
เมื่อใดควรรวมเอฟเฟกต์แบบสุ่มในโมเดล
ฉันใหม่กับการทำโมเดลแบบผสมและฉันสับสนว่ามันเหมาะสมที่จะใช้เอฟเฟกต์แบบสุ่มในการวิเคราะห์ที่ฉันทำหรือไม่ คำแนะนำใด ๆ ที่จะได้รับการชื่นชม. การศึกษาของฉันคือการทดสอบว่าดัชนีที่พัฒนาขึ้นใหม่ของความอุดมสมบูรณ์ของสัตว์เลี้ยงลูกด้วยนมสามารถทำนายมูลค่าของดัชนีที่สร้างขึ้น แต่มีความเข้มข้นของแรงงานมากขึ้นได้อย่างไร ฉันทำการวัดดัชนีเหล่านี้ในผืนป่าหลาย ๆ ผืนพร้อมกับแปลงหลายผืนในแต่ละผืนป่า เพราะฉันไม่สนใจผลของแผ่นปะป่าโดยตรงและเนื่องจากแผ่นตัวอย่างของฉันซ้อนอยู่ในแผ่นปะป่าฉันจึงใช้แผ่นปะป่าเป็นผลแบบสุ่ม อย่างไรก็ตามฉันมีคำถามสองสามข้อเกี่ยวกับเรื่องนี้: ก่อนอื่นฉันรู้ว่าเอฟเฟกต์แบบสุ่มช่วยให้คุณสามารถสรุปผลลัพธ์ของคุณในทุกระดับที่เป็นไปได้ของปัจจัยการสุ่มไม่ใช่เฉพาะที่คุณสุ่มตัวอย่าง แต่สำหรับฉันแล้วการที่จะอนุมานแบบนี้ระดับของคุณจะต้องมีการสุ่มตัวอย่าง? แผ่นปะป่าของฉันไม่ได้สุ่มตัวอย่างแล้วฉันจะยังสามารถใช้มันเป็นเอฟเฟกต์แบบสุ่มได้หรือไม่? ประการที่สองฉันได้อ่านว่าคุณสามารถทดสอบได้ว่าจำเป็นต้องมีเอฟเฟกต์แบบสุ่มหรือไม่เช่นการทดสอบอัตราส่วนความน่าจะเป็นเพื่อเปรียบเทียบแบบจำลองที่มีและไม่มีผลกระทบหรือไม่ ฉันได้ทำไปแล้วและมันแสดงให้เห็นว่าแบบจำลองเอฟเฟกต์แบบสุ่มไม่ได้อธิบายข้อมูลรวมถึงแบบจำลองเอฟเฟกต์ถาวรเท่านั้น ปัญหาของฉันเกี่ยวกับเรื่องนี้ก็คือแผนการของฉันยังคงซ้อนกันอยู่ในแผ่นปะป่าและดังนั้นจึงไม่น่าจะเป็นอิสระ ดังนั้นฉันสามารถใช้วิธี LRT นี้เพื่อปรับการยกเว้นเอฟเฟกต์แบบสุ่มหรือฉันยังต้องรวมวิธีการนี้เพื่อใช้ในการพิจารณาความซ้อนกันหรือไม่? และหากฉันสิ้นสุดการลบเอฟเฟกต์แบบสุ่มมีวิธีการตรวจสอบว่าแปลงในแพทช์ป่าสามารถพิจารณาได้อย่างอิสระหรือไม่? ขอบคุณสำหรับความช่วยเหลือของคุณ! คนโง่

1
สัมประสิทธิ์มหาศาลในการถดถอยโลจิสติก - มันหมายความว่าอะไรและจะทำอย่างไร?
ฉันได้รับค่าสัมประสิทธิ์มหาศาลระหว่างการถดถอยโลจิสติกดูค่าสัมประสิทธิ์กับkrajULKV: > summary(m5) Call: glm(formula = cbind(ml, ad) ~ rok + obdobi + kraj + resid_usili2 + rok:obdobi + rok:kraj + obdobi:kraj + kraj:resid_usili2 + rok:obdobi:kraj, family = "quasibinomial") Deviance Residuals: Min 1Q Median 3Q Max -2.7796 -1.0958 -0.3101 1.0034 2.8370 Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) -486.72087 …

1
การคำนวณโอกาสในการบันทึกสำหรับ MLE ที่กำหนด (เชนมาร์คอฟ)
ขณะนี้ฉันทำงานร่วมกับมาร์คอฟเชนและคำนวณค่าความน่าจะเป็นสูงสุดโดยใช้ความน่าจะเป็นในการเปลี่ยนแปลงตามที่แนะนำโดยหลาย ๆ แหล่ง (เช่นจำนวนช่วงการเปลี่ยนภาพจาก a ถึง b หารด้วยจำนวนการเปลี่ยนภาพโดยรวมจาก a ไปยังโหนดอื่น ๆ ) ตอนนี้ฉันต้องการคำนวณความน่าจะเป็นของ MLE

3
ความแตกต่างทางแนวคิดระหว่าง heteroscedasticity และ non-stationarity
ฉันมีปัญหาในการแยกแยะความแตกต่างระหว่างแนวคิดเรื่องความไร้สติและความคงที่ ในขณะที่ฉันเข้าใจพวกเขา heteroscedasticity นั้นมีความแตกต่างกันในประชากรย่อยและผู้ที่ไม่อยู่กับที่ก็คือค่าเฉลี่ย / ความแปรปรวนที่เปลี่ยนแปลงตลอดเวลา หากสิ่งนี้เป็นความเข้าใจที่ถูกต้อง (แม้ว่าจะเป็นแบบง่ายๆ) การไม่อยู่นิ่ง ๆ เป็นเพียงกรณีเฉพาะของความแตกต่างระหว่างเวลาหรือไม่?

1
การคำนวณค่า p ที่ไม่รู้จัก
ฉันเพิ่งแก้ไขจุดบกพร่องสคริปต์ R และพบสิ่งแปลกประหลาดมากผู้เขียนกำหนดฟังก์ชั่นค่า p ของตัวเอง pval <- function(x, y){ if (x+y<20) { # x + y is small, requires R.basic p1<- nChooseK(x+y,x) * 2^-(x+y+1); p2<- nChooseK(x+y,y) * 2^-(x+y+1); pvalue = max(p1, p2) } else { # if x+y is large, use approximation log_p1 <- (x+y)*log(x+y) - x*log(x) - y*log(y) - …

1
การหาการแจกแจงของสถิติ
กำลังศึกษาเพื่อทดสอบ ไม่สามารถตอบคำถามนี้ ให้เป็น iidตัวแปรสุ่ม กำหนดX1,i,X2,i,X3,i,i=1,…,nX1,i,X2,i,X3,i,i=1,…,nX_{1,i},X_{2,i},X_{3,i}, i=1,\ldots,nN(0,1)N(0,1)\mathcal{N}(0,1) Wi=(X1,i+X2,iX3,i)/1+X23,i−−−−−−−√,i=1,…,nWi=(X1,i+X2,iX3,i)/1+X3,i2,i=1,…,nW_i = (X_{1,i} + X_{2,i}X_{3,i})/\sqrt{1 + X_{3,i}^2}, i = 1, \ldots, n , และ ,W¯¯¯¯¯n=n−1∑ni=1WiW¯n=n−1∑i=1nWi\overline{W}_n = n^{-1}\sum_{i=1}^nW_i S2n=(n−1)−1∑ni=1(Wi−W¯¯¯¯¯n)2,n≥2.Sn2=(n−1)−1∑i=1n(Wi−W¯n)2,n≥2.S_n^2 = (n-1)^{-1}\sum_{i=1}^n(W_i - \overline{W}_n)^2, n \ge 2. การกระจายของ ,คืออะไรW¯¯¯¯¯nW¯n\overline{W}_nS2nSn2S_n^2 ฉันจะได้รับแนวคิดวิธีที่ดีที่สุดที่จะใช้เมื่อเริ่มต้นปัญหาเช่นนี้ได้อย่างไร

1
การวิเคราะห์การอยู่รอดสำหรับการทำนายเหตุการณ์
สำหรับแต่ละระเบียนในชุดข้อมูลของฉันฉันมีข้อมูลต่อไปนี้ (X1 ,… ,Xm ,δ ,T )(X1 ,… ,Xm ,δ ,T ) (X_1 \ , \dots \ , X_m \ , \delta \ , T \ ) ที่ไหน XiXiX_i เป็นคุณสมบัติ δδ\delta คือ 1 ถ้าเหตุการณ์เป้าหมายเกิดขึ้นและ 0 เป็นอย่างอื่นและ TTTเป็นเวลาประทับของเหตุการณ์ที่เกิดขึ้น โดยเฉพาะอย่างยิ่ง,TTT อาจหายไปหากไม่มีเหตุการณ์หรือตั้งเวลาให้ติดตามผลสิ้นสุด ฉันต้องการคำนวณดัชนีความเสี่ยงสำหรับแต่ละระเบียนในชุดข้อมูลของฉัน ฉันคิดว่าจะใช้รูปแบบการจำแนกประเภทที่ใช้คุณสมบัติต่างๆ XiXiX_i เพื่อทำนายชั้นเรียน δδ\delta. อย่างไรก็ตามTTT เป็นสิ่งสำคัญ: ถ้าเหตุการณ์ δδ\delta มีแนวโน้มที่จะเกิดขึ้นในไม่ช้าความเสี่ยงควรสูงขึ้น นั่นคือเหตุผลที่การวิเคราะห์ความอยู่รอดควรเหมาะสำหรับปัญหานี้ …

2
“ หลงลืม” จากก่อนหน้านี้ในการตั้งค่า Bayesian?
เป็นที่ทราบกันดีว่าเมื่อคุณมีหลักฐานมากขึ้น (พูดในรูปของมีขนาดใหญ่กว่าสำหรับตัวอย่าง iid) Bayesian ก่อนหน้านี้จะ "ลืม" และการอนุมานส่วนใหญ่ได้รับผลกระทบจากหลักฐาน (หรือโอกาส)nnnnnn มันง่ายที่จะเห็นมันสำหรับกรณีเฉพาะต่าง ๆ (เช่น Bernoulli กับรุ่นเบต้าก่อนหรือประเภทอื่น ๆ ) - แต่มีวิธีดูในกรณีทั่วไปด้วยและก่อนไหมx1,…,xn∼p(x|μ)x1,...,xn~พี(x|μ)x_1,\ldots,x_n \sim p(x|\mu)p(μ)พี(μ)p(\mu) แก้ไข: ฉันเดาว่าจะไม่สามารถแสดงในกรณีทั่วไปสำหรับก่อนหน้านี้ใด ๆ (ตัวอย่างเช่นมวลจุดก่อนหน้าจะทำให้มวลหลังจุด) แต่อาจมีเงื่อนไขบางอย่างที่ถูกลืมไปก่อน นี่คือ "เส้นทาง" ที่ฉันคิดเกี่ยวกับการแสดงบางอย่างเช่นนั้น: สมมติว่าพื้นที่พารามิเตอร์คือ ΘΘ\Thetaและปล่อยให้ p(θ)พี(θ)p(\theta) และ q(θ)Q(θ)q(\theta) เป็นนักบวชสองคนที่วางมวลความน่าจะไม่เป็นศูนย์ไว้สำหรับทุกคน ΘΘ\Theta. ดังนั้นการคำนวณหลังทั้งสองสำหรับจำนวนเงินก่อนหน้านี้ไปที่: p(θ|x1,…,xn)=∏ip(xi|θ)p(θ)∫θ∏ip(xi|θ)p(θ)dθพี(θ|x1,...,xn)=Πผมพี(xผม|θ)พี(θ)∫θΠผมพี(xผม|θ)พี(θ)dθp(\theta | x_1,\ldots,x_n) = \frac{\prod_i p(x_i | \theta) p(\theta)}{\int_{\theta} \prod_i p(x_i | \theta) p(\theta) d\theta} …
9 bayesian  prior 

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.