สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
อะไรคือความแตกต่างระหว่างการควบคุมตัวแปรในตัวแบบการถดถอยกับการควบคุมตัวแปรในการออกแบบการศึกษาของคุณ?
ฉันคิดว่าการควบคุมตัวแปรในการออกแบบการศึกษาของคุณนั้นมีประสิทธิภาพมากขึ้นในการลดข้อผิดพลาดได้มากกว่าการควบคุมมันในแบบจำลองการถดถอยของคุณ ใครบางคนจะอธิบายอย่างเป็นทางการว่า "การควบคุม" สองอย่างนี้มีความแตกต่างกันอย่างไร มีประสิทธิภาพอย่างไรเมื่อเปรียบเทียบกับการลดข้อผิดพลาดและให้การคาดการณ์ที่แม่นยำยิ่งขึ้น

1
การจำลองมอนติคาร์โลในอาร์
ฉันพยายามที่จะแก้ปัญหาการออกกำลังกายต่อไปนี้ แต่จริง ๆ แล้วฉันไม่มีเงื่อนงำเกี่ยวกับวิธีการเริ่มต้นทำเช่นนี้ ฉันพบรหัสบางอย่างในหนังสือของฉันที่ดูเหมือนว่ามัน แต่เป็นการออกกำลังกายที่แตกต่างอย่างสิ้นเชิงและฉันไม่รู้วิธีการเชื่อมโยงพวกเขากับแต่ละคน ฉันจะเริ่มเลียนแบบการมาถึงได้อย่างไรและฉันจะรู้ได้อย่างไรเมื่อพวกเขาเสร็จสิ้นแล้ว ฉันรู้วิธีจัดเก็บและคำนวณ a, b, c, d ตามนั้น แต่ฉันไม่รู้ว่าจริง ๆ แล้วฉันต้องการจำลอง monte carlo Simulation อย่างไร ใครช่วยกรุณาเริ่มต้นได้บ้าง ฉันรู้ว่านี่ไม่ใช่สถานที่สำหรับตอบคำถามของคุณ แต่ได้รับการแก้ไขแทน แต่ปัญหาคือฉันไม่รู้วิธีเริ่มต้น แผนกช่วยเหลือด้านไอทีแสดงถึงระบบเข้าคิวด้วยผู้ช่วยห้าคนที่รับสายจากลูกค้า การโทรเกิดขึ้นตามกระบวนการปัวซงโดยมีอัตราเฉลี่ยของการโทรหนึ่งครั้งทุก 45 วินาที เวลาบริการสำหรับผู้ช่วยที่ 1, 2, 3, 4 และ 5 คือตัวแปรสุ่มเอ็กซ์โพเนนเชียลทั้งหมดที่มีพารามิเตอร์λ1 = 0.1, λ2 = 0.2, λ3 = 0.3, λ4 = 0.4, และλ5 = 0.5 …

2
p-value subtlety: มากขึ้นเท่ากันและมากกว่า
ในขณะที่ฉันกำลังอ่านหนังสือสถิติทั้งหมดของ Wassermann ฉันสังเกตเห็นความละเอียดอ่อนในคำจำกัดความของค่า p ซึ่งฉันไม่สามารถเข้าใจได้ อย่างไม่เป็นทางการ Wassermann กำหนดค่า p เป็น [.. ] ความน่าจะเป็น (ต่ำกว่า ) ของการสังเกตค่าสถิติการทดสอบเหมือนกับหรือมากกว่าความเป็นจริงมากกว่าที่สังเกตH0H0H_0 เน้นการเพิ่ม เหมือนกันมากขึ้นอย่างเป็นทางการ (ทฤษฎีบท 10.12): สมมติว่าการทดสอบขนาดเป็นของแบบฟอร์มαα\alpha ปฏิเสธถ้าหากว่าc_H0H0H_0T(Xn)≥cαT(Xn)≥cαT(X^n) \ge c_\alpha จากนั้น p-value=supθ∈Θ0Pθ0[T(Xn)≥T(xn)]p-value=supθ∈Θ0Pθ0[T(Xn)≥T(xn)]\text{$p$-value} = \sup_{\theta\in\Theta_0} P_{\theta_0}[T(X^n) \ge T (x^n)] ที่xnxnx^nเป็นค่าสังเกตของXnXnX^n n ถ้าΘ0={θ0}Θ0={θ0}\Theta_0=\{\theta_0\}ดังนั้น p-value=Pθ0[T(Xn)≥T(xn)]p-value=Pθ0[T(Xn)≥T(xn)]\text{$p$-value} = P_{\theta_0}[T(X^n) \ge T (x^n)] นอกจากนี้ Wassermann ยังกำหนดค่า p-value ของการทดสอบ \ chi ^ 2ของ …

1
การใช้เครื่องมือการเรียนรู้เครื่องมาตรฐานกับข้อมูลที่ตรวจสอบแล้ว
ฉันกำลังพัฒนาแอพพลิเคชั่นพยากรณ์ซึ่งมีวัตถุประสงค์เพื่อให้ผู้นำเข้าสามารถคาดการณ์ความต้องการผลิตภัณฑ์ของตนจากเครือข่ายลูกค้าของผู้จัดจำหน่าย ตัวเลขยอดขายเป็นตัวแทนที่ดีสำหรับความต้องการตราบใดที่มีสินค้าคงคลังเพียงพอที่จะเติมเต็มความต้องการ เมื่อสินค้าคงคลังถูกดึงลงมาที่ศูนย์แม้ว่า (สถานการณ์ที่เรากำลังมองหาเพื่อช่วยให้ลูกค้าหลีกเลี่ยง) เราไม่ทราบมากว่าเราพลาดเป้าหมายโดย ลูกค้าจะทำยอดขายได้เท่าใดพวกเขามีอุปทานเพียงพอหรือไม่ วิธีการ ML แบบอิงการถดถอยแบบมาตรฐานที่ใช้การขายเป็นตัวแปรเป้าหมายอย่างง่ายจะสร้างการประมาณที่ไม่สอดคล้องกันของความสัมพันธ์ระหว่างเวลาตัวแปรอธิบายของฉันและความต้องการ การสร้างแบบจำลองบิทเป็นวิธีที่เห็นได้ชัดที่สุดในการแก้ปัญหา: http://en.wikipedia.org/wiki/Tobit_model ฉันสงสัยเกี่ยวกับการปรับ ML ป่าสุ่ม, GBMS, SVM และเครือข่ายประสาทที่ยังบัญชีสำหรับโครงสร้างเซ็นเซอร์ข้อมูลด้านซ้ายมือ ในระยะสั้นฉันจะใช้เครื่องมือการเรียนรู้ของเครื่องกับข้อมูลการถดถอยที่ถูกเซ็นเซอร์ด้านซ้ายเพื่อรับการประมาณการที่สอดคล้องกันของความสัมพันธ์ระหว่างตัวแปรตามและตัวแปรอิสระของฉันได้อย่างไร การตั้งค่าแรกจะเป็นโซลูชั่นที่มีอยู่ใน R ตามด้วย Python ไชโย แอรอน

4
การตรวจจับที่ผิดพลาดในอนุกรมเวลา: วิธีลดผลบวกปลอม?
ฉันพยายามที่จะทำงานโดยอัตโนมัติขอบเขตการตรวจสอบในอนุกรมเวลาและฉันใช้การปรับเปลี่ยนของการแก้ปัญหาที่เสนอโดยร็อบ Hyndman ที่นี่ บอกว่าฉันวัดการเข้าชมเว็บไซต์ทุกวันจากหลายประเทศ สำหรับบางประเทศที่การเข้าชมรายวันเป็นสองสามหมื่นหรือหลายพันวิธีการของฉันดูเหมือนจะทำงานได้อย่างสมเหตุสมผล อย่างไรก็ตามในกรณีที่ประเทศหนึ่งนำไปสู่การเยี่ยมชมเพียง 1 หรือ 2 ครั้งต่อวันข้อ จำกัด ของอัลกอริทึมนั้นแคบมาก (เช่น 1 ± 0.001) ดังนั้นการเข้าชม 2 ครั้งจึงถือว่าเป็นค่าที่ผิดปกติ ฉันจะตรวจจับกรณีดังกล่าวโดยอัตโนมัติได้อย่างไรและฉันจะปฏิบัติต่อพวกเขาเพื่อระบุค่าผิดปกติได้อย่างไร ฉันไม่ต้องการตั้งเกณฑ์แบบกำหนดเองเป็น 100 ครั้งต่อวัน ขอบคุณ!

2
ทำไม runif ไม่สร้างผลลัพธ์เดียวกันทุกครั้ง
ทำไมเครื่องกำเนิดตัวเลขแบบสุ่มrunif()ใน R ไม่สร้างผลลัพธ์เหมือนกันทุกครั้ง? ตัวอย่างเช่น: X <- runif(100) X กำลังสร้างเอาต์พุตที่แตกต่างกันทุกครั้ง เหตุผลในการสร้างผลลัพธ์ที่แตกต่างกันทุกครั้งคืออะไร? มันทำหน้าที่อะไรในพื้นหลังที่จะทำเช่นนี้?

2
glmnet: วิธีทำให้ความรู้สึกของการกำหนดพารามิเตอร์แบบหลายส่วน?
ปัญหาต่อไปนี้: ฉันต้องการทำนายตัวแปรการตอบสนองอย่างเด็ดขาดด้วยตัวแปรเด็ดขาดหนึ่งตัว (หรือมากกว่า) โดยใช้ glmnet () อย่างไรก็ตามฉันไม่สามารถรับรู้ถึงผลลัพธ์ที่ glmnet มอบให้ฉันได้ ตกลงก่อนอื่นเรามาสร้างตัวแปรเด็ดขาดสองตัวที่เกี่ยวข้องกัน: สร้างข้อมูล p <- 2 #number variables mu <- rep(0,p) sigma <- matrix(rep(0,p^2), ncol=p) sigma[1,2] <- .8 #some relationship .. diag(sigma) <- 1 sigma <- pmax(sigma, t(sigma)) n <- 100 set.seed(1) library(MASS) dat <- mvrnorm(n, mu, sigma) #discretize k <- 3 …

2
การเขียนโปรแกรมกำลังสองและ Lasso
ฉันพยายามทำการ lasso ถดถอยซึ่งมีแบบฟอร์มต่อไปนี้: ย่อขนาดใน( Y - X w ) ′ ( Y - X w ) + λWww(Y−Xw)′(Y−Xw)+λ|w|1(Y−Xw)′(Y−Xw)+λ|w|1(Y - Xw)'(Y - Xw) + \lambda \;|w|_1 ได้รับฉันแนะนำให้หาดีที่สุดด้วยความช่วยเหลือของการเขียนโปรแกรมกำลังสองซึ่งใช้รูปแบบต่อไปนี้:wλλ\lambdawww ย่อในโดยขึ้นอยู่กับ1xxxx≤ข12x′Qx+c′x12x′Qx+c′x\frac{1}{2} x'Qx + c'xAx≤b.Ax≤b.Ax \le b. ตอนนี้ฉันรู้แล้วว่าควรเปลี่ยนเป็นเทอมซึ่งค่อนข้างตรงไปตรงมา อย่างไรก็ตามฉันไม่เห็นว่าฉันจะถ่ายโอนเทอมแรกของสมการแรกไปสู่เทอมแรกของสมการที่สองได้อย่างไร ฉันหาอะไรเกี่ยวกับมันไม่ได้ในเน็ตฉันเลยตัดสินใจถามที่นี่A x ≤ bλλ\lambdaAx≤bAx≤bAx \le b

1
เครื่องมือประมาณการ James-Stein ที่มีความแปรปรวนไม่เท่ากัน
ทุกคำสั่งที่ฉันพบของตัวประมาณ James-Stein ถือว่าตัวแปรสุ่มที่ถูกประมาณนั้นมีความแปรปรวน (และหน่วย) เหมือนกัน แต่ตัวอย่างทั้งหมดเหล่านี้ยังพูดถึงว่าตัวประมาณ JS สามารถใช้ในการประมาณปริมาณโดยไม่เกี่ยวข้องกัน ตัวอย่างเช่นวิกิพีเดียคือความเร็วของแสงการบริโภคกาแฟในไต้หวันและน้ำหนักหมูในมอนแทนา แต่สมมุติว่าการวัดปริมาณทั้งสามนี้ของคุณจะมีความแปรปรวน "ที่แท้จริง" ที่แตกต่างกัน สิ่งนี้นำเสนอปัญหาหรือไม่? สิ่งนี้เชื่อมโยงกับปัญหาเชิงแนวคิดที่ใหญ่กว่าซึ่งฉันไม่เข้าใจเกี่ยวข้องกับคำถามนี้: ตัวประเมินเจมส์ - สไตน์: Efron และมอร์ริสคำนวณในปัจจัยการหดตัวอย่างเบสบอลของพวกเขาอย่างไร σ2σ2\sigma^2 cเราคำนวณปัจจัยการหดตัวดังนี้คcc c = 1 - ( k - 3 ) σ2∑ ( y- y¯)2c=1−(k−3)σ2∑(y−y¯)2 c = 1 - \frac{(k-3) \sigma^2} {\sum (y - \bar{y})^2} ฉันคิดว่าเทอมนั้นจริง ๆ แล้ว - ต่างกันสำหรับแต่ละปริมาณที่ประมาณไว้ แต่การสนทนาในคำถามนั้นพูดถึงการใช้ความแปรปรวนร่วมเท่านั้น …

1
ย้อนกลับเปลี่ยนผลลัพธ์การถดถอยเมื่อสร้างแบบจำลองบันทึก (y)
ฉันกระชับถดถอยใน(y) มันถูกต้องหรือไม่กับการประมาณค่าจุดเปลี่ยนกลับ (และช่วงความเชื่อมั่น / การทำนาย) โดยการยกกำลัง? ฉันไม่เชื่อเช่นนั้นเนื่องจากแต่ต้องการความคิดเห็นของผู้อื่นE [ f ( X ) ] ≠ f ( E [ X ] )เข้าสู่ระบบ( y)log⁡(y)\log(y)E[ f( X) ] ≠ f( E[ X] )E[f(X)]≠f(E[X])E[f(X)] \ne f(E[X]) ตัวอย่างด้านล่างของฉันแสดงความขัดแย้งกับการเปลี่ยนรูปด้านหลัง (.239 vs .219) set.seed(123) a=-5 b=2 x=runif(100,0,1) y=exp(a*x+b+rnorm(100,0,.2)) # plot(x,y) ### NLS Fit f <- function(x,a,b) {exp(a*x+b)} …

2
lme4 :: lmer เทียบเท่ากับ ANOVA ที่ทำซ้ำสามทางคืออะไร?
คำถามของฉันอยู่บนพื้นฐานของการตอบสนองซึ่งแสดงให้เห็นว่าlme4::lmerรูปแบบใดที่สอดคล้องกับการวัดความแปรปรวนสองทางแบบ ANOVA: require(lme4) set.seed(1234) d <- data.frame( y = rnorm(96), subject = factor(rep(1:12, 4)), a = factor(rep(1:2, each=24)), b = factor(rep(rep(1:2, each=12))), c = factor(rep(rep(1:2, each=48)))) # standard two-way repeated measures ANOVA: summary(aov(y~a*b+Error(subject/(a*b)), d[d$c == "1",])) # corresponding lmer call: anova(lmer(y ~ a*b+(1|subject) + (1|a:subject) + (1|b:subject), d[d$c == "1",])) …

1
การสร้างแบบจำลองแบบเบย์โดยใช้ตัวแปรหลายตัวแปรร่วมกับ covariate
สมมติว่าคุณมีตัวแปรอธิบายโดยที่แทนพิกัดที่กำหนด คุณยังมีตัวแปรตอบสนองขวา) ตอนนี้เราสามารถรวมตัวแปรทั้งสองเป็น:X=(X(s1),…,X(sn))X=(X(s1),…,X(sn)){\bf{X}} = \left(X(s_{1}),\ldots,X(s_{n})\right)sssY=(Y(s1),…,Y(sn))Y=(Y(s1),…,Y(sn)){\bf{Y}} = \left(Y(s_{1}),\ldots,Y(s_{n})\right) W(s)=(X(s)Y(s))∼N(μ(s),T)W(s)=(X(s)Y(s))∼N(μ(s),T){\bf{W}}({\bf{s}}) = \left( \begin{array}{ccc}X(s) \\ Y(s) \end{array} \right) \sim N(\boldsymbol{\mu}(s), T) ในกรณีนี้เราเลือกμ(s)=(μ1μ2)Tμ(s)=(μ1μ2)T\boldsymbol{\mu}(s) = \left( \mu_{1} \; \; \mu_{2}\right)^{T}และTTTเป็นเมทริกซ์ความแปรปรวนร่วมที่อธิบาย ความสัมพันธ์ระหว่างXXXและYYYYสิ่งนี้อธิบายค่าXXXและYYYที่sssเท่านั้น เนื่องจากเรามีคะแนนเพิ่มเติมจากที่ตั้งอื่นสำหรับXXXและYYYเราจึงสามารถอธิบายค่าเพิ่มเติมของW(s)W(s){\bf{W}}(s)ด้วยวิธีต่อไปนี้: (XY)=N((μ11μ21),T⊗H(ϕ))(XY)=N((μ11μ21),T⊗H(ϕ))\left( \begin{array}{ccc} {\bf{X}} \\ {\bf{Y}} \end{array}\right) = N\left(\left(\begin{array}{ccc}\mu_{1}\boldsymbol{1}\\ \mu_{2}\boldsymbol{1}\end{array}\right), T\otimes H(\phi)\right) คุณจะสังเกตเห็นว่าเราได้จัดเรียงองค์ประกอบของXX\bf{X}และYY\bf{Y}เพื่อให้ได้X(si)X(si)X(s_i)ในคอลัมน์และหลังจากนั้นเชื่อมต่อY(si)Y(si)Y(s_i)เข้าด้วยกัน แต่ละองค์ประกอบH(ϕ)ijH(ϕ)ijH(\phi)_{ij}เป็นฟังก์ชันที่สัมพันธ์กันρ(si,sj)ρ(si,sj)\rho(s_i, s_j)และTTTอยู่ด้านบน เหตุผลที่เรามีความแปรปรวนร่วมT⊗H(ϕ)T⊗H(ϕ)T\otimes H(\phi)เป็นเพราะเราคิดว่ามันเป็นไปได้ที่จะแยกเมทริกซ์ความแปรปรวนเป็นC(s,s′)=ρ(s,s′)TC(s,s′)=ρ(s,s′)TC(s, s')=\rho(s, s') TT คำถามที่ 1: เมื่อฉันคำนวณเงื่อนไขY∣XY∣X{\bf{Y}}\mid{\bf{X}}สิ่งที่ฉันกำลังทำจริง ๆ …

2
ความคาดหวังของแกมม่ากำลังสอง
หากการแจกแจงแกมมาถูกกำหนดพารามิเตอร์ด้วยและดังนั้น:αα\alphaββ\beta E(Γ(α,β))=αβE(Γ(α,β))=αβ E(\Gamma(\alpha, \beta)) = \frac{\alpha}{\beta} ฉันต้องการคำนวณความคาดหวังของแกมม่ากำลังสองนั่นคือ: E(Γ(α,β)2)=?E(Γ(α,β)2)=? E(\Gamma(\alpha, \beta)^2) = ? ฉันคิดว่ามันเป็น: E(Γ(α,β)2)=(αβ)2+αβ2E(Γ(α,β)2)=(αβ)2+αβ2 E(\Gamma(\alpha, \beta)^2) = \left(\frac{\alpha}{\beta}\right)^2 + \frac{\alpha}{\beta^2} ไม่มีใครรู้ว่าการแสดงออกหลังนี้ถูกต้องหรือไม่

1
การบูตสแตรปเหมาะสมกับข้อมูลต่อเนื่องนี้หรือไม่
ฉันเป็นมือใหม่ที่สมบูรณ์ :) ฉันกำลังศึกษาขนาดตัวอย่าง 10,000 คนจากประชากรประมาณ 745,000 คน แต่ละตัวอย่างแสดงถึง "ความคล้ายคลึงกันของเปอร์เซ็นต์" กลุ่มตัวอย่างส่วนใหญ่อยู่ที่ประมาณ 97% -98% แต่มีไม่กี่คนที่อยู่ระหว่าง 60% ถึง 90% นั่นคือการกระจายตัวค่อนข้างเบ้ ประมาณ 0.6% ของผลลัพธ์เป็น 0% แต่สิ่งเหล่านี้จะได้รับการแยกจากตัวอย่าง ค่าเฉลี่ยของตัวอย่าง 10,000 ตัวอย่างทั้งหมดคือ 97.7% และใน Excel StdDev คือ 3.20 ฉันเข้าใจว่า StdDev ไม่สามารถใช้งานได้ที่นี่เพราะผลลัพธ์ไม่ได้กระจายตามปกติ (และเนื่องจาก +3.20 จะทำให้คุณสูงกว่า 100%!) คำถามของฉันคือ: การบูตสแตรป (แนวคิดใหม่สำหรับฉัน) เหมาะสมหรือไม่ ฉันกำลังทำการบูตอย่างถูกต้องหรือไม่ :) ขนาดตัวอย่างที่เพียงพอคืออะไร สิ่งที่ฉันทำคือการสุ่มตัวอย่างใหม่ (แทนที่) ผลลัพธ์ 10,000 รายการของฉันและคำนวณค่าเฉลี่ยใหม่ …

1
เมื่อใดที่จะแก้ไขค่า p ในการเปรียบเทียบหลาย ๆ
ฉันเกรงว่าคำถามที่เกี่ยวข้องไม่ได้ตอบฉัน เราประเมินการแสดงของตัวจําแนก> 2 ตัว (การเรียนรู้ของเครื่อง) สมมติฐานว่างของเราคือการแสดงไม่แตกต่างกัน เราทำการทดสอบพารามิเตอร์ (ANOVA) และการทดสอบที่ไม่ใช่พารามิเตอร์ (ฟรีดแมน) เพื่อประเมินสมมติฐานนี้ หากพวกเขาสำคัญเราต้องการค้นหาว่าตัวแยกประเภทใดที่แตกต่างกันในเควสต์แบบเฉพาะกิจ คำถามของฉันคือสองเท่า: 1) การแก้ไขค่า p หลังจากการทดสอบแบบเปรียบเทียบหลายรายการจำเป็นหรือไม่? เว็บไซต์ Wikipedia ของเยอรมันใน "Alphafehler Kumulierung" กล่าวว่าปัญหาจะเกิดขึ้นก็ต่อเมื่อมีการทดสอบสมมติฐานหลายข้อในข้อมูลเดียวกัน เมื่อเปรียบเทียบตัวแยกประเภท (1,2), (1,3), (2,3) ข้อมูลจะทับซ้อนกันเพียงบางส่วนเท่านั้น ยังจำเป็นต้องแก้ไขค่า p หรือไม่? 2) การแก้ไขค่า P มักใช้หลังจากการทดสอบแบบคู่กับการทดสอบที มันเป็นสิ่งจำเป็นหรือไม่เมื่อทำการทดสอบแบบเฉพาะหลังเช่นการทดสอบแบบ Nemenyi (ไม่ใช่แบบพารามิเตอร์) หรือการทดสอบ HSD ของ Tukey คำตอบนี้บอกว่า "ไม่" สำหรับ HSD ของ Tukey: การทดสอบ Tukey …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.