สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
เริ่มต้น PyMC: วิธีตัวอย่างจากโมเดลที่ติดตั้งจริง
ฉันกำลังลองใช้แบบจำลองที่ง่ายมาก: ปรับค่าปกติที่ฉันคิดว่าฉันรู้ความแม่นยำและฉันแค่ต้องการหาค่าเฉลี่ย รหัสด้านล่างดูเหมือนว่าจะพอดีกับปกติอย่างถูกต้อง แต่หลังจากการติดตั้งฉันต้องการตัวอย่างจากแบบจำลองคือสร้างข้อมูลใหม่ซึ่งคล้ายกับdataตัวแปรของฉัน ฉันรู้ว่าฉันสามารถใช้trace("mean")เพื่อรับตัวอย่างสำหรับตัวแปรค่าเฉลี่ย แต่ฉันจะหาตัวอย่างใหม่จากโมเดลเองได้อย่างไร เราได้ตรวจสอบเอกสารเช่นhttp://pymc-devs.github.io/pymc/database.html#accessing-sampled-data ฉันได้ดูตัวอย่างบางส่วนเช่นภัยพิบัติจากการขุดและอีกหลายรายการจากสมุดบันทึก Probabilistic Programming และไม่มีใครพูดถึงเรื่องนี้ ฉัน (เริ่มต้น MCMC มากขึ้นหรือน้อยลง) คาดว่าการสุ่มตัวอย่างจากโมเดลที่ติดตั้งไว้นั้นเป็นจุดรวม! ฉันกำลังคิดถึงอะไร from pymc import * data = np.array([-1, 0, 4, 0, 2, -2, 1, 0, 0, 2, 1, -3, -1, 0, 0, 1, 0, 1]) mean = Uniform("mean", -4, 4) precision = 2.0**-2 obs …
12 mcmc  pymc 

1
ฟังก์ชั่นระยะทางที่ดีที่สุดสำหรับบุคคลคืออะไรเมื่อมีการระบุคุณสมบัติ?
ฉันไม่ทราบว่าฟังก์ชั่นระยะทางระหว่างบุคคลที่จะใช้ในกรณีที่มีคุณสมบัติระบุ (unordered เด็ดขาด) ฉันกำลังอ่านหนังสือเรียนและพวกเขาแนะนำฟังก์ชั่นการจับคู่อย่างง่ายแต่หนังสือบางเล่มแนะนำว่าฉันควรเปลี่ยนชื่อเป็นแอตทริบิวต์ไบนารีและใช้ค่าสัมประสิทธิ์Jaccard อย่างไรก็ตามจะเกิดอะไรขึ้นถ้าค่าของแอตทริบิวต์ที่ระบุไม่ใช่ 2 เกิดอะไรขึ้นถ้ามีค่าสามหรือสี่ค่าในแอตทริบิวต์นั้น ฉันควรใช้ฟังก์ชันระยะทางใดสำหรับคุณลักษณะที่ระบุ

2
เวกเตอร์ของตัวแปรสามารถแสดงไฮเปอร์เพลนได้อย่างไร?
ฉันกำลังอ่านองค์ประกอบของการเรียนรู้เชิงสถิติและหน้า 12 (ส่วน 2.3) โมเดลเชิงเส้นจะได้รับการบันทึกเป็น: Yˆ= XTβˆY^=XTβ^\widehat{Y} = X^{T} \widehat{\beta} ... โดยที่คือการย้ายของเวกเตอร์คอลัมน์ของตัวทำนาย / ตัวแปรอิสระ / อินพุต (มันระบุก่อนหน้านี้ "เวกเตอร์ทั้งหมดจะถือว่าเป็นพาหะคอลัมน์" เพื่อที่จะไม่ทำให้นี้X Tเวกเตอร์แถวและเบต้าเวกเตอร์คอลัมน์?)XTXTX^{T}XTXTX^{T}βˆβ^\widehat{\beta} สิ่งที่รวมอยู่ในคือ " 1 " ที่จะถูกคูณกับสัมประสิทธิ์ที่สอดคล้องกันซึ่งให้การสกัด (ค่าคงที่)XXX111 มันพูดต่อไปว่า: ในพื้นที่อินพุทมิติ, ( X , Y )หมายถึงไฮเปอร์เพล หากค่าคงที่รวมอยู่ในXแล้วไฮเปอร์เพลนจะรวมค่าเริ่มต้นและเป็นพื้นที่ย่อย หากไม่ได้ก็เป็นชุดเลียนแบบตัดYแกนที่จุด ( 0 , ^ β 0 )( p + 1 )(p+1)(p + 1)( X, วาย …

1
จะทำอย่างไรเมื่อเมทริกซ์ความแปรปรวนร่วมตัวอย่างไม่สามารถกลับด้านได้
ฉันกำลังทำงานกับเทคนิคการจัดกลุ่มบางอย่างซึ่งสำหรับกลุ่ม d- มิติเวกเตอร์ที่กำหนดฉันถือว่าการแจกแจงปกติหลายตัวแปรและคำนวณตัวอย่างเวกเตอร์เฉลี่ยมิติสามมิติและเมทริกซ์ความแปรปรวนร่วมตัวอย่าง จากนั้นเมื่อพยายามที่จะตัดสินใจว่าเวกเตอร์ d-มิติใหม่ที่ยังไม่ถูกมองเป็นของกลุ่มนี้ฉันกำลังตรวจสอบระยะทางผ่านทางวัดนี้: (Xi−μ^X)′σ^−1X(Xi−μ^X)>B0.95(p2,−p2)(Xi−μ^X)′σ^X−1(Xi−μ^X)>B0.95(p2,−p2)\left(X_i-\hat{\mu}_X\right)'\hat{\sigma}_X^{-1}\left(X_i-\hat{\mu}_X\right)>B_{0.95}\left(\frac{p}{2},\frac{-p}{2}\right) ซึ่งจะต้องมีฉันในการคำนวณค่าผกผันของการแปรปรวนเมทริกซ์\แต่จากตัวอย่างบางอย่างที่ฉันไม่สามารถรับประกันได้ว่าเมทริกซ์ความแปรปรวนร่วมจะกลับกันได้ฉันควรทำอย่างไรในกรณีที่ไม่เป็นเช่นนั้นσ^Xσ^X\hat{\sigma}_X ขอบคุณ

1
จะค้นหาความแปรปรวนระหว่างจุดหลายมิติได้อย่างไร
สมมติว่าฉันมีเมทริกซ์ X ซึ่งเป็น n คูณ p นั่นคือมันมีการสังเกต n โดยการสังเกตแต่ละครั้งในพื้นที่มิติ p ฉันจะค้นหาความแปรปรวนของการสังเกตการณ์ n เหล่านี้ได้อย่างไร ในกรณีที่ p = 1 ฉันแค่ต้องใช้สูตรผลต่างปกติ สิ่งที่เกี่ยวกับกรณีที่ p> 1
12 variance 

3
จำนวนตัวเลขที่สำคัญที่จะรายงาน
มีวิธีการทางวิทยาศาสตร์มากขึ้นในการกำหนดจำนวนตัวเลขที่สำคัญในการรายงานค่าเฉลี่ยหรือช่วงความเชื่อมั่นในสถานการณ์ที่ค่อนข้างเป็นมาตรฐาน - เช่นชั้นปีแรกที่วิทยาลัย ฉันได้เห็นจำนวนตัวเลขที่สำคัญที่จะใส่ในตาราง , ทำไมเราไม่ใช้เลขนัยสำคัญและจำนวนตัวเลขที่สำคัญในตารางพอดีไคแต่เหล่านี้ดูเหมือนจะไม่ใส่นิ้วของพวกเขาในการแก้ปัญหา ในชั้นเรียนของฉันฉันพยายามอธิบายให้นักเรียนของฉันทราบว่าเป็นเรื่องเสียหมึกที่จะรายงานตัวเลข 15 หลักที่สำคัญเมื่อพวกเขามีข้อผิดพลาดมาตรฐานที่กว้างเช่นนี้ในผลลัพธ์ของพวกเขา - ความรู้สึกของฉันคือว่ามันควรจะถูกปัดเศษ0.25นี้ไม่ได้แตกต่างกันเกินไปจากสิ่งที่ถูกกล่าวโดยASTM - การรายงานผลการทดสอบหมายถึง E29 ที่พวกเขาบอกว่ามันควรอยู่ระหว่างและ0.50.25σ0.25σ0.25\sigma0.05σ0.05σ0.05\sigma0.5σ0.5σ0.5\sigma แก้ไข: เมื่อฉันมีชุดตัวเลขxด้านล่างฉันควรใช้ตัวเลขกี่หลักในการพิมพ์ค่าเฉลี่ยและส่วนเบี่ยงเบนมาตรฐาน set.seed(123) x <- rnorm(30) # default mean=0, sd=1 # R defaults to 7 digits of precision options(digits=7) mean(x) # -0.04710376 - not far off theoretical 0 sd(x) # 0.9810307 - not far from …

4
บันทึกโมเดลเชิงเส้น
ใครช่วยอธิบายหน่อยได้ไหมว่าทำไมเราถึงใช้โมเดลลิเนียร์ลิเนียร์ในแง่คนธรรมดา? ฉันมาจากภูมิหลังทางวิศวกรรมและนี่เป็นเรื่องยากสำหรับฉันสถิติที่เป็น ฉันจะขอบคุณสำหรับคำตอบ

1
การค้นหาค่าติดตั้งและทำนายสำหรับโมเดลเชิงสถิติ
สมมติว่าฉันมีข้อมูลต่อไปนี้และกำลังใช้โมเดลการถดถอย: df=data.frame(income=c(5,3,47,8,6,5), won=c(0,0,1,1,1,0), age=c(18,18,23,50,19,39), home=c(0,0,1,0,0,1)) ในอีกด้านหนึ่งฉันใช้โมเดลเชิงเส้นเพื่อทำนายรายได้: md1 = lm(income ~ age + home + home, data=df) ประการที่สองฉันเรียกใช้แบบจำลอง logit เพื่อทำนายตัวแปรที่ชนะ: md2 = glm(factor(won) ~ age + home, data=df, family=binomial(link="logit")) สำหรับทั้งสองรุ่นฉันสงสัยว่าฉันจะสร้างตารางหรือกรอบข้อมูลด้วยหมวดการตอบสนองของผู้ทำนายค่าติดตั้งและค่าที่ทำนายรูปแบบได้อย่างไร ดังนั้นสำหรับโมเดลเชิงเส้นบางอย่างเช่น: age fitted_income predicted_income 18 3 5 23 3 3 50 4 2 19 5 5 39 6 4 home fitted_income …
12 r 

4
ใครสามารถอธิบายได้ว่าการพึ่งพาและความแปรปรวนเป็นศูนย์ได้อย่างไร
ใครบางคนสามารถอธิบายได้อย่างที่ Greg ทำ แต่ในรายละเอียดมากขึ้นตัวแปรสุ่มสามารถขึ้นอยู่กับได้อย่างไร แต่ไม่มีความแปรปรวนร่วมเป็นศูนย์? เกร็กโปสเตอร์ที่นี่ให้ตัวอย่างโดยใช้วงกลมที่นี่ ใครสามารถอธิบายกระบวนการนี้อย่างละเอียดมากขึ้นโดยใช้ลำดับขั้นตอนที่แสดงขั้นตอนหลายขั้นตอนได้หรือไม่? นอกจากนี้หากคุณทราบตัวอย่างจากจิตวิทยาโปรดอธิบายด้วยแนวคิดนี้พร้อมตัวอย่างที่เกี่ยวข้อง โปรดแม่นยำและต่อเนื่องในคำอธิบายของคุณและระบุสิ่งที่อาจเกิดขึ้น

6
การตีความผลลัพธ์ ur.df (การทดสอบรูทยูนิต Dickey-Fuller)
ฉันใช้การทดสอบรูทยูนิตต่อไปนี้ (Dickey-Fuller) ในอนุกรมเวลาโดยใช้ur.df()ฟังก์ชั่นในurcaแพ็คเกจ คำสั่งคือ: summary(ur.df(d.Aus, type = "drift", 6)) ผลลัพธ์คือ: ############################################### # Augmented Dickey-Fuller Test Unit Root Test # ############################################### Test regression drift Call: lm(formula = z.diff ~ z.lag.1 + 1 + z.diff.lag) Residuals: Min 1Q Median 3Q Max -0.266372 -0.036882 -0.002716 0.036644 0.230738 Coefficients: Estimate Std. Error t value …

1
การคำนวณฟังก์ชั่นลิงก์แบบบัญญัติใน GLM
ฉันคิดว่าฟังก์ชั่น canonical linkมาจากพารามิเตอร์ธรรมชาติของตระกูล exponential พูดดูครอบครัว ดังนั้นคือฟังก์ชันลิงก์แบบบัญญัติ ใช้การกระจาย Bernoulliเป็นตัวอย่างเรามี ดังนั้นฟังก์ชันลิงก์แบบบัญญัติg(⋅)g(⋅)g(\cdot)f(y,θ,ψ)=exp{yθ−b(θ)a(ψ)−c(y,ψ)}f(y,θ,ψ)=exp⁡{yθ−b(θ)a(ψ)−c(y,ψ)} f(y,\theta,\psi)=\exp\left\{\frac{y\theta-b(\theta)}{a(\psi)}-c(y,\psi)\right\} θ=θ(μ)θ=θ(μ)\theta=\theta(\mu)P(Y=y)=μy(1−μ)1−y=exp{ylogμ1−μ+log(1−μ)}P(Y=y)=μy(1−μ)1−y=exp⁡{ylog⁡μ1−μ+log⁡(1−μ)} P(Y=y)=\mu^{y}(1-\mu)^{1-y}=\exp\left\{y\log\frac{\mu}{1-\mu}+\log{(1-\mu)}\right\} g(μ)=logμ1−μg(μ)=log⁡μ1−μg(\mu)=\log\frac{\mu}{1-\mu} แต่เมื่อฉันเห็นสไลด์นี้มันก็อ้างว่า g′(μ)=1V(μ)g′(μ)=1V(μ) g'(\mu)=\frac{1}{V(\mu)} แม้ว่ามันจะสามารถตรวจสอบได้ง่ายสำหรับการแจกแจงนี้โดยเฉพาะ (และการแจกแจงอื่น ๆ เช่นการแจกแจงปัวซอง) ฉันไม่เห็นความเท่าเทียมกันของกรณีทั่วไป ใครสามารถให้คำแนะนำได้บ้าง ขอบคุณ ~

1
ทางเลือกเพื่อบล็อก bootstrap สำหรับอนุกรมเวลาหลายตัวแปร
ขณะนี้ฉันใช้กระบวนการต่อไปนี้ในการทำการบูตอนุกรมเวลาหลายตัวแปรใน R: กำหนดขนาดบล็อก - เรียกใช้ฟังก์ชันb.starในnpแพ็คเกจที่สร้างขนาดบล็อกสำหรับแต่ละชุด เลือกขนาดบล็อกสูงสุด ทำงานtsbootกับซีรีส์ใดก็ได้โดยใช้ขนาดบล็อกที่เลือก ใช้ดัชนีจากเอาต์พุต bootstrap เพื่อสร้างอนุกรมเวลาหลายตัวแปรอีกครั้ง มีคนแนะนำให้ใช้แพคเกจ meboot เป็นทางเลือกแทน block bootstrap แต่เนื่องจากฉันไม่ได้ใช้ชุดข้อมูลทั้งหมดเพื่อเลือกขนาดบล็อกฉันไม่แน่ใจว่าจะรักษาความสัมพันธ์ระหว่างชุดข้อมูลอย่างไรถ้าฉันใช้ดัชนีที่สร้างขึ้นโดยใช้mebootบน หนึ่งชุด หากใครมีประสบการณ์กับ meboot ในการตั้งค่าหลายตัวแปรฉันจะขอบคุณคำแนะนำในกระบวนการอย่างมาก

1
วิธีกำหนดการแจกแจงแบบนั้นมีความสัมพันธ์กับการจับฉลากจากการแจกแจงแบบอื่นที่กำหนดไว้ล่วงหน้าได้อย่างไร?
ฉันจะกำหนดกระจายของตัวแปรสุ่มดังกล่าวที่วาดจากมีความสัมพันธ์กับที่เป็นวาดเดียวจากการกระจายกับฟังก์ชันการกระจายสะสม ? Y ρ x 1 x 1 F X ( x )YYYYYYρρ\rhox1x1x_1x1x1x_1FX( x )FX(x)F_{X}(x)

5
วิธีการวัด“ ความรอบรู้” ของผู้มีส่วนร่วม SE?
Stack Exchange อย่างที่เราทุกคนรู้กันดีว่าเป็นคอลเลกชันของเว็บไซต์ถาม - ตอบพร้อมหัวข้อที่หลากหลาย สมมติว่าแต่ละไซต์มีความเป็นอิสระจากกันเนื่องจากสถิติที่ผู้ใช้มีวิธีคำนวณ "ความรอบรู้" เมื่อเปรียบเทียบกับคนต่อไป เครื่องมือทางสถิติที่ฉันควรใช้คืออะไร ความจริงแล้วฉันไม่รู้วิธีกำหนดทางคณิตศาสตร์ "ความรอบรู้" แต่มันต้องมีคุณสมบัติดังต่อไปนี้: ทุกสิ่งเท่ากันยิ่งมีผู้ใช้มากขึ้นเท่าไหร่เขาก็ยิ่งมีความรอบรู้มากขึ้นเท่านั้น ทุกสิ่งเท่าเทียมกันยิ่งมีผู้ใช้เข้าร่วมมากเท่าไหร่ก็ยิ่งมีผู้เข้าร่วมมากเท่านั้น การตอบหรือคำถามไม่ได้ส่งผลกระทบต่อความกลม

2
ฉันจะค้นหาความน่าจะเป็นของข้อผิดพลาด type II ได้อย่างไร
ฉันรู้ว่าข้อผิดพลาด Type II เป็นที่ที่ H1 เป็นจริง แต่ H0 ไม่ถูกปฏิเสธ คำถาม ฉันจะคำนวณความน่าจะเป็นของข้อผิดพลาด Type II ที่เกี่ยวข้องกับการแจกแจงแบบปกติที่ค่าเบี่ยงเบนมาตรฐานเป็นที่รู้จักได้อย่างไร

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.