สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
R - Lasso Regression - แลมบ์ดาที่แตกต่างกันต่อการถดถอย
ฉันต้องการทำสิ่งต่อไปนี้: 1) การถดถอย OLS (ไม่มีเงื่อนไขการลงโทษ) เพื่อรับค่าสัมประสิทธิ์เบต้า ; หมายถึงตัวแปรที่ใช้ในการถดถอย ฉันทำสิ่งนี้ด้วยb∗jbj∗b_{j}^{*}jjj lm.model = lm(y~ 0 + x) betas = coefficients(lm.model) 2) การถดถอยของ Lasso ที่มีเงื่อนไขการลงโทษเกณฑ์การคัดเลือกจะต้องเป็นเกณฑ์ข้อมูล Bayesian (BIC) ที่กำหนดโดย λj=log(T)T|b∗j|λj=log⁡(T)T|bj∗|\lambda _{j} = \frac{\log (T)}{T|b_{j}^{*}|} โดยที่หมายถึงหมายเลขตัวแปร / regressor,สำหรับจำนวนการสังเกตและสำหรับ betas เริ่มต้นที่ได้รับในขั้นตอนที่ 1) ฉันต้องการให้ผลลัพธ์การถดถอยสำหรับค่าเฉพาะเจาะจงซึ่งแตกต่างกันสำหรับ regressor แต่ละตัวที่ใช้ ดังนั้นถ้ามีสามตัวแปรจะมีสามค่าที่แตกต่างกัน\jjjTTTb∗jbj∗b_{j}^{*}λjλj\lambda_jλjλj\lambda_j จากนั้นปัญหาการปรับให้เหมาะสมของ OLS-Lasso minbϵRn={∑t=1T(yt−b⊤Xt)2+T∑j=1m(λt|bj|)}minbϵRn={∑t=1T(yt−b⊤Xt)2+T∑j=1m(λt|bj|)}\underset{b\epsilon \mathbb{R}^{n} }{min} = \left \{ \sum_{t=1}^{T}(y_{t}-b^{\top} X_{t} …
11 r  regression  glmnet  lars 

1
การใช้ยาเกินขนาดและความไม่แน่นอนในการถดถอยแบบทวินาม / ปัวซอง
ฉันทำการถดถอยแบบปัวซงใน SAS และพบว่าค่าเพียร์สันไค - สแควร์หารด้วยองศาอิสระมีค่าประมาณ 5 แสดงว่ามีการกระจายตัวมากเกินไป ดังนั้นฉันพอดีกับโมเดลทวินามลบกับ proc genmod และพบว่าค่าเพียร์สันไค - สแควร์หารด้วยองศาอิสระเท่ากับ 0.80 ตอนนี้มีการพิจารณาว่ามีการด้อยค่าหรือไม่ ถ้าเป็นเช่นนั้นเราจะจัดการกับเรื่องนี้อย่างไร? ฉันได้อ่านมากมายเกี่ยวกับการกระจายเกินปกติและเชื่อว่าฉันรู้วิธีจัดการเรื่องนี้ แต่ข้อมูลเกี่ยวกับวิธีจัดการหรือตัดสินว่ามีการด้อยโอกาสน้อยหรือไม่ ใครช่วยได้บ้าง ขอบคุณ

2
ประมาณอัตราที่เครื่องชั่งเบี่ยงเบนมาตรฐานที่มีตัวแปรอิสระ
ฉันมีการทดลองในที่ที่ฉันกำลังการวัดของการกระจายตามปกติตัวแปรYYY , Y∼ N( μ , σ)Y∼N(μ,σ)Y \sim N(\mu,\sigma) อย่างไรก็ตามการทดลองก่อนหน้านี้ได้มีหลักฐานบางอย่างที่เบี่ยงเบนมาตรฐานσσ\sigmaเป็นฟังก์ชั่นเลียนแบบของตัวแปรอิสระคือXXX σ= a | X| +bσ=a|X|+b\sigma = a|X| + b Y∼ N( μ , a | X| +b)Y∼N(μ,a|X|+b)Y \sim N(\mu,a|X| + b) ฉันต้องการที่จะประเมินค่าพารามิเตอร์และBโดยการสุ่มตัวอย่างYที่หลายค่าของX นอกจากนี้เนื่องจากข้อ จำกัด ในการทดสอบฉันสามารถใช้ตัวอย่างYจำนวน จำกัด (ประมาณ 30-40) เท่านั้นและต้องการสุ่มตัวอย่างที่ค่าXหลาย ๆ ค่าด้วยเหตุผลการทดลองที่ไม่เกี่ยวข้อง ได้รับข้อ จำกัด เหล่านี้สิ่งที่วิธีการที่มีอยู่ในการประมาณการและข ?aaaขbbYYYXXXYYYXXXaaaขbb คำอธิบายการทดลอง นี่เป็นข้อมูลเพิ่มเติมถ้าคุณสนใจว่าทำไมฉันถึงถามคำถามข้างต้น การทดลองของฉันวัดการรับรู้ทางสายตาและภาพ ฉันมีตั้งค่าการทดสอบที่ฉันสามารถนำเสนอทั้งการได้ยินหรือการมองเห็นเป้าหมายจากสถานที่ที่แตกต่างกัน, , …

1
Binomial glmm พร้อมตัวแปรเด็ดขาดพร้อมความสำเร็จเต็มรูปแบบ
ฉันกำลังเรียกใช้ glmm พร้อมกับตัวแปรตอบสนองทวินามและตัวทำนายหมวดหมู่ ผลแบบสุ่มจะได้รับจากการออกแบบที่ซ้อนกันที่ใช้สำหรับการรวบรวมข้อมูล ข้อมูลมีลักษณะดังนี้: m.gen1$treatment [1] sucrose control protein control no_injection ..... Levels: no_injection control sucrose protein m.gen1$emergence [1] 1 0 0 1 0 1 1 1 1 1 1 0 0.... > m.gen1$nest [1] 1 1 1 2 2 3 3 3 3 4 4 4 ..... Levels: …

2
สมมติฐานว่างของ MANOVA คืออะไร
พื้นหลัง เพื่อวิเคราะห์ความแตกต่างในตัวแปรต่อเนื่องระหว่างกลุ่มต่าง ๆ (ที่กำหนดโดยตัวแปรเด็ดขาด) เราสามารถทำการวิเคราะห์ความแปรปรวนแบบทางเดียวได้ หากมีตัวแปรอธิบาย (หมวดหมู่) หลายตัวแปรหนึ่งสามารถดำเนินการ ANOVA แบบแฟคทอเรียล หากต้องการวิเคราะห์ความแตกต่างระหว่างกลุ่มในตัวแปรต่อเนื่องหลายตัว (เช่นตัวแปรตอบสนองหลายตัว) กลุ่มหนึ่งจะต้องทำการวิเคราะห์ความแปรปรวนหลายตัวแปร (MANOVA) คำถาม ฉันแทบจะไม่เข้าใจว่าคน ๆ หนึ่งสามารถทำการทดสอบแบบ ANOVA ได้อย่างไรในตัวแปรตอบสนองหลายอย่างและที่สำคัญกว่านั้นฉันไม่เข้าใจว่าสมมติฐานว่างอาจเป็นเช่นไร เป็นสมมติฐานว่าง: "สำหรับตัวแปรตอบกลับแต่ละค่าหมายความว่าทุกกลุ่มมีค่าเท่ากัน", หรือมันคือ "สำหรับตัวแปรตอบกลับอย่างน้อยหนึ่งค่าหมายความว่าทุกกลุ่มมีค่าเท่ากัน", หรือเป็นอย่างอื่น?H0H0H_0

3
ความน่าจะเป็นของข้อผิดพลาด Type I และ II มีความสัมพันธ์เชิงลบหรือไม่?
ในสถิติประถมศึกษาชั้นเรียนที่ผมเป็น TA สำหรับศาสตราจารย์ระบุว่าเป็นความน่าจะเป็นของความผิดพลาดประเภทที่ฉันเพิ่มขึ้นน่าจะเป็นของชนิดที่สองข้อผิดพลาดลดลงและการสนทนาเป็นความจริงเช่นกัน ดังนั้นนี้แสดงให้เห็นว่าฉันว่า&lt;0β ρ อัลฟ่า, β &lt; 0αα\alphaββ\betaρα , β&lt; 0ρα,β&lt;0\rho_{\alpha, \beta} < 0 แต่เราจะพิสูจน์สิ่งนี้สำหรับการทดสอบสมมติฐานทั่วไปได้อย่างไร คำพูดนั้นเป็นจริงโดยทั่วไปหรือไม่? ฉันสามารถลองใช้กรณีเฉพาะ (พูดและ ) แต่เห็นได้ชัดว่ามันไม่ธรรมดาพอที่จะตอบคำถามนี้H 1 : μ &lt; μ 0H0: μ = μ0H0:μ=μ0H_0: \mu = \mu_0H1: μ &lt; μ0H1:μ&lt;μ0H_1: \mu < \mu_0

1
เมื่อใดที่ต้องใช้สิ่งเจือปน Gini และเมื่อใดที่จะใช้ข้อมูลได้รับ?
บางคนช่วยอธิบายให้ฉันทราบได้เมื่อใดที่จะใช้สิ่งเจือปนและข้อมูลที่ได้จากการตัดสินใจของ Gini? คุณสามารถให้สถานการณ์ / ตัวอย่างแก่ฉันเมื่อใดดีที่สุดที่จะใช้

1
การทดสอบสมมติฐานและวิธีการทางวิทยาศาสตร์
อ่านคำตอบกระทู้นี้ผมเริ่มสงสัยเกี่ยวกับวิธีการทดสอบสมมติฐานที่เกี่ยวข้องกับวิธีการทางวิทยาศาสตร์ ในขณะที่ฉันมีความเข้าใจที่ดีของทั้งสองฉันมีเวลายากที่จะวาดการเชื่อมต่อที่แม่นยำระหว่างพวกเขา ในระดับสูงวิธีการทางวิทยาศาสตร์ลงมาที่: ทำให้การคาดเดา &amp; สมมติฐาน (ทฤษฎี) ทำนายจากทฤษฎีนี้ ทำการทดลองและการสังเกต ทดสอบและยอมรับทฤษฎีใหม่ว่า ข้อมูลสอดคล้องกับการคาดการณ์ (มากกว่า) แม่นยำกว่าทฤษฎีทางเลือก ทฤษฎีใหม่นั้นไม่ซับซ้อนกว่าทางเลือกอื่นที่น่าเชื่อถือ ในระดับสูงฉันคิดว่าวิธีการทางวิทยาศาสตร์นั้นเป็นไปตามแนวทาง"accept-if -fit -well"ซึ่งแตกต่างจากวิธีการ"ปฏิเสธถ้ามันไม่พอดี"จากการทดสอบสมมติฐานทางสถิติ ถูกต้องหรือไม่ และถ้าเป็นเช่นนั้นทำไมในกรณีนี้ พวกเขาไม่ได้ไล่ตามเป้าหมายเดียวกันทั้งสอง อนุมานทฤษฎีหรือแบบจำลองที่อธิบายการสังเกตได้ดีที่สุด

2
อะไรคือเคล็ดลับในการเพิ่ม 1 ที่นี่
ฉันกำลังดูหน้านี้เกี่ยวกับการใช้งาน Monte Carlo ของการทดสอบ Lillefors ฉันไม่เข้าใจประโยคนี้: มีข้อผิดพลาดแบบสุ่มในการคำนวณนี้จากการจำลอง อย่างไรก็ตามเนื่องจากเคล็ดลับในการเพิ่ม 1 ให้กับตัวเศษและส่วนในการคำนวณค่า P จึงสามารถใช้งานได้โดยตรงโดยไม่คำนึงถึงการสุ่ม พวกเขาหมายถึงอะไรโดยการเพิ่ม 1 ถึงตัวเศษและส่วน? รหัสที่เกี่ยวข้องอยู่ที่นี่: n &lt;- length(x) nsim &lt;- 4999 d.star &lt;- double(nsim) for (i in 1:nsim) { x.star &lt;- rnorm(n) d.star[i] &lt;- fred(x.star) } hist(d.star) abline(v = d.hat, lty = 2) ## simulation-derived P-value pval &lt;- (sum(d.star …

3
มีค่าใดในการลดมิติข้อมูลของชุดข้อมูลที่ตัวแปรทั้งหมดมีค่าประมาณมุมฉากหรือไม่?
สมมติว่าฉันมีชุดข้อมูล -dimensional ซึ่งมีมิติอยู่มุมฉาก (มีความสัมพันธ์เป็นศูนย์)Nยังไม่มีข้อความNNยังไม่มีข้อความNN มีประโยชน์ใด ๆ ในแง่ของ: การแสดง การแสดง (เพื่อประสิทธิภาพลักษณนาม) หรือเกณฑ์อื่น ๆ ทำการลดขนาดข้อมูลได้อย่างไร?

1
วิธีการรับตัวอย่างกิ๊บส์?
ที่จริงฉันลังเลที่จะถามเรื่องนี้เพราะฉันกลัวว่าฉันจะถูกส่งต่อไปยังคำถามอื่นหรือวิกิพีเดียในการสุ่มตัวอย่างของกิ๊บส์ แต่ฉันไม่มีความรู้สึกว่าพวกเขาอธิบายสิ่งที่อยู่ในมือ รับความน่าจะเป็นแบบมีเงื่อนไข : p ( x | y ) y = y 0 y = y 1 x = x 0 1p ( x | y)p(x|y)p(x|y)p ( x | y)x = x0x = x1Y= y01434Y= y12646p(x|y)y=y0y=y1x=x01426x=x13446 \begin{array}{c|c|c} p(x|y) & y = y_0 & y = y_1 \\ \hline x …
11 sampling  mcmc  gibbs 

3
มีอคติรู้จักกับการสำรวจความคิดเห็นทางโทรศัพท์ในสหรัฐอเมริกาหรือไม่?
ฉันกำลังดูแบบสำรวจ WashingtonTimes / ABC และการแจกแจงผลลัพธ์โดยเฉพาะอย่างยิ่งตามอายุ ดังนั้นฉันจึงไปหาอคติ มันกล่าวว่า: "การสำรวจความคิดเห็นดำเนินการทางโทรศัพท์ 11-14 ธันวาคม 2014 ในกลุ่มตัวอย่างของผู้ใหญ่ 1,000 คนการสัมภาษณ์ดำเนินการเป็นภาษาอังกฤษและสเปนทางโทรศัพท์และโทรศัพท์มือถือ" แบบสำรวจไม่ได้ให้จำนวนผู้ตอบแบบสอบถามในแต่ละกลุ่มอายุและความคิดแรกของฉันคืออายุ 18-29 ปีแบบไหนที่จะรับโทรศัพท์ได้! ตกลงพวกเขารวมถึงมือถือที่ทำให้มันค่อนข้างยุติธรรม แต่ถึงกระนั้นอายุ 18-29 ปีในการตอบรับโทรศัพท์มือถือของพวกเขาจะถูกถามว่าพวกเขาต้องการทำแบบสำรวจหรือไม่และพูดว่า "ใช่แน่นอน" (ฉันไม่ได้หมายความว่าเป็นคำถามเกี่ยวกับวาทศิลป์; ลางสังหรณ์ของฉันคือบางกลุ่มมีโอกาสมากขึ้นเช่นคนที่มีความนับถือตนเองต่ำอาจสนุกกับกระบวนการที่ถูกคนแปลกหน้าถามความเห็นของพวกเขาทางโทรศัพท์) ดังนั้นมีการวิจัยในหัวข้อนี้หรือไม่? องค์กรที่สนใจในการจัดการความคิดเห็นของประชาชนจะเลือกแบบสำรวจความคิดเห็นทางโทรศัพท์มากกว่าการสำรวจความคิดเห็นออนไลน์หรือการสัมภาษณ์ในถนนหรือไม่
11 polling  politics 

2
เศรษฐมิติของวิธีการแบบเบย์ต่อวิธีการศึกษาเหตุการณ์
การศึกษาเหตุการณ์นั้นเกิดขึ้นอย่างกว้างขวางในด้านเศรษฐศาสตร์และการเงินเพื่อกำหนดผลกระทบของเหตุการณ์ที่เกิดขึ้นกับราคาหุ้น การถดถอย OLS - ในช่วงเวลาการอ้างอิงซึ่งแตกต่างจากหน้าต่างเหตุการณ์ - มักจะใช้เพื่อกำหนดพารามิเตอร์ที่จำเป็นในการสร้างแบบจำลองผลตอบแทนปกติสำหรับสินทรัพย์ หนึ่งแล้วกำหนดนัยสำคัญทางสถิติของผลตอบแทนที่ผิดปกติสะสม ( ) ของสินทรัพย์ต่อไปนี้เหตุการณ์ในช่วงเหตุการณ์ที่ระบุหน้าต่างจากเพื่อT_2การทดสอบสมมติฐานใช้เพื่อกำหนดว่าผลตอบแทนเหล่านี้มีนัยสำคัญหรือไม่ดังนั้นจึงผิดปกติหรือไม่ ดังนั้น:i T 1 T 2CARCAR\text{CAR}iiiT1T1T_1T2T2T_2 H0:CARi=0H0:CARi=0H_0 : \text{CAR}_i = 0 , ที่ไหน CARi=∑T2t=T1ARi,t=∑T2t=T1(ri,t−E[ri,t])CARi=∑t=T1T2ARi,t=∑t=T1T2(ri,t−E[ri,t])\text{CAR}_i = \sum_{t=T_1}^{T_2} \text{AR}_{i,t} = \sum_{t=T_1}^{T_2} \left( r_{i,t} -\mathbb{E}[r_{i,t}] \right)และ E[ri,t]E[ri,t]\mathbb{E}[r_{i,t}]คือผลตอบแทนของสินทรัพย์ที่คาดการณ์โดยแบบจำลอง หากจำนวนการสังเกตของเรามีขนาดใหญ่พอเราสามารถสันนิษฐานว่าเป็นเรื่องปกติเชิงเส้นกำกับของการกระจายผลตอบแทนของสินทรัพย์ แต่สิ่งนี้อาจไม่ได้รับการตรวจสอบสำหรับขนาดตัวอย่างที่เล็กลง มันอาจจะเป็นที่ถกเถียงกันอยู่ว่าเพราะเหตุนี้ บริษัท เดียว - เหตุการณ์การศึกษาเดียว (ตามที่ต้องการเช่นในคดี) ควรทำตามวิธีการแบบเบส์เพราะข้อสันนิษฐานของการทำซ้ำหลายครั้งอย่างไม่มีที่สิ้นสุด "มากขึ้นจากการตรวจสอบ" มากกว่าในกรณี ของหลาย บริษัท แต่วิธีการของผู้ใช้บ่อยยังคงเป็นเรื่องธรรมดา เมื่อพิจารณาจากวรรณกรรมที่ขาดแคลนในเรื่องนี้คำถามของฉันคือทำอย่างไรจึงจะเข้าใกล้การศึกษาเหตุการณ์ได้ดีที่สุดซึ่งคล้ายกับวิธีการที่อธิบายไว้ข้างต้นและสรุปในMacKinlay, 1997โดยใช้วิธี …

2
หากฮิสโตแกรมของฉันแสดงเส้นโค้งรูประฆังฉันสามารถพูดได้ว่าข้อมูลของฉันได้รับการกระจายตามปกติ?
ฉันสร้างฮิสโตแกรมสำหรับอายุผู้ตอบและจัดการเพื่อให้ได้เส้นโค้งรูประฆังที่ดีมากจากการที่ฉันสรุปว่าการแจกแจงเป็นเรื่องปกติ จากนั้นฉันรันการทดสอบเชิงปกติใน SPSS โดยมีn = 169 การทดสอบp -value (Sig.) ของการทดสอบ Kolmogorov-Smirnov น้อยกว่า 0.05 และดังนั้นข้อมูลจึงละเมิดสมมติฐานของภาวะปกติ ทำไมการทดสอบแสดงว่าการกระจายอายุไม่ปกติ แต่ฮิสโตแกรมแสดงเส้นโค้งรูประฆังซึ่งจากความเข้าใจของฉันเป็นเรื่องปกติ ฉันควรทำตามผลลัพธ์ใด

1
กราฟ ACF ของฉันบอกอะไรฉันเกี่ยวกับข้อมูลของฉัน
ฉันมีสองชุดข้อมูล: ชุดข้อมูลแรกของฉันคือมูลค่าของการลงทุน (เป็นพันล้านดอลลาร์) เทียบกับเวลาแต่ละหน่วยเวลาเป็นหนึ่งในสี่ตั้งแต่ไตรมาส 1 ของปี 1947 เวลาขยายไปถึงไตรมาสที่ 3 ของปี 2545 ชุดข้อมูลที่สองของฉันคือ "ผลลัพธ์ของการเปลี่ยนค่าของการลงทุนใน [ชุดข้อมูลแรก] เป็นกระบวนการคงที่โดยประมาณ" ชุดแรกของข้อมูลและชุดที่สองของข้อมูล แปลง ACF ที่เกี่ยวข้อง: ฉันรู้ว่าแผนการนั้นถูกต้องและฉันถูกขอให้ "แสดงความคิดเห็นกับพวกเขา" ผมค่อนข้างใหม่ในฟังก์ชั่นอัตและฉันไม่ได้อย่างสิ้นเชิงแน่ใจว่าสิ่งที่มันบอกฉันเกี่ยวกับข้อมูลของฉัน หากใครสามารถใช้เวลาอธิบายสั้น ๆ มันจะได้รับการชื่นชมอย่างมาก

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.