สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
“ กลับกัน” ชาปิโร่ - วิลค์
การทดสอบ Sharipo-Wilk อ้างอิงจากวิกิพีเดียทดสอบสมมติฐานว่าง ( ) "ประชากรจะกระจายตามปกติ"H0H0H_0 ฉันกำลังมองหาการทดสอบคล้ายกันกับ "ประชากรไม่ได้กระจายตามปกติ"H0H0H_0 หลังจากมีการทดสอบฉันต้องการคำนวณเพื่อปฏิเสธที่ระดับนัยสำคัญ iff ; พิสูจน์ให้เห็นว่าประชากรของฉันกระจายตามปกติH 0 α p &lt; αpppH0H0H_0αα\alphap&lt;αp&lt;αp < \alpha โปรดทราบว่าการใช้การทดสอบ Sharipo-Wilk และการยอมรับ iffเป็นวิธีที่ไม่ถูกต้องเนื่องจากมันหมายถึง "เรามีหลักฐานไม่เพียงพอที่จะพิสูจน์ว่า H0 ไม่ได้ถือ" p &gt; αH0H0H_0p&gt;αp&gt;αp > \alpha หัวข้อที่เกี่ยวข้อง - ความหมายของ -valueppp , เป็นปกติทดสอบไร้ประโยชน์? แต่ฉันไม่เห็นวิธีแก้ไขปัญหาของฉัน คำถาม:ฉันควรใช้แบบทดสอบใด? มันนำมาใช้ใน R หรือไม่?

3
จะวิเคราะห์ปัจจัยอย่างไรเมื่อเมทริกซ์ความแปรปรวนร่วมไม่แน่นอนแน่นอน
ฉันมีชุดข้อมูลที่ประกอบด้วยการสังเกต 717 ครั้ง (แถว) ซึ่งอธิบายด้วย 33 ตัวแปร (คอลัมน์) ข้อมูลได้มาตรฐานโดย z- คะแนนตัวแปรทั้งหมด ไม่มีตัวแปรสองตัวที่ขึ้นต่อกันแบบเชิงเส้น ( ) ฉันได้ลบตัวแปรทั้งหมดที่มีความแปรปรวนต่ำมาก (น้อยกว่า0.1 ) รูปด้านล่างแสดงเมทริกซ์สหสัมพันธ์ที่สอดคล้องกัน (เป็นค่าสัมบูรณ์)r=1r=1r=10.10.10.1 เมื่อฉันพยายามเรียกใช้การวิเคราะห์ปัจจัยที่ใช้factoranใน Matlab ดังนี้ [Loadings1,specVar1,T,stats] = factoran(Z2,1); ฉันได้รับข้อผิดพลาดต่อไปนี้: The data X must have a covariance matrix that is positive definite. คุณช่วยบอกฉันทีว่าปัญหาอยู่ที่ไหน มันเป็นเพราะการพึ่งพาซึ่งกันและกันต่ำในหมู่ตัวแปรที่ใช้? นอกจากนี้ฉันจะทำอะไรได้บ้าง เมทริกซ์ความสัมพันธ์ของฉัน:

1
การออกแบบตัวแบบผสมเอฟเฟกต์พร้อมตัวแปรสุ่มตัวอย่าง
ฉันพยายามระบุสูตรสำหรับโมเดลเอฟเฟกต์แบบผสมเชิงเส้น (พร้อมlme4) สำหรับการออกแบบการทดลองของฉัน แต่ฉันไม่แน่ใจว่าฉันทำถูกต้องหรือไม่ การออกแบบ: โดยทั่วไปฉันวัดพารามิเตอร์การตอบสนองในพืช ฉันมีการรักษา 4 ระดับและระดับการชลประทาน 2 ระดับ พืชถูกจัดกลุ่มใน 16 แปลงภายในแต่ละแปลงฉันสุ่ม 4 แปลงย่อย ในแต่ละพล็อตย่อยฉันใช้เวลาสังเกตระหว่าง 15 ถึง 30 (ขึ้นอยู่กับจำนวนพืชที่พบ) นั่นคือมีทั้งหมด 1,500 แถว ตอนแรกระดับย่อยเป็นเพียงที่นี่เพื่อจุดประสงค์ในการสุ่มตัวอย่าง แต่ฉันคิดว่าฉันต้องการนำมาพิจารณาในรูปแบบ (เป็นตัวแปรระดับ 64) เพราะฉันเห็นว่ามีความแปรปรวนจำนวนมากจากพล็อตย่อยหนึ่งไปอีก แม้ในพล็อตเดียวกัน (มากกว่าความแปรปรวนระหว่างแปลงทั้งหมด) ความคิดแรกของฉันคือการเขียน: library(lme4) fit &lt;- lmer(y ~ treatment*irrigation + (1|subplot/plot), data=mydata) หรือ fit &lt;- lmer(y ~ treatment*irrigation + (1|subplot) + …

2
ความเป็นมาของ Normal-Wishart หลัง
ฉันทำงานเกี่ยวกับการสืบทอดของ Normal-Wishart หลัง แต่ฉันติดอยู่ที่หนึ่งในพารามิเตอร์ (ด้านหลังของเมทริกซ์ระดับดูที่ด้านล่าง) สำหรับบริบทและความสมบูรณ์นี่คือแบบจำลองและส่วนที่เหลือของการพิสูจน์: xiμΛ∼N(μ,Λ)∼N(μ0,(κ0Λ)−1)∼W(υ0,W0)xi∼N(μ,Λ)μ∼N(μ0,(κ0Λ)−1)Λ∼W(υ0,W0)\begin{align} x_i &\sim \mathcal{N}(\boldsymbol{\mu}, \boldsymbol{\Lambda})\\ \boldsymbol{\mu} &\sim \mathcal{N}(\boldsymbol{\mu_0}, (\kappa_0 \boldsymbol{\Lambda})^{-1})\\ \boldsymbol{\Lambda} &\sim \mathcal{W}(\upsilon_0, \mathbf{W}_0) \end{align} รูปแบบที่ขยายของแต่ละปัจจัยทั้งสามคือ (ขึ้นอยู่กับค่าคงที่สัดส่วน) คือ: โอกาส: N(xi|μ,Λ)∝|Λ|N/2exp(−12∑i=1N(xTiΛxi−2μTΛxi+μTΛμ))N(xi|μ,Λ)∝|Λ|N/2exp⁡(−12∑i=1N(xiTΛxi−2μTΛxi+μTΛμ))\begin{align} \mathcal{N}(\mathbf{x}_i &| \boldsymbol{\mu}, \boldsymbol{\Lambda}) \propto\notag\\ &|\boldsymbol{\Lambda}|^{N/2} \exp{\left(-\frac{1}{2}\sum_{i=1}^N \left( \mathbf{x}_i^T\boldsymbol{\Lambda}\mathbf{x}_i - 2 \boldsymbol{\mu}^T \boldsymbol{\Lambda}\mathbf{x}_i + \boldsymbol{\mu}^T\boldsymbol{\Lambda}\boldsymbol{\mu}\right) \right)} \end{align} ปกติก่อนหน้า: N(μ|(μ0,κ0Λ)−1)∝|Λ|1/2exp(−12(μTκ0Λμ−2μTκ0Λμ0+μT0κ0Λμ0))N(μ|(μ0,κ0Λ)−1)∝|Λ|1/2exp⁡(−12(μTκ0Λμ−2μTκ0Λμ0+μ0Tκ0Λμ0))\begin{align} \mathcal{N}(\boldsymbol{\mu} &| (\boldsymbol{\mu}_0, \kappa_0 \boldsymbol{\Lambda})^{-1}) …

1
วิธีการเลือกแบบที่ดีที่สุดโดยไม่มีข้อมูลที่เหมาะสมมากเกินไป? การสร้างแบบจำลองการกระจาย bimodal ด้วยฟังก์ชั่นปกติ N ฯลฯ
ฉันมีการกระจายของค่านิยมแบบ bimodal อย่างชัดเจนซึ่งฉันพยายามที่จะปรับให้เหมาะสม ข้อมูลสามารถเข้ากันได้ดีกับทั้ง 2 ฟังก์ชั่นปกติ (bimodal) หรือฟังก์ชั่นปกติ 3 อย่าง นอกจากนี้ยังมีเหตุผลทางกายภาพที่เป็นไปได้สำหรับการปรับข้อมูลด้วย 3 ยิ่งมีการแนะนำพารามิเตอร์มากเท่าใดความพอดีที่สมบูรณ์แบบก็จะยิ่งมากขึ้นเช่นเดียวกับค่าคงที่ที่เพียงพอหนึ่งสามารถ " พอดีช้าง " นี่คือการกระจายตัวพอดีกับผลรวมของ 3 เส้นโค้ง (Gaussian): เหล่านี้คือข้อมูลสำหรับการฟิต ฉันไม่แน่ใจว่าควรใช้แบบทดสอบแบบใดเพื่อตรวจสอบความเหมาะสม ข้อมูลประกอบด้วย 91 คะแนน 1 ฟังก์ชั่นปกติ: RSS: 1.06231 X ^ 2: 3.1674 F.Test: 0.3092 2 ฟังก์ชั่นปกติ: RSS: 0.010939 X ^ 2: 0.053896 F.Test: 0.97101 3 ฟังก์ชั่นปกติ: RSS: 0.00536 X …

1
เกณฑ์การคำนวณสำหรับตัวแยกประเภทความเสี่ยงขั้นต่ำ
สมมติว่าสองชั้นและมีแอตทริบิวต์และมีการกระจายและ0.5) หากเรามีค่าเท่ากับก่อนหน้าสำหรับเมทริกซ์ต้นทุนต่อไปนี้:C 2 x N ( 0 , 0.5 ) N ( 1 , 0.5 ) P ( C 1 ) = P ( C 2 ) = 0.5ค1C1C_1ค2C2C_2xxxยังไม่มีข้อความ( 0 , 0 . 5 )N(0,0.5) \cal{N} (0, 0.5)ยังไม่มีข้อความ( 1 , 0 . 5 )N(1,0.5) \cal{N} (1, 0.5)P( C1) = P( …

2
ม้วนตาย 6 ด้านจนรวมM หมายถึงจำนวนที่เกินหรือไม่
นี่คือคำถาม: คุณหมุนลูกเต๋า 6 ด้านอย่างยุติธรรมซ้ำ ๆ จนกว่าผลรวมของลูกเต๋าจะมีค่ามากกว่าหรือเท่ากับ M ค่าเฉลี่ยและค่าเบี่ยงเบนมาตรฐานของผลรวมลบด้วย M คืออะไรเมื่อ M = 300 ฉันควรเขียนรหัสเพื่อตอบคำถามประเภทนี้หรือไม่? กรุณาให้คำแนะนำกับฉัน ขอบคุณ!

1
ทดสอบโมเดล GLM โดยใช้ค่าศูนย์และค่าเบี่ยงเบนของโมเดล
ฉันสร้างแบบจำลอง glm ใน R และได้ทำการทดสอบโดยใช้กลุ่มการทดสอบและการฝึกอบรมเพื่อให้มั่นใจว่ามันทำงานได้ดี ผลลัพธ์จาก R คือ: Coefficients: Estimate Std. Error t value Pr(&gt;|t|) (Intercept) -2.781e+00 1.677e-02 -165.789 &lt; 2e-16 *** Coeff_A 1.663e-05 5.438e-06 3.059 0.00222 ** log(Coeff_B) 8.925e-01 1.023e-02 87.245 &lt; 2e-16 *** log(Coeff_C) -3.978e-01 7.695e-03 -51.689 &lt; 2e-16 *** --- Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 …

1
ฉันจะตีความเอาต์พุตลาวาได้อย่างไร
ฉันกำลังพยายามวิเคราะห์องค์ประกอบเชิงยืนยัน (CFA) lavaanโดยใช้ lavaanฉันมีช่วงเวลาที่ยากตีความการส่งออกที่ผลิตโดย ฉันมีรูปแบบง่าย ๆ - 4 ปัจจัยแต่ละรายการได้รับการสนับสนุนจากข้อมูลการสำรวจที่เก็บรวบรวม ปัจจัยที่สอดคล้องกับสิ่งที่วัดได้โดยรายการเท่าที่ดูเหมือนว่าพวกเขาสามารถทำหน้าที่เป็นวัดที่ถูกต้อง โปรดช่วยฉันเข้าใจผลลัพธ์ต่อไปนี้ผลิตโดยlavaan's cfa(): Number of observations 1730 Estimator ML Minimum Function Test Statistic 196.634 Degrees of freedom 21 P-value (Chi-square) 0.000 Model test baseline model: Minimum Function Test Statistic 3957.231 Degrees of freedom 36 P-value 0.000 User model versus baseline model: …

1
ฟังก์ชันลิงก์แบบบัญญัติสำหรับ Tweedie GLM คืออะไร
ฉันเพิ่งได้รับการแนะนำให้รู้จักกับการแจกแจงแบบทวีด (ดูนี่หรือสิ่งนี้ ) แต่ฉันมีปัญหาในการค้นหาว่าฟังก์ชันการเชื่อมโยงสำหรับตัวแบบเชิงเส้นทั่วไปของ Tweedie เป็นอย่างไร คิด?

2
พล็อต QQ ใน Python
ฉันสร้างพล็อต qq โดยใช้รหัสต่อไปนี้ ฉันรู้ว่าพล็อต qq ใช้เพื่อตรวจสอบว่ามีการเผยแพร่ข้อมูลตามปกติหรือไม่ คำถามของฉันคือสิ่งที่ป้ายแกน x และ y ระบุในพล็อต qq และค่า r กำลังสองที่ระบุคืออะไร? N = 1200 p = 0.53 q = 1000 obs = np.random.binomial(N, p, size = q)/N import scipy.stats as stats z = (obs-np.mean(obs))/np.std(obs) stats.probplot(z, dist="norm", plot=plt) plt.title("Normal Q-Q plot") plt.show() ฉันรู้แล้วว่ามีการอภิปรายเกี่ยวกับเรื่องqqแต่ฉันไม่เข้าใจแนวคิดของการสนทนา

1
ซึ่งมาบรรจบกันเร็วกว่าค่าเฉลี่ยหรือค่ามัธยฐาน?
ถ้าฉันวาดตัวแปร iid จาก N (0,1) ค่าเฉลี่ยหรือค่ามัธยฐานจะมาบรรจบกันเร็วขึ้นหรือไม่ เร็วเท่าไหร่ หากต้องการเจาะจงมากขึ้นปล่อยให้เป็นลำดับของตัวแปร iid ที่ดึงมาจาก N (0,1) กำหนดและเป็นค่ามัธยฐานของ . ซึ่งมารวมกันเป็น 0 เร็วกว่าหรือ ?x1,x2,…x1,x2,…x_1, x_2, \ldots x¯n=1n∑ni=1xix¯n=1n∑i=1nxi\bar{x}_n = \frac{1}{n}\sum_{i=1}^n x_ix~nx~n\tilde{x}_n{x1,x2,…xn}{x1,x2,…xn}\{x_1, x_2, \ldots x_n\}{x¯n}{x¯n}\{\bar{x}_n\}{x~n}{x~n}\{\tilde{x}_n\} สำหรับการเห็นพ้องกันว่าการรวมกันเร็วขึ้นหมายถึงอะไร:อยู่หรือไม่ ถ้าเป็นเช่นนั้นมันคืออะไร?limn→∞Var(X¯n)/Var(X~n)limn→∞Var(X¯n)/Var(X~n)\lim_{n \to \infty} Var(\bar{X}_n)/Var(\tilde{X}_n)

1
การแสดงข้อมูลลำดับ - หมายถึงค่ามัธยฐานและค่าเฉลี่ยอันดับ
ฉันมีข้อมูลลำดับที่ไม่ได้กระจายตามปกติดังนั้นฉันตัดสินใจทำการทดสอบแบบไม่อิงพารามิเตอร์โดยใช้ Mann-Whitney U Test ฉันกำลังดูความแตกต่างระหว่างกลุ่มสำหรับเจ็ดคะแนน - คะแนนเหล่านี้เป็น 0, 1, 2 หรือ 3 สำหรับแต่ละวิชา ฉันมีช่วงเวลาที่ยากลำบากในการหาวิธีแสดงข้อมูลของฉัน! ถ้าฉันนำเสนอข้อมูลโดยใช้ค่ามัธยฐาน (และค่า IQR ของค่ามัธยฐาน) ก็ไม่ชัดเจนเลยว่าความแตกต่างนั้นเป็นเพราะส่วนใหญ่ค่าเฉลี่ยของสื่อกลางอยู่ที่ 0 หรือ 1 ดังนั้นแม้จะทดสอบ Mann-Whitney U แสดงความแตกต่างอย่างมีนัยสำคัญ ตารางดูไม่น่าสนใจ ฉันยังสามารถนำเสนอข้อมูลโดยใช้วิธีการ มีเอกสารทางวิทยาศาสตร์บางฉบับที่บอกว่าคุณสามารถใช้วิธีการที่มีข้อมูลลำดับ แต่คุณไม่สามารถตั้งสมมติฐานประเภทเดียวกันเกี่ยวกับความแตกต่างระหว่างคะแนน (เช่นความแตกต่างระหว่าง 0 และ 1 ไม่เหมือนกับระหว่าง 1 และ 2) การใช้หมายถึงจะเป็นการโต้เถียงเล็กน้อยแม้ว่าตัวเลขในตารางจะบอกเล่าเรื่องราวได้ดีเมื่อฉันใช้ ตัวเลือกที่สามคือการใช้อันดับเฉลี่ยที่ SPSS มอบให้ฉันในผลลัพธ์ของ Mann-Whitney อันดับเฉลี่ยคือสิ่งที่มีการเปรียบเทียบระหว่างกลุ่มดังนั้นบางทีฉันควรใช้เหล่านั้น ปัญหาเดียวที่ฉันมีคือค่าเฉลี่ยไม่ได้หมายถึงอะไรจริง ๆ ที่เกี่ยวกับข้อมูลจริง (เช่นฉันไม่เห็นว่าวิชาอยู่ใกล้กับ 3 ในขณะที่การควบคุมอยู่ใกล้กับ …

2
สัมประสิทธิ์ประมาณขึ้นเมื่อใดโดยประมาณการถดถอยโลจิสติกและโลจิสติกส์
เมื่อการสร้างแบบจำลองสัดส่วนอย่างต่อเนื่อง (เช่นพืชพรรณตามสัดส่วนที่ quadrats สำรวจหรือสัดส่วนของเวลาในกิจกรรม) การถดถอยโลจิสติกถือว่าไม่เหมาะสม (เช่นWarton &amp; Hui (2011) Arcsine เป็น asinine: การวิเคราะห์สัดส่วนในระบบนิเวศ ) แต่การถดถอยของ OLS หลังจาก logit-transform สัดส่วนหรือบางทีการถดถอยเบต้ามีความเหมาะสมมากกว่า การประมาณค่าสัมประสิทธิ์ของการถดถอยแบบ logit-linear และ logistic regression แตกต่างกันอย่างไรเมื่อใช้ R's lmและglm? ใช้ชุดข้อมูลจำลองต่อไปนี้ซึ่งเราสามารถสันนิษฐานได้ว่าpเป็นข้อมูลดิบของเรา (เช่นสัดส่วนต่อเนื่องแทนที่จะแสดง ):nsuccessesntrialsnsuccessesntrials{n_{successes}\over n_{trials}} set.seed(1) x &lt;- rnorm(1000) a &lt;- runif(1) b &lt;- runif(1) logit.p &lt;- a + b*x + rnorm(1000, 0, 0.2) …
11 r  regression  logistic 

2
การทดสอบของ Bartlett เทียบกับการทดสอบของ Levene
ฉันกำลังพยายามที่จะแก้ไขการละเมิดข้อสมมติฐานของ ANOVA ฉันใช้ชาปิโร - วิลค์เพื่อทดสอบกฎเกณฑ์และได้ทดสอบกับทั้งการทดสอบของ Levene และการทดสอบความแปรปรวนของ Bartlett ตั้งแต่ฉันบันทึกการเปลี่ยนแปลงข้อมูลของฉันเพื่อพยายามแก้ไขความแปรปรวนที่ไม่เท่ากัน ฉันเรียกใช้การทดสอบของ Bartlett ใหม่ในบันทึกการแปลงข้อมูลและยังคงได้รับค่า p อย่างมีนัยสำคัญและจากความอยากรู้อยากเห็นก็ทำการทดสอบของ Levene และได้ค่า p-value ที่ไม่สำคัญ ฉันควรใช้การทดสอบแบบไหน

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.