สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
การแสดงภาพการแจกแจงแบบเบ้ซ้ายจำนวนมาก
ฉันมีชุดของการแจกแจงแบบเบ้ซ้าย / หนักที่ฉันต้องการแสดง 42 มีการกระจายทั่วทั้งสามปัจจัยคือ (ระบุว่าเป็นA, BและCด้านล่าง) Bนอกจากนี้การเปลี่ยนแปลงจะหดตัวทั่วปัจจัย ปัญหาที่ฉันมีคือการกระจายยากที่จะแยกความแตกต่างในระดับของผลลัพธ์ (อัตราส่วนหรือพับเปลี่ยน): ดูเหมือนว่าการบันทึกข้อมูลจะเน้นไปที่ความเบ้ด้านซ้ายและย้ายตัวอย่างไปที่ก้อยมากขึ้น (สร้างจุดที่ผิดพลาด) ใครบ้างมีคำแนะนำเกี่ยวกับเทคนิคอื่น ๆ สำหรับการแสดงข้อมูลเหล่านี้?

4
ทำไมจึงไม่เป็นไรที่จะทำการสหสัมพันธ์แบบเพียร์สันกับข้อมูลสัดส่วน
โมดูลออนไลน์ที่ฉันกำลังศึกษาระบุว่าไม่ควรใช้เพียร์สันสหสัมพันธ์กับข้อมูลสัดส่วน ทำไมจะไม่ล่ะ? หรือถ้าบางครั้งมันก็โอเคหรือเสมอโอเคทำไม?

2
เหมือนหรือต่างกัน ทางเบย์
พูดว่าฉันมีรูปแบบดังต่อไปนี้: Poisson(λ)∼{λ1λ2if t<τif t≥τPoisson(λ)∼{λ1if t<τλ2if t≥τ\text{Poisson}(\lambda) \sim \begin{cases} \lambda_1 & \text{if } t \lt \tau \\ \lambda_2 & \text{if } t \geq \tau \end{cases} และฉันสรุปผู้โปสเตอร์สำหรับและλ 2 ที่แสดงด้านล่างจากข้อมูลของฉัน มีวิธีการบอกแบบเบย์ (หรือเชิงปริมาณ) ถ้าλ 1และλ 2เป็นเหมือนกันหรือแตกต่างกัน ?λ1λ1\lambda_1λ2λ2\lambda_2λ1λ1\lambda_1λ2λ2\lambda_2 บางทีการวัดความน่าจะเป็นที่แตกต่างจากλ 2λ1λ1\lambda_1λ2λ2\lambda_2หรือไม่? หรืออาจจะใช้ divergences ของ KL? ตัวอย่างเช่นฉันจะวัดหรืออย่างน้อยp ( λ 2 > λ 1 ) ได้อย่างไรp(λ2≠λ1)p(λ2≠λ1)p(\lambda_2 \neq \lambda_1)p(λ2>λ1)p(λ2>λ1)p(\lambda_2 …

1
สัญกรณ์สำหรับการสร้างแบบจำลองหลายระดับ
สูตรหนึ่งต้องระบุสำหรับการฝึกอบรมรูปแบบหลายระดับ (ใช้lmerจากlme4 Rห้องสมุด) ทำให้ฉันได้รับเสมอ ฉันได้อ่านหนังสือและแบบฝึกหัดที่นับไม่ถ้วน แต่ไม่เข้าใจเลย นี่คือตัวอย่างจากบทช่วยสอนนี้ที่ฉันต้องการดูสูตรในสมการ เราพยายามจำลองความถี่เสียงเป็นหน้าที่ของเพศ (เพศหญิงมีระดับเสียงสูงกว่าเพศชายโดยทั่วไป) และทัศนคติของบุคคล (ไม่ว่าเขา / เธอจะตอบด้วยวิธีสุภาพหรือไม่เป็นทางการ) ในสถานการณ์ต่าง ๆ นอกจากนี้อย่างที่คุณเห็นจากsubjectคอลัมน์แต่ละคนจะถูกวัดหลายครั้ง > head(politeness, n=20) subject gender scenario attitude frequency 1 F1 F 1 pol 213.3 2 F1 F 1 inf 204.5 3 F1 F 2 pol 285.1 4 F1 F 2 inf 259.7 5 F1 …

2
LASSO เหนือกว่าการเลือกไปข้างหน้า / การกำจัดไปข้างหลังในแง่ของข้อผิดพลาดการตรวจสอบความถูกต้องของการตรวจสอบข้ามของรุ่น
ฉันได้รับแบบจำลองที่ลดลงสามแบบจากแบบเต็มรูปแบบดั้งเดิมโดยใช้ การเลือกไปข้างหน้า กำจัดไปข้างหลัง เทคนิคการลงโทษ L1 (LASSO) สำหรับรุ่นที่ได้รับใช้ไปข้างหน้าเลือกกำจัด / ข้างหลังผมได้รับการตรวจสอบประมาณการข้ามความผิดพลาดของการทำนายโดยใช้CVlmในแพคเกจในการใช้ได้DAAG Rสำหรับรูปแบบที่เลือกผ่าน Lasso cv.glmผมใช้ ข้อผิดพลาดในการทำนายสำหรับ LASSO นั้นน้อยกว่าข้อผิดพลาดที่ได้รับจากคนอื่น ดังนั้นโมเดลที่ได้จาก LASSO จึงน่าจะดีกว่าในแง่ของความสามารถในการทำนายและความแปรปรวน นี่เป็นปรากฏการณ์ทั่วไปที่เกิดขึ้นเสมอหรือเป็นปัญหาที่เฉพาะเจาะจงหรือไม่? อะไรคือเหตุผลเชิงทฤษฎีสำหรับสิ่งนี้หากนี่เป็นปรากฏการณ์ทั่วไป

1
จะตีความการทดสอบ Cochran-Mantel-Haenszel ได้อย่างไร
ฉันกำลังทดสอบความเป็นอิสระของตัวแปรสองตัวคือ A และ B แบ่งเป็นชั้น ๆ โดย C. A และ B เป็นตัวแปรไบนารีและ C คือหมวดหมู่ (5 ค่า) ทำการทดสอบที่แม่นยำของฟิชเชอร์สำหรับ A และ B (ชั้นทั้งหมดรวมกัน) ฉันได้รับ: ## (B) ## (A) FALSE TRUE ## FALSE 1841 85 ## TRUE 915 74 OR: 1.75 (1.25 -- 2.44), p = 0.0007 * โดยที่ OR เป็นอัตราต่อรอง (ประมาณและช่วงความมั่นใจ 95%) …

4
การพยากรณ์อนุกรมเวลา R ด้วยเครือข่ายประสาทเทียม auto.arima และ ets
ฉันได้ยินมาบ้างเกี่ยวกับการใช้โครงข่ายประสาทเทียมในการทำนายอนุกรมเวลา ฉันจะเปรียบเทียบวิธีการพยากรณ์อนุกรมเวลาของฉัน (ข้อมูลการค้าปลีกรายวัน) ได้ดีกว่า: auto.arima (x), ets (x) หรือ nnetar (x) ฉันสามารถเปรียบเทียบ auto.arima กับ ets โดย AIC หรือ BIC แต่ฉันจะเปรียบเทียบกับเครือข่ายประสาทได้อย่างไร ตัวอย่างเช่น: > dput(x) c(1774, 1706, 1288, 1276, 2350, 1821, 1712, 1654, 1680, 1451, 1275, 2140, 1747, 1749, 1770, 1797, 1485, 1299, 2330, 1822, 1627, 1847, 1797, 1452, 1328, 2363, 1998, …

1
การประเมินประสิทธิภาพของตัวแบบการถดถอยโดยใช้ชุดฝึกอบรมและชุดทดสอบ?
ฉันมักจะได้ยินเกี่ยวกับการประเมินประสิทธิภาพของรูปแบบการจำแนกประเภทโดยถือชุดทดสอบและฝึกอบรมแบบจำลองในชุดฝึกอบรม จากนั้นสร้างเวกเตอร์ 2 ตัวหนึ่งรายการสำหรับค่าที่คาดการณ์และอีกหนึ่งรายการสำหรับค่าจริง เห็นได้ชัดว่าการเปรียบเทียบช่วยให้ผู้ตัดสินประสิทธิภาพของแบบจำลองโดยใช้พลังการทำนายโดยใช้สิ่งต่าง ๆ เช่นคะแนน F, สถิติ Kappa, ความแม่นยำ & การเรียกคืน, เส้นโค้ง ROC เป็นต้น สิ่งนี้เปรียบเทียบกับการประเมินการทำนายตัวเลขเช่นการถดถอยอย่างไร ฉันจะสมมติว่าคุณสามารถฝึกรูปแบบการถดถอยในชุดฝึกอบรมใช้เพื่อทำนายค่าจากนั้นเปรียบเทียบค่าที่ทำนายเหล่านี้กับค่าจริงที่อยู่ในชุดทดสอบ เห็นได้ชัดว่าการวัดประสิทธิภาพจะต้องแตกต่างกันเนื่องจากนี่ไม่ใช่งานจัดหมวดหมู่ สถิติทั่วไปและเหลือเป็นมาตรการที่ชัดเจน แต่มีวิธีที่ดีกว่า / ดีกว่าในการประเมินประสิทธิภาพสำหรับตัวแบบการถดถอยหรือไม่? ดูเหมือนว่าการจัดประเภทมีตัวเลือกมากมาย แต่การถดถอยถูกปล่อยไว้ที่และส่วนที่เหลือR2R2R^2R2R2R^2

1
วิธีการแบบเบย์และฟิชเชอร์เพื่อการวิเคราะห์จำแนกเชิงเส้น
ฉันรู้ 2 วิธีในการทำ LDA แนวทาง BayesianและวิธีของFisherวิธีการฟิชเชอร์ สมมติว่าเรามีข้อมูลโดยที่xคือตัวทำนายp -dimensional และyเป็นตัวแปรตามของK(x,y)(x,Y)(x,y)xxxpพีpyYyKKKคลาส โดยวิธี Bayesianเราคำนวณหลังและในขณะที่กล่าวในหนังสือสมมติP(x|Yk)เป็นเสียนตอนนี้เรามีฟังก์ชั่นการจำแนกสำหรับkระดับ TH เป็นฉk ( x )p(yk|x)=p(x|yk)p(yk)p(x)∝p(x|yk)p(yk)p(yk|x)=p(x|yk)p(yk)p(x)∝p(x|yk)p(yk)p(y_k|x)=\frac{p(x|y_k)p(y_k)}{p(x)}\propto p(x|y_k)p(y_k)p(x|yk)p(x|yk)p(x|y_k)kkkฉันสามารถเห็นfk(x)เป็นฟังก์ชันเชิงเส้นของxดังนั้นสำหรับคลาสKทั้งหมดที่เรามีฟังก์ชัน discriminant แบบเชิงเส้นKfk(x)=lnp(x|yk)+lnp(yk)=ln[1(2π)p/2|Σ|1/2ประสบการณ์( - 12( x - μk)TΣ- 1( x - μk) ) ] +lnp ( yk)= xTΣ- 1μk- 12μTkΣ- 1μk+ lnp ( yk)ฉk(x)=LN⁡พี(x|Yk)+LN⁡พี(Yk)=LN⁡[1(2π)พี/2|Σ|1/2ประสบการณ์⁡(-12(x-μk)TΣ-1(x-μk))]+LN⁡พี(Yk)=xTΣ-1μk-12μkTΣ-1μk+LN⁡พี(Yk)\begin{align*}f_k(x)&=\ln p(x|y_k)+\ln p(y_k)\\&=\ln\left[\frac{1}{(2\pi)^{p/2}|\Sigma|^{1/2}}\exp\left(-\frac{1}{2}(x-\mu_k)^T\Sigma^{-1}(x-\mu_k)\right)\right]+\ln p(y_k)\\&=x^T\Sigma^{-1}\mu_k-\frac{1}{2}\mu_k^T\Sigma^{-1}\mu_k+\ln p(y_k)\end{align*}ฉk( x )ฉk(x)f_k(x)xxxKKKKKK อย่างไรก็ตามด้วยวิธีของฟิชเชอร์เราพยายามฉายถึง( K - 1 …

1
คุณรายงานการทดสอบแมนน์ - วิทนีย์ได้อย่างไร
ฉันกำลังทำวิทยานิพนธ์และกำลังทำการทดสอบหลายครั้ง หลังจากใช้การทดสอบ Kruskal – Wallis ฉันมักจะรายงานผลลัพธ์ดังนี้: มีความแตกต่างอย่างมีนัยสำคัญ( χ2( 2 )= 7.448 , p = .024 )(χ(2)2=7.448,p=.024)(\chi^2_{(2)}=7.448, p=.024)ระหว่างวิธีการของ ... แต่ตอนนี้ฉันทำการทดสอบแมนน์ - วิทนีย์และฉันไม่แน่ใจว่าควรนำเสนอสิ่งใด SPSS ให้ Mann – Whitney ยูUU , Wilcoxon WWW , ZZZและPPP value ให้ฉัน ฉันจะแสดงค่าทั้งสี่นี้หรือไม่? หรือไม่เกี่ยวข้องบ้าง

2
ทำไม่ต้องใช้บริการกับ Bonferroni บน Holm-Bonferroni?
ฉันเห็นได้ว่าทำไมคุณไม่ใช้วิธีที่มีประสิทธิภาพมากกว่าเช่นวิธี Hochberg เหนือการแก้ไข Bonferroni เนื่องจากอาจมีการตั้งสมมติฐานเพิ่มเติมเช่นความเป็นอิสระของสมมติฐานในกรณีนี้ แต่ฉันไม่เข้าใจว่าทำไมคุณถึง เคยใช้การแก้ไข Bonferroni เหนือการดัดแปลงการปฏิเสธตามลำดับของโฮล์มเนื่องจากหลังนั้นมีประสิทธิภาพมากกว่าและไม่มีสมมติฐานมากกว่า Bonferroni ฉันพลาดอะไรไปหรือเปล่า

4
การทดสอบ t จะมีนัยสำคัญทางสถิติได้อย่างไรหากความแตกต่างเฉลี่ยเกือบ 0
ฉันกำลังพยายามเปรียบเทียบข้อมูลจากประชากร 2 คนเพื่อบอกว่าความแตกต่างระหว่างการรักษานั้นมีนัยสำคัญทางสถิติหรือไม่ ดูเหมือนว่าชุดข้อมูลจะกระจายตามปกติโดยมีความแตกต่างน้อยมากระหว่างสองชุด ความแตกต่างเฉลี่ยคือ 0.00017 ฉันทำการทดสอบแบบจับคู่โดยคาดหวังว่าฉันจะไม่ปฏิเสธสมมติฐานว่างที่ไม่ต่างกันระหว่างค่าเฉลี่ยอย่างไรก็ตามค่า t ที่คำนวณได้ของฉันนั้นสูงกว่าค่า t วิกฤตมาก

2
การเปรียบเทียบที่ดีเพื่อแสดงให้เห็นถึงจุดแข็งของแบบจำลองลำดับชั้น Bayesian คืออะไร
ฉันค่อนข้างใหม่กับสถิติแบบเบย์และใช้ JAGS เมื่อเร็ว ๆ นี้เพื่อสร้างแบบจำลองแบบเบย์แบบลำดับชั้นในชุดข้อมูลที่แตกต่างกัน ในขณะที่ฉันพอใจกับผลลัพธ์มาก (เมื่อเทียบกับโมเดล glm มาตรฐาน) ฉันต้องอธิบายให้ผู้ที่ไม่ใช่นักสถิติเห็นว่าความแตกต่างของแบบจำลองทางสถิติมาตรฐานคืออะไร โดยเฉพาะอย่างยิ่งฉันต้องการแสดงให้เห็นว่าทำไมและเมื่อ HBMs ทำงานได้ดีกว่าแบบจำลองที่ง่ายกว่า การเปรียบเทียบจะมีประโยชน์โดยเฉพาะอย่างยิ่งที่แสดงองค์ประกอบสำคัญบางอย่าง: หลายระดับของความแตกต่าง ความจำเป็นในการคำนวณเพิ่มเติมเพื่อให้พอดีกับโมเดล ความสามารถในการดึง "สัญญาณ" เพิ่มเติมจากข้อมูลเดียวกัน โปรดทราบว่าคำตอบนั้นควรเป็นการเปรียบเทียบกับคนที่ไม่มีสถิติไม่ใช่ตัวอย่างที่ง่ายและดูดี

1
การกระจายที่เหมาะสมกับข้อมูลเชิงพื้นที่
ข้ามการโพสต์คำถามของฉันจาก mathoverflowเพื่อค้นหาความช่วยเหลือเฉพาะสถิติ ฉันกำลังศึกษากระบวนการทางกายภาพในการสร้างข้อมูลซึ่งมีโครงงานเป็นสองมิติด้วยค่าที่ไม่เป็นลบ แต่ละขั้นตอนมีแทร็ก (ที่คาดการณ์) จุด - - ดูภาพด้านล่างxxxYYy แทร็กตัวอย่างเป็นสีน้ำเงินแทร็กที่มีปัญหาได้รับการวาดด้วยสีเขียวและพื้นที่ที่มีข้อกังวลเป็นสีแดง: แต่ละแทร็กเป็นผลมาจากการทดสอบอิสระ มีการทดลองกว่ายี่สิบล้านครั้งในช่วงหลายปีที่ผ่านมา แต่จากการทดสอบเพียงสองพันครั้งนั้นแสดงให้เห็นถึงคุณลักษณะที่เราวางแผนไว้ เรากังวลเฉพาะกับการทดลองที่สร้างแทร็กดังนั้นชุดข้อมูลของเราคือ (โดยประมาณ) สองพันแทร็ก มีความเป็นไปได้สำหรับแทร็กที่จะเข้าสู่พื้นที่ที่น่าเป็นห่วงและเราคาดหวังว่าจะเรียงตามลำดับในแทร็ก การประมาณจำนวนนั้นเป็นคำถามในมือ:11110410410^4 เราจะคำนวณความน่าจะเป็นของการติดตามโดยพลการเข้าสู่พื้นที่ที่น่าเป็นห่วงได้อย่างไร เป็นไปไม่ได้ที่จะทำการทดลองอย่างรวดเร็วพอที่จะดูว่ามีการสร้างแทร็กบ่อยครั้งเพียงใดซึ่งเข้าสู่พื้นที่ที่น่าเป็นห่วงดังนั้นเราจึงจำเป็นต้องประเมินจากข้อมูลที่มีอยู่ เราได้ติดตั้งตัวอย่างเช่นค่าให้ไว้แต่สิ่งนี้ไม่สามารถจัดการข้อมูลได้อย่างเพียงพอเช่นแทร็กสีเขียว - ดูเหมือนว่าจำเป็นต้องมีโมเดลที่ครอบคลุมทั้งสองมิติxxxY≥ 200Y≥200y\ge200 เราได้ติดตั้งระยะห่างขั้นต่ำจากแต่ละแทร็กไปยังพื้นที่ที่น่ากังวล แต่เราไม่มั่นใจว่าสิ่งนี้จะให้ผลลัพธ์ที่สมเหตุสมผล 1) มีวิธีทราบที่เหมาะสมกับการกระจายข้อมูลประเภทนี้เพื่อการประมาณค่าหรือไม่? -หรือ- 2) มีวิธีที่ชัดเจนในการใช้ข้อมูลนี้เพื่อสร้างแบบจำลองสำหรับการสร้างแทร็กหรือไม่? ตัวอย่างเช่นใช้การวิเคราะห์องค์ประกอบหลักบนแทร็กเป็นจุดในพื้นที่ขนาดใหญ่จากนั้นปรับการกระจาย (Pearson?) ให้พอดีกับแทร็กที่ฉายลงบนส่วนประกอบเหล่านั้น

3
แนวคิดของ 'การพิสูจน์ทางสถิติ'
เมื่อข่าวพูดถึงสิ่งที่ 'พิสูจน์ทางสถิติ' พวกเขาใช้แนวคิดทางสถิติที่ถูกต้องกำหนดอย่างถูกต้องใช้มันผิดหรือแค่ใช้รูปแบบโอออกซีซอน ฉันจินตนาการว่า 'การพิสูจน์ทางสถิติ' ไม่ใช่สิ่งที่ดำเนินการเพื่อพิสูจน์สมมติฐานหรือการพิสูจน์ทางคณิตศาสตร์ แต่เป็นการทดสอบทางสถิติมากกว่า
10 inference  proof 

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.