สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
เราสามารถสร้างความน่าจะเป็นด้วยการทำนายเป็นช่วง ๆ ได้หรือไม่?
ฉันได้อ่านการอภิปรายที่ยอดเยี่ยมมากมายในเว็บไซต์เกี่ยวกับการตีความช่วงเวลาความเชื่อมั่นและช่วงการคาดการณ์ แต่แนวคิดหนึ่งยังคงทำให้งงงวย: พิจารณากรอบ OLS และเราได้รับรูปแบบการติดตั้งY = X β เราได้รับx ∗และขอให้ทำนายการตอบสนองของมัน เราคำนวณx * T βและเป็นโบนัส, เรายังมีช่วงเวลาที่การคาดการณ์ 95% รอบการคาดการณ์ของเราลาได้รับสูตรสำหรับข้อ จำกัด ของการคาดการณ์ในรูปแบบเชิงเส้น ลองเรียกคำทำนายช่วงเวลา PI นี้ดูy^=Xβ^y^=Xβ^\hat y = X\hat\betax∗x∗x^*x∗Tβ^x∗Tβ^x^{*T}\hat\beta ทีนี้ข้อใดต่อไปนี้ (หรือไม่ใช่) การตีความ PI ที่ถูกต้องคืออะไร? สำหรับโดยเฉพาะอย่างยิ่งY ( x * )อยู่ภายใน PI กับความน่าจะเป็น 95%x∗x∗x^*y(x∗)y(x∗)y(x^*) หากเราได้รับจำนวนมากขั้นตอนนี้ในการคำนวณ PIs จะครอบคลุมการตอบสนองที่แท้จริง 95% ของเวลาxxx จากถ้อยคำของ @ gung ในช่วงการทำนายการถดถอยเชิงเส้นดูเหมือนว่าในอดีตจะเป็นความจริง (แม้ว่าฉันจะตีความการตีความผิดได้เป็นอย่างดี) การตีความที่ 1 …

1
โมเดล Lmer ไม่สามารถบรรจบกัน
มีการอธิบายข้อมูลของฉันที่นี่สิ่งที่อาจทำให้เกิด "รูปแบบข้อผิดพลาด () เป็นข้อผิดพลาดเอกพจน์" ใน aov เมื่อทำการวัด ANOVA ซ้ำแล้วซ้ำอีก? ฉันพยายามที่จะเห็นผลของการโต้ตอบโดยใช้lmerกรณีพื้นฐานของฉันคือ: my_null.model <- lmer(value ~ Condition+Scenario+ (1|Player)+(1|Trial), data = my, REML=FALSE) my.model <- lmer(value ~ Condition*Scenario+ (1|Player)+(1|Trial), data = my, REML=FALSE) การใช้งานanovaให้ผลลัพธ์ที่สำคัญกับฉัน แต่เมื่อฉันลองพิจารณาความชันแบบสุ่ม ( (1+Scenario|Player)) แบบจำลองล้มเหลวด้วยข้อผิดพลาดนี้: Warning messages: 1: In commonArgs(par, fn, control, environment()) : maxfun < 10 * length(par)^2 is …
12 r  lme4-nlme 

2
การถดถอยแบบขั้นตอนใน R - ค่า p สำคัญ
p-value ที่สำคัญที่ใช้โดยstep()ฟังก์ชันใน R สำหรับการถดถอยแบบขั้นตอนคืออะไร? ฉันคิดว่ามันคือ 0.15 แต่สมมติฐานของฉันถูกต้อง ฉันจะเปลี่ยนค่า p วิกฤตได้อย่างไร

2
ทำไมชุดการกระจายสินค้านี้
เรากำลังตรวจสอบการทดสอบทางสถิติแบบเบย์และพบกับปรากฏการณ์แปลก ๆ (สำหรับฉันอย่างน้อยที่สุด) พิจารณากรณีต่อไปนี้: เราสนใจที่จะวัดว่าประชากร A หรือ B ใดที่มีอัตราการแปลงสูงกว่า สำหรับการตรวจสอบสติเราตั้งค่านั่นคือความน่าจะเป็นของการแปลงเท่ากันทั้งสองกลุ่ม เราสร้างข้อมูลเทียมโดยใช้แบบจำลองทวินามเช่นpA=pBpA=pBp_A = p_BnA∼Binomial(N,pA)nA∼Binomial(N,pA)n_A \sim \text{Binomial}(N, p_A) จากนั้นเราพยายามประเมินโดยใช้แบบจำลองเบต้า - ทวินามแบบเบย์เพื่อให้เราได้รับสำหรับแต่ละอัตราการแปลงเช่นpA,pBpA,pBp_A, p_BPA∼Beta(1+nA,N−nA+1)PA∼Beta(1+nA,N−nA+1)P_A \sim \text{Beta}(1 + n_A, N - n_A +1 ) สถิติการทดสอบของเราคำนวณโดยการคำนวณผ่านทาง monte carloS=P(PA>PB|N,nA,nB)S=P(PA>PB|N,nA,nB)S = P(P_A > P_B\; |\; N, n_A, n_B) สิ่งที่ทำให้ผมประหลาดใจคือว่าถ้าแล้ว(0,1)} ความคิดของฉันคือว่ามันจะอยู่กึ่งกลางประมาณ 0.5 และยังมาบรรจบกันถึง 0.5 เป็นขนาดตัวอย่าง, , เติบโต pA=pBpA=pBp_A = …

1
การรายงานผลของตัวแบบผสมผลกระทบเชิงเส้น
แบบจำลองเชิงเส้นผสมแบบเชิงเส้นไม่ได้ใช้กันทั่วไปในมุมชีววิทยาของฉันและฉันต้องรายงานการทดสอบทางสถิติที่ฉันใช้ในกระดาษที่ฉันพยายามจะเขียน ฉันรู้ว่าการตระหนักถึงการสร้างแบบจำลองหลายระดับเริ่มปรากฏในบางพื้นที่ของวิทยาศาสตร์ชีวภาพ ( วิธีแก้ปัญหาสำหรับการพึ่งพา: ใช้การวิเคราะห์หลายระดับเพื่อรองรับข้อมูลที่ซ้อนกัน ) แต่ฉันยังคงพยายามเรียนรู้วิธีรายงานผลของฉัน! การออกแบบการทดลองโดยสังเขปของฉัน: * ผู้เข้าร่วมการวิจัยได้รับมอบหมายให้หนึ่งในสี่กลุ่มการรักษา * การวัดตัวแปรตามขึ้นอยู่กับหลายวันหลังจากเริ่มการรักษา * การออกแบบไม่สมดุลกัน (จำนวนไม่เท่ากันของกลุ่มการรักษา การวัดสำหรับบางวิชาในบางวัน) * การรักษา A เป็นหมวดหมู่อ้างอิง * ฉันจัดให้อยู่กึ่งกลางข้อมูลในวันสุดท้ายของการรักษา ฉันต้องการทราบว่าการรักษา A (หมวดหมู่อ้างอิง) ให้ผลลัพธ์ที่ดีกว่าการรักษาอื่น ๆ (เมื่อสิ้นสุดการรักษา) หรือไม่ ฉันทำการวิเคราะห์ใน R โดยใช้ nlme: mymodel <- lme(dv ~ Treatment*Day, random = ~1|Subject, data = mydf, na.action = na.omit, + correlation = …

2
การตีความเมทริกซ์ความแปรปรวนร่วม -
สมมติว่าเรามีโมเดลเชิงเส้นModel1และvcov(Model1)ให้เมทริกซ์ต่อไปนี้: (Intercept) latitude sea.distance altitude (Intercept) 28.898100 -23.6439000 -34.1523000 0.50790600 latitude -23.643900 19.7032500 28.4602500 -0.42471450 sea.distance -34.152300 28.4602500 42.4714500 -0.62612550 altitude 0.507906 -0.4247145 -0.6261255 0.00928242 สำหรับตัวอย่างนี้เมทริกซ์นี้แสดงอะไร? สมมติฐานอะไรที่เราสามารถสร้างโมเดลของเราได้อย่างปลอดภัยและเป็นตัวแปรอิสระ

2
เกณฑ์การให้คะแนนอัจฉริยะและการตัดสินผู้ชนะ
มีพอดคาสต์ NPR ที่เรียกว่า Intelligence Squared แต่ละตอนเป็นการถ่ายทอดสดการโต้วาทีในแถลงการณ์ที่ถกเถียงเช่น "การแก้ไขครั้งที่ 2 ไม่มีความเกี่ยวข้องอีกต่อไป" หรือ "การกระทำที่ยืนยันในวิทยาเขตของวิทยาลัยจะเป็นอันตรายมากกว่าดี" ผู้แทนสี่คนถกเถียงกัน - สองเรื่องต่อการเคลื่อนไหวและอีกสองเรื่องต่อต้าน เพื่อตัดสินว่าฝ่ายใดชนะฝ่ายผู้ชมจะทำการสำรวจทั้งก่อนและหลังการอภิปราย ด้านที่ได้รับมากขึ้นในแง่ของเปอร์เซ็นต์แน่นอนถือเป็นผู้ชนะ ตัวอย่างเช่น: For Against Undecided Before 18% 42% 40% After 23% 49% 28% Winner: Against team -- The motion is rejected. ฉันคิดว่ามาตรวัดความสำเร็จนี้มีอคติและฉันสงสัยว่าจะสำรวจความคิดเห็นของผู้ชมเพื่อตัดสินผู้ชนะอย่างยุติธรรมอย่างไร สามประเด็นที่ฉันเห็นทันทีด้วยวิธีปัจจุบัน: ที่สุดขั้วถ้าด้านใดด้านหนึ่งเริ่มต้นด้วยข้อตกลง 100% พวกเขาสามารถผูกหรือแพ้เท่านั้น หากไม่มีการลังเลจากนั้นด้านที่มีข้อตกลงเริ่มต้นน้อยสามารถดูได้ว่ามีตัวอย่างขนาดใหญ่กว่าที่จะวาด ด้านที่ไม่แน่ใจนั้นไม่น่าจะแน่ใจได้อย่างแท้จริง ถ้าเราคิดว่าทั้งสองฝ่ายมีความเท่าเทียมกันดูเหมือนว่าเราเชื่อว่าประชากรที่ไม่มีความมั่นใจก่อนหน้านี้ควรเป็นหากแต่ละฝ่ายถูกบังคับให้เข้าข้าง .เบต้า( # สำหรับ, # Against )Beta(# …
12 bayesian  rating 

1
วิธีการทดสอบ bootstrap เพื่อเปรียบเทียบค่าเฉลี่ยของสองตัวอย่าง?
ฉันมีตัวอย่างที่บิดเบี้ยวสองตัวอย่างและพยายามใช้การบูตสแตรปเพื่อเปรียบเทียบค่าเฉลี่ยของพวกเขาโดยใช้สถิติที ขั้นตอนที่ถูกต้องในการทำคืออะไร? กระบวนการที่ฉันใช้ ฉันกังวลเกี่ยวกับความเหมาะสมของการใช้ข้อผิดพลาดมาตรฐานของข้อมูลต้นฉบับ / การสังเกตในขั้นตอนสุดท้ายเมื่อฉันรู้ว่านี่ไม่ใช่การกระจายแบบปกติ นี่คือขั้นตอนของฉัน: Bootstrap - สุ่มเลือกตัวอย่างพร้อมเปลี่ยน (N = 1,000) คำนวณเสื้อสถิติสำหรับแต่ละบูตเพื่อสร้างเสื้อกระจาย: T( b ) = ( X)¯¯¯¯ข1- X¯¯¯¯ข2) - ( X¯¯¯¯1- X¯¯¯¯2)σ2x b 1/ n+ σ2x b 2/ n-------------√T(b)=(X¯b1−X¯b2)−(X¯1−X¯2)σxb12/n+σxb22/n T(b) = \frac{(\overline{X}_{b1}-\overline{X}_{b2})-(\overline{X}_1-\overline{X}_2) }{\sqrt{ \sigma^2_{xb1}/n + \sigma^2_{xb2}/n }} ประมาณค่าช่วงความเชื่อมั่น t โดยรับและ1 - α / 2เปอร์เซ็นต์ของการแจกแจงแบบ tα / 2α/2\alpha/21 …

3
ดีกว่าหรือไม่ที่จะเลือกการแจกแจงตามทฤษฎีความเหมาะสมหรืออย่างอื่น?
นี่คือคำถามเกี่ยวกับปรัชญา แต่ฉันสนใจว่าคนอื่น ๆ มีประสบการณ์มากขึ้นคิดอย่างไรเกี่ยวกับการเลือกการกระจาย ในบางกรณีดูเหมือนชัดเจนว่าทฤษฎีอาจทำงานได้ดีที่สุด (ความยาวหางของหนูจะกระจายตามปกติ) ในหลายกรณีอาจไม่มีทฤษฎีที่จะอธิบายชุดข้อมูลดังนั้นคุณเพียงใช้สิ่งที่เหมาะกับสิ่งที่คุณมีค่อนข้างดีโดยไม่คำนึงถึงสิ่งที่มันถูกพัฒนาขึ้นเพื่ออธิบาย? ฉันสามารถจินตนาการถึงข้อผิดพลาดบางอย่างของการไปกับสิ่งเหล่านี้และแน่นอนว่าดูเหมือนว่าจะมีปัญหาที่บางทีคุณควรใช้การกระจายเชิงประจักษ์ถ้าคุณไม่มีความคิด ดังนั้นฉันเดาสิ่งที่ฉันถามจริง ๆ : มีใครบางคนมีวิธีติดต่อกัน / คิดเกี่ยวกับปัญหานี้หรือไม่? และมีทรัพยากรใดบ้างที่คุณสามารถแนะนำได้ว่าให้การปฏิบัติที่ดีต่อสิ่งนี้?

2
การตรวจสอบค่าคงที่สำหรับค่าปกติในโมเดลเชิงเส้นทั่วไป
กระดาษนี้ใช้แบบจำลองเชิงเส้นทั่วไป (ทั้งการแจกแจงแบบทวินามและลบแบบทวินามลบ) เพื่อวิเคราะห์ข้อมูล แต่ในส่วนการวิเคราะห์ทางสถิติของวิธีการมีคำสั่งนี้: ... และลำดับที่สองโดยการสร้างแบบจำลองข้อมูลการแสดงตนโดยใช้ตัวแบบการถดถอยโลจิสติกและข้อมูลเวลาการค้นหาโดยใช้แบบจำลองเชิงเส้นทั่วไป (GLM) การแจกแจงแบบทวินามลบพร้อมฟังก์ชั่นบันทึกการเชื่อมโยงถูกใช้เพื่อสร้างแบบจำลองข้อมูลเวลาการหาอาหาร (Welsh et al. 1996) และตรวจสอบความเพียงพอของแบบจำลอง ใช้การทดสอบ Shapiro – Wilk หรือ Kolmogorov – Smirnov เพื่อทดสอบภาวะปกติทั้งนี้ขึ้นอยู่กับขนาดตัวอย่าง ข้อมูลถูกบันทึกการแปลงก่อนการวิเคราะห์ให้เป็นไปตามปกติ หากพวกเขาถือว่าการแจกแจงข้อผิดพลาดทวินามและลบทวินามก็แน่นอนว่าพวกเขาไม่ควรตรวจสอบความเป็นปกติของเศษซาก?

1
ฉันจะฝึกอบรม HMM เพื่อการจัดหมวดหมู่ได้อย่างไร
ดังนั้นฉันเข้าใจว่าเมื่อคุณฝึกฝน HMM สำหรับการจัดประเภทแนวทางมาตรฐานคือ: แยกชุดข้อมูลของคุณออกเป็นชุดข้อมูลสำหรับแต่ละชั้นเรียน ฝึกหนึ่ง HMM ต่อคลาส ในชุดทดสอบเปรียบเทียบความเป็นไปได้ของแต่ละรุ่นเพื่อจำแนกแต่ละหน้าต่าง แต่ฉันจะฝึก HMM ในแต่ละชั้นได้อย่างไร ฉันเพิ่งต่อข้อมูลที่เกี่ยวข้องกับหนึ่งคลาสเข้าด้วยกันหรือไม่ แต่ไม่ใช่ข้อมูลอนุกรมเวลาหมายถึงการเรียงลำดับ - และถ้าฉันทำอย่างนั้นฉันกำลังบอกว่าจุดข้อมูลบางอย่างต่อเนื่องกันเมื่อพวกเขาไม่ได้? เพื่อให้เป็นรูปธรรมมากขึ้นฉันมีข้อมูล EEG ซึ่งเป็นเมทริกซ์ 96xT ที่ฉันมีเวกเตอร์ฟีเจอร์ 96 เวกเตอร์ซึ่งเป็นความหนาแน่นสเปกตรัมพลังงานของความถี่ที่แตกต่างกันจากช่องสัญญาณที่แตกต่างกันและ T คือระยะเวลาของสัญญาณ สิ่งนี้สามารถแบ่งออกเป็นหน้าต่างที่ฉันรู้จากโปรโตคอลทดลอง (ข้อมูลมีป้ายกำกับ) ดังนั้นฉันจึงสามารถรวบรวมเมทริกซ์ 96 * t สำหรับแต่ละชั้นเรียนได้ โดยที่ t น้อยกว่า T และระบุขนาดของแต่ละหน้าต่าง จากนั้นฉันจะฝึก HMM กับข้อมูลนี้ได้อย่างไร ถ้ามันช่วยให้ฉันพยายามใช้ชุดเครื่องมือ pmtk3 แต่ฉันเปิดให้ใช้อะไรก็ได้จริง ๆ - มันแค่ต้องสามารถจัดการกับการสังเกตที่มีคุณค่าจริง ๆ เพราะความหนาแน่นสเปกตรัมพลังงานนั้นไม่ต่อเนื่องกัน (กล่องเครื่องมือ MATLAB เริ่มต้นเท่านั้นที่สามารถจัดการได้ …

3
ลดความแปรปรวนจาก boxplot
ฉันสงสัยว่าจะอนุมานความแปรปรวนของตัวแปรได้อย่างไรโดยใช้ boxplot อย่างน้อยเป็นไปได้หรือไม่ที่จะอนุมานว่าตัวแปรสองตัวมีความแปรปรวนแบบเดียวกันกับการสังเกต boxplot หรือไม่?
12 variance  boxplot 

1
ถ้าการกระจายตัวของสถิติทดสอบเป็น bimodal, p-value จะมีความหมายอะไรไหม?
P-value ถูกกำหนดความน่าจะเป็นที่จะได้รับสถิติการทดสอบอย่างน้อยที่สุดเท่าที่จะสังเกตได้โดยสมมติว่าสมมติฐานว่างเป็นจริง ในคำอื่น ๆ P( X≥ t | H0)P(X≥t|H0)P( X \ge t | H_0 ) แต่จะเป็นอย่างไรถ้าสถิติการทดสอบนั้นมีค่า bimodal ในการแจกแจง? p-value มีความหมายอะไรในบริบทนี้หรือไม่? ตัวอย่างเช่นฉันจะจำลองข้อมูล bimodal ใน R: set.seed(0) # Generate bi-modal distribution bimodal <- c(rnorm(n=100,mean=25,sd=3),rnorm(n=100,mean=100,sd=5)) hist(bimodal, breaks=100) และสมมติว่าเราสังเกตค่าสถิติทดสอบ 60 และที่นี่เรารู้จากภาพค่านี้ไม่น่ามาก ดังนั้นฉันต้องการให้ขั้นตอนสถิติที่ฉันใช้ (พูด p-value) เปิดเผยสิ่งนี้ แต่ถ้าเราคำนวณค่า p ตามที่กำหนดเราจะได้ค่าสูงมาก observed <- 60 # Get P-value …


1
Clopper-Pearson สำหรับนักคณิตศาสตร์ที่ไม่ใช่
ฉันสงสัยว่าถ้าใครสามารถอธิบายให้ฉันรู้ได้ว่าเกินขนาดของ Clopper-Pearson CI เท่าที่ฉันรู้ทุก CI รวมถึงความแปรปรวนในนั้น อย่างไรก็ตามสำหรับสัดส่วนแม้ว่าสัดส่วนของฉันคือ 0 หรือ 1 (0% หรือ 100%) สามารถคำนวณ Clopper-Pearson CI ได้ ฉันลองดูสูตรและฉันเข้าใจว่ามันมีบางอย่างที่มีเปอร์เซนต์ของการแจกแจงแบบทวินามและฉันเข้าใจว่าการหา CI เกี่ยวข้องกับการทำซ้ำ แต่ฉันสงสัยว่าใครสามารถอธิบายตรรกะและเหตุผลใน "คำง่าย ๆ " หรือด้วยคณิตศาสตร์ขั้นต่ำ ?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.