สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
แบบจำลองการนับศูนย์ที่ไม่พองใน R: ประโยชน์ที่แท้จริงคืออะไร
สำหรับการวิเคราะห์การนับนกศูนย์ที่สูงเกินจริงผมอยากจะใช้รุ่นนับเป็นศูนย์ที่สูงขึ้นโดยใช้แพคเกจ R pscl อย่างไรก็ตามเมื่อดูตัวอย่างที่ให้ไว้ในเอกสารสำหรับหนึ่งในฟังก์ชั่นหลัก ( ? zeroinfl ) ฉันเริ่มสงสัยว่าประโยชน์ที่แท้จริงของรุ่นเหล่านี้คืออะไร จากตัวอย่างโค้ดที่ให้ไว้ฉันคำนวณปัวซองมาตรฐาน, แบบกึ่งกลาง - ปัวซองและโมเดลไบโอโนเมียลบ, ปัวซองแบบ zero-inflated แบบง่าย, และแบบจำลองทวินามลบ, แบบปัวซองแบบพองตัวแบบศูนย์และแบบลบลบทวินาม จากนั้นฉันตรวจสอบฮิสโทแกรมของข้อมูลที่ตรวจพบและข้อมูลที่ติดตั้ง (นี่คือรหัสสำหรับการทำซ้ำ) library(pscl) data("bioChemists", package = "pscl") ## standard count data models fm_pois <- glm(art ~ ., data = bioChemists, family = poisson) fm_qpois <- glm(art ~ ., data = bioChemists, family …

1
การเปรียบเทียบแบบหลายแบบผสมสำหรับการโต้ตอบระหว่างตัวทำนายแบบต่อเนื่องและหมวดหมู่
ฉันต้องการใช้lme4เพื่อให้พอดีกับการถดถอยแบบผสมและmultcompเพื่อคำนวณการเปรียบเทียบแบบคู่ ฉันมีชุดข้อมูลที่ซับซ้อนพร้อมตัวทำนายอย่างต่อเนื่องและจัดหมวดหมู่หลายชุด แต่คำถามของฉันสามารถแสดงให้เห็นได้โดยใช้ChickWeightชุดข้อมูลในตัวเป็นตัวอย่าง: m <- lmer(weight ~ Time * Diet + (1 | Chick), data=ChickWeight, REML=F) Timeมีความต่อเนื่องและDietเป็นหมวดหมู่ (4 ระดับ) และมีลูกไก่หลายตัวต่ออาหาร ลูกไก่ทุกตัวเริ่มต้นด้วยน้ำหนักเท่ากัน แต่อาหารของพวกมัน (อาจ) ส่งผลต่ออัตราการเติบโตดังนั้นการDietสกัดกั้นควรจะเหมือนกัน (มากหรือน้อย) เหมือนกัน แต่ความลาดชันอาจแตกต่างกัน ฉันจะได้รับการเปรียบเทียบแบบคู่สำหรับผลของการสกัดกั้นDietแบบนี้: summary(glht(m, linfct=mcp(Diet = "Tukey"))) และแน่นอนพวกเขาไม่ได้แตกต่างกันอย่างมีนัยสำคัญ แต่ฉันจะทำการทดสอบแบบอะนาล็อกเพื่อให้ได้Time:Dietผลอย่างไร เพียงแค่ใส่คำที่โต้ตอบลงไปในmcpข้อผิดพลาด: summary(glht(m, linfct=mcp('Time:Diet' = "Tukey"))) Error in summary(glht(m, linfct = mcp(`Time:Diet` = "Tukey"))) : error in …

3
อะไรคือสมมติฐานของการวิเคราะห์ปัจจัย?
ฉันต้องการตรวจสอบว่าฉันเข้าใจการวิเคราะห์ตัวประกอบ [คลาสสิคเชิงเส้น] (FA) โดยเฉพาะอย่างยิ่งสมมติฐานที่สร้างขึ้นก่อนหน้านี้ (และหลังจากนั้น) FA ข้อมูลบางส่วนควรมีความสัมพันธ์เริ่มแรกและมีความสัมพันธ์เชิงเส้นที่เป็นไปได้ระหว่างกัน หลังจากทำการวิเคราะห์ปัจจัยข้อมูลจะถูกกระจายตามปกติ (การกระจายตัวแบบ bivariate สำหรับแต่ละคู่) และไม่มีความสัมพันธ์ระหว่างปัจจัย (ทั่วไปและจำเพาะ) และไม่มีความสัมพันธ์ระหว่างตัวแปรจากปัจจัยหนึ่งและตัวแปรจากปัจจัยอื่น ๆ ถูกต้องหรือไม่

1
หลัง Dirichlet
ฉันมีคำถามเกี่ยวกับการกระจายหลัง Dirichlet กำหนดฟังก์ชั่นความน่าจะเป็นพหุนามเป็นที่รู้จักกันว่าหลังเป็นที่คือจำนวนครั้งที่เราได้เห็นสังเกตN ฉันฉันทีเอชDir(αi+Ni)Dir(αi+Ni)Dir({\alpha_i + N_i})NiNiN_iithithi^{th} จะเกิดอะไรขึ้นถ้าเราเริ่มต้นที่จะลดลงสำหรับให้คงที่ ? ดูเหมือนว่าจากรูปแบบของหลังที่บางจุดจะหยุดส่งผลกระทบต่อหลังทั้งหมด แต่มันจะไม่ถูกหรือไม่ที่จะบอกว่าเมื่อเราสร้างเล็กมากความน่าจะเป็นของการเคลื่อนที่ไปยังมุมหนึ่งของซิมเพล็กซ์และด้านหลังต้องได้รับผลกระทบมากขึ้นใช่ไหม ข้อความใดที่ถูกต้องD α ααα\alphaDDDαα\alphaαα\alpha

2
ทำไมข้อมูลควรถูกสุ่มใหม่ภายใต้สมมติฐานว่างในการทดสอบสมมติฐานบูตสแตรป?
การใช้วิธีการ bootstrap ที่ตรงไปตรงมาเพื่อทดสอบสมมติฐานคือการประมาณช่วงความมั่นใจของสถิติการทดสอบ โดยการคำนวณซ้ำ ๆ บนตัวอย่าง bootstrapped (ปล่อยให้สถิติตัวอย่างจาก bootstrap เรียกว่า ) เราปฏิเสธถ้าสมมติฐานพารามิเตอร์ (ซึ่งมักจะมีค่าเท่ากับ 0) โกหกนอกช่วงความเชื่อมั่นของtheta} θ ^ θ * H0θ0 ^ θ *θ^θ^\hat{\theta}θ^θ^\hat{\theta}θ* * * *^θ* * * *^\hat{\theta^*}H0H0H_0θ0θ0\theta_0θ* * * *^θ* * * *^\hat{\theta^*} ฉันอ่านแล้วว่าวิธีนี้ไม่มีพลังงานบ้าง ในบทความโดยHall P. และ Wilson SR "สองแนวทางสำหรับการทดสอบสมมติฐาน Bootstrap" (1992)มันถูกเขียนเป็นแนวทางแรกว่าเราควร resampleไม่ใช่\ และนี่คือส่วนที่ฉันไม่เข้าใจ^ θ * -θ0θ* * …

3
สัญชาตญาณและการใช้สัมประสิทธิ์การเปลี่ยนแปลง
ฉันกำลังเข้าร่วมหลักสูตรการจัดการการดำเนินงานเบื้องต้นใน Coursera.org ในบางช่วงของหลักสูตรศาสตราจารย์เริ่มจัดการกับความแปรปรวนในเวลาของการปฏิบัติงาน การวัดที่เขาใช้คือสัมประสิทธิ์การแปรผันอัตราส่วนระหว่างส่วนเบี่ยงเบนมาตรฐานและค่าเฉลี่ย: คโวลต์= σμคโวลต์=σμc_v = \frac{\sigma}{\mu} เหตุใดการวัดนี้จึงถูกใช้ ข้อดีและข้อเสียของการทำงานกับCVนอกเหนือจากการทำงานด้วยพูดส่วนเบี่ยงเบนมาตรฐานคืออะไร สัญชาตญาณของการวัดนี้คืออะไร?

2
การกระจายแบบไม่ต่อเนื่องนี้คืออะไร (สมการส่วนต่างแบบเรียกซ้ำ) ที่ฉันได้รับ
ฉันเจอเกมนี้ในคอมพิวเตอร์และต้องการเรียนรู้เพิ่มเติมเกี่ยวกับพฤติกรรมของมัน มันมาจากการตัดสินใจว่าเหตุการณ์บางอย่างควรเกิดขึ้นหลังจากการกระทำของผู้เล่นจำนวนหนึ่งหรือไม่ รายละเอียดนอกเหนือจากนี้ไม่เกี่ยวข้อง ดูเหมือนว่าเหมาะสมกับสถานการณ์อื่น ๆ และฉันพบว่ามันน่าสนใจเพราะง่ายต่อการคำนวณและสร้างหางยาว ทุกขั้นตอนเกมสร้างตัวเลขสุ่มเครื่องแบบ&lt;1 ถ้าเหตุการณ์จะถูกเรียกใช้ หลังจากเหตุการณ์เกิดขึ้นอีกครั้งเกมจะรีเซ็ตn = 0และทำงานตามลำดับอีกครั้ง ฉันสนใจเพียงเหตุการณ์เดียวที่เกิดขึ้นสำหรับปัญหานี้เพราะนั่นหมายถึงการกระจายที่เกมใช้อยู่ (นอกจากนี้คำถามใด ๆ เกี่ยวกับเหตุการณ์หลายรายการสามารถตอบด้วยแบบจำลองเหตุการณ์เดียว)0 ≤ X &lt; 1 X &lt; p ( n ) n = 0nnn0≤X&lt;10≤X&lt;10 \leq X < 1X&lt;p(n)X&lt;p(n)X < p(n)n=0n=0n = 0 "ความผิดปกติ" หลักที่นี่คือพารามิเตอร์ความน่าจะเป็นในการแจกแจงนี้เพิ่มขึ้นเมื่อเวลาผ่านไปหรืออีกทางหนึ่งเกณฑ์เพิ่มขึ้นเมื่อเวลาผ่านไป ในตัวอย่างมันเปลี่ยนแปลงเป็นเส้นตรง แต่ฉันคิดว่าอาจใช้กฎอื่น หลังจากnnnขั้นตอนหรือการกระทำโดยผู้ใช้ p(n)=knp(n)=kn p(n) = kn สำหรับบางคนคง0&lt;k&lt;10&lt;k&lt;10 < k < 1&lt;1 …

2
ระยะ Mahalanobis คืออะไรและใช้ในการจดจำรูปแบบอย่างไร
บางคนสามารถอธิบายแนวคิดเรื่องระยะทางของมาฮาลาโนบิสได้หรือไม่? ตัวอย่างเช่นอะไรคือระยะทาง Mahalanobis ระหว่างสองจุด x และ y และโดยเฉพาะอย่างยิ่งมันตีความอย่างไรสำหรับการจดจำรูปแบบ?

1
'bagplot' หรือ 'bivariate boxplot' คืออะไร?
ฉันพบกระดาษที่แนะนำ boxplot รุ่นหลายมิติ (ที่นี่) กระเป๋าใบนั้นคืออะไรกันแน่? ฉันสามารถเห็นชุดของรูปหลายเหลี่ยมซ้อนกันขึ้นอยู่กับจุดยอดหนึ่งในรูปหลายเหลี่ยมเหล่านั้นถูกประกาศให้เป็นกระเป๋า แนวคิดของการสร้างรูปหลายเหลี่ยมซ้อนกันคืออะไร รูปหลายเหลี่ยมใดที่เป็นรูปแบบถุง (กลางหรือถือจำนวนคะแนนเฉลี่ย) ขอบของกระเป๋ามีคุณสมบัติที่มีประโยชน์ (เช่นการแบ่งชุดจุดเฉพาะ) หรือไม่?

2
สมมติฐานการถดถอยของปัวซองและวิธีทดสอบใน R
ฉันต้องการทดสอบว่าการถดถอยแบบใดที่เหมาะกับข้อมูลของฉันที่สุด ตัวแปรตามของฉันคือการนับและมีศูนย์จำนวนมาก และฉันต้องการความช่วยเหลือในการกำหนดรูปแบบและครอบครัวที่จะใช้ (ปัวซองหรือ quasipoisson หรือการถดถอยปัวซองปัวซอง) และวิธีทดสอบสมมติฐาน การถดถอยปัวซอง: เท่าที่ฉันเข้าใจสมมติฐานที่แข็งแกร่งคือความแปรปรวนเฉลี่ย = ความแปรปรวน คุณทดสอบสิ่งนี้อย่างไร พวกเขาต้องอยู่ใกล้กันแค่ไหน? มีการใช้ค่าเฉลี่ยและความแปรปรวนแบบไม่มีเงื่อนไขหรือมีเงื่อนไขหรือไม่ ฉันจะทำอย่างไรถ้าข้อสันนิษฐานนี้ไม่ได้ถืออยู่? ฉันอ่านว่าหากความแปรปรวนมากกว่าค่าเฉลี่ยเรามีการกระจายเกินความเร็วและวิธีที่เป็นไปได้ในการจัดการกับสิ่งนี้คือการรวมตัวแปรอิสระมากขึ้นหรือ family = quasipoisson การแจกจ่ายนี้มีข้อกำหนดหรือข้อสมมติฐานอื่น ๆ หรือไม่? ฉันจะใช้การทดสอบแบบใดเพื่อดูว่า (1) หรือ (2) เหมาะสมกว่าดีกว่าanova(m1,m2)หรือไม่? ฉันยังอ่านด้วยว่าการแจกแจงลบ - ทวินามสามารถใช้เมื่อการกระจายเกินปกติปรากฏขึ้น ฉันจะทำสิ่งนี้ใน R ได้อย่างไร ความแตกต่างของ quasipoisson คืออะไร? การถดถอยปัวซองที่ไม่ทำให้เป็นศูนย์: ฉันอ่านว่าการใช้การทดสอบ vuong จะตรวจสอบว่าแบบจำลองใดที่เหมาะสมกว่า &gt; vuong (model.poisson, model.zero.poisson) ถูกต้องหรือไม่ การถดถอยแบบไม่มี Zero-สมมติฐานมีอะไรบ้าง? บริการด้านวิชาการของ UCLA กลุ่มให้คำปรึกษาทางสถิติมีส่วนเกี่ยวกับการถดถอยแบบปัวซองที่ไม่ทำให้เป็นศูนย์และทดสอบแบบจำลองเซโรพเลต …

2
โอเมก้ากับความน่าเชื่อถือของอัลฟา
ฉันสงสัยว่าใครบางคนสามารถอธิบายได้ว่าอะไรคือความแตกต่างที่สำคัญระหว่างโอเมก้าและอัลฟาที่เชื่อถือได้? ฉันเข้าใจว่าความน่าเชื่อถือของโอเมก้าขึ้นอยู่กับตัวแบบลำดับชั้นตามที่แสดงในภาพต่อไปนี้และอัลฟาใช้ความสัมพันธ์ระหว่างรายการโดยเฉลี่ย สิ่งที่ฉันไม่เข้าใจคือในแง่ใดค่าสัมประสิทธิ์ความน่าเชื่อถือโอเมก้าจะสูงกว่าค่าสัมประสิทธิ์อัลฟ่าและในทางกลับกัน? ฉันสามารถสันนิษฐานได้ไหมว่าความสัมพันธ์ระหว่าง subfactors และตัวแปรสูงกว่าค่าสัมประสิทธิ์โอเมก้าก็จะสูงขึ้น (ดังแสดงในภาพด้านบน) คำแนะนำใด ๆ ที่ชื่นชม!

1
รับผลลัพธ์ที่แตกต่างเมื่อทำการพล็อตจุดไข่ปลา 95% ด้วย ggplot หรือแพ็คเกจวงรี
ฉันต้องการให้เห็นภาพผลลัพธ์ของการจัดกลุ่ม (สร้างด้วยprotoclust{protoclust}) โดยสร้างแผนการสแกลเลอร์สำหรับแต่ละคู่ของตัวแปรที่ใช้สำหรับการจำแนกข้อมูลของฉันการระบายสีตามคลาส คลาส elipses- ทับซ้อนกันภายใต้ตัวแปรแต่ละคู่) ฉันใช้รูปวาดของวงรีในสองวิธีที่แตกต่างกันและรูปวงรีที่ได้นั้นแตกต่างกัน! (รูปวงรีที่ใหญ่กว่าสำหรับการใช้งานครั้งแรก!) นิรนัยที่มีขนาดแตกต่างกันเท่านั้น ฉันเดาว่าฉันต้องทำอะไรผิดโดยใช้หนึ่งในนั้น (หวังว่าจะไม่ใช้ทั้งคู่!) หรือด้วยข้อโต้แย้ง มีใครบอกฉันได้ไหมว่าฉันทำอะไรผิด นี่คือรหัสสำหรับการใช้งานทั้งสอง ทั้งสองขึ้นอยู่กับคำตอบของวิธีการที่วงรีข้อมูลสามารถวางทับบน scatterplot ggplot2 ได้อย่างไร ### 1st implementation ### using ellipse{ellipse} library(ellipse) library(ggplot2) library(RColorBrewer) colorpal &lt;- brewer.pal(10, "Paired") x &lt;- data$x y &lt;- data$y group &lt;- data$group df &lt;- data.frame(x=x, y=y, group=factor(group)) df_ell &lt;- data.frame() for(g in …

3
การใช้คอมพิวเตอร์จำลองเพื่อเข้าใจแนวคิดทางสถิติในระดับบัณฑิตศึกษา
สวัสดีฉันกำลังเรียนหลักสูตรบัณฑิตศึกษาในสถิติและเราได้ครอบคลุมสถิติการทดสอบและแนวคิดอื่น ๆ อย่างไรก็ตามฉันมักจะสามารถใช้สูตรและพัฒนาสัญชาตญาณเกี่ยวกับวิธีการทำงาน แต่ฉันมักจะรู้สึกว่าถ้าฉันสำรองการศึกษาของฉันด้วยการทดลองจำลองฉันจะพัฒนาสัญชาตญาณเป็นปัญหาที่มือ . ดังนั้นฉันจึงคิดว่าจะเขียนแบบจำลองง่าย ๆ เพื่อให้เข้าใจแนวคิดบางอย่างที่เราพูดถึงในชั้นเรียนได้ดีขึ้น ตอนนี้ฉันสามารถใช้พูด Java เพื่อ: สร้างประชากรสุ่มโดยมีค่าเฉลี่ยและส่วนเบี่ยงเบนมาตรฐาน จากนั้นนำตัวอย่างเล็ก ๆ และลองพยายามคำนวณข้อผิดพลาด Type-I และ Type-II เชิงประจักษ์ ตอนนี้คำถามที่ฉันมีคือ: นี่เป็นวิธีที่ถูกต้องตามกฎหมายในการพัฒนาสัญชาตญาณหรือไม่? มีซอฟต์แวร์ให้ทำเช่นนี้SASหรือRไม่? นี่เป็นวินัยในสถิติที่เกี่ยวข้องกับการเขียนโปรแกรมเช่น: สถิติการทดลองหรือไม่, สถิติการคำนวณ? จำลอง?

1
ข้อมูลเหล่านี้สามารถรวมกันเป็นสัดส่วนสำหรับ binomial glm ได้หรือไม่?
เราขอให้คน 60 รายชื่อแฟรนไชส์ร้านอาหารจำนวนมากในแอตแลนตาเท่าที่จะทำได้ รายการโดยรวมนั้นมีร้านอาหารกว่า 70 ร้าน แต่เรากำจัดร้านที่ถูกกล่าวถึงน้อยกว่า 10% ของผู้คนทำให้เราเหลือ 45 คนสำหรับ 45 ร้านนี้เราคำนวณสัดส่วนของผู้ให้ข้อมูลที่แสดงรายการแฟรนไชส์และเราสนใจ การสร้างแบบจำลองสัดส่วนนี้เป็นฟังก์ชั่นของงบประมาณการโฆษณาของแฟรนไชส์ ​​(บันทึกการเปลี่ยนแปลง) และปีนับตั้งแต่กลายเป็นแฟรนไชส์ ดังนั้นฉันจึงเขียนรหัสนี้: model &lt;- glm ( cbind (listed, 55-listed) ~ log.budget + years, family = binomial, data = list.45) ตามที่คาดการณ์ไว้ตัวแปรทั้งสองแสดงผลที่แข็งแกร่งและมีนัยสำคัญ แต่ถึงแม้ว่าฉันรู้ว่าข้อมูลที่เป็นสัดส่วนไม่ควรเป็นแบบจำลองด้วยการถดถอย OLS ฉันก็เขียนรหัสนี้: model.lm &lt;- lm ( proportion.55 ~ log.budget + years, data = list.45) …

2
สร้างอนุกรมเวลาที่มีข้อสังเกตหลายอย่างสำหรับแต่ละวัน
ฉันพยายามใช้อนุกรมเวลากับข้อมูลตัวอย่างรายไตรมาส (ชีวมวลสัตว์) ในช่วงเวลา 10 ปีโดยมี 3 reps ต่อไตรมาส ดังนั้น 40 วัน แต่ 120 การสังเกตทั้งหมด ฉันได้อ่านถึง SARIMA'a ในการวิเคราะห์อนุกรมเวลาของ Shumway และ Stoffer แล้วและก็เป็นแอปพลิเคชันเช่นเดียวกับ Woodward ที่เหลืออยู่ การวิเคราะห์อนุกรมเวลาของอัลประยุกต์และความเข้าใจของฉันคือแต่ละแบบจำลองนั้นอิงจากการสังเกตเพียงจุดเดียวในแต่ละจุดในอนุกรมเวลา คำถาม: ฉันจะรวมการเปลี่ยนแปลงในแต่ละการสังเกตในแบบจำลองของฉันได้อย่างไร ฉันสามารถสร้างซีรีส์ตามค่าเฉลี่ย แต่ฉันจะหลวมการเปลี่ยนแปลงในแต่ละการสังเกตและฉันคิดว่ามันเป็นสิ่งสำคัญที่จะเข้าใจสิ่งที่เกิดขึ้น
11 r  time-series 

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.