สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
พล็อตสถิติสรุปด้วย Mean, sd, min และ max?
ฉันมาจากพื้นหลังทางเศรษฐศาสตร์และมักจะอยู่ในวินัยสถิติสรุปของตัวแปรที่มีการรายงานในตาราง อย่างไรก็ตามฉันต้องการพล็อตพวกเขา ฉันสามารถแก้ไขพล็อตกล่องเพื่อให้สามารถแสดงค่าเฉลี่ยส่วนเบี่ยงเบนมาตรฐานต่ำสุดและสูงสุด แต่ฉันไม่ต้องการทำเช่นนั้นเนื่องจากพล็อตกล่องถูกใช้เพื่อแสดงค่ามัธยฐานและ Q1 และ Q3 ตัวแปรทั้งหมดของฉันมีสเกลต่างกัน มันจะดีถ้ามีคนแนะนำวิธีที่มีความหมายโดยที่ฉันสามารถวางแผนสถิติสรุปเหล่านี้ได้ ฉันสามารถทำงานกับ R หรือ Stata ได้

1
ผสานรวมกับ eCDF อย่างรวดเร็วใน R
ฉันมีสมการอินทิกรัลของรูปแบบ โดยที่คือ cdf เชิงประจักษ์และเป็นฟังก์ชัน . ฉันมีการทำแผนที่การหดตัวดังนั้นฉันจึงพยายามแก้สมการอินทิกรัลโดยใช้ลำดับทฤษฎีบท Banach Fixed PointF nกรัมT1( x ) = ∫x0ก.( T1( y) ) d F^n( y)T1(x)=∫0xก.(T1(Y)) dF^n(Y) T_1(x) = \int_0^x g(T_1(y)) \ d\hat{F}_n(y) F^nF^n\hat{F}_nก.ก.g อย่างไรก็ตามสิ่งนี้ทำงานช้ามากใน R และฉันคิดว่ามันเป็นเพราะฉันรวมการใช้ฟังก์ชั่น sum () สำหรับซ้ำแล้วซ้ำอีกx ∈ F^nx∈F^nx \in \hat{F}_n มีวิธีการรวมที่เร็วขึ้นโดยใช้การกระจายเชิงประจักษ์กับฟังก์ชั่นเช่นบูรณาการ ()?

4
ฉันต้องการแสดง
ปล่อยเป็นตัวแปรสุ่มบนพื้นที่ความน่าจะเป็นแสดงว่าX:Ω→NX:Ω→NX:\Omega \to \mathbb N(Ω,B,P)(Ω,B,P)(\Omega,\mathcal B,P)E(X)=∑n=1∞P(X≥n).E(X)=∑n=1∞P(X≥n).E(X)=\sum_{n=1}^\infty P(X\ge n). คำจำกัดความของฉันจากเท่ากับ E(X)E(X)E(X)E(X)=∫ΩXdP.E(X)=∫ΩXdP.E(X)=\int_\Omega X \, dP. ขอบคุณ

1
มี "มาตรฐาน" สำหรับสัญลักษณ์แบบจำลองทางสถิติหรือไม่
ตัวอย่างเช่นในคู่มือ BUGSหรือหนังสือที่กำลังจะมาถึงโดย Lee และ Wagenmakers ( pdf ) และในสถานที่อื่น ๆ มีการใช้สัญกรณ์ประเภทหนึ่งซึ่งดูเหมือนว่าฉันจะมีความยืดหยุ่นมากในการอธิบายรูปแบบทางสถิติส่วนใหญ่ ตัวอย่างของสัญกรณ์นี้มีดังต่อไปนี้: yi∼Binomial(pi,ni)log(pi1−pi)=bibi∼Normal(μp,σp)yi∼Binomial(pi,ni)log⁡(pi1−pi)=bibi∼Normal(μp,σp) y_i \sim \text{Binomial}(p_i,n_i) \\ \log(\frac{p_i}{1 - p_i}) = b_i \\ b_i \sim \text{Normal}(\mu_p,\sigma_p) ซึ่งจะอธิบายถึงรูปแบบการโลจิสติกลำดับชั้นโดยไม่มีการพยากรณ์ แต่ด้วยกลุ่ม วิธีการอธิบายแบบจำลองนี้ดูเหมือนจะทำงานอย่างเท่าเทียมกันทั้งสำหรับการอธิบายและรูปแบบ frequentist คชกรรมตัวอย่างเช่นการให้คำอธิบายรูปแบบนี้อย่างเต็มที่คชกรรมคุณก็จะต้องเพิ่มไพรเออร์ในและ\i=1…ni=1…ni = 1\dots n μpμp\mu_pσpσp\sigma_p รูปแบบของสัญกรณ์รุ่นนี้มีการอธิบายไว้โดยละเอียดในบทความหรือหนังสือบางเล่มหรือไม่? หากคุณต้องการใช้สัญกรณ์นี้เพื่อเขียนแบบจำลองมีหลายวิธีในการทำสิ่งต่าง ๆ และมันจะมีประโยชน์มากกับคู่มือที่ครอบคลุมทั้งในการติดตามและอ้างอิงผู้อื่น ความแตกต่างบางประการที่ฉันพบในวิธีที่คนใช้สัญกรณ์ประเภทนี้: สิ่งใดที่คุณเรียกการแจกแจง เช่นฉันเคยเห็นฯลฯN,N,Norm,NormalN,N,Norm,Normal\mathcal{N},\text{N},\text{Norm},\text{Normal} คุณจัดการกับดัชนีอย่างไร เช่นฉันเห็น , ,ฯลฯyijyijy_{ij}yi[j]yi[j]y_{i[j]}yj|iyj|iy_{j|i} สัญลักษณ์พารามิเตอร์ใดที่มักใช้สำหรับพารามิเตอร์ ตัวอย่างเช่นเป็นเรื่องปกติที่จะใช้เป็นค่าเฉลี่ยสำหรับการแจกแจงแบบปกติ แต่จะมีการแจกแจงแบบอื่นอย่างไร (สำหรับเรื่องนี้ฉันมักจะตรวจสอบการกระจายของ …

2
วิธีเปรียบเทียบค่าเฉลี่ยของสองตัวอย่างที่มีข้อมูลตรงกับการแจกแจงแบบเอ็กซ์โพเนนเชียล
ฉันมีสองตัวอย่างของข้อมูลตัวอย่างพื้นฐานและตัวอย่างการรักษา สมมติฐานคือตัวอย่างการรักษามีค่าเฉลี่ยสูงกว่าตัวอย่างพื้นฐาน ตัวอย่างทั้งสองมีรูปแบบเลขชี้กำลัง เนื่องจากข้อมูลมีขนาดค่อนข้างใหญ่ฉันจึงมีเพียงค่าเฉลี่ยและจำนวนองค์ประกอบสำหรับแต่ละตัวอย่าง ณ เวลาที่ฉันจะทำการทดสอบ ฉันจะทดสอบสมมติฐานนั้นได้อย่างไร ฉันเดาว่ามันง่ายสุด ๆ และฉันได้พบการอ้างอิงหลายอย่างเกี่ยวกับการใช้การทดสอบ F แต่ฉันไม่แน่ใจว่าพารามิเตอร์แมป

2
ทำความเข้าใจกับคุณสมบัติการแปลงแป้นพิมพ์
วิกิพีเดียให้เห็นตัวอย่างต่อไปนี้เมื่ออธิบายคุณลักษณะคร่ำเครียด ; แต่ดูเหมือนว่าการแมปจะไม่สอดคล้องกับพจนานุกรมที่กำหนดไว้ ตัวอย่างเช่นtoควรแปลง3ตามพจนานุกรม แต่มีการเข้ารหัส1แทน คำอธิบายมีข้อผิดพลาดหรือไม่? ฟีเจอร์การแฮชทำงานอย่างไร ตำรา: John likes to watch movies. Mary likes too. John also likes to watch football games. สามารถแปลงโดยใช้พจนานุกรม {"John": 1, "likes": 2, "to": 3, "watch": 4, "movies": 5, "also": 6, "football": 7, "games": 8, "Mary": 9, "too": 10} เมทริกซ์ [[1 2 1 1 1 …

1
คำนวณความน่าจะเป็นบันทึกใหม่จากโมเดล R lm อย่างง่าย
ฉันเพียงแค่พยายามคำนวณใหม่ด้วย dnorm () ความน่าจะเป็นของล็อกจากฟังก์ชัน logLik จาก lm model (in R) ใช้งานได้ (เกือบสมบูรณ์แบบ) สำหรับข้อมูลจำนวนมาก (เช่น n = 1,000): > n <- 1000 > x <- 1:n > set.seed(1) > y <- 10 + 2*x + rnorm(n, 0, 2) > mod <- glm(y ~ x, family = gaussian) > logLik(mod) 'log Lik.' …

2
เกี่ยวกับความเป็นอิสระตามเงื่อนไขและการแสดงกราฟิก
เมื่อศึกษาการเลือกความแปรปรวนร่วมฉันเคยอ่านตัวอย่างต่อไปนี้ ด้วยความเคารพต่อรูปแบบดังต่อไปนี้: เมทริกซ์ความแปรปรวนร่วมและเมทริกซ์ความแปรปรวนร่วมผกผันมีดังต่อไปนี้ ฉันไม่เข้าใจว่าทำไมความอิสระของและจึงถูกตัดสินโดยความแปรปรวนร่วมที่นี่?yxxxyyy ตรรกะทางคณิตศาสตร์ที่เป็นรากฐานของความสัมพันธ์นี้คืออะไร? นอกจากนี้กราฟด้านซ้ายในรูปต่อไปนี้อ้างว่าสามารถจับความสัมพันธ์ที่เป็นอิสระระหว่างและ ; ทำไม?yxxxyyy

4
ผลกระทบของการอภิปรายในปัจจุบันที่มีนัยสำคัญทางสถิติ
ในช่วงไม่กี่ปีที่ผ่านมานักวิชาการหลายคนได้ยกปัญหาอันตรายของการทดสอบสมมติฐานทางวิทยาศาสตร์ขนานนามว่า "ระดับความเป็นอิสระของนักวิจัย" ซึ่งหมายความว่านักวิทยาศาสตร์มีทางเลือกมากมายให้ทำในระหว่างการวิเคราะห์ที่มีอคติต่อการค้นหาด้วย p-value <5% ทางเลือกที่คลุมเครือเหล่านี้จะยกตัวอย่างเช่นกรณีที่จะรวมซึ่งในกรณีนี้จะถูกจัดประเภทเป็นค่าผิดปกติวิ่งข้อกำหนดรูปแบบต่าง ๆ นานาจนบางสิ่งบางอย่างที่แสดงให้เห็นขึ้นไม่ได้เผยแพร่ผล null ฯลฯ (กระดาษที่จุดประกายการอภิปรายครั้งนี้ในด้านจิตวิทยาเป็นที่นี่ , ดูบทความ Slate ยอดนิยมและการติดตามการอภิปรายโดย Andrew Gelman ที่นี่และนิตยสาร Time ยังได้สัมผัสกับหัวข้อนี้ที่นี่ ) ก่อนหนึ่งคำถามเพื่อความกระจ่าง: นิตยสารThe Timeเขียน "พลัง 0.8 หมายถึงว่ามีการทดสอบสมมติฐานจริงสิบข้อมีเพียงสองข้อเท่านั้นที่จะถูกตัดออกเพราะผลกระทบของข้อมูลเหล่านั้นจะไม่ถูกหยิบขึ้นมาในข้อมูล" ผมไม่แน่ใจว่าวิธีการที่เหมาะกับนี้ในความหมายของอำนาจหน้าที่ที่ผมพบในตำราเรียนซึ่งเป็นน่าจะเป็นของการปฏิเสธโมฆะเป็นหน้าที่ของพารามิเตอร์\ด้วยต่างกันเรามีพลังที่แตกต่างกันดังนั้นฉันจึงไม่เข้าใจคำพูดที่กล่าวมาข้างต้นθθθ\thetaθθ\theta ประการที่สองความหมายของการวิจัย: ในสาขารัฐศาสตร์ / เศรษฐศาสตร์ของฉันนักวิชาการใช้ข้อมูลทั้งหมดของประเทศในปีเดียว ดังนั้นเราไม่ควรกังวลกับตัวอย่างที่เล่นซอนี่? ปัญหาของการรันการทดสอบหลายครั้ง แต่การรายงานเพียงแบบเดียวสามารถแก้ไขได้โดยข้อเท็จจริงที่ว่าคนอื่นในสาขาวิชาจะทดสอบกระดาษของคุณอีกครั้งและทำให้คุณผิดหวังทันทีที่ไม่ได้ผลลัพธ์ที่ดี? การคาดการณ์นี้นักวิชาการในสาขาของฉันมีแนวโน้มที่จะรวมrobustness checkส่วนที่พวกเขาแสดงให้เห็นว่าสเปคหลายรุ่นไม่ได้เปลี่ยนผล เพียงพอหรือไม่ Andrew Gelman และคนอื่น ๆ ยกประเด็นที่ไม่ว่าข้อมูลจะเป็นไปได้เสมอในการค้นหาและเผยแพร่ "รูปแบบ" บางอย่างที่ไม่ได้มีอยู่จริง แต่สิ่งนี้ไม่ควรกังวลเนื่องจากข้อเท็จจริงที่ว่า "รูปแบบ" เชิงประจักษ์จะต้องได้รับการสนับสนุนจากทฤษฎีและทฤษฎีการแข่งขันภายในวินัยจะมีส่วนร่วมในการอภิปราย / การแข่งขันเพื่อค้นหาว่าค่ายใดสามารถหา …

1
การตัดสินใจปรับต้นไม้ทรีตัวแปร (คุณสมบัติ) และตัวแปร (ฟีเจอร์) การปรับมาตรฐาน
ในอัลกอริทึมการเรียนรู้ของเครื่องจำนวนมากการปรับขนาด (หรือที่เรียกว่าการปรับขนาดตัวแปรการทำให้เป็นมาตรฐาน) เป็นขั้นตอนการเตรียมความพร้อมร่วมกันWikipedia - Feature Scaling - คำถามนี้ปิดคำถาม # 41704 - การปรับมาตรฐานและการปรับขนาด ฉันมีสองคำถามโดยเฉพาะเกี่ยวกับต้นไม้ตัดสินใจ: มีการใช้งานต้นไม้ตัดสินใจที่จะต้องมีการปรับขนาด? ฉันรู้สึกว่าเกณฑ์การแยกของอัลกอริทึมส่วนใหญ่ไม่ได้สัดส่วน พิจารณาตัวแปรเหล่านี้: (1) หน่วย, (2) ชั่วโมง, (3) หน่วยต่อชั่วโมง - เป็นการดีที่สุดที่จะปล่อยให้ตัวแปรทั้งสามนี้ "ตามสภาพ" เมื่อถูกป้อนเข้าสู่ต้นไม้การตัดสินใจหรือเราเจอความขัดแย้งบางประเภท เนื่องจากตัวแปร "normalized" (3) สัมพันธ์กับ (1) และ (2)? นั่นคือคุณจะโจมตีสถานการณ์นี้โดยการโยนตัวแปรทั้งสามลงในการผสมหรือคุณจะเลือกการรวมกันของทั้งสามหรือเพียงแค่ใช้คุณสมบัติ "ปกติ / มาตรฐาน" (3)?

1
การกำหนดขนาดตัวอย่างด้วยสัดส่วนและการแจกแจงทวินาม
ฉันกำลังพยายามเรียนรู้สถิติบางอย่างโดยใช้หนังสือ Biometry โดย Sokal และ Rohlf (3e) นี่คือแบบฝึกหัดในบทที่ 5 ซึ่งครอบคลุมความน่าจะเป็นการแจกแจงทวินามและการแจกแจงปัวซอง ฉันรู้ว่ามีสูตรสำหรับสร้างคำตอบสำหรับคำถามนี้: อย่างไรก็ตามสมการนี้ไม่ได้อยู่ในข้อความนี้ ฉันต้องการทราบวิธีการคำนวณขนาดตัวอย่างที่ทราบเฉพาะความน่าจะเป็นระดับความเชื่อมั่นที่ต้องการและการกระจายแบบทวินาม มีทรัพยากรใดบ้างที่ครอบคลุมหัวข้อนี้ที่ฉันสามารถชี้ได้ ฉันลองใช้ Google แล้ว แต่สิ่งที่ฉันเห็นมาแล้วต้องการข้อมูลที่ฉันไม่สามารถเข้าถึงได้ในปัญหานี้n = 4( หน้า-√- คิว√)2n=4(p−q)2 n = \frac 4 {( \sqrt{p} - \sqrt{q} )^2}

3
จะตีความอัตราส่วนอันตรายจากตัวแปรต่อเนื่อง - หน่วยของความแตกต่างได้อย่างไร?
ฉันกำลังอ่านบทความที่แสดงอัตราส่วนอันตรายสำหรับตัวแปรต่อเนื่อง แต่ฉันไม่แน่ใจว่าจะตีความค่าที่กำหนดได้อย่างไร ความเข้าใจปัจจุบันของฉันเกี่ยวกับอัตราส่วนความเป็นอันตรายคือตัวเลขแสดงถึงโอกาสที่สัมพันธ์กันของ [เหตุการณ์] ตามเงื่อนไขบางประการ เช่น: หากอัตราส่วนความเสี่ยงต่อการเสียชีวิตจากมะเร็งปอดที่ได้รับจากการสูบบุหรี่ (เหตุการณ์แบบไบนารี) เท่ากับ 2 แสดงว่าผู้สูบบุหรี่มีโอกาสเสียชีวิตเป็นสองเท่าในช่วงเวลาที่ได้รับการตรวจสอบมากกว่าผู้ไม่สูบบุหรี่ เมื่อมองถึงวิกิพีเดียการตีความตัวแปรต่อเนื่องคืออัตราส่วนความเป็นอันตรายนั้นมีผลกับหน่วยของความแตกต่าง สิ่งนี้สมเหตุสมผลสำหรับฉันสำหรับตัวแปรลำดับ (เช่นจำนวนบุหรี่ที่สูบต่อวัน) แต่ฉันไม่รู้ว่าจะใช้แนวคิดนี้กับตัวแปรต่อเนื่องได้อย่างไร (เช่นกรัมของนิโคตินที่สูบต่อวัน)

1
ฉันควรใช้ระดับความอิสระโดยประมาณของ Welch (1947) หรือ Satterthwaite's (1946) หรือไม่
ฉันสับสนเกี่ยวกับสูตรที่ถูกต้องสำหรับองศาอิสระโดยประมาณที่ใช้สำหรับการทดสอบ t ของ Welch สูตรของ Satterthwaite (1946) เป็นสูตรที่ถูกอ้างถึงมากที่สุด แต่ Welch ให้ทางเลือกในปี 1947 ฉันไม่แน่ใจว่าควรใช้สูตรไหน (หรือใช้โดยซอฟต์แวร์ทางสถิติส่วนใหญ่) สูตรของ Satterthwaite: ( s2x/ nx+ s2Y/ nY)2( s2x/nx)2/ ( nx- 1 ) + ( s2Y/nY)2/ ( nY- 1 )(sx2/nx+sY2/nY)2(sx2/nx)2/(nx-1)+(sY2/nY)2/(nY-1)\frac{\left(s_x^2/n_x +s_y^2/n_y\right)^2}{(s_x^2/n_x )^2/(n_x-1)+(s_y^2/n_y )^2/(n_y-1)} สูตรของ Welch: - 2 + ( s2x/ nx+ s2Y/ nY)2( s2x/ nx)2/ ( nx+ …

2
ANOVA สองทางเหมาะสมหรือไม่
นี่คือคำอธิบายของการศึกษาของฉัน ฉันกำลังทดลองกับพืชสามชนิด: A, B และ C พืชเหล่านี้ควรจะลดระดับน้ำตาลในเลือดสำหรับผู้ป่วยเบาหวาน ฉันต้องการตรวจสอบว่าต้นไม้สามชนิดใดมีผลต่อการลดระดับน้ำตาลในเลือดได้นานขึ้นหลังจากที่หนูได้รับหนูเพียงครั้งเดียว ทำได้โดยการวัดระดับน้ำตาลในเลือดจากหนูที่เวลา 7 คะแนน (วันที่ 1, 2, 3, 5, 7, 10 และ 14) ดังนั้นจึงมี 4 กลุ่ม (ไม่ถูกรักษารับการรักษาด้วย A ได้รับการรักษาด้วย B และรับการรักษาด้วย C) สำหรับการใช้หนู 3 กลุ่มแต่ละกลุ่ม (n = 3) เป้าหมายของฉันคือ: เพื่อตรวจสอบว่าผลกระทบของการรักษาพืชแต่ละอย่างมีนัยสำคัญเมื่อเทียบกับไม่ได้รับการรักษา เพื่อเปรียบเทียบผลของกลุ่มในแต่ละวัน เพื่อตรวจสอบว่ากลุ่มที่ได้รับการรักษามีผลยาวนานที่สุดหลังจาก 14 วัน ทางออกของฉันคือใช้ ANOVA สองทางเนื่องจากมีมากกว่า 2 กลุ่มและฉันต้องการเปรียบเทียบกลุ่มในแต่ละวันและในที่สุดก็ถึงผลกระทบโดยรวม นี่เป็นวิธีที่ถูกต้องหรือไม่? ฉันจะสามารถจัดอันดับซึ่งจะเป็นพืชที่ดีที่สุดตามด้วยอันดับที่ 2 และ …

1
อธิบายตัวกรองคาลมานในแบบจำลองพื้นที่ของรัฐ
ขั้นตอนที่เกี่ยวข้องในการใช้ตัวกรองคาลมานในแบบจำลองพื้นที่ของรัฐมีอะไรบ้าง ฉันเคยเห็นสูตรที่แตกต่างกันสองสามอย่างแต่ฉันไม่แน่ใจเกี่ยวกับรายละเอียด ตัวอย่างเช่นCowpertwaitเริ่มต้นด้วยชุดของสมการนี้: θt=Gtθt-1+wtYเสื้อ= F'เสื้อθเสื้อ+ vเสื้อYเสื้อ=Fเสื้อ'θเสื้อ+โวลต์เสื้อy_{t} = F^{'}_{t}\theta_{t}+v_{t} θเสื้อ= Gเสื้อθt - 1+ wเสื้อθเสื้อ=Gเสื้อθเสื้อ-1+Wเสื้อ\theta_{t} = G_{t}\theta_{t-1}+w_{t} โดยที่และ ,เป็นค่าประมาณที่ไม่รู้จักของเราและเป็นค่าที่สังเกตได้w t ∼ N ( 0 , W t ) θ t y tθ0∼ N( ม0, C0) , vเสื้อ∼ N( 0 , Vเสื้อ)θ0~ยังไม่มีข้อความ(ม.0,ค0),โวลต์เสื้อ~ยังไม่มีข้อความ(0,Vเสื้อ)\theta_{0} \sim N(m_{0}, C_{0}), v_{t} \sim N(0,V_{t})Wเสื้อ∼ N( 0 , Wเสื้อ)Wเสื้อ~ยังไม่มีข้อความ(0,Wเสื้อ)w_{t} \sim …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.