สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
การแก้ไขสำหรับการเปรียบเทียบหลายรายการในภายในวิชา / วัดซ้ำ ANOVA; อนุรักษ์นิยมมากเกินไป?
มันทำให้ฉันรู้สึกว่าการแก้ไขที่มีอยู่สำหรับการเปรียบเทียบหลายครั้งในบริบทของมาตรการ ANOVA ซ้ำ ๆ นั้นเป็นเรื่องที่อนุรักษ์เกินไป เป็นกรณีนี้จริงหรือ ถ้าเป็นเช่นนั้นฉันจะใช้การอ้างอิงอะไรบ้างเพื่อสนับสนุนประเด็นนี้และเรียนรู้เพิ่มเติม

1
ฉันจะคำนวณการประมาณความหนาแน่นหลังจากก่อนและโอกาสได้อย่างไร
ฉันพยายามที่จะเข้าใจวิธีการใช้ทฤษฎีบทของเบย์ในการคำนวณหลัง แต่กำลังติดอยู่กับวิธีการคำนวณเช่นในกรณีต่อไปนี้มันไม่ชัดเจนสำหรับฉันที่จะใช้ผลิตภัณฑ์ของความน่าจะเป็นก่อนและจากนั้นคำนวณ หลัง: สำหรับตัวอย่างนี้ฉันสนใจในการคำนวณความน่าจะเป็นหลังของและฉันใช้มาตรฐานปกติก่อนหน้านี้ในแต่ฉันอยากรู้ วิธีการคำนวณหลังจากก่อนหน้านี้ที่แสดงโดยห่วงโซ่ MCMC ดังนั้นฉันจะใช้ 1,000 ตัวอย่างเป็นจุดเริ่มต้นของฉันμμ\muμμ\mu p(μ)∼N(μ=0,σ=1)p(μ)∼N(μ=0,σ=1)p(\mu)\sim N(\mu = 0, \sigma = 1)μμ\mu ตัวอย่าง 1,000 จากก่อนหน้า set.seed(0) prior.mu <- 0 prior.sigma <- 1 prior.samples <- sort(rnorm(1000, prior.mu, prior.sigma)) ทำการสังเกตบางอย่าง: observations <- c(0.4, 0.5, 0.8, 0.1) และคำนวณความน่าจะเป็นเช่น :p(y|μ,σ)p(y|μ,σ)p(y | \mu, \sigma) likelihood <- prod(dnorm(observations, mean(prior.samplse), sd(prior.samples))) สิ่งที่ฉันไม่ค่อยเข้าใจคือ: เมื่อใด …

5
ตรวจจับชิ้นส่วนของเพลง
หวังว่านี่จะไม่เป็นอัตนัยเกินไป ... ฉันกำลังมองหาทิศทางในความพยายามที่จะตรวจสอบ "ส่วน" ที่แตกต่างกันของเพลงโดยไม่คำนึงถึงสไตล์ดนตรี ฉันไม่มีความคิดว่าจะดูที่ไหน แต่เชื่อมั่นในพลังของเว็บไซต์ StackOverflow อื่น ๆ ฉันคิดว่ามีคนที่นี่สามารถช่วยชี้ทิศทาง ในแง่พื้นฐานที่สุดคนหนึ่งสามารถตรวจจับส่วนต่าง ๆ ของเพลงโดยการจัดกลุ่มรูปแบบการทำซ้ำอย่างต่อเนื่องและเรียกพวกเขาว่า "ส่วน" นั่นอาจไม่ยากนัก - คอมพิวเตอร์ตรวจจับการซ้ำซ้อนของสัญญาณได้ดีแม้ว่าจะมีการเปลี่ยนแปลงเล็กน้อย แต่มันยากเมื่อ "ส่วน" ทับซ้อนกันเหมือนที่พวกเขาทำในเพลงส่วนใหญ่ เป็นการยากที่จะพูดว่าเพลงประเภทไหนที่เหมาะสมที่สุดสำหรับระบบประเภทนี้ ฉันเดาว่าเพลงไพเราะสไตล์คลาสสิคส่วนใหญ่จะเป็นกระบวนการที่ง่ายที่สุด ความคิดใดที่จะมองหาการวิจัยในพื้นที่นี้?

1
การแพร่กระจายของข้อผิดพลาดโดยใช้ชุดลำดับที่ 2 ของ Taylor
ฉันกำลังอ่านข้อความ "สถิติคณิตศาสตร์และการวิเคราะห์ข้อมูล" โดย John Rice เรามีความกังวลกับการใกล้เคียงกับค่าที่คาดหวังและความแปรปรวนของตัวแปรสุ่มYเราสามารถที่จะคำนวณมูลค่าที่คาดหวังและความแปรปรวนของตัวแปรสุ่มและเรารู้ว่าความสัมพันธ์Y = กรัม (X) ดังนั้นจึงเป็นไปได้ที่จะใกล้เคียงกับค่าที่คาดหวังและความแปรปรวนของYโดยใช้การขยายตัวของซีรีส์เทย์เลอร์กรัมเกี่ยวกับ\ mu_XYYYXXXY=g(X)Y=g(X)Y = g(X)YYYgggμXμX\mu_X บนหน้า 162 เขารายการสมการ 3 ค่าที่คาดหวังของYYYโดยใช้การขยายอนุกรมลำดับที่ 1 ของเทย์เลอร์ มันเป็น: μY≈g(μX)μY≈g(μX)\mu_Y \approx g(\mu_X)mu_X) นี้จะเรียกว่าต่อมาในคำถามของฉันเป็นE(Y1)E(Y1)E(Y_1)(Y_1) ความแปรปรวนของYYYโดยใช้การขยายอนุกรมลำดับที่ 1 ของเทย์เลอร์ มันเป็น: σ2Y≈σ2X(g′(μX))2σY2≈σX2(g′(μX))2\sigma_Y^2 \approx \sigma_X^2 (g'(\mu_X))^2 2 นี้จะเรียกว่าต่อมาในคำถามของฉันเป็นVar(Y1)Var(Y1)Var(Y_1)(Y_1) ค่าที่คาดหวังของYYYโดยใช้การขยายอนุกรมลำดับที่ 2 ของเทย์เลอร์ มันเป็นμY≈g(μX)+12σ2Xg′′(μX)μY≈g(μX)+12σX2g″(μX)\mu_Y \approx g(\mu_X) + \frac12 \sigma_X^2 g''(\mu_X)mu_X) นี้จะเรียกว่าต่อมาในคำถามของฉันเป็นE(Y2)E(Y2)E(Y_2)(Y_2) โปรดทราบว่ามีการแสดงออกที่แตกต่างกันสองประการสำหรับYYYเพราะเราใช้คำสั่งที่แตกต่างกันสองคำในการขยายซีรี่ส์เทย์เลอร์ สมการที่ 1 และ …

3
แนวทางการค้นหาความรู้ใหม่ในข้อมูล
ฉันพล็อตเรื่องเพื่อชี้ให้ตัวเองหรือคนอื่น โดยปกติแล้วคำถามจะเริ่มต้นกระบวนการนี้และบ่อยครั้งที่บุคคลนั้นขอความหวังเพื่อหาคำตอบเฉพาะ ฉันจะเรียนรู้สิ่งที่น่าสนใจเกี่ยวกับข้อมูลในแบบที่มีอคติน้อยลงได้อย่างไร ตอนนี้ฉันทำตามวิธีนี้อย่างคร่าวๆ: สถิติสรุป Stripchart พล็อตกระจาย อาจทำซ้ำกับชุดย่อยของข้อมูลที่น่าสนใจ แต่นั่นดูเหมือนจะไม่เป็นระเบียบหรือเป็นวิทยาศาสตร์เพียงพอ มีแนวทางหรือขั้นตอนการปฏิบัติตามที่เปิดเผยข้อมูลเกี่ยวกับข้อมูลที่ฉันไม่คิดว่าจะถามหรือไม่? ฉันจะรู้ได้อย่างไรว่าได้ทำการวิเคราะห์อย่างเพียงพอแล้ว

2
จะทดสอบว่าสัมประสิทธิ์การถดถอยนั้นมีการควบคุมโดยตัวแปรการจัดกลุ่มหรือไม่?
ฉันได้ทำการถดถอยกับกลุ่มตัวอย่างสองกลุ่มโดยใช้ตัวแปรตัวควบคุม (พูดเพศ) ฉันกำลังทำการทดสอบอย่างง่ายสำหรับเอฟเฟกต์การตรวจสอบโดยการตรวจสอบว่าความสำคัญของการถดถอยนั้นหายไปในหนึ่งชุดขณะที่ยังคงอยู่ในอีกชุดหนึ่งหรือไม่ Q1: วิธีการข้างต้นถูกต้องใช่ไหม Q2: ระดับความมั่นใจในการวิจัยของฉันตั้งไว้ที่ 95% สำหรับกลุ่มหนึ่งการถดถอยมีนัยสำคัญที่. 000 สำหรับคนอื่น ๆ มันมีความสำคัญที่ 0.038 ดังนั้นฉันเชื่อว่าฉันต้องยอมรับการถดถอยทั้งสองอย่างมีนัยสำคัญและไม่มีผลการกลั่นกรอง โดยการยอมรับการถดถอยมีความสำคัญในขณะที่มันพิสูจน์แล้วว่าไม่ได้อยู่ที่ 0.01 น. ฉันทำให้เกิดข้อผิดพลาด Type I (ยอมรับอาร์กิวเมนต์ที่ผิดพลาด)?

1
การใส่ข้อมูลหลายครั้งสำหรับข้อมูลการนับที่ขาดหายไปในอนุกรมเวลาจากการศึกษาแบบพาเนล
ฉันกำลังพยายามที่จะจัดการกับปัญหาที่เกี่ยวข้องกับการใส่ข้อมูลที่หายไปจากการศึกษาข้อมูลแบบพาเนล (ไม่แน่ใจว่าฉันกำลังใช้ 'การศึกษาข้อมูลแบบพาเนล' อย่างถูกต้อง - อย่างที่ฉันได้เรียนรู้ในวันนี้) ถึงปี 2009 ตลอดทั้งเดือนชายและหญิงสำหรับ 8 อำเภอที่แตกต่างกันและสำหรับกลุ่มอายุ 4 ขวบ ชื่อไฟล์มีลักษณะดังนี้: District Gender Year Month AgeGroup TotalDeaths Northern Male 2006 11 01-4 0 Northern Male 2006 11 05-14 1 Northern Male 2006 11 15+ 83 Northern Male 2006 12 0 3 Northern Male 2006 12 01-4 0 …

2
จับคู่ ANOVA หรือมาตรการผสมซ้ำแล้วซ้ำอีก?
ฉันถูกขอให้วิเคราะห์ข้อมูลบางอย่างจากการทดลองทางคลินิกโดยหาวิธีสองวิธีในการวัดความดันโลหิต ฉันมีข้อมูลจาก 50 วิชาโดยแต่ละรายการมีค่าระหว่าง 2 และ 57 มาตรการโดยใช้แต่ละวิธี ฉันสงสัยว่าจะทำอย่างไรดีที่สุด เห็นได้ชัดว่าฉันต้องการวิธีการแก้ปัญหาที่จะคำนึงถึงความจริงที่ว่าการวัดความดันโลหิตถูกจับคู่ (สองวิธีที่วัดพร้อมกัน) และเวลาที่แปรเปลี่ยนโควาเรียต (มีจำนวนการสังเกตต่อผู้ป่วยที่แตกต่างกัน ความแปรปรวนของผู้ป่วย ฉันกำลังคิดที่จะหยุดเรื่องรองเท้านี้เป็นมาตรการ ANOVA ซ้ำ ๆ แต่ฉันคิดว่ามันอาจจะต้องเป็นแบบจำลองผสม ฉันขอขอบคุณคำแนะนำที่เป็นประโยชน์ที่คุณสามารถให้ได้ ฉันเป็นมือใหม่ R ที่สมบูรณ์ แต่ตื่นเต้นมากที่จะพัฒนาทักษะและฉันมีประสบการณ์ปานกลางใน Stata ดังนั้นก็สามารถถอยกลับไปได้เสมอ
9 r  anova  mixed-model  stata 

2
เหตุใด R จึงวางแผนส่วนที่เหลือเป็นมาตรฐานเทียบกับปริมาณเชิงทฤษฎีในพล็อต QQ
ใน R ทำไมการตั้งค่าเริ่มต้นของการqqplot(linear model)ใช้ค่ามาตรฐานในแกน y? เหตุใด R จึงไม่ใช้ส่วนที่เหลือ "ปกติ"

2
จะสร้างแบบจำลองผลรวมของตัวแปรสุ่มของเบอร์นูลลี่สำหรับข้อมูลที่ต้องพึ่งพาได้อย่างไร
ฉันมีคำถามเกือบเหมือนกัน: ฉันจะสร้างแบบจำลองผลรวมของตัวแปรสุ่มของเบอร์นูลลี่ได้อย่างมีประสิทธิภาพได้อย่างไร แต่การตั้งค่าแตกต่างกันมาก: S=Σi = 1 , NXผมS=∑i=1,NXiS=\sum_{i=1,N}{X_i}, P(Xผม= 1 ) =พีผมP(Xi=1)=piP(X_{i}=1)=p_i, ยังไม่มีข้อความNN~ 20 พีผมpip_i~ 0.1 เรามีข้อมูลสำหรับผลลัพธ์ของตัวแปรสุ่มของ Bernoulli: Xฉัน, JXi,jX_{i,j} , SJ=Σi = 1 , NXฉัน, JSj=∑i=1,NXi,jS_j=\sum_{i=1,N}{X_{i,j}} ถ้าเราประเมิน พีผมpip_i ด้วยการประเมินความเป็นไปได้สูงสุด (และรับ พี^ML Eผมp^iMLE\hat p^{MLE}_i) ปรากฎว่า P^{ S= 3 } (พี^ML Eผม)P^{S=3}(p^iMLE)\hat P\{S=3\} (\hat p^{MLE}_i) มีขนาดใหญ่กว่าเกณฑ์อื่นที่คาดไว้: P^{ S= 3 } (พี^ML …

1
พหุนามถดถอยพหุคูณหลายตัวแปร?
ในฐานะที่เป็นวิธีการสร้างแรงจูงใจคำถามพิจารณาปัญหา regresison ที่เราพยายามที่จะประเมินโดยใช้ตัวแปรสังเกตYYY{ a , b }{a,ข}\{ a, b \} เมื่อทำการรวมหลายตัวแปรพหุนามกลับมาอีกครั้งฉันพยายามค้นหาการหาค่าพารามิเตอร์ที่เหมาะสมที่สุดของฟังก์ชัน ฉ( y) =ค1a +ค2b +ค3a2+ค4a b +ค5ข2+ ⋯ฉ(Y)=ค1a+ค2ข+ค3a2+ค4aข+ค5ข2+⋯f(y)=c_{1}a+c_{2}b+c_{3}a^{2}+c_{4}ab+c_{5}b^{2}+\cdots ซึ่งเหมาะสมกับข้อมูลในแง่ที่น้อยที่สุด อย่างไรก็ตามปัญหาเกี่ยวกับสิ่งนี้คือพารามิเตอร์ไม่ได้เป็นอิสระ มีวิธีการถดถอยในเวกเตอร์ "พื้นฐาน" ที่แตกต่างกันซึ่งเป็นมุมฉากหรือไม่? การทำเช่นนี้มีข้อดีที่ชัดเจนมากมายคผมคผมc_i 1) สัมประสิทธิ์ไม่มีความสัมพันธ์กันอีกต่อไป 2) ค่าของนั้นไม่ขึ้นอยู่กับระดับของสัมประสิทธิ์อีกต่อไป 3) สิ่งนี้ยังมีข้อได้เปรียบในการคำนวณของความสามารถในการวางเงื่อนไขการสั่งซื้อที่สูงขึ้นสำหรับ coarser แต่ยังคงการประมาณที่ถูกต้องกับข้อมูลคผมคผมc_i สิ่งนี้สามารถทำได้อย่างง่ายดายในกรณีตัวแปรเดี่ยวโดยใช้พหุนาม orthogonal โดยใช้ชุดการศึกษาที่ดีเช่น Chebyshev Polynomials อย่างไรก็ตามมันก็ไม่ชัดเจน (สำหรับฉัน) วิธีการพูดคุยเรื่องนี้! มันเกิดขึ้นกับฉันที่ฉันสามารถพหุนาม chebyshev polynomials เป็นคู่ แต่ฉันไม่แน่ใจว่าเป็นสิ่งที่ถูกต้องทางคณิตศาสตร์ที่ต้องทำ ความช่วยเหลือของคุณได้รับการชื่นชม

3
อัตราการยอมรับของ Metropolis-Hastings พร้อมการกระจายผู้สมัครที่สม่ำเสมอ
เมื่อรันอัลกอริทึม Metropolis-Hastings ด้วยการแจกแจงผู้สมัครที่สม่ำเสมอเหตุผลในการมีอัตราการยอมรับประมาณ 20% คืออะไร? ความคิดของฉันคือ: เมื่อค้นพบค่าพารามิเตอร์จริง (หรือใกล้เคียงกับจริง) แล้วไม่มีการตั้งค่าพารามิเตอร์ของตัวเลือกใหม่จากช่วงเวลาเดียวกันที่เหมือนกันจะเพิ่มค่าของฟังก์ชันความน่าจะเป็น ดังนั้นยิ่งฉันวิ่งซ้ำมากเท่าไหร่อัตราการยอมรับก็ยิ่งต่ำลงเท่านั้น ฉันผิดในความคิดนี้ที่ไหน ขอบคุณมาก! นี่คือภาพประกอบการคำนวณของฉัน: A c c e p t a n c e _ r a t e = exp{ l (θค| Y) + บันทึก( p (θค) ) - [ l (θ* * * *| Y) + บันทึก( p (θ* …


1
จำเป็นต้องมีการนับศูนย์สำหรับการทดสอบอัตราส่วนความน่าจะเป็นของโมเดลปัวซอง / loglinear หรือไม่
หากมี 0 อยู่ในตารางฉุกเฉินและเรากำลังจัดวางแบบจำลอง Poisson / loglinear ที่ซ้อนกัน (ใช้glmฟังก์ชั่นR ) สำหรับการทดสอบอัตราส่วนความน่าจะเป็นเราจำเป็นต้องปรับข้อมูลก่อนที่จะติดตั้งแบบจำลอง glm (เช่นเพิ่ม 1/2 ลงในทั้งหมด จำนวน) เห็นได้ชัดว่าบางพารามิเตอร์ไม่สามารถประมาณได้หากไม่มีการปรับ แต่การปรับ / ขาดการปรับมีผลต่อการทดสอบ LR อย่างไร

1
การสุ่มตัวอย่างเพื่อกำหนดน้ำหนัก / RIM คืออะไร
ฉันได้พบกับวิธีการสุ่มตัวอย่างที่เรียกว่า "การสุ่มตัวอย่างน้ำหนัก / ความน่าจะเป็น" แต่ฉันไม่มีความคิดที่ดีว่าวิธีการสำรวจเหล่านี้เกี่ยวข้องกับอะไร การอ้างอิงอะไรในวรรณกรรมครอบคลุมหัวข้อนี้

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.