สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
ความแตกต่างระหว่างการควบคุมและการรักษาควรเป็นแบบอย่างชัดเจนหรือโดยปริยาย?
รับการตั้งค่าการทดลองต่อไปนี้: ตัวอย่างจำนวนมากนำมาจากหัวเรื่องและแต่ละตัวอย่างได้รับการปฏิบัติหลายวิธี (รวมถึงการรักษาควบคุม) สิ่งที่น่าสนใจที่สุดคือความแตกต่างระหว่างการควบคุมและการรักษาแต่ละครั้ง ฉันนึกถึงโมเดลง่าย ๆ สองแบบสำหรับข้อมูลนี้ ด้วยตัวอย่างรักษารักษา 0 ถูกควบคุมให้เป็นข้อมูลเป็นพื้นฐานสำหรับตัวอย่าง ,มีความแตกต่างในการรักษาญโมเดลแรกดูทั้งการควบคุมและความแตกต่าง:ผมiiJjjYฉันเจYijY_{ij}γผมγi\gamma_iผมiiδJδj\delta_jJjj Yฉันเจ=γผม+δJ+εฉันเจYij=γi+δj+ϵij Y_{ij}=\gamma_i+\delta_j+\epsilon_{ij} δ0= 0δ0=0 \delta_0=0 ในขณะที่รุ่นที่สองเท่านั้นที่ดูความแตกต่าง หากเราทำการล่วงหน้าล่วงหน้า ดังนั้น dฉันเจdijd_{ij}dฉันเจ=Yฉันเจ-Yฉัน0dij=Yij−Yi0 d_{ij}=Y_{ij}-Y_{i0} dฉันเจ=δJ+εฉันเจdij=δj+εij d_{ij}=\delta_j+\varepsilon_{ij} คำถามของฉันคืออะไรความแตกต่างพื้นฐานระหว่างการตั้งค่าทั้งสองนี้คืออะไร โดยเฉพาะอย่างยิ่งหากระดับนั้นไร้ความหมายในตัวเองและมีเพียงความแตกต่างเท่านั้นที่เป็นโมเดลแรกที่ทำมากเกินไปและอาจต่ำกว่าความเป็นจริง?

1
คำถามเกี่ยวกับสมมติฐานที่เป็นอิสระสำหรับการทดสอบ ANOVA, t-test และ non-parametric
ฉันเป็นสามเณรในสถิติและฉันมีความสับสนเกี่ยวกับสมมติฐานของความเป็นอิสระสำหรับการทดสอบทางสถิติ ฉันค้นหาอินเทอร์เน็ตและข้อมูลบางอย่างบอกว่าสำหรับการทดสอบ t การสังเกตในสองกลุ่มควรเป็นอิสระ (นั่นคือการวัดในตัวอย่างที่ 1 และการวัดในตัวอย่างที่ 2 ควรแตกต่างกัน) ข้อมูลอื่นบอกว่าการสังเกตทั้งหมด (แม้จะอยู่ในกลุ่มเดียวกัน) ควรเป็นอิสระ อันไหนที่ถูก? สมมติฐานความเป็นอิสระของ ANOVA และสมมติฐานความเป็นอิสระสำหรับการทดสอบ t-test เหมือนกันหรือไม่? การทดสอบที่ไม่ใช่พารามิเตอร์เช่นการทดสอบระดับวิลคอกซันที่ลงนามต้องมีการทดสอบเพื่อให้เป็นไปตามสมมติฐานที่กำหนด

1
การอนุมานในตัวแบบเชิงเส้นที่มีความต่างกันแบบเชิงเงื่อนไข
สมมติว่าฉันสังเกตเวกเตอร์ตัวแปรอิสระ x⃗ x→\vec{x} และ Z⃗ z→\vec{z} และตัวแปรตาม Yyy. ฉันต้องการให้พอดีกับรูปแบบของแบบฟอร์ม: Y=x⃗ ⊤β1→+ σก.(Z⃗ ⊤β2→) ϵ,y=x→⊤β1→+σg(z→⊤β2→)ϵ,y = \vec{x}^{\top}\vec{\beta_1} + \sigma g\left(\vec{z}^{\top} \vec{\beta_2}\right) \epsilon, ที่ไหน ก.gg เป็นฟังก์ชันที่มีค่าเป็นบวกสองเท่า σσ\sigma เป็นพารามิเตอร์การปรับขนาดที่ไม่รู้จักและ εϵ\epsilon เป็นหน่วยสุ่มแปรปรวนแบบเกาส์ค่าศูนย์ค่าเฉลี่ย (สันนิษฐานว่าเป็นอิสระจาก x⃗ x→\vec{x} และ Z⃗ z→\vec{z}) นี่คือการตั้งค่าการทดสอบของ heteroskedasticity ของ Koenker (อย่างน้อยก็เท่าที่ฉันเข้าใจ) ฉันมี nnn จากการสังเกตของ x⃗ ,Z⃗ x→,z→\vec{x}, \vec{z} และ Yyyและฉันต้องการประเมิน β1→β1→\vec{\beta_1} และ …

2
การแจกจ่ายนี้มีชื่อหรือไม่? หรือกระบวนการสุ่มที่สามารถสร้างได้คืออะไร?
การกระจายแบบไม่ต่อเนื่องพร้อมฟังก์ชันมวล p(x;k)=k(x+k)(x+k−1),x=1,2,…p(x;k)=k(x+k)(x+k−1),x=1,2,…p(x;k) = \frac{k}{(x+k)(x+k-1)},\quad x = 1,2,\ldots เกิดขึ้นในหน้า 9 ของเอกสารนี้ สำหรับเป็นการกระจายของ Yule-Simon ที่มีแต่ฉันไม่พบตัวอย่างอื่นk=1k=1k=1ρ=1ρ=1\rho=1 มันมีชื่อหรือไม่? ปรากฏในบริบทอื่นหรือไม่ มีกระบวนการสุ่มอย่างง่ายที่อาจสร้างมันขึ้นมา?

2
การถดถอยโลจิสติกแบบถ่วงน้ำหนัก
ฉันกำลังดูปัญหาการถดถอยโลจิสติกน้อย ("ปกติ" และ "เงื่อนไข") โดยหลักการแล้วฉันต้องการให้น้ำหนักแต่ละกรณีอินพุตเพื่อให้ glm มุ่งเน้นไปที่การทำนายกรณีที่มีน้ำหนักสูงกว่าอย่างถูกต้องด้วยค่าใช้จ่ายที่อาจเป็นไปได้ในการจำแนกกรณีที่มีน้ำหนักต่ำกว่า แน่นอนว่าสิ่งนี้เคยทำมาก่อน ใครช่วยชี้ให้ฉันดูวรรณกรรมที่เกี่ยวข้อง (หรืออาจแนะนำให้ฟังก์ชั่นความน่าจะเป็นที่แก้ไขแล้ว) ขอบคุณ!
9 logistic 

2
คุณคำนวณข้อผิดพลาดมาตรฐานสำหรับการแปลง MLE ได้อย่างไร?
ฉันจำเป็นต้องอนุมานเกี่ยวกับพารามิเตอร์ที่เป็นบวก พีpp. เพื่อชดเชยความเป็นบวกที่ฉันได้ชดใช้ให้P = ประสบการณ์( q)p=exp⁡(q)p=\exp(q). การใช้รูทีน MLE ฉันคำนวณการประมาณค่าจุดแล้วค้นหาQqq. คุณสมบัติความแปรปรวนของ MLE ให้ค่าประมาณโดยตรงสำหรับฉันพีppแต่ฉันไม่แน่ใจว่าจะคำนวณได้อย่างไร พีpp. ขอบคุณล่วงหน้าสำหรับคำแนะนำหรือการอ้างอิง

2
ระยะทางจะต้องเป็น "ตัวชี้วัด" เพื่อให้การจัดกลุ่มแบบลำดับชั้นมีความถูกต้องหรือไม่
ให้เราบอกว่าเรากำหนดระยะทางซึ่งไม่ใช่ตัวชี้วัดระหว่างรายการ N ขึ้นอยู่กับระยะทางนี้เราก็ใช้การจัดกลุ่มตามลำดับชั้น Agglomerative เราสามารถใช้อัลกอริทึมที่รู้จักกัน (ลิงค์เดี่ยว / สูงสุด / avaerage ฯลฯ ) เพื่อให้ได้ผลลัพธ์ที่มีความหมายได้หรือไม่ หรือวางแตกต่างกันสิ่งที่เป็นปัญหากับการใช้พวกเขาหากระยะทางไม่ได้เป็นตัวชี้วัด?

2
การแจกแจงความเบี่ยงเบนมาตรฐาน
คำถามนี้ตอบคำถามการแจกแจงแบบปกติ แต่ฉันสงสัยว่าสิ่งที่รู้เกี่ยวกับการแจกแจงค่าเบี่ยงเบนมาตรฐานของตัวอย่างขนาดn ที่ดึงมาจากการแจกแจงโดยพลการ โดยเฉพาะค่าเบี่ยงเบนมาตรฐานของค่าเบี่ยงเบนมาตรฐานคืออะไร? สำหรับการกระจายปกติ, SD ของ SD เป็น{2n}} นี่เป็นความจริงโดยประมาณสำหรับการแจกแจงโดยพลการในฐานะ ?σ2 n√σ2n\sigma \over{\sqrt{2n}}n → ∞n→∞n \rightarrow \infty

2
การทำความเข้าใจผลการถดถอยของสันเขา
ฉันใหม่เพื่อการถดถอยสัน เมื่อฉันใช้การถดถอยเชิงเส้นริดจ์ฉันได้ผลลัพธ์ดังต่อไปนี้: >myridge = lm.ridge(y ~ ma + sa + lka + cb + ltb , temp, lamda = seq(0,0.1,0.001)) > select(myridge) modified HKB estimator is 0.5010689 modified L-W estimator is 0.3718668 smallest value of GCV at 0 คำถาม: ตกลงเพื่อรับค่าศูนย์GCVหรือไม่ มันหมายความว่าอะไรกันแน่? มีปัญหากับแบบจำลองของฉันหรือไม่? ฉันจะหา R2R2R^2ค่าของmyridge?

2
อะไรคือการอ้างอิง / คำแนะนำที่ดีสำหรับการเรียนรู้ Emacs Speaks Statistics (with R)?
ฉันใช้ R มาหลายปีแล้ว แต่ฉันใช้ GUI อย่าง Tinn-R, JGR และ R-Studio ล่าสุด แม้ว่าฉันจะชอบอินเตอร์เฟสของ R-Studio แต่ฉันรู้สึกว่าสำหรับโปรแกรมที่ยาวขึ้นโดยมีกราฟิกไม่กี่ตัว / ไม่มีเลยฉันสามารถเขียนโค้ดได้อย่างมีประสิทธิภาพมากขึ้นโดยใช้ประโยชน์จากทางลัดที่นำเสนอโดยโปรแกรมแก้ไขข้อความพื้นฐานเช่น Emacs ฉันติดตั้ง Emacs และปลั๊กอิน ESS ทุกอย่างทำงานได้อย่างถูกต้องและฉันได้ทำการทดสอบโค้ดบางอย่าง แต่ฉันมีเวลายากที่จะชินกับมันและฉันไม่พบคู่มืออ้างอิงที่เหมาะสม การค้นหาของ Google ส่งคืนเว็บไซต์เก่า ๆ จำนวนไม่มากที่มีบทแนะนำซึ่งเน้นที่การติดตั้งและกำหนดค่าปลั๊กอินเป็นหลักและคู่มือในเว็บไซต์อย่างเป็นทางการนั้นค่อนข้างหนาแน่นเกินไปสำหรับฉัน ฉันกำลังมองหาการแนะนำสั้น ๆ (โดยเฉพาะกับภาพหน้าจอและรายการปุ่มลัด) ออกแบบมาสำหรับคนที่คุ้นเคยกับ R แต่ไม่ใช่ Emacs การอ้างอิงหรือเคล็ดลับอื่น ๆ ในการเริ่มต้นจะได้รับการชื่นชมอย่างมาก
9 r  software 

3
Boxplot สำหรับการกระจายหลาย ๆ
ฉันต้องวาดการแจกแจง 20 ครั้งในกราฟเดียวใน R และมันก็ดูไม่ดี (รก) กับฉันด้วย boxplot ปกติ (20 กล่อง) แม้กับ boxwex = 0.3 คุณช่วยแนะนำฉันได้ไหมว่าฉันจะพล็อตบ็อกซ์พล็อตใน R สำหรับการแจกแจง 20 แบบด้วยจุดสำหรับค่ามัธยฐานและแค่บรรทัดแทนที่จะเป็นกล่องได้อย่างไรเช่นด้านล่าง โปรดแนะนำฉันด้วยหากมีวิธีการ R ที่สร้าง boxplots ที่ดีโดยเฉพาะถ้าคุณต้องการแสดงการแจกแจงหลาย ๆ อย่างในกราฟเดียว -----0----
9 r  boxplot 

2
ในการตั้งค่าใดที่คุณคาดว่ารุ่นที่พบโดย LARS จะแตกต่างจากรุ่นที่พบโดยการค้นหาแบบละเอียด
ข้อมูลเพิ่มเติมอีกเล็กน้อย สมมติว่า คุณทราบมาก่อนแล้วว่ามีตัวแปรให้เลือกจำนวนเท่าใดและคุณได้ตั้งค่าการลงโทษที่ซับซ้อนในขั้นตอน LARS เช่นมีตัวแปรหลายตัวที่มีค่าสัมประสิทธิ์ไม่ใช่ 0 ค่าใช้จ่ายในการคำนวณไม่ใช่ปัญหา (จำนวนตัวแปรทั้งหมดมีค่าน้อยพูด 50) ตัวแปรทั้งหมด (y, x) นั้นต่อเนื่อง แบบจำลอง LARS ในการตั้งค่าแบบใด (เช่น OLS พอดีของตัวแปรที่มีค่าสัมประสิทธิ์ไม่ใช่ศูนย์ใน LARS พอดี) จะแตกต่างจากแบบจำลองที่มีค่าสัมประสิทธิ์จำนวนเท่ากัน แต่พบได้จากการค้นหาแบบละเอียด (a la regsubsets ()) แก้ไข: ฉันใช้ 50 ตัวแปรและ 250 การสังเกตด้วยสัมประสิทธิ์จริงที่ดึงมาจาก Gaussian มาตรฐานยกเว้น 10 ตัวแปรที่มีค่าสัมประสิทธิ์ 'ของจริง' เป็น 0 (และคุณลักษณะทั้งหมดที่มีความสัมพันธ์กันอย่างมาก) เห็นได้ชัดว่าการตั้งค่าเหล่านี้ไม่ดีเนื่องจากความแตกต่างระหว่างชุดตัวแปรที่เลือกสองชุดคือนาที นี่เป็นคำถามเกี่ยวกับประเภทของการกำหนดค่าข้อมูลที่ควรจำลองเพื่อให้ได้ความแตกต่างมากที่สุด

1
วิธีการเลือกจำนวนของการแยกใน rpart ()?
ฉันได้ใช้rpart.controlสำหรับการminsplit=2และได้ผลลัพธ์ที่ต่อไปนี้จากrpart()ฟังก์ชั่น เพื่อหลีกเลี่ยงการโอเวอร์โหลดข้อมูลฉันต้องใช้แยก 3 หรือแยก 7 หรือไม่ ฉันไม่ควรใช้ splits 7 ใช่ไหม โปรดแจ้งให้เราทราบ ตัวแปรที่ใช้จริงในการสร้างต้นไม้: [1] ct_a ct_b usr_a Root node error: 23205/60 = 386.75 n= 60 CP nsplit rel error xerror xstd 1 0.615208 0 1.000000 1.05013 0.189409 2 0.181446 1 0.384792 0.54650 0.084423 3 0.044878 2 0.203346 0.31439 0.063681 4 0.027653 …
9 r  cart  rpart 

4
การจัดกลุ่มด้วยการวัดระยะทางแบบอสมมาตร
คุณจัดกลุ่มคุณลักษณะด้วยการวัดระยะทางแบบอสมมาตรอย่างไร ตัวอย่างเช่นสมมติว่าคุณกำลังจัดกลุ่มชุดข้อมูลที่มีวันของสัปดาห์เป็นคุณลักษณะ - ระยะทางตั้งแต่วันจันทร์ถึงวันศุกร์ไม่เหมือนกับระยะทางตั้งแต่วันศุกร์ถึงวันจันทร์ คุณจะรวมสิ่งนี้ลงในการวัดระยะทางของอัลกอริทึมการจัดกลุ่มได้อย่างไร

1
วิธีการรวมสองตัวแปรที่อยู่ในระดับที่แตกต่างกันอย่างไร
หากฉันมีสองตัวแปรตามการแจกแจงสองแบบที่แตกต่างกันและมีส่วนเบี่ยงเบนมาตรฐานที่แตกต่างกัน ... ฉันต้องแปลงสองตัวแปรอย่างไรเพื่อที่เมื่อรวมผลลัพธ์ทั้งสองจะไม่ "ขับเคลื่อน" โดยความผันผวนที่มากขึ้น ตัวอย่างเช่น ... ตัวแปร A นั้นมีความผันผวนน้อยกว่าตัวแปร B (อยู่ในช่วงตั้งแต่ 0 ถึง 3000) และตัวแปร B ไปๆมาๆ 300 ถึง 350 หากเพิ่มตัวแปรทั้งสองเข้าด้วยกันผลลัพธ์จะถูกขับเคลื่อนโดย A

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.