สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

4
ความไม่เท่าเทียมกันของสามเหลี่ยมเป็นจริงสำหรับระยะทางตามความสัมพันธ์เหล่านี้หรือไม่?
สำหรับการจัดกลุ่มแบบลำดับชั้นฉันมักจะเห็น "ตัวชี้วัด" สองตัวต่อไปนี้ (พวกเขาพูดไม่ตรงกัน) สำหรับการวัดระยะห่างระหว่างตัวแปรสุ่มสองตัวและ : \ newcommand {\ Cor} {\ mathrm {Cor}} \ start {align} d_1 (X, Y) และ = 1- | \ คอร์ (X, Y) | \\ d_2 (X, Y) และ = 1 - (\ คอร์ (X, Y)) ^ 2 \ end {} จัด ทำอย่างใดอย่างหนึ่ง ตอบสนองความไม่เท่าเทียมกันของสามเหลี่ยมหรือไม่? ถ้าเป็นเช่นนั้นฉันควรจะพิสูจน์ได้อย่างไรนอกจากการคำนวณแบบ bruteforce? …

2
เราจะหาค่าเฉลี่ยของผลรวมของตัวแปรตามได้อย่างไร?
ฉันรู้ว่าค่าเฉลี่ยของผลรวมของตัวแปรอิสระคือผลรวมของค่าเฉลี่ยของตัวแปรอิสระแต่ละตัว สิ่งนี้นำไปใช้กับตัวแปรตามเช่นกันหรือไม่?

1
โอกาสที่จะได้รับผลกระทบเล็กน้อยจากผลผลิตกิ๊บส์
ฉันทำซ้ำตั้งแต่เริ่มต้นผลลัพธ์ในหัวข้อ 4.2.1 จาก โอกาสที่จะได้รับผลกระทบเล็กน้อยจากผลผลิตกิ๊บส์ Siddhartha Chib วารสารสมาคมสถิติอเมริกัน 90, No. 432. (Dec. , 1995), pp. 1313-1321 มันเป็นส่วนผสมของโมเดล normals พร้อมด้วยหมายเลขรู้จัก k≥1k≥1k\geq 1f(x∣w,μ,σ2)=∏i=1n∑j=1kN(xi∣μj,σ2j).(∗)f(x∣w,μ,σ2)=∏i=1n∑j=1kN(xi∣μj,σj2).(∗) f(x\mid w,\mu,\sigma^2) =\prod_{i=1}^n\sum_{j=1}^k \mathrm{N}(x_i\mid\mu_j,\sigma_j^2) \, . \qquad (*) ตัวอย่าง Gibbs สำหรับรุ่นนี้นำมาใช้โดยใช้เทคนิคการเพิ่มข้อมูลของแทนเนอร์และหว่อง ชุดของตัวแปรการจัดสรรสมมติว่ามีค่าและเราระบุว่าและf (x_i \ mid z \ หมู่, \ Sigma ^ 2) = \ mathrm {N} (x_i \ กลาง \ …

1
การแตกความลาดเอียงสำหรับเคสจากโมเดลเอฟเฟกต์ผสม (lme4)
ฉันต้องการแยกความลาดชันสำหรับแต่ละคนในรูปแบบเอฟเฟกต์ผสมตามที่ระบุไว้ในวรรคต่อไปนี้ แบบจำลองเอฟเฟกต์แบบผสมถูกนำมาใช้เพื่ออธิบายลักษณะการเปลี่ยนแปลงของแต่ละบุคคลในมาตรการสรุปทางปัญญาซึ่งรวมถึงข้อกำหนดสำหรับอายุเพศและปีการศึกษาซึ่งเป็นผลกระทบคงที่ (Laird and Ware, 1982; Wilson et al., 2000, 2002c) ... ส่วนที่เหลือเงื่อนไขความลาดชันการลดลงของความรู้ความเข้าใจของแต่ละบุคคลถูกดึงออกมาจากแบบจำลองผสมหลังจากปรับผลกระทบของอายุเพศและการศึกษา จากนั้นนำมาใช้เป็นข้อมูลเชิงปริมาณสำหรับการวิเคราะห์ความสัมพันธ์ทางพันธุกรรม การประมาณการเหล่านี้เปรียบเสมือนความแตกต่างระหว่างความชันของแต่ละบุคคลกับความชันที่คาดการณ์ของบุคคลที่มีอายุเพศและระดับการศึกษาเดียวกัน De Jager, PL, Shulman, JM, Chibnik, LB, Keenan, BT, Raj, T. , Wilson, RS, et al. (2012) จีโนมกว้างสแกนทั่วไปสายพันธุ์ที่มีผลต่ออัตราการที่เกี่ยวข้องกับอายุการลดลงของความรู้ความเข้าใจ ชีววิทยาของวัย, 33 (5), 1017.e1–1017.e15 ฉันดูที่การใช้coefฟังก์ชั่นเพื่อดึงค่าสัมประสิทธิ์สำหรับแต่ละบุคคล แต่ฉันไม่แน่ใจว่านี่เป็นวิธีการที่ถูกต้องที่จะใช้หรือไม่ ใครสามารถให้คำแนะนำเกี่ยวกับวิธีการทำเช่นนี้? #example R code library(lme4) attach(sleepstudy) fml <- lmer(Reaction ~ Days …
13 r  mixed-model 

1
ตัวกำหนดข้อมูลฟิชเชอร์
(ฉันโพสต์คำถามที่คล้ายกันในmath.se ) ในเรขาคณิตข้อมูล, ดีเทอร์มิแนนต์ของเมทริกซ์ข้อมูลฟิชเชอร์เป็นรูปแบบปริมาตรตามธรรมชาติบนท่อร่วมทางสถิติดังนั้นจึงมีการตีความทางเรขาคณิตที่ดี ความจริงที่ว่ามันปรากฏในคำจำกัดความของเจฟฟรีย์ก่อนหน้านั้นเชื่อมโยงกับความไม่แปรเปลี่ยนของมันภายใต้การซ่อมแซมซ้ำซึ่งเป็นสมบัติทางเรขาคณิต แต่อะไรคือปัจจัยในสถิติ ? มันวัดสิ่งที่มีความหมายหรือไม่? (ตัวอย่างเช่นฉันจะบอกว่าถ้ามันเป็นศูนย์แล้วพารามิเตอร์ไม่ได้เป็นอิสระสิ่งนี้จะไปอีกหรือไม่) นอกจากนี้มีรูปแบบปิดใด ๆ ในการคำนวณอย่างน้อยในบางกรณี "ง่าย"

2
การคำนวณ
ผมได้อ่านเกี่ยวกับการคำนวณR2R2R^2ค่าในรูปแบบผสมและหลังจากที่ได้อ่านคำถามที่พบบ่อย R-sig โพสต์อื่น ๆ ในฟอรั่มนี้ (ฉันจะเชื่อมโยงไม่กี่ แต่ฉันไม่ได้มีชื่อเสียงพอ) และอีกหลายอ้างอิงอื่น ๆ ผมเข้าใจว่าการใช้R2R2R^2ค่าในบริบทของตัวแบบผสมนั้นซับซ้อน อย่างไรก็ตามเมื่อเร็ว ๆ นี้ฉันได้พบกับสองเอกสารด้านล่าง ในขณะที่วิธีการเหล่านี้ดูมีแนวโน้ม (สำหรับฉัน) ฉันไม่ใช่นักสถิติและฉันก็สงสัยว่าถ้ามีใครอีกคนที่มีข้อมูลเชิงลึกเกี่ยวกับวิธีที่พวกเขาเสนอและวิธีเปรียบเทียบกับวิธีอื่น ๆ ที่ได้รับการเสนอ Nakagawa, Shinichi และ Holger Schielzeth "วิธีการทั่วไปและง่าย ๆ สำหรับรับ R2 จากโมเดลเอฟเฟกต์การผสมเชิงเส้นทั่วไป" วิธีการทางนิเวศวิทยาและวิวัฒนาการ 4.2 (2013): 133-142 จอห์นสันพอลซีดี "การขยาย R2GLMM ของ Nakagawa & Schielzeth ไปเป็นแบบจำลองเชิงลาดแบบสุ่ม" วิธีการในนิเวศวิทยาและวิวัฒนาการ (2014) วิธีนี้ยังสามารถนำมาใช้โดยใช้ฟังก์ชั่น r.squaredGLMM ในแพ็คเกจ MuMInซึ่งให้คำอธิบายวิธีการดังต่อไปนี้ R2R2R^2R2R2R^2RGLMM(m)2=σ2fσ2f+∑(σ2l)+σ2e+σ2dRGLMM(m)2=σf2σf2+∑(σl2)+σe2+σd2R_{GLMM}(m)^2 = \frac{σ_f^2}{σ_f^2 + …

3
autocorrelation ที่เหลือเมื่อเทียบกับตัวแปรที่ล้าหลัง
เมื่อการสร้างแบบจำลองอนุกรมเวลาหนึ่งมีความเป็นไปได้ที่จะ (1) แบบจำลองโครงสร้างความสัมพันธ์ของข้อผิดพลาดเช่นกระบวนการ AR (1) กระบวนการ (2) รวมถึงตัวแปรขึ้นอยู่กับ lagged เป็นตัวแปรอธิบาย (ทางด้านขวามือ) ฉันเข้าใจว่าบางครั้งพวกเขาก็มีเหตุผลมากมายที่ต้องไปเพื่อ (2) อย่างไรก็ตามวิธีการมีเหตุผลอะไรที่จะทำอย่างใดอย่างหนึ่ง (1) หรือ (2) หรือทั้งสองอย่าง?

2
การจับภาพฤดูกาลในการถดถอยหลายครั้งสำหรับข้อมูลรายวัน
ฉันมีข้อมูลยอดขายรายวันสำหรับผลิตภัณฑ์ซึ่งเป็นไปตามฤดูกาล ฉันต้องการบันทึกฤดูกาลตามโมเดลการถดถอย ฉันได้อ่านว่าหากคุณมีข้อมูลรายไตรมาสหรือรายเดือนในกรณีนี้คุณสามารถสร้างตัวแปรจำลอง 3 และ 11 ตัวตามลำดับ - แต่ฉันสามารถจัดการกับข้อมูลรายวันได้หรือไม่ ฉันมีข้อมูลรายวันสามปี ตัวแปรอิสระคือจุดราคาแฟล็กการส่งเสริมการขาย (ใช่ / ไม่ใช่) และอุณหภูมิ ตัวแปรตามคือยอดขายของผลิตภัณฑ์นั้น ฉันไม่ได้กำลังมองหาโมเดลอนุกรมเวลาเนื่องจากฉันใช้โมเดลการถดถอยหลายแบบ

2
เราจะวาด ROC curve สำหรับต้นไม้ตัดสินใจได้อย่างไร?
โดยปกติเราไม่สามารถวาดเส้นโค้ง ROC สำหรับตัวแยกประเภทแยกเช่นต้นไม้ตัดสินใจ ฉันถูกไหม? มีวิธีใดในการวาดเส้นโค้ง ROC สำหรับ Dtrees หรือไม่?
13 roc  cart 

1
การบูรณาการ CDF เชิงประจักษ์
ฉันมีการกระจายเชิงประจักษ์ ) ฉันคำนวณมันดังนี้G ( x )G(x)G(x) x <- seq(0, 1000, 0.1) g <- ecdf(var1) G <- g(x) ฉันแสดงว่าคือhคือ pdf ในขณะที่Gคือ cdfh ( x ) = dG / dxh(x)=dG/dxh(x) = dG/dxชั่วโมงhhGGG ตอนนี้ฉันต้องการแก้สมการสำหรับการรวมสูงสุด (พูด, ), ดังนั้นค่าคาดหวังของxคือkบางอันaaaxxxkkk นั่นคือการบูรณาการจากไปขผมควรจะมี∫ x H ( x ) d x = k ฉันต้องการที่จะแก้ปัญหาสำหรับข000bbb∫xh(x)dx=k∫xh(x)dx=k\int xh(x)dx = kbbb เมื่อรวมส่วนต่าง ๆ …
13 r  integral  ecdf 

1
ทำความเข้าใจกับการทดสอบแบบไคสแควร์และการแจกแจงแบบไคสแควร์
ฉันพยายามเข้าใจตรรกะหลังการทดสอบไคสแควร์ การทดสอบไคสแควร์เป็น{} จะถูกเปรียบเทียบกับการแจกแจงแบบ Chi-squared เพื่อค้นหา p.value เพื่อปฏิเสธหรือไม่สมมุติฐานว่าง : การสังเกตมาจากการแจกแจงที่เราเคยสร้างค่าที่เราคาดหวัง ตัวอย่างเช่นเราสามารถทดสอบความน่าจะเป็นที่จะได้รับจากตามที่เราคาดหวัง ดังนั้นเราจึงพลิก 100 ครั้งและหาและ1เราต้องการเปรียบเทียบการค้นพบของเรากับสิ่งที่คาดหวัง ( ) เราสามารถใช้การแจกแจงทวินามได้ด้วย แต่มันก็ไม่ใช่ประเด็นของคำถาม ... คำถามคือ: χ2H0pnH1-nH100⋅pχ2=∑(obs−exp)2expχ2=∑(obs−exp)2exp\chi ^2 = \sum \frac{(obs-exp)^2}{exp}χ2χ2\chi ^2H0H0H_0headpppnHnHn_H Heads1−nH1−nH1-n_H tails100⋅p100⋅p100 \cdot p คุณช่วยอธิบายได้ไหมว่าทำไมภายใต้สมมติฐานว่างตามหลังการแจกแจงแบบไคสแควร์?∑(obs−exp)2exp∑(obs−exp)2exp\sum \frac{(obs-exp)^2}{exp} สิ่งที่ฉันรู้เกี่ยวกับการกระจายตัวไคสแควร์คือการกระจายตัวไคสแควร์ของดีกรีคือผลรวมของการแจกแจงปกติกำลังสองมาตรฐานkkkkkkk

2
การประมาณควอไทล์แบบออนไลน์โดยไม่ต้องเก็บการสังเกต
ฉันจำเป็นต้องคำนวณควอไทล์ (Q1, มัธยฐานและ Q3) แบบเรียลไทม์กับชุดข้อมูลขนาดใหญ่โดยไม่ต้องจัดเก็บข้อสังเกต ฉันลองใช้อัลกอริธึม P square (Jain / Chlamtac) ครั้งแรก แต่ฉันไม่พอใจกับมัน (ใช้ซีพียูมากเกินไปและไม่เชื่อในความแม่นยำของชุดข้อมูลของฉันอย่างน้อย) ตอนนี้ฉันใช้อัลกอริธึม FAME ( Feldman / Shavitt ) สำหรับการประมาณค่ามัธยฐานในขณะเดินทางและพยายามหาขั้นตอนวิธีในการคำนวณ Q1 และ Q3 ด้วย: M = Q1 = Q3 = first data value step =step_Q1 = step_Q3 = a small value for each new data : # update …

4
โมเดลการถดถอยที่มีตัวแปรตอบกลับคือวันของปีที่มีเหตุการณ์รายปี (ปกติ) เกิดขึ้น
ในกรณีนี้ฉันหมายถึงวันที่ทะเลสาบค้าง วันที่ "ice-on" นี้เกิดขึ้นปีละครั้ง แต่บางครั้งก็ไม่เกิดขึ้นเลย (หากฤดูหนาวอบอุ่น) ดังนั้นในหนึ่งปีทะเลสาบอาจหยุดในวันที่ 20 (มกราคม 20) และอีกปีหนึ่งก็อาจไม่หยุดเลย เป้าหมายคือการหาไดรเวอร์ของวันที่น้ำแข็ง ตัวทำนายจะเป็นสิ่งต่าง ๆ เช่นอุณหภูมิอากาศฤดูใบไม้ร่วง / ฤดูหนาวในแต่ละปี ปีอาจเป็นเครื่องทำนายแนวโน้มเชิงเส้นในระยะยาว 1) จำนวนเต็ม "วันของปี" เป็นตัวแปรตอบกลับที่สมเหตุสมผล (ถ้าไม่ใช่คืออะไร) 2) เราควรจัดการกับปีที่ทะเลสาบไม่เคยแข็งตัวอย่างไร? แก้ไข: ฉันไม่รู้ว่ามารยาทคืออะไรที่นี่ แต่ฉันคิดว่าฉันโพสต์ผลลัพธ์ของคำแนะนำที่ฉันได้รับ นี่คือกระดาษที่เปิดการเข้าถึง ฉันได้รับผลตอบรับที่ดีเกี่ยวกับวิธีการใช้ขอบคุณ @pedrofigueira และ @cboettig แน่นอนข้อผิดพลาดเป็นของฉันเอง

2
คุณสังเกตหัว k จากการโยน n เหรียญยุติธรรมหรือไม่
ฉันถูกถามคำถามนี้ด้วยในการสัมภาษณ์ มีคำตอบ "ถูกต้อง" หรือไม่?( n , k ) = ( 400 , 220 )(n,k)=(400,220)(n, k) = (400, 220) สมมติกลมๆมี IID และความน่าจะเป็นของหัวคือpการกระจายจำนวนหัวในการทอย 400 ครั้งควรใกล้เคียงกับ Normal (200, 10 ^ 2) ดังนั้น 220 หัวเป็น 2 ส่วนเบี่ยงเบนมาตรฐานจากค่าเฉลี่ย ความน่าจะเป็นของการสังเกตผลลัพธ์ดังกล่าว (เช่น 2 SDs เพิ่มเติมจากค่าเฉลี่ยในทิศทางใดทิศทางหนึ่ง) น้อยกว่า 5% เล็กน้อยp = 0.5p=0.5p=0.5 ผู้สัมภาษณ์บอกฉันว่า "ถ้าฉันสังเกตอะไร> = 2 SDs จากค่าเฉลี่ยฉันสรุปได้ว่ามีบางอย่างเกิดขึ้นฉันจะพนันกับเหรียญที่ยุติธรรม" นั่นคือเหตุผล …

4
คุณจะทำอย่างไรเมื่อไม่มีจุดศอกสำหรับการจัดกลุ่ม kmeans
ฉันได้เรียนรู้ว่าเมื่อเลือกกลุ่มจำนวนมากคุณควรมองหาจุดศอกสำหรับค่าต่าง ๆ ของเคฉันได้พล็อตค่าของ ininss สำหรับค่า k จาก 1 ถึง 10 แต่ฉันไม่เห็นชัดเจน ข้อศอก. คุณทำอะไรในกรณีเช่นนี้?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.