สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
ฉันสามารถทำให้หลงผิดและแตกต่างเพื่อสร้างชุดเครื่องเขียนได้หรือไม่?
ฉันมีชุดข้อมูลที่เพิ่มขึ้นอย่างชัดเจนเมื่อเวลาผ่านไป (อัตราแลกเปลี่ยนของสกุลเงินข้อมูลรายเดือนเกิน 20 ปี) คำถามของฉันคือ: ฉันสามารถ detrend ข้อมูลแล้วแตกต่างเพื่อให้มันหยุดนิ่งถ้าตัวเองตกอยู่ในตัวเอง ไม่ได้รับสิ่งนี้ใช่หรือไม่ และถ้าเป็นเช่นนั้นสิ่งนี้จะได้รับการพิจารณาต่างกันสองครั้งหรือน่ารังเกียจและแตกต่างเพียงครั้งเดียว

3
สหสัมพันธ์หรือสัมประสิทธิ์การตัดสินใจเกี่ยวข้องกับเปอร์เซ็นต์ของค่าที่ตกไปตามเส้นการถดถอยหรือไม่?
สหสัมพันธ์, , เป็นการวัดความสัมพันธ์เชิงเส้นระหว่างสองตัวแปร ค่าสัมประสิทธิ์ของการตัดสินใจเป็นการวัดความแปรปรวนในตัวแปรหนึ่งที่สามารถอธิบาย "การเปลี่ยนแปลง" ในอีกตัวแปรหนึ่งrrrr2r2r^2 ตัวอย่างเช่นถ้าความสัมพันธ์ระหว่างสองตัวแปรแล้ว0.64 ดังนั้น 64% ของความแปรปรวนในหนึ่งสามารถอธิบายได้ด้วยความแตกต่างในอีก ขวา?r 2 = 0.64r=0.8r=0.8r = 0.8r2=0.64r2=0.64r^2 = 0.64 คำถามของฉันสำหรับตัวอย่างที่ระบุไว้ข้อความใดข้อความหนึ่งต่อไปนี้ถูกต้อง? 64% ของค่าอยู่ในแนวเส้นถดถอย 80% ของค่าอยู่ในแนวเส้นถดถอย

1
วิธีการถดถอยตัวแปรเครื่องมือด้วยคำที่ใช้โต้ตอบใน Stata ได้อย่างไร
ฉันมีปัญหาเล็กน้อยกับไวยากรณ์ของ Stata ฉันต้องทำการถดถอยต่อไปนี้: y=ax+bz+c(xz)+ey=ax+bz+c(xz)+ey = ax + bz + c(xz) + e ที่ทั้งและจะ instrumented และระยะปฏิสัมพันธ์ใช้ค่า instrumented ของและZxxxzzzxzxzxzxxxzzz เพียงแค่สร้างค่าที่คาดการณ์สำหรับและและใช้พวกเขาเป็น regressors ทำให้เกิดข้อผิดพลาดมาตรฐานที่ไม่ถูกต้องxxxzzz แก้ไข: ฉันยังต้องทำการถดถอยที่คล้ายกันโดยมีเพียงหนึ่งในตัวแปรที่มีเครื่องมือและมีตัวแปรที่ใช้ในการโต้ตอบนี้

2
สถิติที่สมบูรณ์เพียงพอคืออะไร
ฉันมีปัญหาในการทำความเข้าใจสถิติที่เพียงพอหรือไม่ ให้เป็นสถิติที่เพียงพอT=ΣxiT=ΣxiT=\Sigma x_i ถ้ามีความน่าจะเป็น 1 สำหรับฟังก์ชันgบางตัวแสดงว่าเป็นสถิติที่สมบูรณ์เพียงพอE[g(T)]=0E[g(T)]=0E[g(T)]=0ggg แต่สิ่งนี้หมายความว่าอย่างไร ฉันเคยเห็นตัวอย่างเครื่องแบบและ Bernoulli (หน้า 6 http://amath.colorado.edu/courses/4520/2011fall/HandOuts/umvue.pdf ) แต่มันไม่ง่ายเลยฉันสับสนมากขึ้นเมื่อเห็นการรวมกลุ่ม ใครช่วยอธิบายด้วยวิธีที่ง่ายและใช้งานง่าย?

2
ทำไมการเพิ่มจำนวนคุณสมบัติจึงทำให้ประสิทธิภาพลดลง?
ฉันพยายามที่จะเพิ่มสัญชาตญาณว่าทำไมการเพิ่มจำนวนคุณสมบัติจึงสามารถลดประสิทธิภาพลงได้ ขณะนี้ฉันใช้ตัวแยกประเภท LDA ซึ่งทำงานได้ดีกว่าในฟีเจอร์บางอย่าง แต่ก็แย่ลงเมื่อดูฟีเจอร์อื่น ๆ ความแม่นยำในการจัดหมวดหมู่ของฉันดำเนินการโดยใช้ช่วงเวลา 10 เท่า x มีกรณีง่ายๆหรือไม่ที่เมื่อตัวจําแนกจะทำงานได้ดีกว่าแบบไม่มีเงื่อนไขโดยดีกว่าการได้รับ bivaraiately เพื่อให้ได้สัญชาตญาณทางกายภาพหรือเชิงพื้นที่ของสิ่งที่เกิดขึ้นในมิติที่สูงขึ้นเหล่านี้หรือไม่

1
วิธีคำนวณ“ เส้นทางสู่ทำเนียบขาว” โดยใช้ R
ฉันเพิ่งเจอการวิเคราะห์ที่ยอดเยี่ยมนี้ซึ่งทั้งน่าสนใจและสวยงามด้วยสายตา: http://www.nytimes.com/interactive/2012/11/02/us/politics/paths-to-the-white-house.html ฉันอยากรู้ว่า "เส้นทางต้นไม้" นั้นสามารถสร้างได้อย่างไรโดยใช้ R ข้อมูลและอัลกอริทึมใดที่เราจำเป็นต้องสร้างเช่นเส้นทางต้นไม้ ขอบคุณ

1
ฉันสามารถตีความการรวมคำศัพท์กำลังสองในการถดถอยโลจิสติกส์เพื่อระบุจุดเปลี่ยนได้หรือไม่?
ในการถดถอยโลจิสติกับการเชิงเส้นและสมการกำลังสองแง่เท่านั้นถ้าฉันมีค่าสัมประสิทธิ์เชิงเส้นβ1β1\beta_1และสมการกำลังสองค่าสัมประสิทธิ์β2β2\beta_2ผมสามารถพูดได้ว่ามีจุดของความน่าจะเปลี่ยนที่−β1/(2β2)−β1/(2β2)-\beta_1 / (2\beta_2) ?

1
ข้อมูลการตรวจนับเวลา
ฉันใช้ stl () ใน R เพื่อย่อยสลายข้อมูลนับเป็นแนวโน้มองค์ประกอบตามฤดูกาลและผิดปกติ ค่าแนวโน้มผลลัพธ์ไม่ได้เป็นจำนวนเต็มอีกต่อไป ฉันมีคำถามต่อไปนี้: เป็น stl () เป็นวิธีที่เหมาะสมในการ deseasonalize ข้อมูลการนับ? เนื่องจากแนวโน้มที่เกิดขึ้นไม่ได้เป็นค่า interger อีกต่อไปฉันสามารถใช้ lm () เพื่อสร้างแบบจำลองส่วนประกอบแนวโน้มได้หรือไม่

1
AIC สำหรับรุ่นที่ไม่ซ้อนกัน: normalizing ค่าคงที่
เอไอซีถูกกำหนดให้เป็นฉันC = - 2 เข้าสู่ระบบ( L ( θ ) ) + 2 Pที่θเป็นประมาณการความน่าจะเป็นสูงสุดและPเป็นมิติของพื้นที่พารามิเตอร์ สำหรับการประมาณθAIC=−2log(L(θ^))+2pAIC=−2log⁡(L(θ^))+2pAIC=-2 \log(L(\hat\theta))+2pθ^θ^\hat\thetapppθθ\thetaมักจะละเลยปัจจัยคงที่ของความหนาแน่น นี่คือปัจจัยที่ไม่ได้ขึ้นอยู่กับพารามิเตอร์เพื่อลดความซับซ้อนของโอกาส ในทางกลับกันปัจจัยนี้มีความสำคัญมากสำหรับการคำนวณ AIC เนื่องจากเมื่อเปรียบเทียบแบบจำลองที่ไม่ซ้อนกันปัจจัยนี้ไม่ธรรมดาและลำดับของ AIC ที่เกี่ยวข้องอาจแตกต่างกันหากไม่ได้พิจารณา คำถามของฉัน , เราจะต้องคำนวณรวมทั้งแง่ของความหนาแน่นเมื่อเปรียบเทียบกับรุ่นที่ไม่ซ้อนกันทั้งหมดหรือไม่log(L(θ^))log⁡(L(θ^))\log(L(\hat\theta))

6
อัลกอริธึมการเรียนรู้ของเครื่องใดดีสำหรับการประเมินว่าคุณลักษณะใดมีความสำคัญมากกว่า
ฉันมีข้อมูลที่มีคุณสมบัติขั้นต่ำที่ไม่เปลี่ยนแปลงและมีคุณสมบัติเพิ่มเติมบางอย่างที่สามารถเปลี่ยนแปลงได้และมีผลกระทบอย่างมากต่อผลลัพธ์ ชุดข้อมูลของฉันมีลักษณะดังนี้: คุณสมบัติคือ A, B, C (แสดงเสมอ) และ D, E, F, G, H (บางครั้งก็ปรากฏ) A = 10, B = 10, C = 10 outcome = 10 A = 8, B = 7, C = 8 outcome = 8.5 A = 10, B = 5, C = 11, D = 15 …

2
Random Forest: จะเป็นอย่างไรถ้าฉันรู้ว่าตัวแปรมีความสำคัญ
ความเข้าใจของฉันเป็นเพื่อนที่ป่าสุ่มสุ่มmtryตัวแปรในการสร้างแต่ละต้นไม้ตัดสินใจ ดังนั้นถ้า mtry = ncol / 3 ดังนั้นแต่ละตัวแปรจะถูกใช้โดยเฉลี่ยใน 1 ใน 3 ของต้นไม้ และต้นไม้ 2/3 จะไม่ใช้มัน แต่ถ้าฉันรู้ว่าตัวแปรตัวเดียวน่าจะสำคัญมากมันจะดีหรือไม่ที่จะเพิ่มความน่าจะเป็นที่ตัวแปรนี้จะถูกเลือกในแต่ละต้น เป็นไปได้หรือไม่ที่มีแพ็คเกจสุ่มป่าไม้ใน R

6
การวัดที่แข็งแกร่ง (ไม่ใช่พารามิเตอร์) เช่นค่าสัมประสิทธิ์การแปรผัน - IQR / ค่ามัธยฐานหรือทางเลือก?
สำหรับชุดข้อมูลที่กำหนดการแพร่กระจายมักจะคำนวณเช่นค่าเบี่ยงเบนมาตรฐานหรือเป็น IQR (ช่วงควอไทล์ระหว่าง) ในขณะที่ a standard deviationอยู่ในเกณฑ์ปกติ (คะแนน z, ฯลฯ ) และสามารถนำมาใช้เพื่อเปรียบเทียบการแพร่กระจายจากประชากรสองกลุ่มที่แตกต่างกันนี่ไม่ใช่กรณีที่มี IQR เนื่องจากตัวอย่างจากประชากรสองคนที่แตกต่างกันอาจมีค่าในระดับที่แตกต่างกันสองระดับ e.g. Pop A: 100, 67, 89, 75, 120, ... Pop B: 19, 22, 43, 8, 12, ... สิ่งที่ฉันตามมาคือการวัดที่แข็งแกร่ง (ไม่ใช่พารามิเตอร์) ที่ฉันสามารถใช้เพื่อเปรียบเทียบการเปลี่ยนแปลงภายในประชากรที่แตกต่างกัน ทางเลือกที่ 1: IQR / Median- นี้จะเป็นโดยการเปรียบเทียบกับค่าสัมประสิทธิ์ของการเปลี่ยนแปลงคือการหมู่}σμσμ \frac{\sigma}{\mu} ตัวเลือก 2: Range / IQR คำถาม: มาตรการใดที่มีความหมายมากขึ้นสำหรับการเปรียบเทียบความแปรปรวนระหว่างประชากร? และถ้าเป็นตัวเลือกที่ 1 …

2
ระยะห่างระหว่างส่วนผสม Gaussian จำกัด และ Gaussian จำกัด คืออะไร
สมมติว่าฉันมีส่วนผสมของ Gaussians จำนวนมากที่มีน้ำหนัก, ค่าเฉลี่ย, และค่าเบี่ยงเบนมาตรฐาน วิธีการไม่เท่ากัน แน่นอนว่าค่าเฉลี่ยและส่วนเบี่ยงเบนมาตรฐานของการผสมสามารถคำนวณได้เนื่องจากช่วงเวลานั้นมีค่าเฉลี่ยถ่วงน้ำหนักของช่วงเวลาของส่วนประกอบ ส่วนผสมไม่ได้เป็นการกระจายตัวแบบธรรมดา แต่ไกลแค่ไหนจากปกติ? ภาพด้านบนแสดงความหนาแน่นของความน่าจะเป็นที่เป็นไปได้สำหรับส่วนผสมแบบเกาส์พร้อมส่วนประกอบหมายถึงคั่นด้วยส่วนเบี่ยงเบนมาตรฐาน (ของส่วนประกอบ) และแบบเกาส์เดียวที่มีค่าเฉลี่ยและความแปรปรวนเหมือนกัน222 111 แรงจูงใจ:ฉันไม่เห็นด้วยกับคนขี้เกียจบางคนเกี่ยวกับการแจกแจงจริงบางอย่างที่พวกเขาไม่ได้วัดซึ่งพวกเขาคิดว่าใกล้เคียงกับปกติเพราะจะดี ฉันก็ขี้เกียจเหมือนกัน ฉันไม่ต้องการวัดการกระจายตัวเช่นกัน ฉันต้องการที่จะบอกว่าสมมติฐานของพวกเขานั้นไม่สอดคล้องกันเพราะพวกเขาบอกว่าการผสมผสานอัน จำกัด ของ Gaussians ด้วยวิธีการที่แตกต่างกันคือ Gaussian ซึ่งไม่ถูกต้อง ฉันไม่อยากจะบอกว่ารูปร่างของหางนั้นผิดเพราะสิ่งเหล่านี้เป็นเพียงการประมาณซึ่งควรจะมีความแม่นยำพอสมควรภายในค่าเบี่ยงเบนมาตรฐานของค่าเฉลี่ย ฉันอยากจะบอกว่าถ้าส่วนประกอบมีการประมาณค่าปกติจากการแจกแจงปกติแล้วส่วนผสมไม่ได้และฉันต้องการที่จะหาปริมาณนี้ L1L1L^12221/41/41/4

3
มีรุ่นตัวอย่างหลายตัวหรือเป็นทางเลือกในการทดสอบ Kolmogorov-Smirnov หรือไม่
ฉันกำลังเปรียบเทียบการกระจายขนาดของต้นไม้ในหกคู่แปลงที่หนึ่งแปลงได้รับการรักษาและอื่น ๆ ควบคุม โดยใช้การทดสอบ Kolmogorov-Smirnov คู่ของแปลงแต่ละผมพบว่าช่วงที่จะ0.75มีวิธีการที่เหมาะสมในการจัดการกับข้อมูลซ้ำทั้งหมดหรือไม่เช่นการทดสอบหลายตัวอย่างของการทดสอบ KS หรือมีการทดสอบติดตามที่เหมาะสมหรือไม่? หรือฉันควรสรุปบางอย่างเช่น "การกระจายขนาดแตกต่างกันอย่างมีนัยสำคัญ ) ใน 2 คู่ของแปลงและเล็กน้อย ( ) ในหนึ่งคู่ของแปลง"ppp0.00037070.00037070.00037070.750.750.75(p&lt;0.05(p&lt;0.05(p < 0.05p=0.59p=0.59p = 0.59

1
การถดถอยเชิงเส้นพร้อมมาตรการซ้ำใน R
ฉันไม่สามารถหาวิธีการถดถอยเชิงเส้นใน R ในการออกแบบการวัดซ้ำ ในคำถามก่อนหน้านี้ (ยังไม่ได้ตอบ) แนะนำให้ฉันไม่ใช้lmแต่ควรใช้โมเดลผสม ฉันใช้lmวิธีต่อไปนี้: lm.velocity_vs_Velocity_response &lt;- lm(Velocity_response~Velocity*Subject, data=mydata) (รายละเอียดเพิ่มเติมเกี่ยวกับชุดข้อมูลสามารถดูได้ที่ลิงค์ด้านบน) อย่างไรก็ตามฉันไม่สามารถค้นหาบนอินเทอร์เน็ตตัวอย่างด้วยรหัส R ที่แสดงวิธีการวิเคราะห์การถดถอยเชิงเส้น สิ่งที่ฉันต้องการก็คือพล็อตของข้อมูลที่มีเส้นที่พอดีกับข้อมูลและในทางกลับกันค่าพร้อมกับค่า p สำหรับการทดสอบความสำคัญสำหรับแบบจำลองR2R2R^2 มีใครบ้างที่สามารถให้คำแนะนำได้บ้าง ตัวอย่างรหัส R สามารถช่วยได้มาก แก้ไข ตามคำแนะนำที่ฉันได้รับจนถึงขณะนี้โซลูชันของฉันในการวิเคราะห์ข้อมูลของฉันเพื่อที่จะเข้าใจว่ามีความสัมพันธ์เชิงเส้นตรงระหว่างตัวแปรสองตัว Velocity_response (ที่ได้จากแบบสอบถาม) และ Velocity (ที่ได้มาจากประสิทธิภาพ) ควรเป็นดังนี้: library(nlme) summary(lme(Velocity_response ~ Velocity*Subject, data=scrd, random= ~1|Subject)) ผลลัพธ์ของการสรุปให้สิ่งนี้: &gt; summary(lme(Velocity_response ~ Velocity*Subject, data=scrd, random= ~1|Subject)) Linear mixed-effects model fit by …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.