สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
ขั้นตอนที่แนะนำสำหรับการวิเคราะห์ปัจจัยเกี่ยวกับข้อมูลแบบแบ่งขั้วด้วย R
ฉันต้องเรียกใช้การวิเคราะห์ปัจจัยบนชุดข้อมูลที่สร้างขึ้นจากตัวแปร dichotomous (0 = ใช่, 1 = ไม่) และฉันไม่รู้ว่าฉันกำลังอยู่ในเส้นทางที่ถูกต้องหรือไม่ ใช้ฉันจะสร้างเมทริกซ์ความสัมพันธ์ซึ่งผมทำงานtetrachoric() fa(data,factors=1)ผลลัพธ์ค่อนข้างใกล้เคียงกับผลลัพธ์ที่ฉันได้รับเมื่อใช้MixFactorแต่ไม่เหมือนกัน ไม่เป็นไรหรือคุณจะแนะนำขั้นตอนอื่นหรือไม่ เหตุใดจึงfa()ทำงานและfactanal()สร้างข้อผิดพลาด ( Fehler in solve.default(cv) : System ist für den Rechner singulär: reziproke Konditionszahl = 4.22612e-18)

2
Markowitz Portfolio หมายถึงการปรับความแปรปรวนใน R
ฉันมีตลาดแลกเปลี่ยนเงินตราต่างประเทศรวม 5 ตลาดเกิดใหม่ซึ่งฉันคาดการณ์ผลตอบแทนในช่วงเวลาเดียวในอนาคต (1 ปี) ฉันต้องการสร้าง Markowitz หมายถึงผลต่างที่ได้รับการปรับปรุงให้ดีที่สุดในซีรีส์ 5 โดยใช้ผลต่างทางประวัติศาสตร์และค่าแปรปรวนร่วม (1) และผลตอบแทนที่คาดหวังของฉันเอง R มีวิธี / ไลบรารี (ง่าย) ในการทำสิ่งนี้หรือไม่? นอกจากนี้ฉันจะคำนวณ (1) มีฟังก์ชันในตัวได้อย่างไร เพื่อประโยชน์ของสกุลเงินของฉันคือ USDTRY, USDZAR, USDRUB, USDHUF และ USDPLN
10 r 

3
เทคนิคการติดตามแบบสุ่ม
ฉันได้พบกับเทคนิคการติดตามแบบสุ่มต่อไปนี้ใน M. Seeger“ การอัปเดตระดับต่ำสำหรับการสลายตัวของ Cholesky” University of California ที่ Berkeley, Tech ตัวแทน, 2007 TR( A ) = E[ xTA x ]TR⁡(A)=E[xTAx]\operatorname{tr}(\mathbf{A}) = {E[\mathbf{x}^T \mathbf{A} \mathbf{x}]} ที่x ∼N( 0 , ฉัน )x~ยังไม่มีข้อความ(0,ผม)\mathbf{x} \sim N(\mathbf{0},\mathbf{I}) ) ในฐานะคนที่ไม่มีพื้นฐานคณิตศาสตร์ลึกฉันสงสัยว่าความสำเร็จนี้จะเกิดขึ้นได้อย่างไร ยิ่งกว่านั้นเราจะตีความxTA xxTAx\mathbf{x}^T \mathbf{A} \mathbf{x}อย่างไรตัวอย่างเช่นในเชิงเรขาคณิต? ฉันควรดูเพื่อทำความเข้าใจความหมายของการนำผลิตภัณฑ์ภายในของเวกเตอร์และค่าของช่วงได้อย่างไร ทำไมค่าเฉลี่ยเท่ากับผลรวมของค่าลักษณะเฉพาะ นอกจากคุณสมบัติทางทฤษฎีแล้วความสำคัญของการปฏิบัติคืออะไร ฉันได้เขียนโค้ด MATLAB เพื่อดูว่ามันใช้งานได้หรือไม่ #% tr(A) == E[x'Ax], x …

2
ข้อมูลระยะยาว: อนุกรมเวลาการวัดซ้ำหรืออย่างอื่น
ในภาษาอังกฤษธรรมดา: ฉันมีการถดถอยหลายครั้งหรือแบบจำลอง ANOVA แต่ตัวแปรการตอบสนองสำหรับแต่ละบุคคลเป็นฟังก์ชัน curvilinear ของเวลา ฉันจะบอกได้อย่างไรว่าตัวแปรด้านขวามือใดที่รับผิดชอบความแตกต่างที่สำคัญในรูปร่างหรือการชดเชยแนวดิ่งของเส้นโค้ง นี่เป็นปัญหาอนุกรมเวลาปัญหาซ้ำหลายครั้งหรืออย่างอื่นทั้งหมดหรือไม่ อะไรคือแนวปฏิบัติที่ดีที่สุดสำหรับการวิเคราะห์ข้อมูลดังกล่าว (ควรใช้Rแต่ฉันเปิดให้ใช้ซอฟต์แวร์อื่น) ในแง่ที่แม่นยำยิ่งขึ้น: สมมุติว่าฉันมีแบบจำลองแต่เป็นชุดของข้อมูลที่รวบรวมจากจุดkบุคคลเดียวกันที่เวลาหลายจุดtซึ่งถูกบันทึกเป็นตัวแปรตัวเลข การพล็อตข้อมูลแสดงให้เห็นว่าสำหรับแต่ละy_ {ijkt}เป็นฟังก์ชันกำลังสองหรือวัฏจักรของเวลาซึ่งออฟเซ็ตแนวตั้งรูปร่างหรือความถี่ (ในกรณีวัฏจักร) อาจขึ้นอยู่กับ covariates โควาเรียตไม่เปลี่ยนแปลงตลอดเวลา - กล่าวคือบุคคลมีน้ำหนักตัวคงที่หรือกลุ่มการรักษาในช่วงระยะเวลาของการรวบรวมข้อมูลy ฉันj k k t y ฉันj k tYฉันเจk= β0+ β1xผม+ β2xJ+ β3xผมxJ+ ϵkyijk=β0+β1xi+β2xj+β3xixj+ϵky_{ijk} = \beta_0 + \beta_1 x_i + \beta_2 x_j + \beta_3 x_i x_j + \epsilon_kYฉันเจkyijky_{ijk}kkkเสื้อttYผม j k tyijkty_{ijkt} …


1
ใช้ kurtosis เพื่อประเมินความสำคัญขององค์ประกอบจากการวิเคราะห์องค์ประกอบอิสระ
ในค่าลักษณะเฉพาะ PCA กำหนดลำดับของส่วนประกอบ ใน ICA ฉันใช้ kurtosis เพื่อรับการสั่งซื้อ มีวิธีการใดบ้างที่ได้รับการยอมรับในการประเมินจำนวน (เนื่องจากฉันมีคำสั่งซื้อ) ของส่วนประกอบที่แตกต่างจากความรู้ก่อนหน้าเกี่ยวกับสัญญาณ

1
วิธีจัดการกับตัวแปรดัมมี่ที่ถูกตัดในรูปแบบเอฟเฟกต์คงที่?
ฉันใช้รูปแบบคงมีผลสำหรับข้อมูลที่แผงของฉัน (9 ปี 1000 + OBS) ตั้งแต่การทดสอบ Hausman ของฉันแสดงให้เห็นค่า(PR&gt;เมื่อฉันเพิ่มตัวแปรดัมมี่สำหรับอุตสาหกรรมที่ บริษัท ของฉันรวมไว้พวกเขาจะถูกละไว้เสมอ ฉันรู้ว่ามีความแตกต่างใหญ่เมื่อมันมาถึง DV (ดัชนีการเปิดเผย) ในกลุ่มอุตสาหกรรมที่แตกต่างกัน แต่ฉันไม่สามารถรับมันในแบบจำลองของฉันเมื่อใช้ Stata(Pr&gt;χ2)&lt;0.05(Pr&gt;χ2)&lt;0.05(Pr>\chi^2)<0.05 ข้อเสนอแนะวิธีการแก้ปัญหานี้? และทำไมพวกเขามองข้าม?

3
สถิติการศึกษาของเด็กในประเทศต่าง ๆ ?
ฉันสนใจที่จะรู้ว่าเด็ก ๆ เรียนรู้สถิติในระดับใดในประเทศต่างๆทั่วโลก คุณช่วยแนะนำข้อมูล / ลิงค์ที่ทำให้เข้าใจว่าเกิดอะไรขึ้นในเรื่องนี้? ฉันจะเริ่ม อิสราเอล: นักเรียนที่เรียนคณิตศาสตร์ขั้นสูงมากขึ้น - น้อยลงหมายถึง sd, ฮิสโตแกรม, การแจกแจงแบบปกติ, ความน่าจะเป็นพื้นฐานมาก
10 dataset  teaching 

4
การทำเอฟเฟกต์ของการเปลี่ยนแปลงความกว้างเคอร์เนลใน R
ฉันมีข้อมูลบางอย่างใน R เก็บไว้ในรายการ คิด d &lt;- c(1,2,3,4) แม้ว่านี่จะไม่ใช่ข้อมูลของฉัน ถ้าฉันแล้วป้อนคำสั่ง plot(density(d, kernel="gaussian", width=1)) จากนั้นฉันจะได้รับการประมาณความหนาแน่นของความน่าจะเป็นเคอร์เนลที่เคอร์เนลเป็นมาตรฐานปกติ ถ้าฉันแทนที่ 1 ด้วยตัวเลขอื่น ๆ แน่นอนว่าภาพเปลี่ยนไป สิ่งที่ฉันต้องการจะทำคือการสร้างวิดีโอหรือภาพเคลื่อนไหวที่แต่ละเฟรมเป็นพล็อต แต่แบนด์วิดท์ของเคอร์เนลแตกต่างกันไปในแต่ละเฟรมดังนั้นจึงแสดงผลของการเปลี่ยนแบนด์วิดท์ ฉันจะทำสิ่งนี้ได้อย่างไร (ฉันขอโทษถ้านี่ไม่ใช่สถานที่ที่เหมาะสมที่จะถามคำถามเกี่ยวกับอาร์)

1
การทดสอบอย่างมีนัยสำคัญทำให้รู้สึกถึงการเปรียบเทียบกลุ่มแบบสุ่มที่พื้นฐานหรือไม่
เอกสาร Randomized Controll Trial (RCT) จำนวนมากรายงานการทดสอบที่สำคัญเกี่ยวกับพารามิเตอร์พื้นฐานหลังจาก / ก่อนการสุ่มเพื่อแสดงให้เห็นว่ากลุ่มนั้นคล้ายกันจริง ๆ นี่มักเป็นส่วนหนึ่งของตาราง "คุณสมบัติพื้นฐาน" อย่างไรก็ตามการทดสอบนัยสำคัญวัดความน่าจะเป็นที่จะได้รับความแตกต่างที่สังเกต (หรือมากกว่า) โดยบังเอิญใช่ไหม และถ้าการทดสอบนั้นสำคัญเราก็สรุปได้ว่ามีความแตกต่างที่แท้จริงเพราะความแตกต่างแบบสุ่มของขอบเขตนั้นจะไม่น่าเป็นไปได้ การทดสอบอย่างมีนัยสำคัญทำให้เกิดความรู้สึกหลังจากสุ่มเมื่อเรารู้ว่าความแตกต่างใด ๆต้องเกิดจากโอกาสหรือไม่?

1
สัมประสิทธิ์สหสัมพันธ์ Intraclass vs. F-test (one-way ANOVA)
ฉันสับสนเล็กน้อยเกี่ยวกับค่าสัมประสิทธิ์สหสัมพันธ์ของ intraclass และการวิเคราะห์ความแปรปรวนทางเดียว เมื่อฉันเข้าใจแล้วทั้งคู่ก็บอกคุณว่าการสังเกตแบบเดียวกันภายในกลุ่มนั้นเกี่ยวข้องกับการสังเกตในกลุ่มอื่นอย่างไร ใครช่วยอธิบายสิ่งนี้ให้ดีขึ้นได้บ้างและอาจอธิบายสถานการณ์ที่แต่ละวิธีมีประโยชน์มากกว่ากัน

5
การถดถอยโลจิสติกจะเอนเอียงเมื่อตัวแปรผลลัพธ์ถูกแบ่ง 5% - 95% หรือไม่
ฉันกำลังสร้างแบบจำลองความโน้มเอียงโดยใช้การถดถอยโลจิสติกสำหรับไคลเอนต์ยูทิลิตี้ ความกังวลของฉันคือจากตัวอย่างทั้งหมดบัญชี 'ไม่ดี' ของฉันมีเพียง 5% และส่วนที่เหลือดีทั้งหมด ฉันทำนายว่า 'ไม่ดี' ผลที่ได้จะเป็นแบบ Biassed หรือไม่? อะไรคือสิ่งที่ดีที่สุด 'ไม่ดีกับสัดส่วนที่ดี' เพื่อสร้างแบบจำลองที่ดี?

1
เป็นไปได้หรือไม่ที่จะรวม
ประการแรกฉันคิดว่ามีการรวมกฎเพื่อบูรณาการเชิงวิเคราะห์เพื่อแก้ปัญหานี้เมื่อเทียบกับการวิเคราะห์เชิงตัวเลข (เช่นสี่เหลี่ยมคางหมูกฎ Gauss-Legendre หรือ Simpson) หรือไม่ ฉันมีฟังก์ชั่นโดยที่ g ( x ; μ , σ ) = 1ฉ( x ) = x g( x ; μ , σ)f(x)=xg(x;μ,σ)\newcommand{\rd}{\mathrm{d}}f(x) = x g(x; \mu, \sigma) เป็นฟังก์ชั่นความหนาแน่นของความน่าจะเป็นของการกระจาย lognormal กับพารามิเตอร์μและσ ด้านล่างนี้ฉันจะย่อเครื่องหมายเป็นg(x)และใช้G(x)สำหรับฟังก์ชันการแจกแจงสะสมก.( x ; μ , σ) = 1σx 2 π--√อี- 12 σ2( บันทึก( x ) …

1
ความสำคัญของสัมประสิทธิ์การถดถอย (GAM) เมื่อความน่าจะเป็นแบบจำลองไม่สูงกว่าค่า null อย่างมีนัยสำคัญ
ฉันใช้การถดถอยแบบอิง GAM โดยใช้gamlssแพ็คเกจ R และสมมติว่ามีการกระจายข้อมูลเบต้าที่ไม่มีศูนย์ mymodel = gamlss(response ~ input, family=BEZI)ฉันมีเพียงตัวแปรอธิบายเดียวในรูปแบบของฉันดังนั้นมันเป็นพื้น: อัลกอริทึมทำให้ฉันสัมประสิทธิ์สำหรับผลกระทบของตัวแปรอธิบายในค่าเฉลี่ย ( ) และค่า p ที่เกี่ยวข้องสำหรับคล้าย:kkkμμ\muk(input)=0k(input)=0k(\text{input})=0 Mu link function: logit Mu Coefficients: Estimate Std. Error t value Pr(&gt;|t|) (Intercept) -2.58051 0.03766 -68.521 0.000e+00 input -0.09134 0.01683 -5.428 6.118e-08 ดังที่คุณเห็นในตัวอย่างด้านบนสมมติฐานของถูกปฏิเสธด้วยความมั่นใจสูงk(input)=0k(input)=0k(\text{input})=0 จากนั้นฉันเรียกใช้โมเดลว่าง: null = gamlss(response ~ 1, family=BEZI)และเปรียบเทียบความน่าจะเป็นโดยใช้การทดสอบอัตราส่วนความน่าจะเป็น: p=1-pchisq(-2*(logLik(null)[1]-logLik(mymodel)[1]), df(mymodel)-df(null)). ในหลายกรณีฉันได้รับแม้ว่าค่าสัมประสิทธิ์ที่อินพุตมีการรายงานว่ามีความสำคัญสูง …

4
การทดสอบเพื่อเปรียบเทียบองค์ประกอบชุมชนคืออะไร
หวังว่าคำถาม newbie นี้เป็นคำถามที่เหมาะสมสำหรับเว็บไซต์นี้: สมมติว่าฉันต้องการเปรียบเทียบองค์ประกอบของชุมชนนิเวศวิทยาที่สองไซต์ A, B. ฉันรู้ว่าทั้งสามไซต์มีสุนัขแมววัวและนกดังนั้นฉันจึงลองชิมความอุดมสมบูรณ์ของพวกเขาในแต่ละไซต์ (ฉันไม่มี " คาดว่า "ความอุดมสมบูรณ์ของสัตว์แต่ละตัวในแต่ละไซต์) ถ้าฉันนับให้พูดว่าสัตว์แต่ละตัวห้าตัวในแต่ละไซต์ A และ B นั้น "คล้ายกัน" มาก แต่ถ้าฉันเจอสุนัข 100 ตัวแมว 5 ตัววัว 2 ตัวและนก 3 ตัวที่ไซต์ A. สุนัข 5 ตัวแมว 3 ตัววัว 75 ตัวและนก 2 ตัวที่ไซต์ B จากนั้นฉันจะบอกว่าไซต์ A และ B นั้นแตกต่างกัน แม้ว่าจะมีองค์ประกอบสปีชีส์เดียวกันแน่นอน (ฉันอ่านดัชนีโซเรนเซนและเบรย์ - เคอร์ติส แต่ดูเหมือนว่าพวกเขาจะพิจารณาว่ามี / ไม่มีสุนัขแมว …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.