สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
ฟอเรสต์แบบสุ่มในข้อมูลที่จัดกลุ่ม
ฉันใช้ฟอเรสต์แบบสุ่มกับข้อมูลที่จัดกลุ่มมิติสูง (ตัวแปรอินพุตตัวเลข 50 ตัว) ซึ่งมีโครงสร้างแบบลำดับชั้น รวบรวมข้อมูลด้วยการจำลองแบบ 6 ครั้งที่ 30 ตำแหน่งของวัตถุที่แตกต่างกัน 70 รายการทำให้เกิดจุดข้อมูล 12,600 จุดซึ่งไม่เป็นอิสระ ดูเหมือนว่าฟอเรสต์แบบสุ่มมีความเหมาะสมกับข้อมูลมากเกินไปเนื่องจากข้อผิดพลาด oob นั้นมีขนาดเล็กกว่าข้อผิดพลาดที่เราได้รับเมื่อออกจากข้อมูลหนึ่งวัตถุในระหว่างการฝึกอบรมและจากนั้นทำนายผลลัพธ์ของวัตถุด้านซ้าย ยิ่งกว่านั้นฉันมีความสัมพันธ์ที่เหลืออยู่ ฉันคิดว่า overfitting เกิดขึ้นเนื่องจากป่าสุ่มคาดว่าจะมีข้อมูลอิสระ เป็นไปได้ไหมที่จะบอกฟอเรสต์แบบสุ่มเกี่ยวกับโครงสร้างลำดับชั้นของข้อมูล? หรือมีวิธีการรวมหรือการหดตัวที่ทรงพลังอีกวิธีหนึ่งที่สามารถจัดการข้อมูลที่จัดกลุ่มมิติสูงด้วยโครงสร้างการโต้ตอบที่แข็งแกร่งได้หรือไม่ คำใบ้ใด ๆ ที่ฉันสามารถทำได้ดีกว่า?


5
วิธีการเปรียบเทียบอนุกรมเวลาที่ไม่หยุดนิ่ง 2 แบบเพื่อกำหนดสหสัมพันธ์
ฉันมีชุดข้อมูลสองชุดที่พล็อตค่ามัธยฐานของอายุเมื่อเวลาผ่านไป ทั้งสองซีรีส์แสดงอายุที่เพิ่มขึ้นเมื่อตายในช่วงเวลาหนึ่ง แต่ต่ำกว่าอีกมาก ฉันต้องการตรวจสอบว่าการเพิ่มขึ้นของอายุที่เสียชีวิตของกลุ่มตัวอย่างต่ำกว่านั้นแตกต่างจากกลุ่มตัวอย่างบนอย่างมีนัยสำคัญหรือไม่ นี่คือข้อมูลที่เรียงลำดับตามปี (ตั้งแต่ปี 1972 ถึง 2009 รวม) โดยปัดเศษเป็นทศนิยมสามตำแหน่ง: Cohort A 70.257 70.424 70.650 70.938 71.207 71.263 71.467 71.763 71.982 72.270 72.617 72.798 72.964 73.397 73.518 73.606 73.905 74.343 74.330 74.565 74.558 74.813 74.773 75.178 75.406 75.708 75.900 76.152 76.312 76.558 76.796 77.057 77.125 77.328 77.431 77.656 77.884 …

4
สิ่งที่ต้องทำในห้องอธิบายเวลา
หลังจากที่ได้ทำงานกับข้อมูลภาคตัดขวางมาจนถึงตอนนี้และเมื่อเร็ว ๆ นี้การสืบค้นดูสะดุดไปกับวรรณคดีอนุกรมเวลาเบื้องต้นฉันสงสัยว่าสิ่งใดที่ตัวแปรอธิบายบทบาทกำลังเล่นอยู่ในการวิเคราะห์อนุกรมเวลา ฉันต้องการอธิบายแนวโน้มแทนการยกเลิกแนวโน้ม ส่วนใหญ่ของสิ่งที่ฉันอ่านเป็นบทนำถือว่าซีรีส์เกิดจากกระบวนการสุ่ม ฉันอ่านเกี่ยวกับกระบวนการ AR (p) และ MA รวมถึงแบบจำลอง ARIMA ต้องการจัดการกับข้อมูลมากกว่ากระบวนการ autoregressive เท่านั้นที่ฉันพบ VAR / VECM และวิ่งตัวอย่างบางส่วน แต่ฉันก็ยังสงสัยว่ามีบางกรณีที่เกี่ยวข้องกับสิ่งที่ explanatories ทำในส่วนต่างๆ แรงจูงใจเบื้องหลังสิ่งนี้คือการสลายตัวของซีรี่ส์ของฉันแสดงให้เห็นว่าเทรนด์เป็นผู้สนับสนุนรายใหญ่ในขณะที่ส่วนที่เหลือและผลกระทบตามฤดูกาลแทบจะไม่มีบทบาท ฉันต้องการอธิบายแนวโน้มนี้ ฉันสามารถ / ควรถอยหลังซีรีส์ของฉันในซีรีย์ต่าง ๆ กันไหม? โดยสังหรณ์ใจฉันจะใช้ gls เนื่องจากความสัมพันธ์แบบอนุกรม (ฉันไม่แน่ใจเกี่ยวกับโครงสร้างคร) ฉันได้ยินเกี่ยวกับการถดถอยที่น่าเกรงขามและเข้าใจว่านี่เป็นข้อผิดพลาด แต่ฉันกำลังมองหาวิธีที่จะอธิบายแนวโน้ม สิ่งนี้ผิดปกติหรือผิดปกติหรือไม่? หรือฉันเพิ่งพลาดบทที่ถูกต้องจนถึงตอนนี้?

6
ฉันจะลดจำนวนจุดข้อมูลในชุดข้อมูลได้อย่างไร
ฉันไม่ได้เรียนสถิติมานานกว่า 10 ปี (แล้วก็เป็นหลักสูตรพื้นฐาน) ดังนั้นคำถามของฉันอาจจะยากที่จะเข้าใจ อย่างไรก็ตามสิ่งที่ฉันต้องการทำคือลดจำนวนจุดข้อมูลในชุดข้อมูล แกน x คือจำนวนมิลลิวินาทีนับตั้งแต่เริ่มต้นการวัดและแกน y คือการอ่านสำหรับจุดนั้น บ่อยครั้งที่มีจุดข้อมูลหลายพันจุด แต่ฉันอาจต้องการเพียงไม่กี่ร้อยเท่านั้น ดังนั้นคำถามของฉันคือฉันจะลดจำนวนจุดข้อมูลอย่างแม่นยำได้อย่างไร กระบวนการนี้เรียกว่าอะไร? (ดังนั้นฉันสามารถ google มัน) มีอัลกอริทึมที่ต้องการ (ฉันจะใช้มันใน C #) หวังว่าคุณจะได้เบาะแส ขออภัยสำหรับคำศัพท์ที่ไม่เหมาะสม แก้ไข: รายละเอียดเพิ่มเติมมาที่นี่: ข้อมูลดิบที่ฉันได้รับคือข้อมูลอัตราการเต้นของหัวใจและในรูปของจำนวนมิลลิวินาทีนับตั้งแต่จังหวะสุดท้าย ก่อนทำการพล็อตข้อมูลฉันคำนวณจำนวนมิลลิวินาทีจากตัวอย่างแรกและ bpm (จำนวนครั้งต่อนาที) ที่จุดข้อมูลแต่ละจุด (60000 / timesincelastbeat) ฉันต้องการที่จะเห็นภาพข้อมูลเช่นพล็อตมันในกราฟเส้น ฉันต้องการลดจำนวนคะแนนในกราฟจากหลายพันเป็นหลายร้อย ทางเลือกหนึ่งคือการคำนวณ bpm เฉลี่ยสำหรับทุก ๆ วินาทีในซีรีย์หรืออาจจะทุกๆ 5 วินาทีหรือมากกว่านั้น นั่นคงง่ายมากถ้าฉันรู้ว่าฉันจะมีตัวอย่างอย่างน้อยหนึ่งรายการสำหรับแต่ละช่วงเวลาเหล่านั้น (วินาทีของช่วงเวลา 5 วินาที)

1
วิธีการจัดกลุ่ม U-Matrix อัตโนมัติ?
หลังจากฝึกแผนที่การจัดระเบียบตนเองแล้วสามารถคำนวณU-Matrixได้ มีเครื่องมือบางอย่างที่จะมองเห็นมันด้วยตนเองและระบุกลุ่ม แต่ฉันสงสัยว่ามีอัลกอริทึมใด ๆ ที่จะทำกระบวนการนี้ด้วยวิธีอัตโนมัติ (เช่นไม่มีคนดูรูปเพื่อระบุกลุ่ม) มีวิธีการทำเช่นนี้? ฉันกำลังเขียนรหัสของฉันในอาร์ฉันไม่พบสิ่งใดบนอินเทอร์เน็ตดังนั้นอาจมีคนช่วยฉันที่นี่

4
เหตุใดวิธีการกำลังสองน้อยที่สุดและความน่าจะเป็นสูงสุดของการถดถอยจึงไม่เท่ากันเมื่อข้อผิดพลาดไม่กระจายตามปกติ
ชื่อกล่าวมันทั้งหมด ฉันเข้าใจว่ากำลังสองน้อยที่สุดและโอกาสสูงสุดจะให้ผลเหมือนกันสำหรับสัมประสิทธิ์การถดถอยหากข้อผิดพลาดของโมเดลกระจายตามปกติ แต่จะเกิดอะไรขึ้นหากข้อผิดพลาดไม่ได้รับการแจกจ่ายตามปกติ ทำไมทั้งสองวิธีจึงไม่เท่ากันอีกต่อไป?

1
ฟังก์ชันนูนของ PDF และ CDF ของตัวแปรสุ่มมาตรฐานแบบปกติ
โปรดแสดงหลักฐานว่านูน∀x>0 ที่นี่ϕและΦเป็น PDF ปกติมาตรฐานและ CDF ตามลำดับQ ( x ) = x2+ x ϕ ( x )Φ ( x )Q(x)=x2+xϕ(x)Φ(x)Q\left(x\right)=x^{2}+x\frac{\phi\left(x\right)}{\Phi\left(x\right)}∀ x > 0∀x>0\forall x>0 φϕ\phiΦΦ\mathbf{\Phi} ขั้นตอนที่ลอง 1) วิธีการคำนวณ ฉันได้ลองวิธีแคลคูลัสและมีสูตรสำหรับ derivate ที่สอง แต่ผมไม่สามารถที่จะแสดงให้เห็นว่ามันเป็นบวก∀ x > 0∀x>0\forall x > 0 0โปรดแจ้งให้เราทราบหากคุณต้องการรายละเอียดเพิ่มเติม สุดท้าย ∂Q(x)ให้ Q ( x ) = x2+ x ϕ ( x …

5
วิธีแก้ไขค่าผิดปกติที่ตรวจพบเมื่อทำการพยากรณ์ข้อมูลอนุกรมเวลา?
ฉันพยายามหาวิธีแก้ไขค่าผิดปกติเมื่อฉันค้นหา / ตรวจจับพวกมันในข้อมูลอนุกรมเวลา วิธีการบางอย่างเช่น nnetar ใน R ให้ข้อผิดพลาดบางประการสำหรับอนุกรมเวลาที่มีค่าผิดปกติจำนวนมาก / มาก ฉันจัดการเพื่อแก้ไขค่าที่หายไปแล้ว แต่ผู้นอกองค์กรยังคงสร้างความเสียหายต่อการคาดการณ์ของฉัน ...

1
การตีความการสลายตัวของอนุกรมเวลาโดยใช้ TBATS จากแพ็คเกจพยากรณ์
ฉันต้องการที่จะแยกข้อมูลอนุกรมเวลาต่อไปนี้ออกเป็นฤดูกาลแนวโน้มและส่วนประกอบที่เหลือ ข้อมูลนี้เป็นข้อมูลการระบายความร้อนพลังงานทุกชั่วโมงจากอาคารพาณิชย์: TotalCoolingForDecompose.ts <- ts(TotalCoolingForDecompose, start=c(2012,3,18), freq=8765.81) plot(TotalCoolingForDecompose.ts) มีผลกระทบตามฤดูกาลรายวันและรายสัปดาห์ที่ชัดเจนดังนั้นจึงขึ้นอยู่กับคำแนะนำจาก: วิธีการสลายอนุกรมเวลาที่มีองค์ประกอบตามฤดูกาลหลายรายการ? ฉันใช้tbatsฟังก์ชั่นจากforecastแพ็คเกจ: TotalCooling.tbats <- tbats(TotalCoolingForDecompose.ts, seasonal.periods=c(24,168), use.trend=TRUE, use.parallel=TRUE) plot(TotalCooling.tbats) ซึ่งผลลัพธ์ใน: อะไรlevelและslopeส่วนประกอบของรุ่นนี้อธิบายอะไร ฉันจะได้รับtrendและremainderส่วนประกอบคล้ายกับกระดาษที่อ้างอิงโดยแพคเกจนี้ ( De Livera, Hyndman และ Snyder (JASA, 2011) )

1
ชื่อสำหรับการแจกแจงระหว่างเลขชี้กำลังและแกมม่า
ความหนาแน่นฉ( s ) ∝ ss + αอี- s,s > 0f(s)∝ss+αe−s,s>0f(s)\propto \frac{s}{s+\alpha}e^{-s},\quad s > 0ที่อัลฟ่า≥ 0α≥0\alpha \ge 0เป็นพารามิเตอร์ที่ชีวิตระหว่างชี้แจง (α = 0α=0\alpha=0 ) และΓ ( 2 , 1 )Γ(2,1)\Gamma(2,1) (α → ∞α→∞\alpha \to \infty ) การกระจาย เพียงแค่สงสัยว่าสิ่งนี้เกิดขึ้นเป็นตัวอย่างของครอบครัวที่มีการแจกแจงทั่วไปมากขึ้นหรือไม่? ฉันไม่รู้จักเช่นนี้

2
วิธีแก้ปัญหารถถังเยอรมัน
มีข้อพิสูจน์ทางคณิตศาสตร์อย่างเป็นทางการหรือไม่ว่าวิธีแก้ปัญหาของปัญหารถถังเยอรมันนั้นเป็นฟังก์ชั่นเฉพาะพารามิเตอร์k (จำนวนตัวอย่างที่สังเกต) และm (ค่าสูงสุดระหว่างตัวอย่างที่สังเกต) กล่าวอีกนัยหนึ่งสามารถพิสูจน์ได้ว่าวิธีแก้ปัญหาเป็นอิสระจากค่าตัวอย่างอื่นนอกเหนือจากค่าสูงสุดหรือไม่

1
มาตรการซ้ำ anova: lm vs lmer
ฉันพยายามสร้างการทดสอบการโต้ตอบหลายครั้งระหว่างมาตรการทั้งสองlmและlmerมาตรการซ้ำ (2x2x2) เหตุผลที่ฉันต้องการเปรียบเทียบทั้งสองวิธีนี้เป็นเพราะ GLM ของ SPSS สำหรับการวัดซ้ำ ๆ ทำให้ได้ผลลัพธ์ที่เหมือนกันกับlmวิธีที่นำเสนอที่นี่ดังนั้นในตอนท้ายฉันต้องการเปรียบเทียบ SPSS กับ R-lmer จนถึงตอนนี้ฉันทำได้แค่ทำซ้ำ (อย่างใกล้ชิด) ปฏิสัมพันธ์บางอย่าง คุณจะพบสคริปต์ด้านล่างเพื่อแสดงจุดของฉันให้ดีขึ้น: library(data.table) library(tidyr) library(lmerTest) library(MASS) set.seed(1) N <- 100 # number of subjects sigma <- 1 # popuplation sd rho <- .6 # correlation between variables # X1: a a a a b b b …

1
MLE ของ
สมมติว่ามี pdf(X,Y)(X,Y)(X,Y) fθ(x,y)=e−(x/θ+θy)1x>0,y>0,θ>0fθ(x,y)=e−(x/θ+θy)1x>0,y>0,θ>0f_{\theta}(x,y)=e^{-(x/\theta+\theta y)}\mathbf1_{x>0,y>0}\quad,\,\theta>0 ความหนาแน่นของตัวอย่างดึงมาจากประชากรนี้จึงเป็น(X,Y)=(Xi,Yi)1≤i≤n(X,Y)=(Xi,Yi)1≤i≤n(\mathbf X,\mathbf Y)=(X_i,Y_i)_{1\le i\le n} gθ(x,y)=∏i=1nfθ(xi,yi)=exp[−∑i=1n(xiθ+θyi)]1x1,…,xn,y1,…,yn>0=exp[−nx¯θ−θny¯]1x(1),y(1)>0,θ>0gθ(x,y)=∏i=1nfθ(xi,yi)=exp⁡[−∑i=1n(xiθ+θyi)]1x1,…,xn,y1,…,yn>0=exp⁡[−nx¯θ−θny¯]1x(1),y(1)>0,θ>0\begin{align} g_{\theta}(\mathbf x,\mathbf y)&=\prod_{i=1}^n f_{\theta}(x_i,y_i) \\&=\exp\left[{-\sum_{i=1}^n\left(\frac{x_i}{\theta}+\theta y_i\right)}\right]\mathbf1_{x_1,\ldots,x_n,y_1,\ldots,y_n>0} \\&=\exp\left[-\frac{n\bar x}{\theta}-\theta n\bar y\right]\mathbf1_{x_{(1)},y_{(1)}>0}\quad,\,\theta>0 \end{align} ตัวประมาณโอกาสสูงสุดของสามารถได้รับเป็นθθ\theta θ^(X,Y)=X¯¯¯¯Y¯¯¯¯−−−√θ^(X,Y)=X¯Y¯\hat\theta(\mathbf X,\mathbf Y)=\sqrt\frac{\overline X}{\overline Y} ฉันต้องการทราบว่าการ จำกัด การกระจายของ MLE นี้เป็นปกติหรือไม่ เป็นที่ชัดเจนว่าเป็นสถิติที่เพียงพอสำหรับตามกลุ่มตัวอย่างคือY)θθ\theta(X¯¯¯¯,Y¯¯¯¯)(X¯,Y¯)(\overline X,\overline Y) ตอนนี้ฉันจะได้กล่าวว่า MLE เป็นอาการปกติโดยไม่ต้องสงสัยถ้ามันเป็นสมาชิกของตระกูลเลขชี้กำลังหนึ่งพารามิเตอร์แบบปกติ ฉันไม่คิดว่าเป็นเช่นนั้นส่วนหนึ่งเป็นเพราะเรามีสถิติเพียงพอสองมิติสำหรับพารามิเตอร์หนึ่งมิติ (เช่นในการแจกแจง )N(θ,θ2)N(θ,θ2)N(\theta,\theta^2) การใช้ความจริงที่ว่าและเป็นตัวแปรเอกซ์โปเนนเชียลที่เป็นอิสระฉันสามารถแสดงให้เห็นว่าการกระจายที่แน่นอนของเป็นเช่นนั้นXXXYYYθθ^θ^\hat\theta θ^θ=dF−−√, where F∼F2n,2nθ^θ=dF, where F∼F2n,2n\frac{\hat\theta}{\theta}\stackrel{d}{=} \sqrt F\quad,\text{ where …

2
ใช้โมเดล ARMA-GARCH เพื่อจำลองราคาแลกเปลี่ยนเงินตราต่างประเทศ
ฉันได้ติดตั้งแบบจำลอง ARIMA (1,1,1) -GARCH (1,1) เข้ากับช่วงเวลาของราคาบันทึกอัตราแลกเปลี่ยน AUD / USD ที่สุ่มตัวอย่างเป็นระยะเวลาหนึ่งนาทีตลอดระยะเวลาหลายปีทำให้ฉันมากกว่าสองปี ล้านจุดข้อมูลที่จะประเมินรูปแบบ ชุดข้อมูลที่สามารถใช้ได้ที่นี่ เพื่อความชัดเจนนี่เป็นรูปแบบ ARMA-GARCH ที่ติดตั้งเพื่อส่งคืนบันทึกเนื่องจากการรวมราคาบันทึกครั้งแรก ซีรี่ส์เวลา AUD / USD ดั้งเดิมมีลักษณะดังนี้: จากนั้นฉันพยายามจำลองอนุกรมเวลาตามโมเดลที่ติดตั้งให้ฉันดังนี้: ฉันคาดหวังและต้องการอนุกรมเวลาที่จำลองมานั้นจะแตกต่างจากซีรี่ส์ดั้งเดิม แต่ฉันไม่ได้คาดหวังว่าจะมีความแตกต่างที่มีนัยสำคัญ โดยเนื้อแท้แล้วฉันต้องการให้ซีรีย์ที่จำลองขึ้นมีลักษณะหรือกว้างเหมือนต้นฉบับ นี่คือรหัส R ที่ฉันใช้ประเมินโมเดลและจำลองซีรีย์: library(rugarch) rows <- nrow(data) data <- (log(data[2:rows,])-log(data[1:(rows-1),])) spec <- ugarchspec(variance.model = list(model = "sGARCH", garchOrder = c(1, 1)), mean.model = list(armaOrder = c(1, …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.