สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
การทดสอบอัตราส่วนชาร์ปอย่างมีนัยสำคัญ
วิธีที่เหมาะสมในการทดสอบความสำคัญของอัตราส่วน Sharpe หรืออัตราส่วนข้อมูลคืออะไร? อัตราส่วน Sharpe จะขึ้นอยู่กับดัชนีส่วนต่าง ๆ และอาจมีช่วงเวลามองย้อนกลับไปตัวแปร ทางออกหนึ่งที่ฉันได้เห็นอธิบายเพียงใช้ทดสอบนักเรียนกับ df ตั้งระยะเวลาในการมองย้อนกลับ ฉันลังเลที่จะใช้วิธีการข้างต้นเนื่องจากข้อกังวลดังต่อไปนี้: ฉันเชื่อว่า t-test นั้นมีความอ่อนไหวต่อความเบ้ ค่าเฉลี่ยผลตอบแทนที่คำนวณโดยใช้การส่งคืนค่าน้อยกว่าค่าเฉลี่ยผลตอบแทนที่คำนวณโดยใช้ผลตอบแทนแบบง่าย ฉันคิดว่าสิ่งนี้จะทำให้มีโอกาสมากขึ้นที่อัตราส่วน Sharpe ที่ให้ผลตอบแทนแบบง่ายจะลงทะเบียนว่ามีนัยสำคัญเมื่อเทียบกับ Sharpe ที่ใช้อัตราส่วนผลตอบแทนกลับมา หากช่วงเวลาที่มองย้อนกลับไปมีขนาดเล็ก (เช่นขนาดตัวอย่างเล็ก) การทดสอบ t อาจเหมาะสม แต่เกณฑ์ใดที่เหมาะสมที่จะใช้การทดสอบอื่น ความโน้มเอียงแรกของฉันคือการหลีกเลี่ยงการใช้การกระจายนักศึกษา -t และสร้างการทดสอบตามการกระจายพลังงานแบบอสมมาตรซึ่งฉันได้อ่านได้แสดงให้เห็นว่าใกล้เคียงกับผลตอบแทนของตลาดตราสารทุนมากขึ้น ความชอบครั้งที่สองของฉันคือการดูการทดสอบแบบไม่อิงพารามิเตอร์ แต่มีประสบการณ์ จำกัด ในการใช้งานของพวกเขาฉันไม่แน่ใจว่าจะเริ่มต้นอย่างไรและควรหลีกเลี่ยงข้อผิดพลาดอะไร ฉันคิดมากปัญหานี้หรือไม่

1
ทำไมคะแนนส่วนประกอบหลักจึงไม่เกี่ยวข้องกัน
Supose AA\mathbf Aเป็นเมทริกซ์ของข้อมูลที่มีค่าเฉลี่ยกึ่งกลาง เมทริกซ์S =cov( A )S=cov(A)\mathbf S=\text{cov}(\mathbf A) คือ m × mm×mm\times mมี ม.mm ค่าลักษณะเฉพาะที่แตกต่างและค่าลักษณะเฉพาะ s1s1\mathbf s_1, s2s2\mathbf s_2 ... sม.sm\mathbf s_mซึ่งเป็นมุมฉาก ผมiiองค์ประกอบหลักที่ (บางคนเรียกพวกเขาว่า "คะแนน") เป็นเวกเตอร์ Zผม= Asผมzi=Asi\mathbf z_i = \mathbf A\mathbf s_i. มันคือการรวมกันเชิงเส้นของคอลัมน์ของAA\mathbf Aโดยที่ค่าสัมประสิทธิ์เป็นองค์ประกอบของ ผมii- ไอเกนวิคเตอร์ของ SS\mathbf S. ฉันไม่เข้าใจว่าทำไม Zผมzi\mathbf z_i และ ZJzj\mathbf z_j กลายเป็นไม่เกี่ยวข้องกับทุกคน ฉัน≠ ji≠ji\neq j. …

2
ถังคืออะไร?
ฉันได้ไปรอบ ๆ เพื่อหาคำอธิบายที่ชัดเจนของ "การถัง" ในการเรียนรู้ของเครื่องโดยไม่มีโชค สิ่งที่ฉันเข้าใจจนถึงตอนนี้ก็คือการสร้างถังข้อมูลนั้นมีความคล้ายคลึงกับปริมาณในการประมวลผลสัญญาณดิจิตอลโดยที่ช่วงของค่าต่อเนื่องจะถูกแทนที่ด้วยค่าที่ไม่ต่อเนื่องหนึ่งค่า ถูกต้องหรือไม่ อะไรคือข้อดีและข้อเสีย (นอกเหนือจากผลกระทบที่ชัดเจนของการสูญเสียข้อมูล) ของการใช้งานถังข้อมูล? มีกฎของหัวแม่มือเกี่ยวกับวิธีการใช้ถัง? มีแนวทาง / อัลกอริธึมสำหรับการใช้การทำให้เป็นถังก่อนการใช้การเรียนรู้ของเครื่องหรือไม่?

2
การตรวจสอบความถูกต้องข้ามแบบซ้อน - แตกต่างจากการเลือกรุ่นผ่าน kfold CV ในชุดฝึกอบรมอย่างไร
ฉันมักจะเห็นคนพูดเกี่ยวกับการตรวจสอบ 5x2 ข้ามเป็นกรณีพิเศษของการตรวจสอบข้ามซ้อนกัน ฉันถือว่าตัวเลขแรก (ที่นี่: 5) หมายถึงจำนวนเท่าในวงด้านในและหมายเลขที่สอง (ที่นี่: 2) หมายถึงจำนวนเท่าในวงด้านนอก? ดังนั้นวิธีนี้แตกต่างจากการเลือกรูปแบบและการประเมินผลแบบ "ดั้งเดิม" อย่างไร โดย "ดั้งเดิม" ฉันหมายถึง แบ่งชุดข้อมูลออกเป็นการฝึกอบรมแยกต่างหาก (เช่น 80%) และชุดทดสอบ ใช้การตรวจสอบความถูกต้องไขว้ของ k-fold (เช่น k = 10) สำหรับการปรับจูนพารามิเตอร์และการเลือกแบบจำลองในชุดฝึกอบรม ประเมินประสิทธิภาพการวางนัยทั่วไปของรุ่นที่เลือกโดยใช้ชุดการทดสอบ ไม่ใช่ 5x2 เหมือนกันทุกประการยกเว้นชุดทดสอบและชุดฝึกอบรมที่มีขนาดเท่ากันถ้า k = 2 หรือไม่

2
ความแตกต่างระหว่าง PCA และการจัดกลุ่มสเปกตรัมสำหรับชุดตัวอย่างขนาดเล็กของคุณลักษณะบูลีน
ฉันมีชุดข้อมูลจำนวน 50 ตัวอย่าง แต่ละตัวอย่างประกอบด้วยคุณลักษณะบูลีน 11 (อาจมีความสัมพันธ์) ฉันต้องการที่จะเห็นภาพตัวอย่างเหล่านี้ในพล็อต 2D และตรวจสอบว่ามีกลุ่ม / กลุ่มใน 50 ตัวอย่างหรือไม่ ฉันได้ลองสองวิธีต่อไปนี้: (a) เรียกใช้ PCA บนเมทริกซ์ 50x11 และเลือกสององค์ประกอบหลักแรก ฉายข้อมูลลงบนพล็อต 2 มิติและรัน K-mean อย่างง่ายเพื่อระบุกลุ่ม (b) สร้างเมทริกซ์ความคล้ายคลึงกัน 50x50 (โคไซน์) เรียกใช้การจัดกลุ่มสเปกตรัมเพื่อลดมิติตามด้วย K-mean อีกครั้ง อะไรคือแนวคิดที่แตกต่างระหว่างการทำ PCA โดยตรงกับการใช้ค่าลักษณะเฉพาะของเมทริกซ์ความเหมือนกัน? ดีกว่าอีกไหม? นอกจากนี้ยังมีวิธีที่ดีกว่าในการแสดงภาพข้อมูลในแบบ 2D หรือไม่? เนื่องจากขนาดตัวอย่างของฉันถูก จำกัด ไว้ที่ 50 เสมอและชุดคุณลักษณะของฉันอยู่ในช่วง 10-15 เสมอฉันยินดีที่จะลองใช้วิธีการต่างๆแบบทันทีและเลือกที่ดีที่สุด คำถามที่เกี่ยวข้อง: การ จัดกลุ่มตัวอย่างโดยการทำคลัสเตอร์หรือ PCA

1
ความแปรปรวนร่วมของตัวแปรมาตรฐานมีความสัมพันธ์กันหรือไม่?
ฉันมีคำถามพื้นฐาน ว่าฉันมีสองตัวแปรสุ่มและYฉันสามารถสร้างมาตรฐานให้พวกเขาโดยการหักค่าเฉลี่ยและหารด้วยค่าเบี่ยงเบนมาตรฐานคือ(X))}XXXYYYXstandardized=(X−E(X))(SD(X))Xstandardized=(X−E(X))(SD(X))X_{standardized} = \frac{(X - E(X))}{(SD(X))} ความสัมพันธ์ของและ ,เท่ากับความแปรปรวนร่วมของและเวอร์ชันมาตรฐานหรือไม่? นั่นคือหรือไม่XXXYYYCor(X,Y)Cor(X,Y)Cor(X, Y)XXXYYYCor(X,Y)=Cov(Xstandardized,Ystandardized)Cor(X,Y)=Cov(Xstandardized,Ystandardized)Cor(X, Y) = Cov(X_{standardized}, Y_{standardized})

3
ปกติหารด้วยให้การแจกแจงแบบที - พิสูจน์ได้
ให้และ(s)Z∼N(0,1)Z∼N(0,1)Z \sim N(0,1)W∼χ2(s)W∼χ2(s)W \sim \chi^2(s) หากและมีการกระจายอย่างอิสระแล้วตัวแปรดังต่อไปนี้การกระจายกับองศาอิสระsZZZWWWY=ZW/s√Y=ZW/sY = \frac{Z}{\sqrt{W/s}}tttsss ฉันกำลังมองหาหลักฐานของความจริงนี้การอ้างอิงที่ดีพอถ้าคุณไม่ต้องการที่จะเขียนอาร์กิวเมนต์ที่สมบูรณ์

1
lsmeans รายงานอะไรสำหรับโมเดลเชิงเส้นแบบทั่วไปเช่นโมเดลปัวซองแบบผสม (พอดีกับ glmer)
ฉันกำลังวิเคราะห์ข้อมูลการติดตามด้วยตาจากการทดสอบที่ออกแบบมา ข้อมูลรุ่นที่เรียบง่ายของฉันจะมีลักษณะดังนี้ (คุณสามารถรับข้อมูล dput () ได้ที่นี่ ) head(lookDATA) participant fixationImage fixationCount 1 9 Automobile 81 2 9 Bird 63 3 9 Chair 82 4 9 Dog 64 5 9 Face 90 6 9 Plant 75 โดยที่ผู้เข้าร่วมเป็นตัวระบุที่ไม่ซ้ำกันสำหรับแต่ละเรื่อง fixationImage คือประเภทของรูปภาพที่พวกเขาจับจ้องอยู่และ fixationCount คือจำนวนครั้งที่พวกเขาได้รับการแก้ไขในหมวดหมู่รูปภาพนั้น ฉันพอดีกับรูปแบบ Poisson ข้อมูลโดยใช้ glmer () จากแพคเกจ lme4 model<-glmer(fixationCount ~ fixationImage …

2
ตัวอย่างที่ดีของส่วนสถิติในบทความวารสารวิชาการ
ฉันเป็นนักชีวสถิติที่ทำงานในสาขาที่สมัครแล้วและฉันมีหน้าที่รับผิดชอบในการเขียนส่วนวิธีการทางสถิติสำหรับเอกสารที่ฉันทำงานร่วมกัน ในการอ่านบทความทางวิชาการจำนวนมากฉันได้พบตัวอย่างมากมายของสถิติที่เขียนไม่ดี (ส่วนใหญ่พวกเขาน่าเบื่อไม่รู้และขาดความแม่นยำรายละเอียดและความเข้าใจในวิธีการที่ใช้) โดยไม่คำนึงถึงหัวข้อและความซับซ้อนของวิธีการทางสถิติที่ใช้อะไรเป็นตัวอย่างที่ดีของส่วนที่เป็นลายลักษณ์อักษรอย่างดีในบทความวิจัยประยุกต์? วิธีการกำหนด "ดีเขียน" เป็นอัตนัย แต่ฉันจะอธิบายส่วนสถิติเช่นเดียวกับการเขียนถ้ามันชัดเจนให้ (หรือดูเหมือนว่าจะให้) ภาพเต็มรูปแบบของวิธีการวิเคราะห์ได้ดำเนินการที่อยู่สมมติฐานที่ทำในระหว่างการวิเคราะห์ และรวมกระบวนการทางสถิติเข้ากับการไหลของกระดาษ นี่คือตัวอย่างของเอกสารที่ฉันคิดว่ามีส่วนสถิติที่ดี: การฉีดวัคซีนบีซีจีลดความเสี่ยงของการติดเชื้อวัณโรคในแบ๊ดเจ้อวัคซีนและลูกแบดเจอร์ที่ไม่ได้รับวัคซีน รูปแบบการทำนายอัตราการตายในผู้ป่วยกล้ามเนื้อหัวใจตายที่ได้รับการรักษาด้วยการแทรกแซงของหลอดเลือดหัวใจปฐมภูมิขั้นปฐมภูมิเฉียบพลัน: ผลลัพธ์จากการประเมิน Pexelizumab ในการทดลองกล้ามเนื้อหัวใจตายเฉียบพลัน อื่น ๆ ? ความคิดเกี่ยวกับสิ่งที่ควรรวมอยู่ในส่วนของสถิติ "ดี" ด้วย

2
ประเมินการกระจายการทำนายหลังในการถดถอยเชิงเส้นแบบเบย์
ฉันสับสนเกี่ยวกับวิธีการประเมินการกระจายการทำนายหลังสำหรับการถดถอยเชิงเส้นแบบเบย์ผ่านกรณีพื้นฐานที่อธิบายไว้ที่นี่ในหน้า 3 และคัดลอกด้านล่าง p(y~∣y)=∫p(y~∣β,σ2)p(β,σ2∣y)p(y~∣y)=∫p(y~∣β,σ2)p(β,σ2∣y) p(\tilde y \mid y) = \int p(\tilde y \mid \beta, \sigma^2) p(\beta, \sigma^2 \mid y) กรณีพื้นฐานคือตัวแบบการถดถอยเชิงเส้น: y=Xβ+ϵ,y∼N(Xβ,σ2)y=Xβ+ϵ,y∼N(Xβ,σ2) y = X \beta + \epsilon, \hspace{10mm} y \sim N(X \beta, \sigma^2) ถ้าเราใช้ทั้งเครื่องแบบก่อนหน้าโดยมีมาตราส่วน-Invก่อนหน้าบนหรือค่าผกผันแกมมาปกติก่อนหน้า (ดูที่นี่ ) การกระจายการทำนายหลังเป็นแบบวิเคราะห์และเป็นนักเรียน t ββ\betaχ2χ2\chi^2σ2σ2\sigma^2 แล้วรุ่นนี้ล่ะ? y=Xβ+ϵ,y∼N(Xβ,Σ)y=Xβ+ϵ,y∼N(Xβ,Σ) y = X \beta + \epsilon, \hspace{10mm} y \sim …

2
คุณสามารถคำนวณพลังของการทดสอบ Kolmogorov-Smirnov ใน R ได้หรือไม่?
เป็นไปได้ไหมที่จะทำการวิเคราะห์พลังงานสำหรับการทดสอบ Kolmogorov Smirnov แบบ 2 ด้านใน R? ฉันกำลังทดสอบว่าการแจกแจงเชิงประจักษ์สองแบบนั้นแตกต่างกันหรือไม่โดยใช้ ks.test () และต้องการเพิ่มการวิเคราะห์พลังงาน ฉันไม่พบการวิเคราะห์พลังงานในตัวสำหรับการทดสอบ KS ใน R. คำแนะนำใด ๆ แก้ไข : นี่คือการแจกแจงแบบสุ่มที่สร้างขึ้นโดยประมาณใกล้เคียงกับข้อมูลของฉัน (ด้วยขนาดตัวอย่างจริงและอัตราการสลายตัวโดยประมาณสำหรับการแจกแจงแบบเอ็กซ์โปเนนเชียล) set.seed(100) x <- rexp(64, rate=0.34) y <- rexp(54,rate=0.37) #K-S test: Do x and y come from same distribution? ks.test(x,y) ข้อมูลเหล่านี้เป็นการวัดขนาดร่างกายในสองกลุ่มที่แตกต่างกัน ฉันต้องการแสดงให้เห็นว่าทั้งสองกลุ่มมีการกระจายตัวเหมือนกันเป็นหลัก แต่ถูกถามโดยผู้ทำงานร่วมกันว่าฉันมีอำนาจที่จะพูดแบบนั้นตามขนาดตัวอย่างหรือไม่ ฉันสุ่มมาจากการแจกแจงเอ็กซ์โพเนนเชียลที่นี่ แต่สิ่งเหล่านี้ใกล้เคียงกับข้อมูลจริง จนถึงตอนนี้ฉันได้บอกว่าไม่มีความแตกต่างอย่างมีนัยสำคัญในการแจกแจงเหล่านี้ตามการทดสอบ KS แบบสองด้าน ฉันได้วางแผนการแจกแจงสองแบบด้วย ฉันจะแสดงให้เห็นได้อย่างไรว่าฉันมีอำนาจในการสร้างคำสั่งดังกล่าวโดยพิจารณาจากขนาดตัวอย่างและอัตราการสลายตัวของ …

1
เกือบจะแน่ใจว่าการบรรจบกันไม่ได้หมายถึงการบรรจบกันที่สมบูรณ์
เราบอกว่ามาบรรจบกันอย่างสมบูรณ์กับหากสำหรับinftyX1,X2,…X1,X2,…X_1, X_2, \ldotsXXXϵ&gt;0ϵ&gt;0\epsilon>0 ∑∞n=1P(|Xn−X|&gt;ϵ)&lt;∞∑n=1∞P(|Xn−X|&gt;ϵ)&lt;∞\sum_{n=1}^\infty \text{P}\left(|X_n-X|>\epsilon\right) <\infty ด้วยบทแทรกของ Borel Cantelli ตรงไปตรงมาเพื่อพิสูจน์ว่าการลู่เข้าแบบสมบูรณ์หมายถึงการบรรจบกันเกือบจะแน่นอน ฉันกำลังมองหาตัวอย่างเกือบแน่ใจว่าคอนเวอร์เจนซ์ไม่สามารถพิสูจน์ได้ด้วย Borel Cantelli นี่คือลำดับของตัวแปรสุ่มที่รวมกันเกือบจะแน่นอน แต่ไม่สมบูรณ์

1
สูตรสำหรับการทดสอบ A / B แบบเบย์ไม่มีเหตุผลใด ๆ
ฉันใช้สูตรจากการทดสอบ AB แบบเบย์เพื่อคำนวณผลลัพธ์ของการทดสอบ AB โดยใช้วิธีการแบบเบย์ Pr(pB&gt;pA)=∑i=0αB−1B(αA+i,βB+βA)(βB+i)B(1+i,βB)B(αA,βA)Pr(pB&gt;pA)=∑i=0αB−1B(αA+i,βB+βA)(βB+i)B(1+i,βB)B(αA,βA) \Pr(p_B > p_A) = \sum^{\alpha_B-1}_{i=0} \frac{B(\alpha_A+i,\beta_B+\beta_A)}{(\beta_B+i)B(1+i,\beta_B)B(\alpha_A, \beta_A)} ที่ไหน αAαA\alpha_Aในหนึ่งบวกกับจำนวนความสำเร็จสำหรับ A βAβA\beta_Aในหนึ่งบวกกับจำนวนความล้มเหลวสำหรับ A αBαB\alpha_Bในหนึ่งบวกกับจำนวนความสำเร็จสำหรับ B βBβB\beta_Bในหนึ่งบวกกับจำนวนความล้มเหลวสำหรับ B BBBคือฟังก์ชั่นเบต้า ข้อมูลตัวอย่าง: control: 1000 trials with 78 successes test: 1000 trials with 100 successes การทดสอบแบบ prop ที่ไม่ใช่แบบเบย์มาตรฐานให้ผลลัพธ์ที่สำคัญกับฉัน (p &lt;10%): prop.test(n=c(1000,1000), x=c(100,78), correct=F) # 2-sample test for equality of …
10 r  bayesian  ab-test 

2
การดำเนินการตรวจสอบข้ามซ้อน
ฉันพยายามที่จะเข้าใจว่าความเข้าใจของฉันเกี่ยวกับการตรวจสอบความถูกต้องแบบซ้อนกันดังนั้นฉันจึงเขียนตัวอย่างของเล่นนี้เพื่อดูว่าฉันพูดถูกหรือไม่: import operator import numpy as np from sklearn import cross_validation from sklearn import ensemble from sklearn.datasets import load_boston # set random state state = 1 # load boston dataset boston = load_boston() X = boston.data y = boston.target outer_scores = [] # outer cross-validation outer = cross_validation.KFold(len(y), n_folds=3, shuffle=True, …

3
วิธีการจำแนกชุดข้อมูลที่ไม่สมดุลโดย Convolutional Neural Networks (CNN)
ฉันมีชุดข้อมูลที่ไม่สมดุลในงานการจำแนกแบบไบนารีซึ่งจำนวนบวกกับจำนวนเชิงลบคือ 0.3% เทียบกับ 99.7% ช่องว่างระหว่างผลบวกและเชิงลบนั้นมีขนาดใหญ่มาก เมื่อฉันฝึก CNN ด้วยโครงสร้างที่ใช้ในปัญหา MNIST ผลการทดสอบจะแสดงอัตราลบติดลบสูง นอกจากนี้เส้นโค้งข้อผิดพลาดในการฝึกอบรมจะลดลงอย่างรวดเร็วในช่วงเวลาสองสามตอนที่เริ่มต้น แต่ยังคงเป็นค่าเดียวกันในยุคต่อไปนี้ คุณช่วยแนะนำวิธีแก้ไขปัญหานี้ให้ฉันได้ไหม? ขอบคุณ!

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.