สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
ระยะทางระหว่างตัวแปรที่ทำเมทริกซ์ความแปรปรวนร่วมคืออะไร
ฉันมีเมทริกซ์ความแปรปรวนร่วมและต้องการแบ่งพาร์ติชันตัวแปรเป็นกลุ่มโดยใช้การจัดกลุ่มแบบลำดับชั้น (ตัวอย่างเช่นเพื่อเรียงลำดับเมทริกซ์ความแปรปรวนร่วม)n×nn×nn \times nkkk มีฟังก์ชั่นระยะทางทั่วไประหว่างตัวแปร (เช่นระหว่างคอลัมน์ / แถวของเมทริกซ์ความแปรปรวนร่วมสี่เหลี่ยม) หรือไม่ หรือถ้ามีมากขึ้นมีการอ้างอิงที่ดีในหัวข้อ?

2
ขอบเขตท้ายของ Euclidean norm สำหรับการกระจายแบบสม่ำเสมอบน
สิ่งที่เป็นที่รู้กันว่าขอบเขตบนของยุคลิดเป็นองค์ประกอบที่ได้รับการแต่งตั้งอย่างสม่ำเสมอของจะใหญ่กว่าเกณฑ์ที่กำหนดหรือไม่{−n, −(n−1), ..., n−1, n}d{−n, −(n−1), ..., n−1, n}d\:\{-n,~-(n-1),~...,~n-1,~n\}^d\: ฉันสนใจส่วนใหญ่อยู่ในขอบเขตที่มาบรรจบกันชี้แจงให้เป็นศูนย์เมื่อnnnมีมากน้อยกว่าdddd

1
ตัวชี้วัดการประเมินผลการทำนายสำหรับข้อมูลแผง / ยาว
ฉันต้องการประเมินแบบจำลองต่างๆที่ให้การคาดการณ์พฤติกรรมในระดับรายเดือน ข้อมูลมีความสมดุลและ 100,000 และ 12 ผลลัพธ์คือการเข้าร่วมคอนเสิร์ตในเดือนที่กำหนดดังนั้นจึงเป็นศูนย์สำหรับ ~ 80% ของผู้คนในเดือนใด ๆ แต่มีผู้ใช้งานจำนวนมาก การคาดการณ์ที่ฉันไม่ได้ดูเหมือนจะเคารพธรรมชาติการนับของผลลัพธ์: คอนเสิร์ตที่เป็นเศษส่วนนั้นแพร่หลายn=n=n=T=T=T= ฉันไม่รู้อะไรเกี่ยวกับแบบจำลอง ฉันสังเกตการคาดการณ์กล่องดำ 6 แบบที่แตกต่างกันสำหรับแต่ละคนต่อเดือน ฉันมีข้อมูลเพิ่มเติมอีกหนึ่งปีที่ผู้สร้างแบบจำลองไม่ได้มีไว้สำหรับการประเมิน (แม้ว่าผู้ชมคอนเสิร์ตจะยังคงเหมือนเดิม) และฉันอยากจะวัดว่าแต่ละคนทำงานได้ดีแค่ไหน (ในแง่ของความแม่นยำและความแม่นยำ) ตัวอย่างเช่นแบบจำลองบางแบบทำนายผลได้ดีสำหรับผู้ที่มาชมคอนเสิร์ตบ่อยครั้ง แต่ล้มเหลวในการทานมันฝรั่งหรือไม่? การทำนายเดือนมกราคมดีกว่าการคาดการณ์ในเดือนธันวาคมหรือไม่? หรือจะเป็นการดีถ้าได้รู้ว่าการคาดคะเนทำให้ฉันสามารถจัดอันดับคนได้อย่างถูกต้องตามความเป็นจริงแม้ว่าขนาดที่แน่นอนไม่น่าเชื่อถือy^1,...,y^6y^1,...,y^6\hat y_1,...,\hat y_6 ความคิดแรกของฉันคือการเรียกใช้ผลกระทบคงที่ของจริงในการคาดการณ์และเวลาหุ่นและดู RMSEs หรือสำหรับแต่ละรุ่น แต่นั่นไม่ได้ตอบคำถามเกี่ยวกับว่าแต่ละรุ่นทำงานได้ดีหรือไม่หรือถ้าความแตกต่างนั้นสำคัญ (เว้นแต่ฉันจะบูต RMSE) การกระจายของผลลัพธ์ยังทำให้ฉันกังวลด้วยวิธีนี้R2R2R^2 ความคิดที่สองของฉันคือการทิ้งผลลัพธ์ลงใน 0, 1-3 และ 3+ และคำนวณเมทริกซ์ความสับสน แต่สิ่งนี้จะละเว้นมิติเวลายกเว้นว่าฉันทำ 12 ข้อเหล่านี้ มันก็ค่อนข้างหยาบ ฉันตระหนักถึงคำสั่ง Stata concordโดย TJ Steichen และ …

1
การกระจายตัวตัวอย่างของสัมประสิทธิ์การถดถอย
ก่อนหน้านี้ฉันได้เรียนรู้เกี่ยวกับการสุ่มตัวอย่างการแจกแจงที่ให้ผลลัพธ์ซึ่งมีไว้สำหรับตัวประมาณในแง่ของพารามิเตอร์ที่ไม่รู้จัก ตัวอย่างเช่นสำหรับการแจกแจงตัวอย่างของและในโมเดลการถดถอยเชิงเส้น β 1Yฉัน=βo+β1Xฉัน+εฉันβ^0β^0\hat\beta_0β^1β^1\hat\beta_1Yผม= βโอ+ β1Xผม+ εผมYผม=βโอ+β1Xผม+εผมY_i = \beta_o + \beta_1 X_i + \varepsilon_i β^0∼ N( β0, σ 2( 1)n+ x¯2Sx x) )β^0~ยังไม่มีข้อความ(β0, σ2(1n+x¯2Sxx)) \hat{\beta}_0 \sim \mathcal N \left(\beta_0,~\sigma^2\left(\frac{1}{n}+\frac{\bar{x}^2}{S_{xx}}\right)\right) และ β^1∼ N( β1, σ 2Sx x)β^1~ยังไม่มีข้อความ(β1, σ2Sxx) \hat{\beta}_1 \sim \mathcal N \left(\beta_1,~\frac{\sigma^2}{S_{xx}}\right) โดยที่Sx x= ∑ni = 1( x2ผม)−nx¯2Sxx=∑i=1n(xi2)-nx¯2S_{xx} = \sum_{i=1}^n …

2
IQR มีความแม่นยำเพียงใดในการตรวจจับค่าผิดปกติ
ฉันกำลังเขียนสคริปต์ที่วิเคราะห์เวลาทำงานของกระบวนการ ฉันไม่แน่ใจเกี่ยวกับการแจกจ่ายของพวกเขา แต่ฉันต้องการทราบว่ากระบวนการทำงาน "ยาวเกินไป" หรือไม่ จนถึงตอนนี้ฉันใช้ค่าเบี่ยงเบนมาตรฐาน 3 ครั้งในการรันครั้งล่าสุด (n> 30) แต่ฉันก็บอกว่ามันไม่ได้ให้ประโยชน์อะไรเลยหากข้อมูลไม่ปกติ ฉันพบการทดสอบนอกกรอบอื่นที่ระบุว่า: ค้นหาช่วงควอไทล์ระหว่างซึ่งเป็น IQR = ไตรมาส 3 - Q1 โดยที่ไตรมาสที่สามคือควอไทล์ที่สามและไตรมาสที่ 1 เป็นควอไทล์แรก จากนั้นหาตัวเลขสองตัวนี้: a) Q1 - 1.5 * IQR b) Q3 + 1.5 * IQR จุดเป็นค่าผิดปกติถ้า <a หรือ> b ข้อมูลของฉันมีแนวโน้มที่จะเป็นเช่น 2sec, 3sec, 2sec, 5sec, 300sec, 4sec, .... ที่ 300sec นั้นเป็นค่าที่เกิน …

2
เปรียบเทียบตัวแยกประเภทตาม AUROC หรือความแม่นยำ
ฉันมีปัญหาการจำแนกเลขฐานสองและฉันได้ทดสอบตัวแยกประเภทที่แตกต่างกัน: ฉันต้องการเปรียบเทียบตัวแยกประเภท ข้อใดเป็นค่าวัด AUC หรือความแม่นยำที่ดีกว่า และทำไม? Raondom Forest: AUC: 0.828 Accuracy: 79.6667 % SVM: AUC: 0.542 Accuracy: 85.6667 %

2
การทดสอบ t และการวิเคราะห์ความแปรปรวนทางเดียวทั้งการทดสอบ Wald หรือไม่
t-test สำหรับการทดสอบว่าค่าเฉลี่ยของตัวอย่างที่กระจายแบบปกติเท่ากับค่าคงที่หรือไม่นั้นเป็นการทดสอบแบบ Wald โดยการประมาณค่าเบี่ยงเบนมาตรฐานของค่าเฉลี่ยตัวอย่างจากข้อมูลการกระจายตัวปกติของปลาที่ค่าเฉลี่ยตัวอย่าง แต่สถิติการทดสอบในการทดสอบ t มีการแจกแจงแบบนักเรียนทีในขณะที่การทดสอบแบบ staistic ในการทดสอบแบบ Wald นั้นมีการกระจายแบบไคสแควร์ ฉันสงสัยว่าจะอธิบายได้อย่างไร ในการวิเคราะห์ความแปรปรวนทางเดียวสถิติทดสอบถูกกำหนดเป็นอัตราส่วนระหว่างความแปรปรวนระหว่างคลาสกับความแปรปรวนภายในคลาส ฉันสงสัยว่ามันเป็นแบบทดสอบของ Wald หรือไม่? แต่สถิติการทดสอบในการวิเคราะห์ความแปรปรวนแบบทางเดียวมีการแจกแจงแบบ F และสถิติการทดสอบในการทดสอบวัลด์แบบ asymptotically มีการแจกแจงแบบไคสแควร์ ฉันสงสัยว่าจะอธิบายได้อย่างไร ขอบคุณและขอแสดงความนับถือ!

1
สมมติฐานว่างของความเท่าเทียมกัน
สมมติว่าเป็นตัวอย่างสุ่มอย่างง่ายจากปกติ ( μ , σ 2 )การจัดจำหน่ายX1, X2,. . ., XnX1,X2,...,XnX_1, X_2, \, ... \, , X_n( μ , σ2)(μ,σ2)(\mu,\sigma^2) ฉันสนใจที่จะทำการทดสอบสมมติฐานต่อไปนี้: สำหรับให้คงค> 0H0: | μ | ≤ cH1: | μ | > ค,H0:|μ|≤cH1:|μ|>c, H_0: | \mu| \le c \\ H_1: |\mu| > c, c>0c>0c > 0 ผมคิดว่าในการดำเนินการสองด้านหนึ่ง -tests (TOST) ในวิธีที่คล้ายคลึงกับสถานการณ์การทดสอบชีวสมมูลปกติที่เป็นโมฆะและ| …

1
Neg Binomial และ Jeffreys 'ก่อนหน้า
ฉันพยายามรับ Jeffreys ก่อนเพื่อการกระจายแบบทวินามลบ ฉันไม่สามารถดูว่าฉันผิดไปไหนดังนั้นถ้ามีคนช่วยชี้ให้เห็นว่าจะได้รับการชื่นชม เอาล่ะเพื่อให้สถานการณ์อย่างนี้ผมจะเปรียบเทียบการกระจายก่อนที่ได้รับใช้ทวินามและทวินามลบที่ (ในทั้งสองกรณี) มีการทดลองและประสบความสำเร็จ ฉันได้คำตอบที่ถูกสำหรับเคสทวินาม แต่ไม่ใช่สำหรับลบทวินามnnnม.ม.m ลองโทรฟรีย์ก่อนtheta) จากนั้นπJ( θ )πJ(θ)\pi_J(\theta) πJ( θ ) ∝ [ I( θ ) ]1 / 2.πJ(θ)α[ผม(θ)]1/2. \pi_J(\theta)\propto [I(\theta)]^{1/2}. ภายใต้เงื่อนไขความสม่ำเสมอ (ปฏิบัติตามที่เรากำลังเผชิญกับตระกูลเอ็กซ์โปเนนเชียล) ผม( θ ) = - E( ∂2เข้าสู่ระบบL ( θ | x )∂θ2)ผม(θ)=-E(∂2เข้าสู่ระบบ⁡L(θ|x)∂θ2) I(\theta)=-E\left(\frac{\partial^2 \log L(\theta|x)}{\partial \theta^2}\right) โดยที่ลบทวินามคือxด้านบน expression (จำนวนความสำเร็จทั้งหมดmได้รับการแก้ไขแล้วnไม่ใช่) การกระจายตัว - ฉันคิดว่า …

2
ความสัมพันธ์อัตโนมัติเชิงพื้นที่สำหรับข้อมูลอนุกรมเวลา
ฉันมีชุดข้อมูล 20 ปีของการนับจำนวนปีของสายพันธุ์ที่อุดมสมบูรณ์สำหรับชุดรูปหลายเหลี่ยม (~ 200 รูปหลายเหลี่ยมที่ต่อเนื่องและมีรูปร่างไม่สม่ำเสมอ) ฉันใช้การวิเคราะห์การถดถอยเพื่ออนุมานแนวโน้ม (การเปลี่ยนแปลงจำนวนต่อปี) สำหรับรูปหลายเหลี่ยมแต่ละรูปรวมถึงการรวมข้อมูลรูปหลายเหลี่ยมตามขอบเขตการจัดการ ฉันแน่ใจว่ามีข้อมูลเชิงพื้นที่สัมพันธ์อัตโนมัติซึ่งแน่นอนว่าจะส่งผลกระทบต่อการวิเคราะห์การถดถอยสำหรับข้อมูลรวม คำถามของฉันคือ - ฉันจะรันการทดสอบ SAC สำหรับข้อมูลอนุกรมเวลาได้อย่างไร ฉันต้องดู SAC ​​ของส่วนที่เหลือจากการถดถอยของฉันในแต่ละปี (โมแรนระดับโลกของฉัน) หรือไม่? หรือฉันสามารถทำการทดสอบหนึ่งครั้งกับทุกปีได้หรือไม่? เมื่อฉันทดสอบว่าใช่มี SAC มีวิธีง่าย ๆ ในการจัดการเรื่องนี้หรือไม่? พื้นหลังสถิติของฉันมีน้อยและทุกอย่างที่ฉันได้อ่านในการสร้างแบบจำลองเชิงพื้นที่มีความซับซ้อนมาก ฉันรู้ว่า R มีฟังก์ชั่น autocovariate ทางไกล - นี่ใช้ง่ายไหม? ฉันค่อนข้างสับสนในการประเมิน / addess SAC สำหรับปัญหานี้และจะขอบคุณคำแนะนำลิงก์หรือการอ้างอิงใด ๆ ขอบคุณล่วงหน้า!

2
มี overfitting ในวิธีการ modellng นี้หรือไม่
เมื่อไม่นานมานี้ฉันได้รับแจ้งว่ากระบวนการที่ฉันติดตาม (องค์ประกอบของวิทยานิพนธ์ MS) อาจถูกมองว่าเหมาะสมเกินไป ฉันกำลังมองหาที่จะได้รับความเข้าใจที่ดีขึ้นนี้และดูว่าคนอื่นเห็นด้วย วัตถุประสงค์ของบทความนี้คือ เปรียบเทียบประสิทธิภาพของต้นไม้การถดถอยแบบไล่ระดับสีไล่ระดับกับการสุ่มป่าบนชุดข้อมูล ดูประสิทธิภาพของรุ่นสุดท้ายที่เลือก (ทั้ง GBM หรือ RF) gbmและแพคเกจในการวิจัยที่มีการใช้พร้อมกับrandomForest caret กระบวนการตามเป็นดังนี้: การประมวลผลข้อมูลเบื้องต้นล่วงหน้า (เช่นการเสียบค่าที่ขาดหายไปของตัวทำนายที่ระบุด้วยหมวดหมู่ที่แตกต่างที่เรียกว่า "หายไป") ตัวแปรเป้าหมายไม่ได้พิจารณาถึงการประมวลผลล่วงหน้าใด ๆ (ซึ่งน้อยมาก) สร้างตารางค่าสำหรับเมตา - พารามิเตอร์ของแต่ละอัลกอริทึม (เช่นจำนวนการวนซ้ำสำหรับ GBM) สร้างชุดข้อมูลแยก 25 ชุด (การฝึกอบรม 65% และการทดสอบ 35%) ทำซ้ำ 25 ครั้งต่อไปนี้สำหรับ GBM (แต่ละครั้งใช้หนึ่งในการสุ่มแยกรถไฟ / ทดสอบแต่ละครั้งที่การฝึกอบรมและชุดทดสอบเป็น "การเปลี่ยนแปลงในปัจจุบัน" ของการเปลี่ยนแปลงหลักสูตร ใช้การตรวจสอบความถูกต้องไขว้ 5 เท่าเพื่อค้นหาการตั้งค่าพารามิเตอร์ "ดีที่สุด" ของอัลกอริทึมเหนือการค้นหากริด ไม่มีอะไรจากการวิ่งก่อนหน้านี้เลยในการวิ่งปัจจุบัน เมื่อพิจารณาแล้วให้พอดีกับรูปแบบของชุดการฝึกอบรม "ปัจจุบัน" …

4
Bayesian uninformative priors เทียบกับ null nullistes บ่อยครั้ง: ความสัมพันธ์คืออะไร?
ฉันมาข้ามภาพนี้ในบล็อกโพสต์ที่นี่ ฉันรู้สึกผิดหวังที่การอ่านคำแถลงนั้นไม่ได้ทำให้สีหน้าฉันเหมือนที่เคยทำกับผู้ชายคนนี้ ดังนั้นสิ่งที่มีความหมายโดยคำพูดที่ว่าสมมติฐานว่างเป็นวิธีที่บ่อยครั้งแสดงความไม่ทราบมาก่อน? เป็นเรื่องจริงเหรอ? แก้ไข:ฉันหวังว่าบางคนสามารถเสนอการตีความเพื่อการกุศลที่ทำให้ข้อความเป็นจริงแม้ในบางกรณี

8
การแสดงข้อมูลมิติสูง
ฉันมีตัวอย่างของสองคลาสซึ่งเป็นเวกเตอร์ในพื้นที่มิติสูงและฉันต้องการพล็อตพวกมันใน 2D หรือ 3D ฉันรู้เกี่ยวกับเทคนิคการลดขนาด แต่ฉันต้องการเครื่องมือที่ง่ายและใช้งานง่าย (ใน matlab, python หรือ. exe ที่สร้างไว้ล่วงหน้า) นอกจากนี้ฉันสงสัยว่าการเป็นตัวแทนใน 2D จะเป็น "ความหมาย" หรือไม่? (ตัวอย่างเช่นวิธีที่สองคลาสตัดกันหรือสามารถแยกได้)

2
ฉันสามารถรวมขนาดเอฟเฟกต์เป็นตัวแปรอิสระในการถดถอยได้หรือไม่?
คำถามของฉันคือฉันสามารถใช้เอฟเฟกต์ขนาดเป็นตัวแปรตามและอีกขนาดเอฟเฟกต์เป็นตัวแปรอิสระในการถดถอยแบบ meta-reg หรือไม่?XXXYYY ตัวอย่างเช่นฉันทำการวิเคราะห์อภิมานสำหรับผลของการออกกำลังกายในปัญหาการดื่มและฉันพบผลลัพธ์ที่สำคัญและความหลากหลายที่สูง ฉันต้องการทำเมตาถดถอยและใช้ขนาดผลกระทบของการแทรกแซงเหล่านั้นในความวิตกกังวลเป็นตัวแปรอิสระและขนาดผลกระทบของปัญหาการดื่มเป็นตัวแปรตาม (สมมติว่าการศึกษาแต่ละครั้งประเมินความวิตกกังวลและปัญหาการดื่มและฉันคำนวณผลกระทบ ขนาดเป็น Hedges's )ggg สิ่งนี้สมเหตุสมผลสำหรับคุณหรือไม่

2
การสร้างภาพข้อมูลที่ดีสำหรับการถดถอยของปัวซองคืออะไร
ฉันต้องการเชื่อมโยงข้อบกพร่องของรหัสเข้ากับการวัดความซับซ้อนของรหัสเช่นความใกล้ชิด แบบจำลองทั่วไปอย่างหนึ่งคือการดูสิ่งนี้เป็นกระบวนการปัวซองซึ่งระยะเวลาคือเวลาที่ใช้ในการเข้ารหัสและความหนาแน่นเป็นฟังก์ชันของความซับซ้อนของรหัส ฉันสามารถทำการถดถอยและรับค่านัยสำคัญเป็นต้น อย่างไรก็ตามมันยากสำหรับฉันที่จะเห็นภาพผลลัพธ์ (และยิ่งยากขึ้นสำหรับเพื่อนร่วมงานที่มีความโน้มเอียงทางคณิตศาสตร์ของฉัน) มีวิธีที่ดีในการดูสิ่งนี้เพื่อดูสิ่งต่าง ๆ เช่นค่าผิดปกติหรือไม่หากเป็นแนวโน้มเชิงเส้นเป็นต้น (ลิงก์ไปยังแพ็คเกจ R ได้รับการชื่นชม) ตัวอย่างเช่นฉันสามารถพล็อตได้Defects / Time ~ Complexityแต่มันค่อนข้างมีเสียงรบกวนและเนื่องจากDefectsมีการแบ่งแยกและมีขนาดเล็กมากจึงยากที่จะดูแนวโน้ม สิ่งหนึ่งที่ฉันคิดคือการที่ฉันสามารถแบ่งข้อมูลออกเป็นควอนไทล์แล้วทำการถดถอยต่อควอไทล์และวางแผนความหนาแน่นที่เกิดขึ้น - ฉันไม่แน่ใจว่ามันถูกต้องแค่ไหนโดยเฉพาะอย่างยิ่งเนื่องจากข้อมูลของฉันไม่ได้กระจายตามปกติ ผู้คนเข้าใจผิดเกี่ยวกับสิ่งที่เป็น quantile

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.