สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
การประยุกต์ใช้การถดถอยของริดจ์กับระบบสมการที่บ่อนทำลาย?
เมื่อปัญหากำลังสองน้อยที่สุดซึ่งกำหนดข้อ จำกัด เป็นทรงกลมบนค่าของ\ betaสามารถเขียนเป็น \ start {สมการ} \ \ \ {array} & \ operatorname {min} \ \ | y - X \ beta \ | ^ 2_2 \\ \ operatorname {st} \ \ | \ beta \ | ^ 2_2 \ le \ delta ^ 2 \ end {array} \ …

2
คุณวางแผนการปฏิสัมพันธ์ระหว่างปัจจัยและ covariate อย่างต่อเนื่องได้อย่างไร
ฉันต้องการลงจุดบนกราฟเดียวกันการทำงานร่วมกันระหว่างตัวทำนายต่อเนื่องของฉันกับผู้ดูแลหมวดหมู่ของฉัน ฉันรู้ว่าต้องทำอย่างไรเมื่อทั้งสองมีการจัดหมวดหมู่ ( การโต้ตอบระหว่างปัจจัย ) แต่ไม่รู้จริง ๆ ว่าจะทำอย่างไรเมื่อมีการต่อเนื่องและมีการจัดหมวดหมู่

2
ความหมายของการแสดง simplex เป็นพื้นผิวรูปสามเหลี่ยมในการแจกแจง Dirichlet คืออะไร?
ฉันกำลังอ่านจากหนังสือที่แนะนำการแจกแจง Dirchilet แล้วนำเสนอตัวเลขเกี่ยวกับมัน แต่ฉันไม่สามารถเข้าใจตัวเลขเหล่านั้นได้ ฉันแนบรูปที่นี่ที่ด้านล่าง สิ่งที่ฉันไม่เข้าใจคือความหมายของสามเหลี่ยม โดยปกติเมื่อเราต้องการพล็อตฟังก์ชั่นของตัวแปร 2 ตัวคุณใช้ค่าของ var1 และ va2 จากนั้นพล็อตค่าของฟังก์ชั่นค่าของตัวแปรสองตัวนั้น ... ซึ่งให้การสร้างภาพข้อมูลในมิติสามมิติ แต่ที่นี่มี 3 มิติและอีกหนึ่งค่าสำหรับค่าฟังก์ชั่นดังนั้นมันจึงสร้างภาพในพื้นที่ 4D ฉันไม่เข้าใจตัวเลขเหล่านั้น! ฉันหวังว่าบางคนสามารถชี้แจงได้โปรด! แก้ไข: นี่คือสิ่งที่ฉันไม่เข้าใจจากรูปที่ 2.14 ก ดังนั้นเราได้วาดจาก K = 3 dirichlet ตัวอย่างทีต้า (ซึ่งโดยทั่วไปคือเวกเตอร์) นั่นคือ: theta = [theta1, theta2, theta3] สามเหลี่ยมแปลง [theta1, theta2, theta3] ระยะทางจากจุดเริ่มต้นไปยังแต่ละ theta_i คือค่าของ theta_i จากนั้นสำหรับ theta_i แต่ละอันให้ใส่จุดยอดและเชื่อมต่อจุดยอดทั้งสามและทำรูปสามเหลี่ยม ฉันรู้ว่าถ้าฉันเสียบ …

1
ความคาดหวังของผลรวมของตัวเลข K โดยไม่ต้องเปลี่ยน
ป.ร. ให้ไว้ nnn ตัวเลขซึ่งค่าของแต่ละตัวเลขแตกต่างกันแสดงว่า v1,v2,...,vnv1,v2,...,vnv_1, v_2, ..., v_nและความน่าจะเป็นในการเลือกแต่ละตัวเลขคือ p1,p2,...,pnพี1,พี2,...,พีnp_1, p_2, ..., p_nตามลำดับ ตอนนี้ถ้าฉันเลือก KKK ตัวเลขขึ้นอยู่กับความน่าจะเป็นที่กำหนด K≤nK≤nK \leq nอะไรคือความคาดหวังของผลรวมของสิ่งเหล่านั้น KKKหมายเลข? โปรดทราบว่าการเลือกจะไม่มีการเปลี่ยนเพื่อให้KKKตัวเลขต้องไม่เกี่ยวข้องกับตัวเลขที่ซ้ำกัน ฉันเข้าใจว่าหากการเลือกนั้นมาพร้อมการเปลี่ยนความคาดหวังของผลรวมของKKK ตัวเลขเท่ากับ K×E(V)K×E(V)K \times E(V)ที่ไหน E(V)=v1×p1+v2×p2+...+vn×pn.E(V)=โวลต์1×พี1+โวลต์2×พี2+...+โวลต์n×พีn.E(V) = v_1 \times p_1 + v_2 \times p_2 + ... + v_n \times p_n. นอกจากนี้สิ่งที่เกี่ยวกับความคาดหวังของความแปรปรวนของเหล่านั้น KKK หมายเลข? ฉันเป็นนักเรียน CS PhD ที่กำลังทำงานกับปัญหาข้อมูลขนาดใหญ่และฉันไม่มีพื้นฐานทางสถิติ ฉันคาดหวังว่าใครบางคนสามารถให้สูตรฉันเป็นคำตอบได้ อย่างไรก็ตามหากคำตอบนั้นซับซ้อนเกินกว่าที่จะอธิบายโดยสูตรหรือการคำนวณอย่างเข้มข้นต้องมีส่วนเกี่ยวข้องคำตอบโดยประมาณนั้นเป็นที่ยอมรับโดยสิ้นเชิง คุณสามารถสันนิษฐานได้ …

1
การตั้งค่าข้อมูลสำหรับความแตกต่าง
การตั้งค่าใดถูกต้องสำหรับความแตกต่างของรูปแบบการถดถอยที่ใช้ Yฉันs T= α +γs* T+ λdเสื้อ+ δ* ( T* * * *dเสื้อ) +εฉันs TYผมsเสื้อ=α+γs* * * *T+λdเสื้อ+δ* * * *(T* * * *dเสื้อ)+εผมsเสื้อY_{ist} = \alpha +\gamma_s*T + \lambda d_t + \delta*(T*d_t)+ \epsilon_{ist} โดยที่ T คือดัมมี่ที่มีค่าเท่ากับ 1 ถ้าการสังเกตมาจากกลุ่มการรักษาและ d คือดัมมีที่เท่ากับ 1 ในช่วงเวลาหลังจากการรักษาเกิดขึ้น 1) สุ่มตัวอย่างจากแต่ละกลุ่มและเวลา (เช่น 4 ตัวอย่างสุ่ม) หรือ 2) ข้อมูลพาเนลที่มีการติดตามหน่วยเดียวกันตลอดช่วงเวลาทั้งสองหรือไม่ …

4
หลักสูตรคณิตศาสตร์บริสุทธิ์ที่สำคัญสำหรับนักศึกษาปริญญาเอกด้านสถิติคืออะไร?
ฉันรู้ว่าพีชคณิตเชิงเส้นและการวิเคราะห์ (โดยเฉพาะทฤษฎีการวัด) มีความสำคัญ การใช้หลักสูตรระดับบัณฑิตศึกษาในการวิเคราะห์ที่แท้จริงและซับซ้อนมีประโยชน์หรือไม่ ฉันควรเรียนรายวิชาพีชคณิตนามธรรมนอกเหนือจากหลักสูตรเบื้องต้นเช่นพีชคณิตสับเปลี่ยนและเรขาคณิตเชิงพีชคณิตหรือไม่

1
ทดสอบว่าตัวอย่างของการแจกแจงทวินามสองตัวอย่างเป็นไปตาม p เดียวกันหรือไม่
สมมติว่าฉันได้ทำ: n1n1n_1 การทดลองอิสระด้วยอัตราความสำเร็จที่ไม่รู้จัก p1p1p_1 และสังเกต k1k1k_1 ประสบความสำเร็จ n2n2n_2 การทดลองอิสระด้วยอัตราความสำเร็จที่ไม่รู้จัก p2p2p_2 และสังเกต k2k2k_2 ประสบความสำเร็จ ถ้าตอนนี้ p1=p2=:pp1=p2=:pp_1 = p_2 =: p แต่ยังไม่ทราบความน่าจะเป็น p(k2)p(k2)p(k_2) สังเกต k2k2k_2 สำหรับที่กำหนด k1k1k_1(หรือกลับกัน) เป็นสัดส่วนกับดังนั้นถ้าฉันต้องการทดสอบp_1 \ neq p_2ฉันแค่ต้องการดูว่า ผลคูณของการแจกแจงที่สอดคล้องกันการสังเกตของฉันคือ∫10B(n1,p,k1)B(n2,p,k2)dp=1n1+n2+1(n1k1)(n2k2)(n1+n2k1+k2)−1∫01B(n1,p,k1)B(n2,p,k2)dp=1n1+n2+1(n1k1)(n2k2)(n1+n2k1+k2)−1\int_0^1 B(n_1,p,k_1) B(n_2, p, k_2) \text{d}p = \frac{1}{n_1+n_2+1}\binom{n_1}{k_1}\binom{n_2}{k_2}\binom{n_1+n_2}{k_1+k_2}^{-1}p1≠p2p1≠p2p_1 \neq p_2 จนถึงตอนนี้สำหรับการปรับแต่งล้อ ตอนนี้ปัญหาของฉันคือฉันไม่พบสิ่งนี้ในวรรณคดีและฉันอยากรู้: คำศัพท์ทางเทคนิคสำหรับการทดสอบนี้หรืออะไรที่คล้ายกันคืออะไร

2
ข้อมูลอนุกรมเวลารวมจากแหล่งที่มีความละเอียดเชิงพื้นที่ / สเกลหลายตัว
ฉันมีภาพแรสเตอร์ดาวเทียมจำนวนมากจากเซ็นเซอร์ที่แตกต่างกัน จากสิ่งเหล่านี้ coarser มีความละเอียดทางโลกที่เหลือใช้มาก ตัวแก้ไขความละเอียดปานกลางมักจะมีวันที่ซื้อน้อย แต่ก็ยังมีข้อมูลบางส่วนอยู่ คนที่มีความละเอียดปลีกย่อยมีความคมชัดทางโลกต่ำมากซึ่งประกอบไปด้วยวันที่สังเกตจาก 2 ถึง 6 ในไม่เกินสองปี ฉันสงสัยว่าถ้าใครรู้ถึงความพยายามใด ๆ ในการศึกษาซีรีย์เวลาหลายขนาดประเภทนี้ในทางใดทางหนึ่ง? ฉันจะสนใจในการทำนายค่าในอนาคตที่ระดับปลีกย่อยโดยใช้ข้อมูลที่มีอยู่จาก coarser มันสมเหตุสมผลสำหรับฉันที่ข้อมูลจะต้องเกี่ยวข้อง (ใช่ภาพครอบคลุมภูมิภาคเดียวกัน) แต่ฉันไม่รู้ว่าจะเริ่มมีเพศสัมพันธ์ข้อมูลนี้ในรูปแบบการทำนาย

1
เกณฑ์การจำแนกประเภทใน RandomForest-sklearn
1) ฉันจะเปลี่ยนเกณฑ์การจำแนกได้อย่างไร (ฉันคิดว่าเป็น 0.5 โดยค่าเริ่มต้น) ใน RandomForest ใน sklearn 2) ฉันจะตัวอย่างน้อยใน sklearn ได้อย่างไร 3) ฉันมีผลลัพธ์ต่อไปนี้จากลักษณนาม RandomForest: [[1635 1297] [520 3624]] precision recall f1-score support class 0 0.76 0.56 0.64 2932 class 1 0.74 0.87 0.80 4144 เฉลี่ย / รวม 0.75 0.74 0.73 7076 ก่อนข้อมูลไม่สมดุล (30% จากคลาส 0 และ 70% จากคลาส …

2
ดัชนีความมั่นคงของประชากร - การหารด้วยศูนย์
ดัชนีความมั่นคงของประชากรวัดปริมาณการเปลี่ยนแปลงของการแจกแจงของตัวแปรโดยการเปรียบเทียบตัวอย่างข้อมูลในช่วงเวลาสองช่วงเวลา เป็นที่นิยมใช้ในการวัดการเปลี่ยนแปลงของคะแนน มีการคำนวณดังนี้ 1) ตัวอย่างจากช่วงเวลาพื้นฐานจะถูกแยกออก โดยปกติจะแบ่งเป็น deciles 2) ตัวอย่างจากช่วงเวลาเป้าหมายถูกแยกออกโดยใช้ช่วงเวลาเดียวกับในขั้นตอนแรก PSผม=Σผม(Aผม-Bผม) ⋅ l n (AผมBผม)PSผม=Σผม(Aผม-Bผม)⋅ล.n(AผมBผม)PSI = \sum_{i} (A_{i} - B_{i}) \cdot ln(\frac{A_{i}}{B_{i}}) ที่ไหน: AผมAผมA_{i} - ส่วนแบ่งของถังขยะ i-th ในช่วงเวลาฐาน BผมBผมB_{i} - ส่วนแบ่งของถังขยะ i-th ในช่วงเวลาเป้าหมาย คำถาม : ควรทำอย่างไรเมื่อหนึ่งในถังขยะจากตัวอย่างเป้าหมายว่างเปล่า

1
ค่าสัมประสิทธิ์สหสัมพันธ์สำหรับข้อมูลที่ได้รับคำสั่ง: Kendall's Tau กับ Polychoric กับ Spearman's rho
ดูเหมือนว่าสำหรับการจัดการกับวัดได้รับคำสั่งนักวิจัยมักจะจัดการกับความสัมพันธ์ Polychoric (ตัวอย่างเช่นสำหรับการสร้างเมทริกซ์ก่อนที่จะทำการวิเคราะห์ปัจจัย) ทำไมต้องเป็นเช่นนั้น ค่าสัมประสิทธิ์สหสัมพันธ์อันดับเคนดัลล์เอกภาพและค่าสัมประสิทธิ์สหสัมพันธ์ของสเปียร์แมนเหมาะสำหรับข้อมูลที่ได้รับคำสั่ง คะแนน 'โปร' และ 'ตรงกันข้าม' สำหรับค่าสัมประสิทธิ์สหสัมพันธ์เหล่านี้ยินดีต้อนรับ

1
การจัดกลุ่มสูตรความเฉื่อยใน scikit เรียนรู้
ฉันต้องการรหัสการจัดกลุ่ม kmeans ใน python โดยใช้ pandas และ scikit เรียนรู้ ในการเลือก k ที่ดีฉันต้องการรหัสสถิติ Gap จาก Tibshirani และ al 2001 ( pdf ) ฉันต้องการทราบว่าฉันสามารถใช้ผลเฉื่อยจาก scikit และปรับสูตรสถิติช่องว่างโดยไม่ต้องคำนวณการคำนวณระยะทางทั้งหมดอีกครั้ง ไม่มีใครรู้สูตรความเฉื่อยที่ใช้ใน scikit / รู้วิธีที่ง่ายในการถอดรหัสสถิติช่องว่างโดยใช้ฟังก์ชั่นระยะทางระดับสูง?

1
ค่าที่คาดหวังของสถิติการสั่งซื้อขั้นต่ำจากตัวอย่างปกติ
อัพเดท 25 มกราคม 2014: ความผิดพลาดได้รับการแก้ไขแล้ว โปรดเพิกเฉยค่าที่คำนวณได้ของค่าที่คาดหวังในภาพที่อัปโหลด - มันผิด - ฉันไม่ลบภาพเพราะมันได้สร้างคำตอบให้กับคำถามนี้ อัพเดท 10 มกราคม 2014: พบข้อผิดพลาด - พิมพ์ผิดทางคณิตศาสตร์ในหนึ่งในแหล่งที่ใช้ กำลังเตรียมการแก้ไข ... ความหนาแน่นของสถิติการสั่งซื้อขั้นต่ำจากการรวบรวมตัวแปรสุ่มแบบต่อเนื่อง iid ด้วย cdfและ pdfคือ nnnFX(x)FX(x)F_X(x)fX(x)fX(x)f_X(x)fX(1)(x(1))=nfX(x(1))[1−FX(x(1))]n−1[1]fX(1)(x(1))=nfX(x(1))[1−FX(x(1))]n−1[1]f_{X_{(1)}}(x_{(1)}) = nf_X(x_{(1)})\left[1-F_X(x_{(1)})\right]^{n-1} \qquad [1] หากตัวแปรสุ่มเหล่านี้เป็นมาตรฐานปกติแล้ว fX(1)(x(1))=nϕ(x(1))[1−Φ(x(1))]n−1=nϕ(x(1))[Φ(−x(1))]n−1[2]fX(1)(x(1))=nϕ(x(1))[1−Φ(x(1))]n−1=nϕ(x(1))[Φ(−x(1))]n−1[2]f_{X_{(1)}}(x_{(1)}) = n\phi(x_{(1)})\left[1-\Phi(x_{(1)})\right]^{n-1} = n\phi(x_{(1)})\left[\Phi(-x_{(1)})\right]^{n-1}\qquad [2] ดังนั้นค่าที่คาดหวังคือ E(X(1))=n∫∞−∞x(1)ϕ(x(1))[Φ(−x(1))]n−1dx(1)[3]E(X(1))=n∫−∞∞x(1)ϕ(x(1))[Φ(−x(1))]n−1dx(1)[3]E\left(X_{(1)}\right) = n\int_{-\infty}^{\infty}x_{(1)}\phi(x_{(1)})\left[\Phi(-x_{(1)})\right]^{n-1}dx_{(1)}\qquad [3] ที่เราได้ใช้คุณสมบัติสมมาตรของมาตรฐานปกติ ในโอเวน 1980 , p.402, eq. [ n, 011 …

1
R: Anova และการถดถอยเชิงเส้น
ฉันใหม่สำหรับสถิติและฉันพยายามเข้าใจความแตกต่างระหว่าง ANOVA และการถดถอยเชิงเส้น ฉันใช้ R เพื่อสำรวจสิ่งนี้ ฉันอ่านบทความต่าง ๆ เกี่ยวกับสาเหตุที่ ANOVA และการถดถอยแตกต่างกัน แต่ก็ยังเหมือนเดิมและวิธีที่สามารถมองเห็นได้ ฯลฯ ฉันคิดว่าฉันสวยที่นั่น แต่หายไปหนึ่งบิต ฉันเข้าใจว่า ANOVA เปรียบเทียบความแปรปรวนภายในกลุ่มกับความแปรปรวนระหว่างกลุ่มเพื่อพิจารณาว่ามีหรือไม่มีความแตกต่างระหว่างกลุ่มที่ทดสอบ ( https://controls.engin.umich.edu/wiki/index.php/Factor_analysis_and_ANOVA ) สำหรับการถดถอยเชิงเส้นฉันพบโพสต์ในฟอรัมนี้ซึ่งบอกว่าสามารถทดสอบได้เหมือนกันเมื่อเราทดสอบว่า b (ความชัน) = 0 ( ทำไม ANOVA สอน / ใช้ราวกับว่ามันเป็นวิธีการวิจัยที่แตกต่างเมื่อเทียบกับการถดถอยเชิงเส้น ) สำหรับกลุ่มมากกว่าสองกลุ่มฉันพบเว็บไซต์ที่ระบุ: สมมติฐานว่างคือ: H0:μ1=μ2=μ3H0:µ1=µ2=µ3\text{H}_0: µ_1 = µ_2 = µ_3 รูปแบบการถดถอยเชิงเส้นคือ: Y=ข0+ข1X1+ข2X2+ eY=ข0+ข1X1+ข2X2+อีy = b_0 + b_1X_1 + b_2X_2 …
9 r  regression  anova 

2
ความสัมพันธ์ระหว่างหมวดหมู่ระหว่างตัวแปรระบุแน่ชัด
ฉันมีชุดข้อมูลที่มีตัวแปรระบุหมวดหมู่สองชุด ฉันต้องการทราบว่า (และวิธี) ฉันสามารถระบุความสัมพันธ์ที่เป็นไปได้ระหว่างหมวดหมู่จากตัวแปรทั้งสองนี้หรือไม่ กล่าวอีกนัยหนึ่งไม่ว่าตัวอย่างเช่นผลลัพธ์ของหมวดหมู่ ผมii ในตัวแปร 1 แสดงความสัมพันธ์ที่ดีกับหมวดหมู่เฉพาะ Jjj ในตัวแปร 2 เนื่องจากฉันมีสองตัวแปรที่มี 5 หมวดหมู่การวิเคราะห์สหสัมพันธ์ทั้งหมดสำหรับหมวดหมู่ทั้งหมดจะลดลงถึง 25 ผลลัพธ์ (อย่างน้อยถ้ามันทำงานตามที่ฉันหวัง / คาดหวังว่ามันจะทำงาน) ฉันได้พยายามกำหนดปัญหาให้เป็นคำถามที่เป็นรูปธรรม: คำถามที่ 1: สมมติว่าฉันโอนตัวแปรเด็ดขาดเป็นตัวแปรดัมมี่ 5 ตัวต่อค่า (หมวดหมู่) ขั้นตอนเดียวกันนี้ฉันใช้สำหรับตัวแปรที่สองเช่นกัน จากนั้นฉันต้องการหาความสัมพันธ์ระหว่าง dummy 1.i และ 2.i (ตัวอย่าง) มันถูกต้องทางสถิติหรือไม่ที่ฉันจะดำเนินการตามขั้นตอนนี้ด้วยวิธีการของสัมประสิทธิ์สหสัมพันธ์สามัญ? สัมประสิทธิ์สหสัมพันธ์ที่เกิดจากขั้นตอนนี้ให้ข้อมูลเชิงลึกที่เหมาะสมในความสัมพันธ์ระหว่างตัวแปรจำลองทั้งสองหรือไม่? คำถามที่ 2: หากกระบวนการที่อธิบายไว้ในคำถามที่หนึ่งเป็นกระบวนการที่ถูกต้องมีวิธีดำเนินการวิเคราะห์นี้สำหรับทุกหมวดหมู่ของ 2 (หรืออาจมากกว่า) ตัวแปรระบุหมวดหมู่ทั้งหมดในครั้งเดียวหรือไม่? โปรแกรมที่ฉันใช้คือ SPSS (20)

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.