สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
ทำไมฉันถึงได้รับข้อมูลข่าวสารมากกว่า 1
ฉันใช้ฟังก์ชันต่อไปนี้เพื่อคำนวณเอนโทรปี: from math import log def calc_entropy(probs): my_sum = 0 for p in probs: if p > 0: my_sum += p * log(p, 2) return - my_sum ผลลัพธ์: >>> calc_entropy([1/7.0, 1/7.0, 5/7.0]) 1.1488348542809168 >>> from scipy.stats import entropy # using a built-in package # give the same answer >>> entropy([1/7.0, …

1
พารามิเตอร์ Noncentrality - มันคืออะไรมันทำอะไรอะไรจะเป็นค่าที่แนะนำ?
ฉันพยายามทำความเข้าใจเกี่ยวกับสถิติของฉันโดยเฉพาะอย่างยิ่งเกี่ยวกับการกำหนดขนาดตัวอย่างและการวิเคราะห์พลังงานทางสถิติ แต่ดูเหมือนว่ายิ่งฉันอ่านมากกว่าที่ฉันต้องอ่าน อย่างไรก็ตามฉันพบเครื่องมือที่เรียกว่าG * Powerซึ่งดูเหมือนว่าจะทำทุกอย่างที่ฉันต้องการ แต่ฉันมีปัญหาในการทำความเข้าใจพารามิเตอร์ Noncentrality มันคืออะไรมันทำอะไรทำอะไรจะเป็นค่าที่แนะนำ ฯลฯ ข้อมูลเกี่ยวกับวิกิพีเดีย ฯลฯ นั้นไม่สมบูรณ์หรือฉันไม่เข้าใจงาน ฉันกำลังดำเนินการชุดการทดสอบ z แบบสองหางหากนั่นคือความช่วยเหลือใด ๆ ps ทุกคนสามารถเพิ่มแท็กที่ดีกว่าให้กับคำถามนี้ได้ไหม

1
สมมติฐานปกติในการถดถอยเชิงเส้น
ในฐานะที่เป็นข้อสันนิษฐานของการถดถอยเชิงเส้นปกติของการกระจายของข้อผิดพลาดบางครั้งก็ผิด "ขยาย" หรือตีความว่าเป็นความจำเป็นสำหรับความปกติของ y หรือ x เป็นไปได้หรือไม่ที่จะสร้างสถานการณ์ / ชุดข้อมูลที่ที่ X และ Y ไม่ได้เป็นแบบปกติ แต่มีข้อผิดพลาดเกิดขึ้นดังนั้นค่าประมาณการถดถอยเชิงเส้นที่ได้รับจึงถูกต้อง?

3
ค่าสเกลในการวิเคราะห์ discriminant เชิงเส้น (LDA) สามารถนำมาใช้เพื่อพล็อตตัวแปรอธิบายบน discriminants เชิงเส้นได้หรือไม่
การใช้ biplot ของค่าที่ได้จากการวิเคราะห์องค์ประกอบหลักเป็นไปได้ที่จะสำรวจตัวแปรอธิบายที่ประกอบกันเป็นองค์ประกอบหลัก นี่เป็นไปได้ไหมกับการวิเคราะห์จำแนกเชิงเส้น? ตัวอย่างที่มีให้ใช้ข้อมูลคือ "ข้อมูล Iris Data ของ Edgar Anderson" ( http://en.wikipedia.org/wiki/Iris_flower_data_set ) นี่คือข้อมูลม่านตา : id SLength SWidth PLength PWidth species 1 5.1 3.5 1.4 .2 setosa 2 4.9 3.0 1.4 .2 setosa 3 4.7 3.2 1.3 .2 setosa 4 4.6 3.1 1.5 .2 setosa 5 5.0 3.6 1.4 …

2
ความสัมพันธ์ระหว่างไพ่สองสำรับ?
ฉันได้เขียนโปรแกรมเพื่อจำลองการสลับไพ่ ฟาด ไพ่แต่ละใบมีหมายเลขโดยมีชุดสูทจากCLUBS, DIAMONDS, HEARTS, SPADESและอันดับจากสองถึงสิบจากนั้นแจ็ค, Queen, King และ Ace ดังนั้น Two of Clubs จึงมีหมายเลข 1, Three of Clubs a 2 .... Ace of Clubs คือ 13 ... Ace of Spades คือ 52 หนึ่งในวิธีการในการกำหนดวิธีสับไพ่คือการเปรียบเทียบกับไพ่ที่ไม่ได้สับไพ่และดูว่าลำดับของไพ่มีความสัมพันธ์กันหรือไม่ นั่นคือฉันอาจมีการ์ดเหล่านี้พร้อมกับการ์ดที่ไม่มีการสับเพื่อเปรียบเทียบ: Unshuffled Shuffled Unshuffled number Shuffled number Two of Clubs Three of Clubs 1 2 Three …

3
วิธีการใช้การทดสอบ Nemenyi อย่างถูกต้องหลังการทดสอบฟรีดแมน
ฉันกำลังเปรียบเทียบประสิทธิภาพของอัลกอริทึมหลายชุดในชุดข้อมูลหลายชุด ตั้งแต่ผู้การวัดประสิทธิภาพการทำงานไม่ได้รับประกันว่าจะกระจายตามปกติผมเลือกทดสอบฟรีดแมนกับโพสต์-hoc ทดสอบ Nemenyi ขึ้นอยู่กับDemšar (2006) จากนั้นฉันก็พบกระดาษอื่นที่นอกเหนือจากการแนะนำวิธีอื่น ๆ เช่นการทดสอบ Quade ด้วยการทดสอบหลังการทำ Shaffer ที่ตามมาพวกเขาใช้การทดสอบ Nemenyi ต่างกัน ฉันจะใช้การทดสอบ Nemenyi หลังการทดสอบอย่างถูกต้องได้อย่างไร 1. การใช้สถิติช่วง Studentized ในบทความของDemšarมันบอกว่าจะปฏิเสธสมมติฐานว่าง (ไม่มีความแตกต่างของประสิทธิภาพของสองอัลกอริธึม) ถ้าค่าเฉลี่ยความแตกต่างอันดับมากกว่าระยะทางวิกฤติซีดี คD =Qαk ( k + 1 )6 N-------√CD=qαk(k+1)6N CD = q_{\alpha}\sqrt{{k(k+1)}\over{6N}} "โดยที่ค่าวิกฤตqαขึ้นอยู่กับสถิติของช่วง Studentized หารด้วย "2-√.2.\sqrt{2}. หลังจากขุดค้นพบว่าคุณสามารถค้นหา "ค่าวิกฤต" สำหรับα = 0.05α=0.05\alpha = 0.05บางตัวเช่นในตารางสำหรับสำหรับองศาอิสระที่ไม่มีที่สิ้นสุด (ที่ด้านล่างของแต่ละตาราง) 2. หรือใช้การแจกแจงแบบปกติ? เมื่อฉันคิดว่าฉันรู้ว่าต้องทำอะไรฉันพบกระดาษอีกฉบับที่ทำให้ฉันสับสนอีกครั้งเพราะพวกเขาใช้การแจกแจงแบบปกติเท่านั้น …

1
สองวิธีของการทดสอบนัยสำคัญ bootstrap
การใช้ bootstrap ฉันคำนวณค่า p ของการทดสอบนัยสำคัญโดยใช้สองวิธี: resampling ภายใต้สมมติฐานว่างและนับผลลัพธ์อย่างน้อยที่สุดเท่าที่ผลลัพธ์มาจากข้อมูลต้นฉบับ การ resampling ใหม่ภายใต้สมมติฐานทางเลือกและการนับผลลัพธ์อย่างน้อยที่สุดห่างจากผลลัพธ์ดั้งเดิมเป็นค่าที่สอดคล้องกับสมมติฐานว่าง ผมเชื่อว่า 1 เซนต์วิธีการที่ถูกต้องทั้งหมดเป็นไปตามความหมายของค่าเอพี ฉันไม่ค่อยแน่ใจเกี่ยวกับวินาที แต่มักจะให้ผลลัพธ์ที่คล้ายกันมากและเตือนให้ฉันทดสอบ Wald ฉันถูกไหม? วิธีการทั้งสองถูกต้องหรือไม่ พวกเขาเหมือนกัน (สำหรับตัวอย่างขนาดใหญ่) หรือไม่ ตัวอย่างสำหรับทั้งสองวิธี (แก้ไขหลังจากคำถามของ DWIN และคำตอบของ Erik): ตัวอย่างที่ 1 ลองสร้างการทดสอบบูตสแตรปเหมือนกับการทดสอบ T สองตัวอย่าง วิธีที่ 1 จะสุ่มตัวอย่างจากตัวอย่างหนึ่ง (ได้จากการรวมสองต้นฉบับ) วิธีที่ 2 จะสุ่มตัวอย่างจากตัวอย่างทั้งสองอย่างอิสระ ตัวอย่างที่ 2 เรามาสร้าง bootstrap test ของสหสัมพันธ์ระหว่างx₁…xₐและy₁…yₐ วิธีที่ 1 จะไม่ถือว่ามีความสัมพันธ์และการสุ่มตัวอย่างใหม่อนุญาตสำหรับคู่ (xₑ, yₔ) โดยที่≠ …

4
แหล่งข้อมูลออนไลน์สำหรับปรัชญาของสาเหตุเพื่อการอนุมานสาเหตุ
คุณสามารถแนะนำหนังสือบทความเรียงความบทเรียน / หลักสูตรออนไลน์และอื่น ๆ ที่น่าสนใจและมีประโยชน์สำหรับนักระบาดวิทยา / นักชีวสถิติเพื่อเรียนรู้เกี่ยวกับปรัชญาของการอนุมานสาเหตุ / สาเหตุ ฉันรู้ค่อนข้างน้อยเกี่ยวกับการใช้การอนุมานเชิงสาเหตุจากกรอบ epi และ biostats แต่ฉันต้องการเรียนรู้บางอย่างเกี่ยวกับปรัชญาที่สนับสนุนและกระตุ้นงานนี้ ตัวอย่างเช่นมันเป็นความเข้าใจของฉันที่ฮูมพูดถึงความคิดแรกที่สามารถตีความได้ว่าเป็นของต่อต้าน โดยทั่วไปฉันไม่มีการฝึกอบรมหรือมีประสบการณ์เกี่ยวกับปรัชญาดังนั้นฉันต้องการสิ่งที่ค่อนข้างเกริ่นนำเพื่อเริ่มต้นด้วย แต่ฉันจะสนใจคำแนะนำสำหรับข้อความ / ผู้เขียนที่ซับซ้อน แต่สำคัญ / พื้นฐาน / ผู้เขียน (แต่โปรดระบุว่าพวกเขาไม่ได้เกริ่นนำ) ฉันหวังว่านี่จะไม่ใช่หัวข้อที่เกินไปสำหรับการตรวจสอบข้าม แต่ฉันหวังว่าคุณบางคนจะอยู่ในเรือลำเดียวกันกับฉันก่อนหน้านี้และสามารถแบ่งปันทรัพยากรที่คุณโปรดปราน

2
วิธีสร้างแบบจำลองเดือนต่อเดือนผลกระทบในข้อมูลอนุกรมเวลารายวัน?
ฉันมีชุดข้อมูลรายวันสองชุด หนึ่งคือsign-upsและอื่น ๆterminationsของการสมัครสมาชิก ฉันต้องการทำนายหลังโดยใช้ข้อมูลที่มีอยู่ในตัวแปรทั้งสอง เมื่อมองดูกราฟของซีรี่ส์เหล่านี้เห็นได้ชัดว่าการเลิกจ้างมีความสัมพันธ์กับการลงชื่อสมัครเข้าใช้หลายรายการก่อนหน้านี้หลายเดือน นั่นคือการขัดขวางการลงชื่อสมัครใช้ในวันที่ 10 พฤษภาคมจะนำไปสู่การเพิ่มขึ้นของการยุติในวันที่ 10 มิถุนายน 10 กรกฎาคมและ 10 สิงหาคมเป็นต้นไปแม้ว่าผลจะหมดไป ฉันหวังว่าจะได้คำใบ้ว่าฉันควรใช้แบบจำลองรุ่นใดเพื่อแก้ปัญหาเฉพาะนี้ คำแนะนำใด ๆ ที่จะได้รับการชื่นชมมาก .. จนถึงตอนนี้ฉันกำลังคิดแบบจำลอง VAR แต่ฉันไม่แน่ใจว่าจะรวมเอฟเฟกต์รายเดือนอย่างไรให้ใช้คำสั่งล่าช้าสูงมากหรือเพิ่มองค์ประกอบตามฤดูกาลอย่างใด

3
พิสูจน์ความสัมพันธ์ระหว่างอัตราอันตรายความหนาแน่นของความน่าจะเป็นฟังก์ชันการเอาชีวิตรอด
ฉันกำลังอ่านหนังสือเกี่ยวกับการวิเคราะห์ความอยู่รอดและหนังสือเรียนส่วนใหญ่ระบุว่า h(t)=limΔt→0P(t&lt;T≤t+Δt|T≥t)Δt=f(t)1−F(t)(1)h(t)=limΔt→0P(t&lt;T≤t+Δt|T≥t)Δt=f(t)1−F(t)(1)h(t)= \lim_{ \Delta t \rightarrow 0} \frac{P(t < T \leq t+\Delta t |T \geq t )}{ \Delta t} =\frac{f(t)}{1-F(t)} (1) เมื่อh(t)h(t)h(t)คืออัตราความอันตราย f(t)=limΔt→0P(t&lt;T≤t+Δt)Δt(2)f(t)=limΔt→0P(t&lt;T≤t+Δt)Δt(2)f(t)=\lim_{\Delta t \rightarrow 0} \frac{P(t < T \leq t+\Delta t)}{ \Delta t}(2)ฟังก์ชันความหนาแน่น F(t)=Pr(T&lt;t)(3)F(t)=Pr(T&lt;t)(3)F(t)=Pr(Tt)=1-F(t) (4) พวกเขายังกล่าวว่า S(t)=e−∫t0h(s)ds(5)S(t)=e−∫0th(s)ds(5)S(t)= e^{- \int_0^t h(s)ds } (5) หนังสือเรียนส่วนใหญ่ (อย่างน้อยที่ฉันมี) ไม่แสดงหลักฐานสำหรับ (1) หรือ (5) ฉันคิดว่าฉันสามารถผ่าน …
11 survival 

1
ประสิทธิภาพการถดถอยของเคอร์เนลเคอร์เนล
การถดถอยของสันสามารถแสดงเป็น Y^= (X'X +aผมd)- 1X xy^=(X′X+aId)−1Xx\hat{y} = (\mathbf{X'X} + a\mathbf{I}_d)^{-1}\mathbf{X}x ที่ไหน Y^y^\hat{y}เป็นป้ายที่คาดการณ์ระบุเมทริกซ์วัตถุที่เรากำลังพยายามที่จะหาฉลากและเมทริกซ์ของวัตถุเช่นนั้น:IdId\mathbf{I}_dd×dd×dd \times dxx\mathbf{x}XX\mathbf{X}n×dn×dn \times dnnnxi=(xi,1,...,xi,d)∈Rdxi=(xi,1,...,xi,d)∈Rd\mathbf{x}_i = (x_{i,1}, ..., x_{i,d})\in \mathbb{R}^d X=⎛⎝⎜⎜⎜⎜⎜x1,1x2,1⋮xn,1x1,2x2,2⋮x1,2……⋱…x1,dx2,d⋮xn,d⎞⎠⎟⎟⎟⎟⎟X=(x1,1x1,2…x1,dx2,1x2,2…x2,d⋮⋮⋱⋮xn,1x1,2…xn,d) \mathbf{X} = \begin{pmatrix} x_{1,1} & x_{1,2} & \ldots & x_{1,d}\\ x_{2,1} & x_{2,2} & \ldots & x_{2,d}\\ \vdots & \vdots & \ddots & \vdots\\ x_{n,1} & x_{1,2} &\ldots …

3
PCA, ICA และ Laplacian eigenmaps
คำถาม ฉันสนใจวิธีการ Laplacian Eigenmaps มาก ขณะนี้ฉันกำลังใช้เพื่อทำการลดขนาดของชุดข้อมูลทางการแพทย์ของฉัน อย่างไรก็ตามฉันพบปัญหาโดยใช้วิธีการ ตัวอย่างเช่นฉันมีข้อมูลบางอย่าง (สัญญาณสเปกตรัม) และฉันสามารถใช้ PCA (หรือ ICA) เพื่อรับพีซี (หรือไอซี) บางอย่าง ปัญหาคือวิธีการรับมิติที่คล้ายกันลดองค์ประกอบของข้อมูลต้นฉบับโดยใช้ LE? จากวิธีการของไอแลปแมชีทแลปเลียนเราจำเป็นต้องแก้ปัญหาค่าลักษณะเฉพาะทั่วไปซึ่งก็คือ L Y= λ D yLy=λDyL y = \lambda D y ที่นี่ Yyyเป็นไอเกนวีค ถ้าฉันพล็อตเช่น eigenvector 3 อันดับแรก (การแก้ปัญหาตาม 3 eigenvalues) ผลลัพธ์จะไม่สามารถตีความได้ อย่างไรก็ตามเมื่อฉันพล็อตพีซี 3 อันดับแรกและไอซี 3 อันดับแรกผลลัพธ์ดูเหมือนจะชัดเจน (มองเห็น) แสดงข้อมูลต้นฉบับ xxx. ฉันถือว่าเหตุผลเป็นเพราะเมทริกซ์ LLL ถูกกำหนดโดยเมทริกซ์น้ำหนัก …
11 pca  ica 

4
คุณจะค้นหาความสัมพันธ์เชิงสาเหตุในข้อมูลได้อย่างไร
ให้บอกว่าฉันมีตารางที่มีคอลัมน์ "A", "B" มีวิธีการทางสถิติเพื่อตรวจสอบว่า "A" ทำให้ "B" เกิดขึ้นหรือไม่? เราไม่สามารถใช้ r ของ Pearson ได้เพราะ: มันเพียงทดสอบความสัมพันธ์ระหว่างค่า สหสัมพันธ์ไม่ใช่สาเหตุ เพียร์สัน r สามารถสัมพันธ์เชิงเส้นสัมพันธ์เท่านั้น ฉันมีตัวเลือกอื่นที่นี่อีกไหม

3
การสร้างค่าสุ่มที่มีความสัมพันธ์อัตโนมัติใน R
เรากำลังพยายามสร้างค่าสุ่มที่มีความสัมพันธ์โดยอัตโนมัติซึ่งจะใช้เป็นชุดเวลา เราไม่มีข้อมูลที่เราอ้างถึงและเพียงต้องการสร้างเวกเตอร์ตั้งแต่เริ่มต้น ในอีกด้านหนึ่งเราต้องการกระบวนการสุ่มที่มีการแจกแจงและ SD ในอีกทางหนึ่งความสัมพันธ์อัตโนมัติที่มีอิทธิพลต่อกระบวนการสุ่มจะต้องมีการอธิบาย ค่าของเวกเตอร์นั้นมีความสัมพันธ์กันโดยอัตโนมัติพร้อมกับความแข็งแรงลดลงในช่วงเวลาต่าง ๆ เช่น lag1 มี 0.5, lag2 0.3, lag1 0.1 เป็นต้น ดังนั้นในที่สุดเวกเตอร์ควรมองสิ่งที่: 2, 4, 7, 11, 10, 8, 5, 4, 2, -1, 2, 5, 9, 12, 13, 10, 8, 4, 3, 1, -2, -5 และอื่น ๆ

1
ฟิชเชอร์ทดสอบใน R
สมมติว่าเรามีชุดข้อมูลต่อไปนี้: Men Women Dieting 10 30 Non-dieting 5 60 ถ้าฉันใช้การทดสอบที่แน่นอนของฟิชเชอร์ใน R ดังนั้นอะไรalternative = greater(หรือน้อยกว่า) หมายถึงอะไร ตัวอย่างเช่น: mat = matrix(c(10,5,30,60), 2,2) fisher.test(mat, alternative="greater") ฉันจะได้รับและp-value = 0.01588 odds ratio = 3.943534นอกจากนี้เมื่อฉันพลิกแถวของตารางฉุกเฉินเช่นนี้ mat = matrix(c(5,10,60,30), 2, 2) fisher.test(mat, alternative="greater") แล้วฉันจะได้รับและp-value = 0.9967 odds ratio = 0.2535796แต่เมื่อผมทำงานตารางสองฉุกเฉินโดยไม่มีข้อโต้แย้งทางเลือก (เช่นfisher.test(mat)) p-value = 0.02063แล้วฉันจะได้รับ คุณช่วยอธิบายเหตุผลให้ฉันได้ไหม นอกจากนี้สมมติฐานว่างและสมมติฐานทางเลือกในกรณีข้างต้นคืออะไร? ฉันสามารถทำการทดสอบการประมงบนโต๊ะฉุกเฉินได้ไหม …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.