สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล


2
การกระจายเชิงสถิติของลำดับสูงสุดของบรรทัดฐานแบบสุ่ม IID
สูงสุด( X1, X2, . . . , Xn)สูงสุด(X1,X2,...,Xn)\max( X_1,X_2,...,X_n) nnn∞∞\inftyσ2σ2\sigma^2 นี่เป็นปัญหาที่รู้จักกันดีด้วยหลักฐานอันชาญฉลาดและวิธีแก้ปัญหาที่ดี แต่ฉันขุดมาแล้วไม่พบอะไรเลย

2
kurtosis ขนาดมหึมา?
ฉันกำลังทำสถิติเชิงพรรณนาของผลตอบแทนรายวันจากดัชนีหุ้น คือถ้าและP 2เป็นระดับของดัชนีในวันที่ 1 และวันที่ 2 ตามลำดับจากนั้นl o g e ( P 2P1P1P_1P2P2P_2คือผลตอบแทนที่ฉันใช้ (มาตรฐานสมบูรณ์ในวรรณกรรม)loge(P2P1)loge(P2P1)log_e (\frac{P_2}{P_1}) ดังนั้นความโด่งจึงมีมากในบางส่วนของสิ่งเหล่านี้ ฉันกำลังดูข้อมูลรายวันประมาณ 15 ปี (ประมาณการสังเกตอนุกรมเวลา)260∗15260∗15260 * 15 means sds mins maxs skews kurts ARGENTINA -0.00031 0.00965 -0.33647 0.13976 -15.17454 499.20532 AUSTRIA 0.00003 0.00640 -0.03845 0.04621 0.19614 2.36104 CZECH.REPUBLIC 0.00008 0.00800 -0.08289 0.05236 -0.16920 5.73205 FINLAND …

2
ตำราเรียนที่ได้รับ Metropolis-Hastings และ Gibbs Sampling
ฉันมีประสบการณ์ในทางปฏิบัติที่ดีกับการสุ่มตัวอย่าง Metropolis-Hastings และ Gibbs แต่ฉันต้องการทำความเข้าใจทางคณิตศาสตร์ของอัลกอริทึมเหล่านี้ให้ดีขึ้น หนังสือหรือบทความดี ๆ อะไรบ้างที่พิสูจน์ความถูกต้องของตัวอย่างเหล่านี้ (อัลกอริธึมที่มากกว่านั้นก็ยอดเยี่ยมเช่นกัน)?

4
เหตุใดจึงต้องใช้ตัวแปรควบคุมในส่วนที่แตกต่าง
ฉันมีคำถามเกี่ยวกับวิธีแยกความแตกต่างด้วยสมการมาตรฐานต่อไปนี้: โดยที่ treat เป็นตัวแปรจำลองสำหรับกลุ่มและโพสต์ที่ได้รับการรักษา y=a+b1treat+b2post+b3treat⋅post+uy=a+b1treat+b2post+b3treat⋅post+u y= a + b_1\text{treat}+ b_2\text{post} + b_3\text{treat}\cdot\text{post} + u ตอนนี้คำถามของฉันง่าย: ทำไมกระดาษส่วนใหญ่ยังคงใช้ตัวแปรควบคุมเพิ่มเติม? ฉันคิดว่าหากการคาดการณ์แนวโน้มแบบขนานนั้นถูกต้องเราไม่ควรกังวลเกี่ยวกับการควบคุมเพิ่มเติม ฉันคิดเพียง 2 เหตุผลที่เป็นไปได้ว่าทำไมถึงใช้ตัวแปรควบคุม: หากไม่มีพวกเขาแนวโน้มจะไม่ขนานกัน เนื่องจากสเปค DnD นั้นมีความแตกต่างในแนวโน้มระหว่างกลุ่มการรักษาและกลุ่มควบคุม ณ เวลาที่ทำการรักษากับการแทรกแซง (เช่นคำศัพท์ที่ปฏิบัติต่อการรักษา * โพสต์) - เมื่อเราไม่ได้ควบคุมตัวแปรอื่น ๆ สัมประสิทธิ์ของการโต้ตอบอาจจบลง - / understated มีใครบ้างไหมที่ให้ความกระจ่างเกี่ยวกับปัญหานี้ เหตุผลของฉัน 1) หรือ 2) สมเหตุสมผลไหม? ฉันไม่เข้าใจการใช้ตัวแปรควบคุมใน DnD อย่างสมบูรณ์

1
คำถามเกี่ยวกับการระบุตัวแบบผสมเชิงเส้นใน R สำหรับการวัดซ้ำข้อมูลด้วยโครงสร้างการซ้อนเพิ่มเติม
โครงสร้างข้อมูล > str(data) 'data.frame': 6138 obs. of 10 variables: $ RT : int 484 391 422 516 563 531 406 500 516 578 ... $ ASCORE : num 5.1 4 3.8 2.6 2.7 6.5 4.9 2.9 2.6 7.2 ... $ HSCORE : num 6 2.1 7.9 1 6.9 8.9 8.2 …

1
ในสหสัมพันธ์ cophenetic สำหรับการรวมกลุ่ม dendrogram
พิจารณาบริบทของการรวมกลุ่ม dendrogram ให้เราเรียกความแตกต่างเดิมระยะทางระหว่างบุคคล หลังจากสร้าง dendrogram เราจะกำหนดความแตกต่างของ copheneticระหว่างบุคคลสองคนเป็นระยะห่างระหว่างกลุ่มที่บุคคลเหล่านี้อยู่ บางคนคิดว่าความสัมพันธ์ระหว่างความแตกต่างดั้งเดิมและความแตกต่างของ cophenetic (เรียกว่าสหสัมพันธ์ cophenetic ) เป็น "ดัชนีความเหมาะสม" ของการจัดหมวดหมู่ เสียงนี้ทำให้ฉันงงงวยจริงๆ การคัดค้านของฉันไม่ได้ขึ้นอยู่กับตัวเลือกเฉพาะของสหสัมพันธ์ของเพียร์สัน แต่โดยทั่วไปแล้วความคิดใด ๆ ที่เชื่อมโยงระหว่างความแตกต่างเดิมกับความแตกต่างของ cophenetic อาจเกี่ยวข้องกับความเหมาะสมของการจำแนกประเภท คุณเห็นด้วยกับฉันหรือคุณอาจเสนออาร์กิวเมนต์ที่สนับสนุนการใช้สหสัมพันธ์ cophenetic เป็นดัชนีความเหมาะสมสำหรับการจำแนก dendrogram?

3
หมายถึงเวลาการเอาชีวิตรอดสำหรับฟังก์ชันการเอาชีวิตรอดแบบล็อก - ปกติ
ฉันพบสูตรมากมายที่แสดงวิธีหาเวลาเฉลี่ยในการเอาชีวิตรอดสำหรับการแจกแจงแบบเลขชี้กำลังหรือ Weibull แต่ฉันโชคดีน้อยลงสำหรับฟังก์ชันการเอาชีวิตรอดแบบล็อก - ปกติ รับฟังก์ชั่นการอยู่รอดต่อไปนี้: S( t ) = 1 - ϕ [ ln( t ) - μσ]S(เสื้อ)=1-φ[LN⁡(เสื้อ)-μσ]S(t) = 1 - \phi \left[ {{{\ln (t) - \mu } \over \sigma }} \right] เราจะหาเวลารอดเฉลี่ยได้อย่างไร ตามที่ผมเข้าใจมันคือพารามิเตอร์ขนาดโดยประมาณและที่ exp ( ) จากรูปแบบการอยู่รอดพาราคือ\ในขณะที่ฉันคิดว่าฉันสามารถจัดการมันได้อย่างเป็นสัญลักษณ์เพื่อให้ได้ทั้งหมดหลังจากตั้งค่า S (t) = 0.5 สิ่งที่ทำให้ฉันนิ่งงันโดยเฉพาะคือวิธีจัดการในรูปแบบ R เมื่อมันเข้ามาเพื่อประเมินค่าทั้งหมดและได้รับ เวลาเฉลี่ยบีตาμσσ\sigmaββ\betaμμ\muφφ\phi ป่านนี้ฉันได้สร้างฟังก์ชันการอยู่รอด (และเส้นโค้งที่เกี่ยวข้อง) เช่น: …
10 survival 

3
วิธีทำแบบจำลองลำเอียงที่มีอคติแตกต่างกันไปตามเวลา
สินค้าทุกรุ่นของเหรียญลำเอียงมักจะมีพารามิเตอร์หนึ่งtheta) วิธีหนึ่งในการประมาณจากชุดของการจับฉลากคือการใช้เบต้าก่อนหน้านี้และคำนวณการกระจายด้านหลังด้วยความน่าจะเป็นทวินามθ=P(Head|θ)θ=P(Head|θ)\theta = P(\text{Head} | \theta)θθ\theta ในการตั้งค่าของฉันเพราะของกระบวนการทางกายภาพบางอย่างแปลกคุณสมบัติเหรียญของฉันจะเปลี่ยนแปลงอย่างช้าๆและกลายเป็นหน้าที่ของเวลาทีข้อมูลของฉันคือชุดของคำสั่งให้ดึงเช่น\} ฉันสามารถพิจารณาว่าฉันมีเพียงหนึ่งวาดสำหรับแต่ละในตารางเวลาไม่ต่อเนื่องและปกติθθ\thetattt{H,T,H,H,H,T,...}{H,T,H,H,H,T,...}\{H,T,H,H,H,T,...\}ttt คุณจะทำแบบนี้อย่างไร ฉันกำลังคิดบางอย่างเช่นตัวกรองคาลมานที่ปรับให้เข้ากับความจริงที่ว่าตัวแปรที่ซ่อนอยู่คือและรักษาโอกาสทวินาม ฉันจะใช้อะไรกับโมเดลเพื่อให้อนุมานได้θθ\thetaP(θ(t+1)|θ(t))P(θ(t+1)|θ(t))P(\theta(t+1)|\theta(t)) แก้ไขคำตอบต่อไปนี้ (ขอบคุณ!) : ฉันต้องการสร้างแบบจำลองเป็น Markov Chain ของคำสั่งที่ 1 เหมือนที่ทำในตัวกรอง HMM หรือ Kalman ข้อสันนิษฐานเดียวที่ฉันทำได้คือราบรื่น ฉันสามารถเขียนด้วยเสียงแบบเกาส์ขนาดเล็ก (ความคิดตัวกรองคาลมาน) แต่สิ่งนี้จะทำลายข้อกำหนดที่จะต้องยังคงอยู่ใน[0,1]จากแนวคิดต่อไปนี้จาก @J Dav ฉันสามารถใช้ฟังก์ชัน probit เพื่อแมปบรรทัดจริงกับแต่ฉันมีสัญชาตญาณว่าสิ่งนี้จะให้โซลูชันที่ไม่ใช่การวิเคราะห์ การแจกแจงแบบเบต้าพร้อมค่าเฉลี่ยθ(t)θ(t)\theta(t)θ(t)θ(t)\theta(t)P(θ(t+1)|θ(t))=θ(t)+ϵP(θ(t+1)|θ(t))=θ(t)+ϵP(\theta(t+1)|\theta(t)) = \theta(t) + \epsilonϵϵ\epsilonθθ\theta[0,1][0,1][0,1][0,1][0,1][0,1]θ(t)θ(t)\theta(t) และความแปรปรวนที่กว้างขึ้นสามารถทำกลอุบายได้ ฉันถามคำถามนี้เพราะฉันรู้สึกว่าปัญหานี้ง่ายมากจนต้องมีการศึกษามาก่อน

2
วิธีที่ดีที่สุดในการรวมการตอบสนองแบบไบนารีและแบบต่อเนื่อง
ฉันกำลังพยายามหาวิธีที่ดีที่สุดในการทำนายจำนวนเงินที่ชำระสำหรับ บริษัท ตัวแทนเรียกเก็บเงิน ตัวแปรตามไม่ได้เป็นศูนย์เฉพาะเมื่อมีการชำระเงินแล้ว เป็นที่เข้าใจกันดีว่ามีจำนวนศูนย์เป็นจำนวนมากเพราะคนส่วนใหญ่ไม่สามารถเข้าถึงหรือไม่สามารถชำระหนี้คืนได้ นอกจากนี้ยังมีความสัมพันธ์เชิงลบที่แข็งแกร่งมากระหว่างจำนวนหนี้และความน่าจะเป็นในการชำระเงิน โดยปกติแล้วฉันจะสร้างแบบจำลองโลจิสติกส์เพื่อทำนายความน่าจะเป็นของการจ่าย / ไม่จ่ายเงิน แต่สิ่งนี้มีผลลัพธ์ที่โชคร้ายในการค้นหาคนที่มียอดคงเหลือต่ำสุด มีวิธีรวมรูปแบบการจ่าย / การจ่ายที่ไม่ใช่โลจิสติกเข้ากับแบบจำลองแยกที่ทำนายจำนวนเงินที่ชำระหรือไม่

4
การกระจายการบันทึกปกติที่เหมาะสมใน R กับ SciPy
ฉันติดตั้งโมเดล lognormal โดยใช้ R พร้อมชุดข้อมูล พารามิเตอร์ผลลัพธ์คือ: meanlog = 4.2991610 sdlog = 0.5511349 ฉันต้องการถ่ายโอนโมเดลนี้ไปยัง Scipy ซึ่งฉันไม่เคยใช้มาก่อน เมื่อใช้ Scipy ฉันสามารถรับรูปร่างและมาตราส่วน 1 และ 3.1626716539637488e + 90 - ตัวเลขที่แตกต่างกันมาก ฉันยังพยายามใช้ exp ของ meanlog และ sdlog แต่ยังคงได้กราฟที่แปลกประหลาด ฉันได้อ่านเอกสารทุกฉบับที่ฉันสามารถทำได้ใน scipy และฉันยังสับสนเกี่ยวกับความหมายของพารามิเตอร์รูปร่างและขนาดในกรณีนี้ มันจะสมเหตุสมผลหรือไม่ที่จะเขียนโค้ดฟังก์ชันเอง ที่ดูเหมือนว่าจะเกิดข้อผิดพลาดในขณะที่ฉันใหม่เพื่อ scipy SCIPY Lognormal (BLUE) กับ R Lognormal (RED): มีความคิดเห็นเกี่ยวกับทิศทางใดที่จะนำไปใช้? ข้อมูลมีความสอดคล้องกับโมเดล R เป็นอย่างดีดังนั้นถ้ามันดูเป็นอย่างอื่นใน Python …
10 r  python  numpy  scipy 


2
Wilcoxon-Mann-Whitney ค่าวิกฤตใน R
ฉันสังเกตว่าเมื่อฉันพยายามค้นหาค่าวิกฤตสำหรับ Mann-Whitney U โดยใช้ R ค่าจะเป็น 1 + ค่าวิกฤตเสมอ ตัวอย่างเช่นสำหรับ , ค่าวิกฤต (สองหาง) คือ 8 ในขณะที่สำหรับ , (สองหาง ) ค่าวิกฤตคือ 22 (ตรวจสอบตาราง ) แต่:α = .05 , n = 12 , m = 8α=.05,n=10,m=5α=.05,n=10,m=5\alpha=.05, n = 10, m = 5α = .05 , n = 12 , m = 8α=.05,n=12,m=8\alpha=.05, …

2
จะตีความความแตกต่างที่กำหนดเองเหล่านี้ได้อย่างไร
ฉันกำลังทำ ANOVA ทางเดียว (ต่อสปีชีส์) ด้วยความแตกต่างที่กำหนดเอง [,1] [,2] [,3] [,4] 0.5 -1 0 0 0 5 1 -1 0 0 12.5 0 1 -1 0 25 0 0 1 -1 50 0 0 0 1 ที่ฉันเปรียบเทียบความเข้ม 0.5 กับ 5, 5 กับ 12.5 และอื่น ๆ นี่คือข้อมูลที่ฉันกำลังทำอยู่ ด้วยผลลัพธ์ต่อไปนี้ Generalized least squares fit by …

3
วิธีการฝึกอบรมข้อมูลที่มีประสิทธิภาพที่สุดโดยใช้หน่วยความจำน้อยที่สุดคืออะไร?
นี่คือข้อมูลการฝึกอบรมของฉัน: 200,000 ตัวอย่าง x 10,000 คุณสมบัติ เมทริกซ์ข้อมูลการฝึกอบรมของฉันคือ - 200,000 x 10,000 ฉันจัดการเพื่อบันทึกสิ่งนี้ในไฟล์ flat โดยไม่ต้องมีปัญหาหน่วยความจำโดยบันทึกทุกชุดข้อมูลหนึ่งโดยหนึ่ง (หนึ่งตัวอย่างหลังจากที่อื่น) ในขณะที่ฉันสร้างคุณสมบัติสำหรับแต่ละตัวอย่าง แต่ตอนนี้เมื่อฉันใช้Milk , SVM lightหรืออัลกอริทึมการเรียนรู้ของเครื่องจักรอื่น ๆ ทุกอย่างพยายามโหลดข้อมูลการฝึกอบรมทั้งหมดลงในหน่วยความจำแทนการฝึกอบรมทีละคน อย่างไรก็ตามฉันเพิ่งมี RAM 8 GB ดังนั้นฉันจึงไม่สามารถดำเนินการต่อได้ คุณรู้หรือไม่ว่าฉันสามารถฝึกอัลกอริทึมหนึ่งชุดข้อมูลโดยหนึ่งชุดข้อมูล? นั่นคือเพื่อที่ทันทีฉันมีเพียงหนึ่งชุดข้อมูลที่โหลดลงในหน่วยความจำในขณะที่การฝึกอบรม

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.