สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
การเปรียบเทียบตัวแบบการถดถอยกับข้อมูลการนับ
ฉันเพิ่งพอดีแบบจำลองการถดถอย 4 แบบสำหรับข้อมูลตัวทำนาย / ตอบกลับเดียวกัน รุ่นที่ฉันพอดีกับการถดถอยของปัวซอง model.pois <- glm(Response ~ P1 + P2 +...+ P5, family=poisson(), ...) model.pois.inter <- glm(Response ~ (P1 + P2 +...+ P5)^2, family=poisson(), ...) แบบจำลองสองแบบที่ฉันพอดีกับการถดถอยแบบทวินาม library(MASS) model.nb <- glm.nb(Response ~ P1 + P2 +...+ P5, ...) model.nb.inter <- glm.nb(Response ~ (P1 + P2 +...+ P5)^2, ...) …

3
การประมาณพารามิเตอร์ของโมเดลเชิงเส้นแบบไดนามิก
ฉันต้องการที่จะใช้ (ใน R) แบบจำลองเชิงเส้นตรงแบบง่าย ๆ ดังต่อไปนี้ซึ่งฉันมี 2 ตัวแปรที่ไม่รู้จักเวลา (ความแปรปรวนของข้อผิดพลาดการสังเกตและความแปรปรวนของข้อผิดพลาดของรัฐϵ 2 t )ε1เสื้อϵt1\epsilon^1_tε2เสื้อϵt2\epsilon^2_t Yเสื้อθt + 1==θเสื้อ+ ϵ1เสื้อθเสื้อ+ ϵ2เสื้อYt=θt+ϵt1θt+1=θt+ϵt2 \begin{matrix} Y_t & = & \theta_t + \epsilon^1_t\\ \theta_{t+1} & = & \theta_{t}+\epsilon^2_t \end{matrix} ฉันต้องการที่จะประมาณค่าพารามิเตอร์เหล่านี้ที่จุดในแต่ละครั้ง, โดยไม่ต้องมีอคติมองไปข้างหน้า จากสิ่งที่ฉันเข้าใจฉันสามารถใช้ MCMC (บนหน้าต่างกลิ้งเพื่อหลีกเลี่ยงอคติข้างหน้า) หรือตัวกรองอนุภาค (หรือ Sequential Monte Carlo - SMC) วิธีการที่คุณจะใช้และ อะไรคือข้อดีและข้อเสียของทั้งสองวิธี? คำถามโบนัส: ในวิธีการเหล่านี้คุณจะเลือกความเร็วของการเปลี่ยนแปลงพารามิเตอร์ได้อย่างไร ฉันเดาว่าเราต้องป้อนข้อมูลที่นี่เพราะมีการต่อรองระหว่างการใช้ข้อมูลจำนวนมากเพื่อประเมินพารามิเตอร์และใช้ข้อมูลน้อยลงเพื่อตอบสนองต่อการเปลี่ยนแปลงของพารามิเตอร์ได้เร็วขึ้นหรือไม่
11 r  mcmc  dlm  particle-filter 

4
Lasso fitting โดยการประสานงานโคตร: การใช้งานโอเพนซอร์ส? [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้เป็นไปตามหัวข้อสำหรับการตรวจสอบข้าม ปิดเมื่อปีที่แล้ว การใช้งานโอเพนซอร์ซอะไร - ในภาษาใด - มีอยู่ที่นั่นที่สามารถคำนวณเส้นทางการทำปฎิบัติการแบบ lasso สำหรับการถดถอยเชิงเส้นโดยการประสานงานโคตร? จนถึงตอนนี้ฉันรู้: glmnet scikits.learn มีอะไรอีกบ้าง?

6
มีเว็บไซต์ที่โพสต์แบบสำรวจของฉันเพื่อฉันจะได้รับตัวแทนตัวอย่างของประชากรหรือไม่
นี่เป็นเพียงโครงการระดับมัธยมปลายของฉันดังนั้นจึงไม่จำเป็นต้องสมบูรณ์แบบ ฉันกำลังทำโครงการเกี่ยวกับภาวะโลกร้อนและฉันต้องการสำรวจผู้คนเพื่อแสดงความคิดเห็น ฉันรู้ว่าถ้าฉันใช้ตัวอย่างความสะดวกสบายของเพื่อนร่วมชั้นฉันจะมีอคติมากมาย ฉันสงสัยว่ามีเว็บไซต์บนอินเทอร์เน็ตที่ฉันสามารถโพสต์แบบสำรวจของฉันเพื่อให้คนสุ่มตอบหรือไม่เพื่อที่ฉันจะได้เข้าใกล้ SRS มากที่สุด ถ้าไม่ฉันจะสนใจคำแนะนำอื่น ๆ สำหรับวิธีการทำแบบสำรวจของฉัน
11 survey  internet 

14
คุณสามารถขุดข้อมูลได้มากเท่าไหร่?
ชื่อ: ก่อนอาจเป็นกึ่งกลางและนามสกุล ฉันอยากรู้ว่าคุณสามารถขุดข้อมูลได้มากแค่ไหนโดยใช้ชุดข้อมูลที่เปิดเผยต่อสาธารณะ ฉันรู้ว่าคุณสามารถรับสิ่งต่อไปนี้ได้ทุกที่ระหว่างความน่าจะเป็นต่ำ (ขึ้นอยู่กับอินพุต) โดยใช้ข้อมูลการสำรวจสำมะโนประชากรของสหรัฐ: 1) เพศ 2) การแข่งขัน ตัวอย่างเช่น Facebook ใช้เพื่อค้นหาว่าด้วยความแม่นยำในระดับที่เหมาะสมการกระจายทางเชื้อชาติของผู้ใช้เว็บไซต์ของพวกเขา (https://www.facebook.com/note.php?note_id=205925658858) มีอะไรอีกบ้างที่สามารถขุดได้? ฉันไม่ได้มองหาสิ่งใดเป็นพิเศษนี่เป็นคำถามปลายเปิดเพื่อระงับความอยากรู้อยากเห็นของฉัน ตัวอย่างของฉันเฉพาะในสหรัฐอเมริกาดังนั้นเราจะสมมติว่าชื่อนั้นเป็นชื่อของบุคคลที่อยู่ในสหรัฐอเมริกา แต่ถ้ามีคนรู้ว่าชุดข้อมูลที่เปิดเผยต่อสาธารณชนสำหรับประเทศอื่น ๆ ฉันก็เปิดกว้างกว่าเช่นกัน ฉันไม่แน่ใจว่านี่เป็นสถานที่ที่เหมาะสมสำหรับสิ่งนี้หรือไม่ถ้าไม่ฉันจะขอบคุณถ้ามีคนชี้ให้ฉันไปยังสถานที่ที่เหมาะสมกว่า ฉันหวังว่านี่เป็นคำถามที่น่าสนใจและนี่คือสถานที่ที่เหมาะสม!

3
ขนาดเอฟเฟกต์สำหรับเอฟเฟกต์ปฏิสัมพันธ์ในการออกแบบการควบคุมการรักษาก่อนโพสต์
หากคุณเลือกที่จะวิเคราะห์การออกแบบการควบคุมการรักษาก่อนโพสต์ด้วยตัวแปรตามอย่างต่อเนื่องโดยใช้ ANOVA แบบผสมมีวิธีต่าง ๆ ในการวัดผลกระทบของการอยู่ในกลุ่มการรักษา เอฟเฟกต์การโต้ตอบเป็นหนึ่งในตัวเลือกหลัก โดยทั่วไปแล้วฉันชอบการวัดแบบ d ของ Cohen มากกว่า (เช่น ) ฉันไม่ชอบความแปรปรวนที่อธิบายมาตรการเนื่องจากผลลัพธ์แตกต่างกันไปตามปัจจัยที่ไม่เกี่ยวข้องเช่นขนาดตัวอย่างที่สัมพันธ์กันของกลุ่มμ1- μ2σμ1-μ2σ{\frac{\mu_1 - \mu_2}{\sigma}} ดังนั้นฉันคิดว่าฉันสามารถหาปริมาณผลกระทบได้ดังนี้ Δ μค= μc 2- μc 1Δμค=μค2-μค1\Delta\mu_c = \mu_{c2} - \mu_{c1} Δ μเสื้อ= μt 2- μt 1Δμเสื้อ=μเสื้อ2-μเสื้อ1\Delta\mu_t = \mu_{t2} - \mu_{t1} ดังนั้นขนาดของผลกระทบที่อาจจะหมายถึงΔ μเสื้อ- Δ μคσΔμเสื้อ-Δμคσ\frac{\Delta\mu_t - \Delta\mu_c}{\sigma} โดยที่อ้างถึงการควบคุม, tถึงการรักษา, และ 1 และ 2 …

2
สร้างการสรุปโดยอัตโนมัติด้วยตัวแปรปัจจัยใน R
ฉันมีชื่อไฟล์ดังต่อไปนี้: case simulation temp plank oxygen 1 1 1 8 7 11 2 2 1 16 10 15 ... 17 17 2 26 12 17 18 18 2 15 8 12 19 19 2 28 11 21 20 20 2 24 6 14 ฉันต้องการสรุปโดยแยกตามระดับของตัวแปรการจำลอง ตัวอย่างเช่นฉันต้องการค่าเฉลี่ยของtempการจำลอง == 1 และจำลอง == 2 …
11 r 

2
ทำไมการทดสอบของ McNemar จึงใช้ไคสแควร์ไม่ใช่การแจกแจงแบบปกติ?
ฉันเพิ่งสังเกตเห็นว่าการทดสอบที่ไม่แม่นยำของ McNemar ใช้การแจกแจงแบบ asymptotic ของไคสแควร์อย่างไร แต่เนื่องจากการทดสอบที่แน่นอน (สำหรับตารางกรณีสองกรณี) นั้นขึ้นอยู่กับการแจกแจงทวินามทำไมจึงไม่เป็นเรื่องปกติที่จะแนะนำการประมาณแบบปกติในการแจกแจงทวินาม ขอบคุณ

3
การวิเคราะห์การแทรกแซงด้วยอนุกรมเวลาหลายมิติ
ฉันต้องการทำการวิเคราะห์การแทรกแซงเพื่อหาปริมาณผลลัพธ์ของการตัดสินใจเชิงนโยบายเกี่ยวกับการขายแอลกอฮอล์เมื่อเวลาผ่านไป อย่างไรก็ตามฉันค่อนข้างใหม่กับการวิเคราะห์อนุกรมเวลาดังนั้นฉันจึงมีคำถามเริ่มต้น จากการตรวจสอบวรรณกรรมพบว่านักวิจัยคนอื่นได้ใช้ ARIMA เพื่อจำลองการขายเครื่องดื่มแอลกอฮอล์ตามลำดับเวลาโดยมีตัวแปรหุ่นจำลองเป็นตัวแทนเพื่อจำลองผลกระทบของการแทรกแซง ในขณะที่สิ่งนี้ดูเหมือนจะเป็นวิธีการที่สมเหตุสมผล แต่ชุดข้อมูลของฉันก็ยิ่งดีกว่าที่ฉันเคยเขียนในวรรณคดี ประการแรกชุดข้อมูลของฉันถูกจำแนกตามประเภทเครื่องดื่ม (เช่นเบียร์ไวน์สุรา) แล้วแยกตามเขตภูมิศาสตร์ต่อไป ในขณะที่ฉันสามารถสร้างการวิเคราะห์ ARIMA แยกต่างหากสำหรับแต่ละกลุ่มที่ไม่ได้แยกจากกันแล้วเปรียบเทียบผลลัพธ์ แต่ฉันสงสัยว่ามีวิธีการที่ดีกว่าที่นี่ ใครบ้างที่คุ้นเคยกับข้อมูลอนุกรมเวลาหลายมิติมากขึ้นสามารถให้คำแนะนำหรือคำแนะนำได้?

4
หนึ่งสามารถลดจำนวนของสินค้าใน Likert-scale ที่เผยแพร่ได้อย่างถูกต้องหรือไม่?
[แก้ไขเพื่อตอบกลับ feedback- ขอบคุณ :-)] Doh! แก้ไขเพิ่มเติม! ขออภัย! สวัสดี- ฉันกำลังทำการรวบรวมข้อมูลที่ค่อนข้างหยาบและพร้อมกับการสำรวจที่ส่งไปยังเจ้าหน้าที่ดูแลสุขภาพโดยใช้สเกลที่ตีพิมพ์เกี่ยวกับขวัญกำลังใจและปัญหาอื่น ๆ สิ่งเดียวคือเครื่องชั่งค่อนข้างยาวกับสิ่งอื่น ๆ ทั้งหมดในแบบสำรวจและฉันต้องการลดขนาดของมันโดยการลดขนาดย่อยแต่ละอันครึ่งและใช้เพียงครึ่งรายการ สัญชาตญาณของฉันคือสิ่งนี้ดีเนื่องจาก subscales มีความสัมพันธ์ระหว่างกันและแม้ว่ามันจะไม่เหมาะสำหรับการวิจัยมาตรฐานการตีพิมพ์ แต่ก็ไม่เป็นไรสำหรับการค้นหาข้อเท็จจริงภายในองค์กร ฉันสงสัยว่าใครมีความคิดใด ๆ เกี่ยวกับความถูกต้องของการทำสิ่งผิดพลาดหรือสิ่งอื่นใด โดยเฉพาะอย่างยิ่งการอ้างอิงที่ได้รับสุดซึ้งเพราะเพื่อนร่วมงานของฉันจะต้องมีความเชื่อมั่น! ขอบคุณมาก Chris B edits- ใช่มันเป็นเครื่องชั่งที่ผ่านการตรวจสอบแล้วซึ่งมีคุณสมบัติของไซโครเมท มันมีมิติเดียวและมีระดับย่อยถ้าเป็นวิธีที่ถูกต้อง ฉันจะทำงานที่ระดับย่อยและยอดรวมไม่ใช่รายการระดับ 30 รายการอาจจะประมาณ 40-60 คน ไชโย!

3
ทำไมระยะทางแนวตั้ง?
ทำไมการประมาณของ OLS จึงเกี่ยวข้องกับการเบี่ยงเบนในแนวดิ่งของคะแนนไปยังเส้นมากกว่าระยะทางแนวนอน

6
อาร์กิวเมนต์ทางสถิติสำหรับสาเหตุที่ 10,000 หัวจากการโยน 20,000 ครั้งจะแนะนำข้อมูลที่ไม่ถูกต้อง
สมมติว่าเรามีการโยนเหรียญที่ยุติธรรมซ้ำแล้วซ้ำเล่าและเรารู้ว่าจำนวนหัวและก้อยควรจะเท่ากัน เมื่อเราเห็นผลลัพธ์เช่น 10 หัวและ 10 ก้อยรวมเป็น 20 โยนเราเชื่อว่าผลลัพธ์และมีแนวโน้มที่จะเชื่อว่าเหรียญมีความยุติธรรม เมื่อคุณเห็นผลลัพธ์เช่น 10,000 หัวและ 10,000 ก้อยต่อการโยนรวม 20,000 ครั้งฉันจะถามความถูกต้องของผลลัพธ์ (ผู้ทดลองทำการปลอมข้อมูล) เพราะฉันรู้ว่ามันไม่น่าจะเป็นไปได้มากกว่าที่จะพูด 10093 หัวและหาง 9907 อะไรคือข้อโต้แย้งทางสถิติที่อยู่เบื้องหลังสัญชาตญาณของฉัน

1
ข้อมูลสองปีที่อธิบายการเกิดขึ้นของสมาคมการทดสอบความรุนแรงกับจำนวนผู้ป่วยในวอร์ด
ฉันมีข้อมูลสองปีซึ่งมีลักษณะโดยทั่วไปดังนี้ วันที่ _ __ ความรุนแรง Y / N? _ จำนวนผู้ป่วย 1/1/2551 _ ___ 0 __ _ __ _ ____ 11 2/1/2551 _ __ _ 0 _ __ _ __ _ __ 11 3/1/2551 _ ____ 1 __ _ __ _ ____ 12 4/1/2551 _ ____ 0 __ _ __ _ …

2
ความน่าจะเป็นที่ใครบางคนจะชอบภาพ
ฉันมีปัญหาต่อไปนี้: - เราได้ตั้งค่าของคน N - เรามีชุดของภาพ K - แต่ละคนให้คะแนนภาพจำนวนหนึ่ง บุคคลอาจจะชอบหรือไม่ชอบภาพ (สิ่งเหล่านี้เป็นเพียงสมบัติสองอย่าง) - ปัญหาคือวิธีการคำนวณความน่าจะเป็นที่บางคนชอบภาพที่เฉพาะเจาะจง ฉันจะยกตัวอย่างนำเสนอสัญชาตญาณของฉัน N = 4 K = 5 + หมายความว่าบุคคลนั้นชอบภาพ - หมายความว่าบุคคลนั้นไม่ชอบรูปภาพ 0 หมายความว่าบุคคลนั้นไม่ได้ถูกถามเกี่ยวกับภาพและควรคาดการณ์ค่านั้น x 1 2 3 4 5 1 + - 0 0 + 2 + - + 0 + 3 - - + + 0 …

3
ค้นหาจุด GPS เฉลี่ย
ฉันต้องเขียนโปรแกรมเพื่อค้นหาจุด GPS เฉลี่ยจากประชากรของจุด ในทางปฏิบัติสิ่งต่อไปนี้เกิดขึ้น: ในแต่ละเดือนบุคคลจะบันทึกจุด GPS ของสินทรัพย์คงที่เดียวกัน เนื่องจากลักษณะของ GPS คะแนนเหล่านี้แตกต่างกันเล็กน้อยในแต่ละเดือน บางครั้งคนทำผิดบันทึกการทดสอบผิดในตำแหน่งที่แตกต่างอย่างสิ้นเชิง จุด GPS แต่ละจุดมีน้ำหนักที่แน่นอน ( HDOP ) ซึ่งระบุว่าข้อมูล GPS ปัจจุบันนั้นแม่นยำแค่ไหน จุด GPS ที่มีค่า HDOP ที่ดีกว่าเป็นที่ต้องการมากกว่าจุดต่ำ ฉันจะตรวจสอบสิ่งต่อไปนี้ได้อย่างไร: จัดการกับข้อมูลที่มี 2 ค่าเทียบกับค่าเดียวเช่นอายุ (ค้นหาอายุเฉลี่ยในประชากรของผู้คน) กำหนดค่าผิดปกติ ในตัวอย่างด้านล่างนี้จะเป็น [-28.252, 25.018] และ [-28.632, 25.219] หลังจากไม่รวมค่าผิดปกติให้หาจุด GPS เฉลี่ยในจุดนี้อาจเป็น [-28.389, 25.245] มันจะเป็นโบนัสถ้าสามารถทำงาน "น้ำหนัก" ที่จัดทำโดยค่า HDOP สำหรับแต่ละจุด
11 outliers  spatial 

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.