สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
การเปรียบเทียบหลายรายการในการทดสอบแบบไม่มีพารามิเตอร์
ฉันกำลังทำงานกับชุดข้อมูลที่ไม่ใช่พารามิเตอร์และมี 12 การรักษา ฉันทำการทดสอบ Kruskal-Wallis และได้ค่าสำคัญและตอนนี้ฉันต้องการทำการเปรียบเทียบหลายขั้นตอนเพื่อดูว่าการรักษาใดที่แตกต่างกันอย่างมีนัยสำคัญ มีข้อมูลจำนวนมากเกี่ยวกับหัวข้อนี้ แต่ฉันไม่พบสิ่งใดที่แก้ไขปัญหานี้โดยเฉพาะ ความคิดใด ๆ ?? พีพีp

2
วิธีการหาปริมาณความสำคัญตัวแปรสัมพัทธ์ในการถดถอยโลจิสติกในแง่ของ p?
สมมติว่ารูปแบบการถดถอยโลจิสติกใช้ในการทำนายว่านักช็อปออนไลน์จะซื้อผลิตภัณฑ์ (ผลลัพธ์: ซื้อ) หรือไม่หลังจากที่เขาคลิกชุดโฆษณาออนไลน์ (ผู้ทำนาย: Ad1, Ad2 และ Ad3) ผลลัพธ์ที่ได้คือตัวแปรไบนารี: 1 (ซื้อแล้ว) หรือ 0 (ไม่ระบุ) ตัวทำนายยังเป็นตัวแปรไบนารี: 1 (คลิก) หรือ 0 (ไม่ได้คลิก) ดังนั้นตัวแปรทั้งหมดอยู่ในระดับเดียวกัน หากค่าสัมประสิทธิ์ที่ได้ของ Ad1, Ad2 และ Ad3 คือ 0.1, 0.2 และ 03 เราสามารถสรุปได้ว่า Ad3 สำคัญกว่า Ad2 และ Ad2 สำคัญกว่า Ad1 นอกจากนี้เนื่องจากตัวแปรทั้งหมดอยู่ในระดับเดียวกันจึงควรมีค่าสัมประสิทธิ์ที่เป็นมาตรฐานและไม่ได้มาตรฐานและเราสามารถสรุปได้ว่า Ad2 มีความสำคัญมากกว่า Ad1 สองเท่าในแง่ของอิทธิพลที่มีต่อระดับ logit (log-odds) แต่ในทางปฏิบัติเราสนใจมากขึ้นเกี่ยวกับวิธีการเปรียบเทียบและตีความความสำคัญสัมพัทธ์ของตัวแปรในแง่ของระดับ p (ความน่าจะเป็นของการซื้อ) …

6
วิธีการใน R หรือ Python เพื่อทำการเลือกคุณสมบัติในการเรียนรู้ที่ไม่มีผู้ดูแล [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้เป็นไปตามหัวข้อสำหรับการตรวจสอบข้าม ปิดให้บริการใน2 ปีที่ผ่านมา อะไรคือวิธีการ / การนำไปใช้งานใน R / Python เพื่อยกเลิก / เลือกคุณสมบัติที่ไม่สำคัญ / สำคัญในข้อมูล ข้อมูลของฉันไม่มีป้ายกำกับ (ไม่มีการสำรอง) ข้อมูลมีคุณสมบัติประมาณ ~ 100 ชนิดผสม บางตัวเป็นตัวเลขในขณะที่อื่น ๆ เป็นเลขฐานสอง (0/1)

3
GLM ที่มีข้อมูลต่อเนื่องซ้อนกันเป็นศูนย์
ฉันพยายามใช้แบบจำลองเพื่อประเมินว่าโรคภัยพิบัติเช่นวัณโรคเอดส์ ฯลฯ ส่งผลกระทบต่อการใช้จ่ายในการเข้ารักษาตัวในโรงพยาบาล ฉันมี "ต้นทุนต่อการเข้ารักษาตัวในโรงพยาบาล" เป็นตัวแปรตามและเครื่องหมายของแต่ละบุคคลเป็นตัวแปรอิสระซึ่งเกือบทั้งหมดเป็นตัวอย่างเช่นเพศหัวหน้าครัวเรือนสถานะสถานะความยากจนและแน่นอนเป็นตัวแทนว่าคุณมีความเจ็บป่วยหรือไม่ และอายุกำลังสอง) และกลุ่มคำศัพท์โต้ตอบ ตามที่คาดไว้มีจำนวนมาก - และฉันหมายถึงข้อมูลจำนวนมากซ้อนกันที่ศูนย์ (กล่าวคือไม่มีค่าใช้จ่ายในการเข้ารักษาตัวในโรงพยาบาลในระยะเวลาอ้างอิง 12 เดือน) อะไรจะเป็นวิธีที่ดีที่สุดในการจัดการกับข้อมูลเช่นนี้ ณ ตอนนี้ฉันตัดสินใจที่จะแปลงค่าใช้จ่ายln(1+cost)เพื่อรวมการสังเกตทั้งหมดแล้วเรียกใช้โมเดลเชิงเส้น ฉันกำลังติดตามใช่ไหม?

1
การเลือกรูปแบบในการเรียนรู้ออฟไลน์และออนไลน์
ฉันพยายามเรียนรู้เพิ่มเติมเกี่ยวกับการเรียนรู้ออนไลน์เมื่อเร็ว ๆ นี้ (มันน่าทึ่งมาก!) และธีมหนึ่งที่ฉันไม่สามารถเข้าใจได้ดีคือวิธีคิดเกี่ยวกับการเลือกรูปแบบในออฟไลน์กับบริบทออนไลน์ โดยเฉพาะอย่างสมมติว่าเราฝึกลักษณนามออฟไลน์อยู่บนพื้นฐานของข้อมูลบางอย่างถาวรชุดDเราประเมินคุณลักษณะด้านประสิทธิภาพผ่านการตรวจสอบความถูกต้องพูดและเราเลือกตัวจําแนกที่ดีที่สุดด้วยวิธีนี้SSSDDD นี่คือสิ่งที่ฉันคิดเกี่ยวกับ: แล้วเราจะไปเกี่ยวกับการใช้กับการตั้งค่าออนไลน์ได้อย่างไร เราสามารถสมมติได้ว่าดีที่สุดที่พบแบบออฟไลน์จะทำงานได้ดีในฐานะตัวจําแนกออนไลน์ มันสมเหตุสมผลไหมที่จะรวบรวมข้อมูลบางอย่างเพื่อฝึกอบรมจากนั้นนำตัวแยกประเภทเดียวกันและ "ปฏิบัติการ" ในการตั้งค่าออนไลน์โดยใช้พารามิเตอร์เดียวกับที่พบในหรือวิธีอื่นอาจดีกว่า คำเตือนในกรณีเหล่านี้คืออะไร ผลลัพธ์ที่สำคัญที่นี่คืออะไร และอื่น ๆSSSSSSSSSSSSDDD อย่างไรก็ตามตอนนี้ก็อยู่ที่นั่นแล้วฉันเดาว่าฉันกำลังมองหาอะไรคือการอ้างอิงหรือแหล่งข้อมูลที่จะช่วยฉัน (และหวังว่าคนอื่น ๆ ที่กำลังคิดเกี่ยวกับเรื่องนี้!) ทำให้การเปลี่ยนจากการคิดในแง่ออฟไลน์เท่านั้น พัฒนากรอบจิตเพื่อคิดเกี่ยวกับปัญหาของการเลือกแบบจำลองและคำถามเหล่านี้อย่างสอดคล้องกันมากขึ้นเมื่อการอ่านของฉันดำเนินไป

1
การประเมินความแข็งแรงของความแข็งแรง?
ฉันกำลังใช้ตัวประมาณปกติสำหรับ kurtosisแต่ฉันสังเกตเห็นว่าแม้แต่ 'ค่าผิดปกติ' ในการแจกแจงเชิงประจักษ์ของฉัน เช่นยอดเขาเล็ก ๆ ห่างจากศูนย์กลางส่งผลกระทบอย่างมาก มีตัวประมาณค่าความโด่งซึ่งมีความทนทานกว่านี้หรือไม่?K^= μ^4σ^4K^=μ^4σ^4\hat{K}=\frac{\hat{\mu}_4}{\hat{\sigma}^4}

3
ปัญหาของการใช้เปอร์เซ็นต์ผลลัพธ์ในการถดถอยเชิงเส้นคืออะไร
ฉันมีการศึกษาที่ผลลัพธ์จำนวนมากแสดงเป็นเปอร์เซ็นต์และฉันใช้การถดถอยเชิงเส้นหลายครั้งเพื่อประเมินผลของตัวแปรหมวดหมู่ต่อผลลัพธ์เหล่านี้ ฉันสงสัยว่าเนื่องจากการถดถอยเชิงเส้นสันนิษฐานว่าผลลัพธ์คือการกระจายอย่างต่อเนื่องมีปัญหาเกี่ยวกับระเบียบวิธีในการใช้แบบจำลองดังกล่าวกับเปอร์เซ็นต์ซึ่งมีข้อ จำกัด ระหว่าง 0 ถึง 100

1
อะไรคือความแตกต่างระหว่าง "การบรรทุก" และ "การโหลดความสัมพันธ์" ใน PCA และ PLS
สิ่งหนึ่งที่ต้องทำเมื่อทำการวิเคราะห์ส่วนประกอบหลัก (PCA) คือการพล็อตการโหลดสองครั้งต่อกันเพื่อตรวจสอบความสัมพันธ์ระหว่างตัวแปร ในกระดาษที่มาพร้อมกับแพคเกจ PLS Rสำหรับการทำส่วนประกอบหลักการถดถอยและการถดถอย PLS มีพล็อตที่แตกต่างกันที่เรียกว่าพล็อตโหลดความสัมพันธ์ (ดูรูปที่ 7 และหน้า 15 ในกระดาษ) การโหลดความสัมพันธ์ตามที่อธิบายไว้คือความสัมพันธ์ระหว่างคะแนน (จาก PCA หรือ PLS) และข้อมูลที่สังเกตได้จริง สำหรับฉันแล้วการโหลดและความสัมพันธ์มีความคล้ายคลึงกันยกเว้นว่าอัตราส่วนจะถูกปรับให้แตกต่างกันเล็กน้อย ตัวอย่างที่ทำซ้ำได้ใน R พร้อมกับชุดข้อมูล mtcars ในตัวมีดังนี้: data(mtcars) pca <- prcomp(mtcars, center=TRUE, scale=TRUE) #loading plot plot(pca$rotation[,1], pca$rotation[,2], xlim=c(-1,1), ylim=c(-1,1), main='Loadings for PC1 vs. PC2') #correlation loading plot correlationloadings <- cor(mtcars, pca$x) plot(correlationloadings[,1], …

1
ตัวอย่างการใช้ทฤษฎีบท Bayes ที่ผิดพลาด
คำถามชุมชนMath Overflowนี้ขอให้ "ตัวอย่างของการขัดแย้งที่ไม่ดีซึ่งเกี่ยวข้องกับการประยุกต์ใช้ทฤษฎีบททางคณิตศาสตร์ในบริบทที่ไม่ใช่คณิตศาสตร์" และผลิตรายการที่น่าสนใจของคณิตศาสตร์ประยุกต์ทางพยาธิวิทยา ฉันสงสัยเกี่ยวกับตัวอย่างที่คล้ายคลึงกันของการใช้พยาธิวิทยาของการอนุมานแบบเบย์ มีใครพบบทความทางวิชาการโพสต์บล็อกประหลาดที่ใช้วิธีการแบบเบย์ในรูปแบบที่โหดร้าย
11 bayesian 

2
ทุกอย่างเกี่ยวกับการเรียนรู้ของเครื่องในทางปฏิบัติจริงคืออะไร
ฉันเป็นผู้ใช้ใหม่ในการเรียนรู้ของเครื่อง (เช่นสถิติ) การเรียนรู้ความรู้ (อัลกอริทึมการเรียนรู้แบบมีผู้สอน / ไม่ได้ดูแลวิธีการหาค่าเหมาะที่สุดที่เกี่ยวข้องการทำให้เป็นมาตรฐาน ฉันรู้ว่าหากไม่มีการฝึกฝนจริงฉันจะไม่เข้าใจสิ่งที่เรียนรู้จากเครื่องเหล่านั้นอย่างลึกซึ้ง ดังนั้นฉันเริ่มต้นด้วยปัญหาการจัดหมวดหมู่กับข้อมูลจริงพูดการจำแนกตัวเลขด้วยลายมือ (MNIST) ด้วยความประหลาดใจของฉันโดยไม่มีการเรียนรู้ / วิศวกรรมความแม่นยำถึง 0.97 โดยใช้ตัวจําแนกแบบฟอเรสต์แบบสุ่มที่มีค่าพิกเซลแบบดิบเป็นอินพุต ฉันยังลองใช้อัลกอริทึมการเรียนรู้อื่นเช่น SVM, LR พร้อมปรับพารามิเตอร์ ถ้างั้นฉันก็หลงทางมันจะง่ายเกินไปหรือฉันจะทำอะไรหายไปหรือเปล่า เพียงแค่หยิบอัลกอริทึมการเรียนรู้จากชุดเครื่องมือและปรับแต่งพารามิเตอร์บางอย่าง? หากนั่นคือทั้งหมดที่เกี่ยวกับการเรียนรู้ของเครื่องในทางปฏิบัติแล้วฉันจะสูญเสียความสนใจในสาขานี้ ฉันคิดและอ่านบล็อกสักสองสามวันแล้วฉันก็มาถึงข้อสรุป: ส่วนที่สำคัญที่สุดของการเรียนรู้ของเครื่องในทางปฏิบัติคือวิศวกรรมคุณสมบัติซึ่งได้รับข้อมูลค้นหาการแสดงคุณลักษณะที่ดีขึ้น อัลกอริทึมการเรียนรู้ใดที่จะใช้ก็มีความสำคัญเช่นกันการปรับพารามิเตอร์ แต่ตัวเลือกสุดท้ายคือเพิ่มเติมเกี่ยวกับการทดลอง ฉันไม่แน่ใจว่าฉันเข้าใจถูกต้องหวังว่าทุกคนสามารถแก้ไขฉันได้และให้คำแนะนำเกี่ยวกับการเรียนรู้ของเครื่องในทางปฏิบัติ

1
ค่าติดตั้งของตัวแบบ ARMA
ฉันกำลังพยายามที่จะเข้าใจวิธีคำนวณค่าติดตั้งสำหรับโมเดล ARMA (p, q) ฉันพบคำถามที่นี่แล้วเกี่ยวกับค่าที่เหมาะสมของกระบวนการ ARMA แต่ไม่สามารถเข้าใจได้ ถ้าฉันมีโมเดล ARMA (1,1) เช่น Xเสื้อ= α1Xt - 1+ ϵเสื้อ- β1εt - 1Xเสื้อ=α1Xเสื้อ-1+εเสื้อ-β1εเสื้อ-1X_t = \alpha_1X_{t-1}+\epsilon_t - \beta_1 \epsilon_{t-1} และฉันได้รับอนุกรมเวลา (เครื่องเขียน) ฉันสามารถประมาณพารามิเตอร์ได้ ฉันจะคำนวณค่าติดตั้งโดยใช้การประมาณการเหล่านั้นได้อย่างไร สำหรับรุ่น AR (1) ค่าติดตั้งจะถูกกำหนดโดย Xเสื้อ^= α1^Xt - 1.Xเสื้อ^=α1^Xเสื้อ-1.\hat{X_t} = \hat{\alpha_1}X_{t-1} . เนื่องจากนวัตกรรมในแบบจำลอง ARMA ไม่สามารถตรวจสอบได้ฉันจะใช้การประมาณค่าพารามิเตอร์ MA ได้อย่างไร ฉันจะเพิกเฉยต่อชิ้นส่วน MA และคำนวณค่าติดตั้งของส่วน AR ไหม
11 arma 

2
โมเดลการสกัดกั้นแบบสุ่มเทียบกับ GEE
พิจารณาแบบจำลองเชิงเส้นตัดขวางแบบสุ่ม นี่เทียบเท่ากับการถดถอยเชิงเส้น GEE กับเมทริกซ์สหสัมพันธ์การทำงานที่แลกเปลี่ยนได้ สมมติว่ามีการพยากรณ์และและค่าสัมประสิทธิ์สำหรับพยากรณ์เหล่านี้เป็น ,และ\การตีความสัมประสิทธิ์ในการสกัดกั้นแบบสุ่มคืออะไร? มันเหมือนกับการถดถอยเชิงเส้นของ GEE ยกเว้นว่าอยู่ในระดับบุคคลหรือไม่?x1,x2,x1,x2,x_1, x_2,x3x3x_3β1β1\beta_1β2β2\beta_2β3β3\beta_3

3
ฟังก์ชันการแทรกแซงการถ่ายโอน ARIMA - วิธีการแสดงผล
ฉันมีชุดเวลารายเดือนที่มีการแทรกแซงและฉันต้องการที่จะหาปริมาณผลกระทบของการแทรกแซงนี้ในผล ฉันรู้ว่าซีรี่ส์ค่อนข้างสั้นและยังไม่ได้สรุปผล ข้อมูล cds <- structure(c(2580L, 2263L, 3679L, 3461L, 3645L, 3716L, 3955L, 3362L, 2637L, 2524L, 2084L, 2031L, 2256L, 2401L, 3253L, 2881L, 2555L, 2585L, 3015L, 2608L, 3676L, 5763L, 4626L, 3848L, 4523L, 4186L, 4070L, 4000L, 3498L), .Dim=c(29L, 1L), .Dimnames=list(NULL, "CD"), .Tsp=c(2012, 2014.33333333333, 12), class="ts") วิธีการ 1) ซีรี่ส์ก่อนการแทรกแซง (จนถึงตุลาคม 2013) ถูกใช้กับauto.arimaฟังก์ชัน รูปแบบที่แนะนำคือ ARIMA …

3
อนาคตของสถิติ
คำถามนี้เกิดขึ้นกับฉันเมื่อฉันนั่งบรรยายในที่สาธารณะเกี่ยวกับคำถามที่ยังไม่แก้ในวิชาคณิตศาสตร์ เป็นที่ทราบกันดีว่ายังมีคำถามทางคณิตศาสตร์ที่ยังไม่แก้มากมาย มันทำให้ฉันคิดว่าปัญหาที่ยังไม่คลี่คลายในสถิติคืออะไร หลังจากใช้เวลาสักครู่ใน googleing หัวข้อนี้ฉันไม่คิดว่าจะมีการอภิปรายที่ค่อนข้างละเอียดเกี่ยวกับคำถามนี้ ดังนั้นฉันอยากได้ยินสิ่งที่ผู้คนคิดเกี่ยวกับมัน สถิติจะเป็นวินัยที่ไหน เราควรใช้เวลามากขึ้นในการปรับปรุงทฤษฎีหรือเราควรมุ่งเน้นไปที่วิธีการวิเคราะห์ข้อมูลเฉพาะที่รวบรวมจากการทดลองทางวิทยาศาสตร์ทุกประเภท? ความคิดใด ๆ เกี่ยวกับเรื่องนี้เป็นที่นิยมอย่างมาก ขอบคุณ!

1
เกิดอะไรขึ้นถ้าความน่าจะเป็นไม่เท่ากันใน“ .632 กฎ”
คำถามนี้ได้มาจากคำถามนี้เกี่ยวกับ".632 Rule" ฉันกำลังเขียนโดยมีการอ้างอิงโดยเฉพาะกับคำตอบ / สัญกรณ์ของ user603 เท่าที่มันง่ายขึ้นเรื่อง คำตอบที่ขึ้นต้นด้วยตัวอย่างที่มีขนาดด้วยการเปลี่ยนจากรายการที่แตกต่างกันในคอลเลกชัน (โทร) มัน N. ความน่าจะเป็นว่าตัวอย่างจะแตกต่างจากองค์ประกอบเฉพาะของ N คือแล้วn ,n,n,nnnผมt hithi^{th}sผมsis_iม.mm( 1 - 1 / n )(1−1/n).(1 - 1/n). ในคำตอบนั้นองค์ประกอบทั้งหมดของ N มีโอกาสเท่าเทียมกันในการถูกสุ่มจับ คำถามของฉันคือ: สมมติว่าในคำถามข้างต้นรายการที่จะวาดนั้นเป็นสิ่งที่พวกเขามีการกระจายตามปกติ นั่นคือเราแบ่งเส้นโค้งปกติมาตรฐานจากถึงเป็น (พูด) 100 ช่วงเวลาที่มีความยาวเท่ากัน แต่ละรายการ 100 ใน N มีความน่าจะเป็นที่จะถูกดึงที่เท่ากับพื้นที่ subtended โดยเส้นโค้งในช่วงเวลาที่เกี่ยวข้องZ= - 4Z=−4Z = -4Z= 4Z=4Z = 4 ความคิดของฉันเป็นดังนี้: การให้เหตุผลมีความคล้ายคลึงกับคำตอบที่ฉันคิดไว้ ความน่าจะเป็นที่โดยที่เป็นองค์ประกอบของ …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.