สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
AUC ที่ดีสำหรับเส้นโค้งการเรียกคืนที่แม่นยำคืออะไร
เนื่องจากฉันมีชุดข้อมูลที่ไม่สมดุลมาก (ผลบวก 9%) ฉันจึงตัดสินใจว่ากราฟความแม่นยำในการเรียกคืนมีความเหมาะสมมากกว่าเส้นโค้ง ROC ฉันได้รับมาตรวัดสรุปพื้นที่แบบอะนาล็อกภายใต้เส้นโค้ง PR (.49 ถ้าคุณสนใจ) แต่ไม่แน่ใจว่าจะตีความมันอย่างไร ฉันได้ยินมาว่า. 8 หรือสูงกว่านั้นเป็น AUC ที่ดีสำหรับ ROC แต่การตัดทั่วไปจะเหมือนกันสำหรับ AUC สำหรับเส้นโค้งการเรียกคืนที่แม่นยำหรือไม่

2
หากอนุกรมเวลาเป็นคำสั่งที่สองที่หยุดนิ่งนี่จะแปลว่าเป็นเครื่องเขียนที่เคร่งครัดหรือไม่?
กระบวนการไม่หยุดนิ่งหากการกระจายข้อต่อของเหมือนกันกับการกระจายข้อต่อของสำหรับทุกสำหรับทุกและทุกt_1,Xเสื้อXเสื้อX_t X ที1 + k , X เสื้อ2 + k , . . , X ตันเมตร + kมk T 1 , T 2 , . . , เสื้อเมตรXเสื้อ1, Xเสื้อ2, . . . , Xเสื้อม.Xเสื้อ1,Xเสื้อ2,...,Xเสื้อม.X_{t_1},X_{t_2},...,X_{t_m}Xเสื้อ1+ k, Xเสื้อ2+ k, . . . , Xเสื้อม.+ kXเสื้อ1+k,Xเสื้อ2+k,...,Xเสื้อม.+kX_{t_1+k},X_{t_2+k},...,X_{t_m+k}ม.ม.mkkkเสื้อ1, t2, . . . , tม.เสื้อ1,เสื้อ2,...,เสื้อม.t_1,t_2,...,t_m กระบวนการคือลำดับที่สองนิ่งถ้าค่าเฉลี่ยของมันเป็นค่าคงที่และฟังก์ชั่น …

2
เป็นไปได้หรือไม่ที่จะยอมรับสมมติฐานทางเลือก
ฉันรู้คำถามที่เกี่ยวข้องหลายที่นี่ (เช่นสมมติฐานการทดสอบคำศัพท์ null รอบ , มันเป็นไปได้ที่จะพิสูจน์สมมติฐาน? ) แต่ผมไม่ทราบว่าคำตอบที่ชัดเจนสำหรับคำถามของฉันด้านล่าง สมมติว่าการทดสอบสมมติฐานที่เราต้องการทดสอบว่าเหรียญนั้นยุติธรรมหรือไม่ เรามีสองสมมติฐาน: H0:p(head)=0.5H0:p(head)=0.5H_0: p(head)=0.5 H1:p(head)≠0.5H1:p(head)≠0.5H_1: p(head)\neq0.5 สมมติว่าเราใช้ระดับนัยสำคัญ 5% มีสองกรณีที่เป็นไปได้: เมื่อเราได้รับข้อมูลและพบว่าค่า p น้อยกว่า 0.05 เราจะพูดว่า "ด้วยระดับนัยสำคัญ 5% เราจะปฏิเสธ "H0H0H_0 p-value มากกว่า 0.05 จากนั้นเราพูดว่า "ด้วยระดับนัยสำคัญ 5% เราไม่สามารถปฏิเสธ "H0H0H_0 คำถามของฉันคือ: ในกรณีที่ 1 ถูกต้องหรือไม่ที่จะพูดว่า "เรายอมรับ "H1H1H_1 อย่างสังหรณ์ใจและจากสิ่งที่ฉันได้เรียนรู้ในอดีตฉันรู้สึกว่า "การยอมรับ" อะไรก็ตามที่เป็นผลมาจากการทดสอบสมมติฐานนั้นไม่ถูกต้องเสมอไป ในอีกกรณีหนึ่งเนื่องจากสหภาพในของครอบคลุม "พื้นที่" ทั้งหมด "ปฏิเสธ " และ "ยอมรับH0H0H_0H1H1H_1H0H0H_0 …

2
การประมาณค่าความน่าจะเป็นสูงสุดของความแปรปรวนร่วมของข้อมูลปกติแบบแปรปรวนคืออะไรเมื่อทราบค่าเฉลี่ยและความแปรปรวน?
สมมติว่าเรามีตัวอย่างแบบสุ่มจากการแจกแจงปกติแบบ bivariate ซึ่งมีค่าศูนย์เป็นค่ากลางและค่าความแปรปรวนดังนั้นพารามิเตอร์ที่ไม่รู้จักเพียงค่าเดียวคือความแปรปรวนร่วม MLE ของความแปรปรวนร่วมคืออะไร? ฉันรู้ว่ามันควรจะเป็น1n∑nj=1xjyj1n∑j=1nxjyj\frac{1}{n} \sum_{j=1}^{n}x_j y_jแต่เราจะรู้ได้อย่างไร

2
เหตุใดจึงเป็นที่พึงปรารถนาที่จะมีความสัมพันธ์แบบอัตโนมัติต่ำใน MCMC
ฉันอ่านต่อเกี่ยวกับความจำเป็นในการตรวจสอบความสัมพันธ์อัตโนมัติใน MCMC ทำไมจึงเป็นสิ่งสำคัญที่ autocorrelation ต่ำ? มันวัดอะไรในบริบทของ MCMC?

1
การถดถอยสำหรับข้อมูลเชิงมุม / วงกลม
ฉันดูแลปัญหาการเรียนรู้ที่เป้าหมายเป็นมุม หากฉันจะถดถอยอย่างง่ายตัวเลข 360 และ 1 จะอยู่ไกลสำหรับแบบจำลองของฉัน แต่ที่จริงแล้วพวกเขาอยู่ใกล้และทำนายพิกัด x และ y ไม่รู้สึกถูกต้อง วิธีที่เหมาะสมในการทำปัญหาดังกล่าวคืออะไร?

1
คำสั่ง Lag สำหรับการทดสอบ Granger Causality
สมมติว่าฉันกำลังพิจารณาตัวแปรอิสระหลายตัวสำหรับการรวมไว้ในโมเดล ARIMAX ที่ฉันกำลังพัฒนา ก่อนที่จะปรับตัวแปรที่แตกต่างกันฉันต้องการคัดกรองตัวแปรที่มีสาเหตุแบบย้อนกลับโดยใช้การทดสอบ Granger (ฉันใช้granger.testฟังก์ชั่นจากMSBVARแพ็คเกจใน R แม้ว่าฉันเชื่อว่าการทำงานอื่น ๆ คล้ายกัน) ฉันจะกำหนดจำนวนการทดสอบที่ล่าช้าได้อย่างไร ฟังก์ชัน R คือ: granger.test(y, p)โดยที่ydata frame หรือ matrix และpเป็น lags สมมติฐานคือว่าที่ผ่านมาค่าของไม่ได้ช่วยในการทำนายค่าของYpppXXXYYY มีเหตุผลใดที่จะไม่เลือกความล่าช้าที่สูงมากที่นี่ (นอกเหนือจากการสูญเสียการสังเกต)? โปรดทราบว่าฉันได้แตกต่างทุกอนุกรมเวลาในกรอบข้อมูลของฉันตามลำดับของการรวมของอนุกรมเวลาขึ้นอยู่กับฉัน (เช่นทำให้ความแตกต่างของอนุกรมเวลาขึ้นต่อกันของฉันทำให้มันหยุดนิ่งดังนั้นฉันจึงแตกต่างอนุกรมเวลา "อิสระ" ทั้งหมดหนึ่งครั้ง)

2
ฟังก์ชันการสูญเสียเปอร์เซ็นไทล์
วิธีแก้ไขปัญหา: minmE[|m−X|]minmE[|m−X|] \min_{m} \; E[|m-X|] เป็นที่รู้จักกันดีว่าเป็นค่ามัธยฐานของXXXแต่ฟังก์ชั่นการสูญเสียมีลักษณะอย่างไรสำหรับเปอร์เซ็นไทล์อื่น ๆ เช่นเปอร์เซ็นไทล์ที่ 25 ของ X เป็นวิธีแก้: minmE[L(m,X)]minmE[L(m,X)] \min_{m} \; E[ L(m,X) ] LคืออะไรLLLในกรณีนี้

1
ข้อดีของระยะทางของ Jeffries Matusita
ตามกระดาษที่ฉันกำลังอ่านมีการใช้ระยะทางของ Jeffries และ Matusita แต่ฉันไม่สามารถหาข้อมูลได้มากนักยกเว้นสูตรด้านล่าง JMD (x, y) =∑(xi−−√2−yi−−√2)2−−−−−−−−−−−−−√2∑(xi2−yi2)22\sqrt[2]{\sum(\sqrt[2]{x_i}-\sqrt[2]{y_i})^2} มันคล้ายกับระยะทางแบบยุคลิดยกเว้นสแควร์รูท E (x, y) =∑(xi−yi)2−−−−−−−−−−√2∑(xi−yi)22\sqrt[2]{\sum(x_i-y_i)^2} ระยะทาง JM นั้นเชื่อถือได้มากกว่าระยะทางแบบยุคลิดในแง่ของการจำแนกประเภท ทุกคนสามารถอธิบายได้หรือไม่ว่าทำไมความแตกต่างนี้ทำให้ระยะทาง JM ดีขึ้น?

4
วิธีจัดการกับค่าที่หายไปเพื่อเตรียมข้อมูลสำหรับการเลือกคุณสมบัติด้วย LASSO
สถานการณ์ของฉัน: ตัวอย่างขนาดเล็ก: 116 ตัวแปรผลลัพธ์ไบนารี รายการตัวแปรอธิบายยาวแบบยาว: 44 ตัวแปรอธิบายไม่ได้มาจากด้านบนของหัวของฉัน ทางเลือกของพวกเขาขึ้นอยู่กับวรรณกรรม กรณีส่วนใหญ่ในตัวอย่างและตัวแปรส่วนใหญ่มีค่าขาดหายไป เลือกวิธีการเลือกคุณลักษณะ: LASSO แพ็คเกจ glmnet ของ R จะไม่ให้ฉันเรียกใช้รูทีน glmnet อย่างเห็นได้ชัดเนื่องจากมีค่าที่ขาดหายไปในชุดข้อมูลของฉัน ดูเหมือนจะมีวิธีการต่าง ๆ สำหรับการจัดการข้อมูลที่หายไปดังนั้นฉันอยากจะรู้ว่า: LASSO กำหนดข้อ จำกัด ใด ๆ ในแง่ของวิธีการใส่ร้ายที่ฉันสามารถใช้ได้หรือไม่? อะไรจะเป็นทางออกที่ดีที่สุดสำหรับวิธีการใส่ร้าย เป็นการดีที่ฉันต้องการวิธีการที่ฉันสามารถทำงานบน SPSS (ดีกว่า) หรือ R UPDATE1: มันชัดเจนจากคำตอบบางส่วนด้านล่างที่ฉันได้จัดการกับปัญหาพื้นฐานเพิ่มเติมก่อนที่จะพิจารณาวิธีการใส่ร้าย ฉันต้องการที่จะเพิ่มคำถามใหม่เกี่ยวกับที่นี่ ในคำตอบที่แนะนำการเข้ารหัสเป็นค่าคงที่และการสร้างตัวแปรใหม่เพื่อจัดการกับค่า 'ไม่สามารถใช้งานได้' และการใช้กลุ่ม lasso: คุณจะบอกว่าถ้าฉันใช้กลุ่ม LASSO ฉันจะสามารถใช้วิธีการที่แนะนำให้ผู้ทำนายต่อเนื่องกับผู้ทำนายหมวดหมู่ได้หรือไม่ ถ้าเป็นเช่นนั้นฉันคิดว่ามันจะเทียบเท่ากับการสร้างหมวดหมู่ใหม่ - ฉันระแวงว่านี่อาจทำให้เกิดอคติ ไม่มีใครรู้ว่าแพ็คเกจ glmnet ของ R …

2
การตรวจสอบก่อนหน้านี้โดยใช้การถดถอย
สามารถใช้การถดถอยสำหรับการตรวจสอบ lier ออก ฉันเข้าใจว่ามีวิธีในการปรับปรุงรูปแบบการถดถอยโดยการลบค่าผิดปกติ แต่เป้าหมายหลักที่นี่ไม่เหมาะกับโมเดลการถดถอย แต่ค้นหา liers โดยใช้การถดถอย

5
อัลกอริทึม Metropolis Hastings
ฉันจำเป็นต้องศึกษาวิธีการมาร์คอฟเชนมอนติคาร์โลเพื่อให้มีความเฉพาะเจาะจงมากขึ้นฉันต้องศึกษาอัลกอริทึม Metropolis Hastings และทุกอย่างเกี่ยวกับเรื่องนี้เช่นเกณฑ์การลู่เข้า ใครสามารถกำหนดหนังสือหรือกระดาษหรือเว็บไซต์ที่อธิบายอาร์กิวเมนต์นี้โดยใช้คำศัพท์ง่ายๆ แต่ไม่มีความรู้รอบตัว
11 references  mcmc 

3
ฉันจะฝึกอบรมการถดถอย (โลจิสติก) ใน R โดยใช้ฟังก์ชั่นการสูญเสีย L1 ได้อย่างไร
ฉันสามารถฝึกการถดถอยโลจิสติกในการRใช้ glm(y ~ x, family=binomial(logit))) แต่ IIUC สิ่งนี้จะปรับให้เหมาะสมกับความน่าจะเป็นของบันทึก มีวิธีฝึกโมเดลด้วยฟังก์ชั่นการสูญเสียเชิงเส้น ( ) หรือไม่ซึ่งในกรณีนี้จะเหมือนกับระยะการเปลี่ยนแปลงทั้งหมดหรือไม่L1L1L_1 เช่นได้รับเวกเตอร์เป็นตัวเลขและบิต (ตรรกะ) เวกเตอร์ฉันต้องการสร้างฟังก์ชัน monotonic (ในความเป็นจริงเพิ่มขึ้น) ที่เช่นนั้นถูกย่อให้เล็กสุดxxxf ∑ | f ( x ) - y |yyyfff∑|f(x)−y|∑|f(x)−y|\sum |f(x)-y| ดูสิ่งนี้ด้วย ฉันจะฝึกอบรมการถดถอยโลจิสติกใน R โดยใช้ฟังก์ชั่นการสูญเสีย L1 ได้อย่างไร
11 logistic 

5
สัญชาตญาณในความหมายของความแปรปรวนร่วม
ฉันพยายามที่จะเข้าใจความแปรปรวนร่วมของตัวแปรสุ่มสองตัวที่ดีขึ้นและเข้าใจว่าคนแรกที่นึกถึงมันมาถึงคำจำกัดความที่ใช้เป็นประจำในสถิติ ฉันไปวิกิพีเดียเพื่อทำความเข้าใจให้ดีขึ้น จากบทความดูเหมือนว่าการวัดหรือปริมาณผู้สมัครที่ดีสำหรับควรมีคุณสมบัติดังต่อไปนี้:คo v ( X), วาย)Cov(X,Y)Cov(X,Y) มัน shoukd มีสัญญาณเชิงบวกเมื่อตัวแปรสุ่มสองตัวมีความคล้ายคลึงกัน (เช่นเมื่อเพิ่มอีกอันหนึ่งทำกับและเมื่อหนึ่งลดลงอีกหนึ่งทำเช่นกัน) นอกจากนี้เรายังต้องการให้มันมีเครื่องหมายลบเมื่อตัวแปรสุ่มสองตัวมีลักษณะตรงข้ามกัน (เช่นเมื่อหนึ่งตัวแปรที่เพิ่มขึ้นแบบสุ่มมีแนวโน้มลดลง) สุดท้ายเราต้องการให้ปริมาณความแปรปรวนร่วมนี้เป็นศูนย์ (หรืออาจน้อยมาก?) เมื่อตัวแปรสองตัวนั้นเป็นอิสระจากกัน (เช่นพวกมันไม่ได้แปรผันตามกัน) จากคุณสมบัติข้างต้นเราต้องการกำหนดY) คำถามแรกของฉันคือมันไม่ชัดเจนเลยสำหรับฉันว่าทำไมตอบสนองคุณสมบัติเหล่านั้น จากคุณสมบัติที่เรามีฉันจะคาดหวังมากกว่าของสมการเหมือนอนุพันธ์ "ที่จะเป็นผู้สมัครในอุดมคติ ตัวอย่างเช่นมีอะไรเพิ่มเติมเช่น "ถ้าการเปลี่ยนแปลงในเชิงบวก X แล้วการเปลี่ยนแปลงใน Y ก็ควรจะเป็นบวก" นอกจากนี้ทำไมการแตกต่างจากสิ่งที่ถูกต้องหมายถึงทำอะไรC o v ( X , Y ) = E [ ( X - E [ X ] ) ( Y - E …

2
การถดถอยโลจิสติก: การตีความตัวแปรอย่างต่อเนื่อง
ฉันมีคำถามสองสามข้อเกี่ยวกับการตีความอัตราส่วนอัตราต่อรองสำหรับตัวแปรต่อเนื่องในการถดถอยโลจิสติก ฉันรู้สึกว่านี่เป็นคำถามพื้นฐานเกี่ยวกับการถดถอยโลจิสติกส์ (และอาจเกี่ยวกับการถดถอยทั่วไป) และถึงแม้ว่าฉันรู้สึกละอายเล็กน้อยที่ไม่รู้คำตอบฉันจะกลืนความภาคภูมิใจและถามพวกเขาเพื่อที่ฉันจะได้รู้ อนาคต! นี่คือสถานการณ์ของฉัน ... ฉันกำลังดูตัวอย่างของเยาวชนที่ถูกตัดสินซึ่งเป็นส่วนหนึ่งของการทดลองของพวกเขาได้รับการลงทะเบียนในโปรแกรมการฝึกอบรมทักษะการทำงาน / ชีวิต ฉันต้องการเห็นว่าอายุที่พวกเขาได้รับการปล่อยตัวจากโปรแกรมทำนายการจ้างงานหกเดือนหลังการปล่อยตัวจากโปรแกรม (โปรดทราบว่ามีตัวทำนายอื่น ๆ ในโมเดล แต่ฉันได้ยกเว้นพวกเขาเพราะพวกเขาไม่มีนัยสำคัญทางสถิติและฉันต้องการให้ชัดเจนที่สุดเท่าที่จะทำได้) ทำนาย: อายุที่ออกจากโปรแกรมการฝึกอบรม (อายุเฉลี่ย = 17.4, SD = 1.2, ช่วง 14.3-20.5) ผลลัพธ์: ลูกจ้างหรือไม่ (ลูกจ้าง = 1, ไม่ใช่ลูกจ้าง = 0) ผลลัพธ์: อัตราต่อรอง 3.01 (p <.005) (ฉันไม่รวมความดีของสถิติพอดี ฯลฯ เพราะฉันกำลังหาคำตอบเกี่ยวกับการตีความอัตราส่วนอัตราต่อรองเท่านั้นฉันรู้สึกสบายใจกับการประเมินแบบพอดี CI ของ ฯลฯ ) ใส่ลงไปในคำ: เมื่ออายุเพิ่มขึ้นหนึ่งปีอัตราต่อรองของการจ้างงานเพิ่มขึ้นหกเดือนหลังจำหน่ายเพิ่มขึ้นสามหน่วย คำถาม: 1) เมื่อฉันพูดว่า …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.