สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

4
การทดสอบทางสถิติที่รวมความไม่แน่นอนของการวัด
สมมติว่าฉันได้รับการวัดมวลสองกลุ่ม (เป็น mg) ซึ่งเรียกว่า y1 และ y2 ฉันต้องการทดสอบเพื่อดูว่าตัวอย่างทั้งสองนั้นมาจากประชากรที่มีวิธีการต่างกันหรือไม่ ตัวอย่างเช่นนี้ (ใน R): y1 <- c(10.5,2.9,2.0,4.4,2.8,5.9,4.2,2.7,4.7,6.6) y2 <- c(3.8,4.3,2.8,5.0,9.3,6.0,7.6,3.8,6.8,7.9) t.test(y1,y2) ฉันได้ค่า p - 0.3234 และอย่างมีนัยสำคัญที่ระดับ 0.05 ไม่ปฏิเสธสมมติฐานว่างว่าทั้งสองกลุ่มนั้นมาจากประชากรที่มีค่าเฉลี่ยเท่ากัน ตอนนี้ฉันได้รับความไม่แน่นอนสำหรับการวัดแต่ละครั้ง: u1 <- c(2.3,1.7,1.7,1.7,2.0,2.2,2.1,1.7,2.3,2.2) u2 <- c(2.4,1.8,1.6,2.3,2.5,1.8,1.9,1.5,2.3,2.3) โดยที่ u1 [1] คือความไม่แน่นอนมาตรฐานรวมในการวัด y1 [1] (และอื่น ๆ ) ฉันจะรวมความไม่แน่นอนเหล่านี้เข้ากับการทดสอบทางสถิติได้อย่างไร

3
หนังสือ / เอกสารที่ดีเกี่ยวกับการให้คะแนนเครดิต
ฉันกำลังมองหาหนังสือแนะนำเกี่ยวกับการให้คะแนนเครดิต ฉันสนใจในทุกด้านของปัญหานี้ แต่ส่วนใหญ่ใน: 1) คุณสมบัติที่ดี สร้างได้อย่างไร? สิ่งใดได้รับการพิสูจน์แล้วว่าดี 2) โครงข่ายประสาทเทียม การประยุกต์ใช้กับปัญหาการให้คะแนนเครดิต 3) ฉันเลือกเครือข่ายประสาท แต่ฉันก็สนใจวิธีอื่นเช่นกัน

1
การรวมเมทริกซ์ความแปรปรวนร่วมสองแบบ
ฉันคำนวณความแปรปรวนร่วมของการแจกแจงแบบขนานและฉันต้องรวมผลลัพธ์ที่กระจายเข้าด้วยกันบน Gaussian เอกพจน์ ฉันจะรวมสองวิธีเข้าด้วยกันได้อย่างไร การสอดแทรกเชิงเส้นตรงระหว่างสองอย่างนี้เกือบจะได้ผลถ้ามันมีการกระจายและขนาดใกล้เคียงกัน Wikipediaมีฟอรัมอยู่ที่ด้านล่างสำหรับชุดค่าผสม แต่ดูเหมือนจะไม่ถูกต้อง การแจกแจงแบบกระจายสองตัวที่เหมือนกันควรมีความแปรปรวนร่วมเดียวกัน แต่สูตรที่ด้านล่างของหน้าเพิ่มความแปรปรวนร่วมสองเท่า มีวิธีการรวมสองเมทริกซ์หรือไม่?

2
การตีความฟังก์ชันสรุปสำหรับโมเดล lm ใน R
ความหมายของt valueและPr(>|t|)เมื่อใช้summary()ฟังก์ชันกับตัวแบบการถดถอยเชิงเส้นใน R คืออะไร? Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 10.1595 1.3603 7.469 1.11e-13 *** log(var) 0.3422 0.1597 2.143 0.0322 *

2
แคลคูลัสจำเป็นต้องมีความเข้าใจในการประมาณค่าความน่าจะเป็นสูงสุดอย่างไร
ฉันพยายามวางแผนแผนการเรียนรู้เพื่อการเรียนรู้ MLE ในการทำเช่นนี้ฉันกำลังพยายามหาแคลคูลัสระดับต่ำสุดที่จำเป็นต้องเข้าใจ MLE มันเพียงพอที่จะเข้าใจพื้นฐานของแคลคูลัส (เช่นการค้นหาฟังก์ชันขั้นต่ำและสูงสุด) เพื่อที่จะเข้าใจ MLE หรือไม่?

2
น้ำหนักคะแนนความชอบในการวิเคราะห์ค่า Cox และการเลือกค่าความแปรปรวนร่วม
เกี่ยวกับการให้คะแนนความชอบ (IPTW) เมื่อทำแบบจำลองความเป็นอันตรายตามสัดส่วนของ Cox ของข้อมูลการรอดชีวิตแบบเวลาต่อเหตุการณ์: ฉันมีข้อมูลรีจิสทรีในอนาคตที่เราสนใจที่จะดูผลการรักษาของยาซึ่งโดยส่วนใหญ่แล้วผู้ป่วยจะได้รับข้อมูลพื้นฐาน ฉันไม่แน่ใจว่าจะวิเคราะห์ข้อมูลได้ดีที่สุดอย่างไร อาจเป็นไปได้ว่าตัวแปรพื้นฐานบางตัวมีระดับที่ได้รับอิทธิพลจากการรักษาและไม่ใช่วิธีอื่น ๆ (เช่นผู้ให้บริการชีวภาพบางราย) ฉันหลงทางนิดหน่อยว่า covariates ใดที่ฉันควรรวมไว้ในแบบจำลองคะแนนความชอบสำหรับการประเมินน้ำหนักและสิ่งที่ฉันควรจะรวมเป็น covariates ในcoxphรูปแบบ (ถ้ามี) คำแนะนำในทิศทางที่ถูกต้องจะเป็นประโยชน์! ฉันยังไม่สามารถค้นหาวรรณกรรมเกี่ยวกับเรื่องนี้ในการสร้างแบบจำลองของ CoxPh ได้ในตอนนี้ ฉันคิดว่าโควาเรียที่เป็นตัวแทนของการรักษาที่มีพื้นฐานที่ว่า (อาจ) มีอิทธิพลต่อผลลัพธ์ควรรวมอยู่ใน Cox PH covariates แต่ฉันไม่แน่ใจในเรื่องนี้ ฉันจะทราบได้อย่างไรว่าควรรวมตัวแปรตัวใดเป็นโควาเรียต์ในโมเดล Cox แทนที่จะใช้ในการคำนวณน้ำหนักคะแนนความชอบ? คำถามติดตาม ฉันเข้าใจปัญหาที่สืบทอดมาของการประเมินผลการรักษาของการแทรกแซงบางอย่างที่ได้เริ่มขึ้นแล้ว - นั่นคือแพร่หลายในหมู่ผู้ป่วยก่อนที่จะเริ่มการสังเกต ทั้งในเรื่องที่เกี่ยวกับการแนะนำอคติที่เกี่ยวข้องกับการเปลี่ยนแปลงเวลาของความเสี่ยง (เช่นผลข้างเคียงที่พบบ่อยในปีแรกของการบำบัด) และเพื่อนร่วมทุนที่ได้รับผลกระทบจากการรักษา หากฉันไม่เข้าใจผิดนี่เป็นข้อเสนอที่เป็นสาเหตุของความคลาดเคลื่อนระหว่างการสังเกตและการสุ่มว่าเกี่ยวกับหัวใจและหลอดเลือดและการบำบัดทดแทนฮอร์โมน ในชุดข้อมูลของฉันในอีกทางหนึ่งเราสนใจที่จะดูผลกระทบที่อาจเกิดขึ้นจากการรักษา ถ้าฉันใช้การปรับคะแนนความชอบเพื่อตรวจสอบผลการรักษาในหมู่ผู้ใช้ที่แพร่หลายเช่นการใช้ยาก่อนการสังเกตในข้อมูลกลุ่มและเราสังเกตเห็นผลข้างเคียงของการรักษาด้วยยา (และนี่คือสิ่งที่เรากำลังมองหา) ฉันสามารถแยกแยะความเป็นไปได้ที่จะประเมินความเสี่ยงที่เกี่ยวข้องกับการรักษามากเกินไปได้หรือไม่? คือตราบใดที่ความเสี่ยงนั้นเพิ่มขึ้นอย่างมีนัยสำคัญมันเป็น "แน่นอน" ที่สุดที่ไม่ได้ป้องกัน? ฉันไม่สามารถจินตนาการถึงตัวอย่างที่ความลำเอียงชนิดนี้สามารถแนะนำการประเมินค่าความเสี่ยงสูงเกินไปของการเชื่อมโยงความเสี่ยงที่ผิดพลาดในบริบทนี้

1
การจัดการกับการถดถอยของตัวแปรตอบสนองที่มีขอบเขตผิดปกติ
ฉันกำลังพยายามที่จะสร้างแบบจำลองตัวแปรการตอบสนองที่ถูกผูกไว้ในทางทฤษฎีระหว่าง -225 และ +225 ตัวแปรคือคะแนนรวมที่ผู้เล่นได้รับเมื่อเล่นเกม แม้ว่าในทางทฤษฎีมันเป็นไปได้สำหรับวิชาที่จะทำคะแนน +225 แม้จะเป็นเช่นนี้เพราะคะแนนขึ้นอยู่กับการกระทำของอาสาสมัครเท่านั้น แต่ยังรวมถึงการกระทำของการกระทำอื่นที่คะแนนสูงสุดที่ทุกคนทำคือ 125 (นี่คือผู้เล่นสูงสุด 2 คนที่เล่นกันสามารถทำคะแนนได้) เกิดขึ้นด้วยความถี่สูงมาก คะแนนต่ำสุดคือ +35 ขอบเขตของ 125 นี้ทำให้เกิดปัญหากับการถดถอยเชิงเส้น สิ่งเดียวที่ฉันคิดได้คือการปรับขนาดการตอบสนองใหม่ให้อยู่ระหว่าง 0 ถึง 1 และใช้การถดถอยเบต้า ถ้าฉันทำเช่นนี้แม้ว่าฉันไม่แน่ใจว่าฉันสามารถพิสูจน์ได้ว่า 125 เป็นขอบเขตสูงสุด (หรือ 1 หลังจากการเปลี่ยนแปลง) เนื่องจากเป็นไปได้ที่จะได้คะแนน +225 นอกจากนี้ถ้าฉันทำสิ่งนี้ขอบเขตด้านล่างของฉันคือ 35 ขอบคุณ โจนาธาน

1
การประเมินตัวแยกประเภท: เส้นโค้งการเรียนรู้กับเส้นโค้ง ROC
ฉันต้องการเปรียบเทียบตัวแยกประเภทที่แตกต่างกัน 2 ตัวสำหรับปัญหาการจำแนกข้อความแบบหลายคลาสที่ใช้ชุดข้อมูลการฝึกอบรมขนาดใหญ่ ฉันสงสัยว่าฉันควรใช้ ROC curves หรือ learning curves เพื่อเปรียบเทียบ 2 ตัวแยกประเภท ในอีกด้านหนึ่งเส้นโค้งการเรียนรู้มีประโยชน์สำหรับการตัดสินใจขนาดของชุดข้อมูลการฝึกอบรมเนื่องจากคุณสามารถหาขนาดของชุดข้อมูลที่ตัวแยกประเภทหยุดการเรียนรู้ (และอาจลดระดับ) ดังนั้นตัวจําแนกที่ดีที่สุดในกรณีนี้อาจเป็นตัวจําแนกที่มีความแม่นยำสูงสุดด้วยขนาดชุดข้อมูลที่เล็กที่สุด ในทางกลับกัน ROC curves ช่วยให้คุณค้นหาจุดที่มีการแลกเปลี่ยนที่เหมาะสมระหว่างความไว / ความจำเพาะ ลักษณนามที่ดีที่สุดในกรณีนี้คือตัวที่ใกล้กับส่วนบนซ้ายมากที่สุดโดยมี TPR สูงสุดสำหรับ FPR ใด ๆ ฉันควรใช้วิธีการประเมินทั้งสองหรือไม่ เป็นไปได้หรือไม่ที่วิธีที่มีช่วงการเรียนรู้ที่ดีกว่ามีเส้นโค้ง ROC ที่แย่ลงและในทางกลับกัน

3
วัดความสม่ำเสมอของการกระจายของคะแนนในรูปแบบ 2 มิติ
ฉันมีสแควร์ 2 มิติและมีชุดของจุดอยู่ข้างในนั้นพูด 1,000 จุด ฉันต้องการวิธีที่จะดูว่าการกระจายของจุดภายในจัตุรัสนั้นกระจายออกไป (หรือมากกว่าหรือน้อยกว่าการกระจายอย่างสม่ำเสมอ) หรือพวกเขามีแนวโน้มที่จะรวมตัวกันในบางจุดภายในจัตุรัส ฉันต้องการวิธีการทางคณิตศาสตร์ / สถิติ (ไม่ใช่การเขียนโปรแกรม) เพื่อตรวจสอบสิ่งนี้ ฉัน googled พบสิ่งที่ชอบความดีของ Kolmogorov และอื่น ๆ และเพียงแค่สงสัยว่ามีวิธีการอื่นเพื่อให้บรรลุนี้ ต้องการสิ่งนี้สำหรับกระดาษสำหรับชั้นเรียน อินพุต: จตุรัส 2D และ 1,000 คะแนน เอาท์พุท: ใช่ / ไม่ (ใช่ = กระจายออกไปอย่างสม่ำเสมอไม่ = รวมตัวกันในบางจุด)

2
แปลงตัวแปรต่อเนื่องสำหรับการถดถอยโลจิสติก
ฉันมีข้อมูลการสำรวจขนาดใหญ่ตัวแปรผลลัพธ์ไบนารีและตัวแปรอธิบายมากมายรวมถึงไบนารีและต่อเนื่อง ฉันกำลังสร้างชุดแบบจำลอง (ทดลองกับทั้ง GLM และ GLM แบบผสม) และใช้วิธีการทางทฤษฎีข้อมูลเพื่อเลือกแบบจำลองชั้นนำ ฉันตรวจสอบคำอธิบายอย่างระมัดระวัง (ทั้งแบบต่อเนื่องและแบบแบ่งหมวดหมู่) สำหรับความสัมพันธ์และฉันใช้เฉพาะในรูปแบบเดียวกันที่มีค่าสัมประสิทธิ์ Pearson หรือ Phicorr น้อยกว่า 0.3 ฉันต้องการให้โอกาสต่อเนื่องของตัวแปรทั้งหมดในการแข่งขันกับนางแบบชั้นนำ จากประสบการณ์ของฉันการเปลี่ยนสิ่งที่ต้องการโดยยึดตามความเบ้ปรับปรุงโมเดลที่พวกเขาเข้าร่วม (AIC ที่ต่ำกว่า) คำถามแรกของฉันคือ: การปรับปรุงนี้เพราะการเปลี่ยนแปลงช่วยเพิ่มความเป็นเชิงเส้นกับ logit หรือไม่ หรือการแก้ไขความเบ้ช่วยปรับปรุงความสมดุลของตัวแปรอธิบายอย่างใดด้วยการทำให้ข้อมูลสมมาตรมากขึ้น? ฉันหวังว่าฉันจะเข้าใจเหตุผลทางคณิตศาสตร์ที่อยู่เบื้องหลังเรื่องนี้ แต่สำหรับตอนนี้ถ้าใครบางคนสามารถอธิบายสิ่งนี้ในแง่ง่ายนั่นจะเป็นการดี หากคุณมีการอ้างอิงใด ๆ ที่ฉันสามารถใช้ได้ฉันจะขอบคุณมันจริงๆ เว็บไซต์อินเทอร์เน็ตหลายแห่งบอกว่าเพราะความเป็นมาตรฐานไม่ใช่ข้อสันนิษฐานในการถดถอยโลจิสติกแบบไบนารีอย่าเปลี่ยนตัวแปร แต่ฉันรู้สึกว่าถ้าไม่เปลี่ยนตัวแปรของฉันฉันจะเสียเปรียบเมื่อเทียบกับคนอื่น ๆ และอาจส่งผลกระทบต่อสิ่งที่โมเดลชั้นนำและเปลี่ยนการอนุมาน (ดีมันมักจะไม่ได้ ตัวแปรของฉันบางอย่างทำงานได้ดีขึ้นเมื่อบันทึกการเปลี่ยนแปลงบางอย่างเมื่อยกกำลังสอง (ทิศทางที่แตกต่างกันของความลาดเอียง) และบางตัวแปรที่ไม่ได้เปลี่ยนแปลง ใครบางคนจะสามารถให้แนวทางแก่ฉันในการระวังการเปลี่ยนตัวแปรอธิบายสำหรับการถดถอยโลจิสติกและถ้าไม่ทำมันทำไมไม่


1
Log-Cauchy การสร้างตัวเลขสุ่ม
ฉันต้องการวาดตัวเลขสุ่มจากการแจกแจงล็อก - โคชีซึ่งมีความหนาแน่น: ใครช่วยฉันหรือชี้ให้ฉันเห็นหนังสือ / กระดาษที่สามารถแสดงให้ฉันได้อย่างไรฉ( x ; μ , σ) = 1x πσ[ 1 + ( l n ( x ) - μσ)2].ฉ(x;μ,σ)=1xπσ[1+(ล.n(x)-μσ)2].f(x;\mu,\sigma)=\frac{1}{x\pi\sigma\left[1+\left(\frac{ln(x)-\mu}{\sigma}\right)^2\right]}.

2
วิธีการ 'เก็บข้อมูลที่เรียงลำดับอย่างชาญฉลาด' อย่างชาญฉลาด
ฉันกำลังพยายามที่จะจัดเก็บคอลเลกชันที่เรียงอย่างชาญฉลาด ฉันมีชุดข้อมูลจำนวนชิ้น แต่ฉันรู้ว่านี้เหมาะกับข้อมูลลงในขนาดถังขยะไม่มีที่เปรียบ ฉันไม่รู้วิธีเลือกจุดสิ้นสุดอย่างชาญฉลาดเพื่อให้พอดีกับข้อมูล ตัวอย่างเช่น:nnnม.ม.m ว่าฉันมี 12 รายการในคอลเลกชันของฉันและฉันรู้ว่าข้อมูลจะพอดีกับ 3 ถังขยะ: Index: 1 2 3 4 5 6 7 8 9 10 11 12 Value: 1 1 1 3 3 3 3 3 3 5 5 6 ฉันจะเลือกเบรกพอยต์อย่างชาญฉลาดสำหรับช่องเก็บของอย่างไรi = { 1 - 3 } , { 4 - 9 } , …

4
เส้นตรงในแนวทแยงในส่วนที่เหลือเทียบกับพล็อตค่าติดตั้งสำหรับการถดถอยหลายครั้ง
ฉันกำลังสังเกตรูปแบบแปลก ๆ ที่เหลืออยู่สำหรับข้อมูลของฉัน: [แก้ไข] นี่คือพล็อตการถดถอยบางส่วนสำหรับตัวแปรสองตัว: [EDIT2] เพิ่มแผนการของ PP การกระจายดูเหมือนจะทำได้ดี (ดูด้านล่าง) แต่ฉันไม่มีเงื่อนงำที่เส้นตรงนี้อาจมาจาก ความคิดใด ๆ [อัพเดท 31.07] มันกลับกลายเป็นว่าคุณพูดถูกฉันมีหลายกรณีที่จำนวนทวีตซ้ำเป็น 0 อย่างแน่นอนและ 15 รายนี้ส่งผลให้มีรูปแบบที่เหลือแปลก ๆ ส่วนที่เหลือดูดีขึ้นมากในขณะนี้: ฉันได้รวมการถดถอยบางส่วนเข้ากับเส้นเหลือง

1
กำลังค้นหากลุ่มควบคุมเทียบเคียงสำหรับกลุ่มการรักษาหรือไม่?
ฉันมีกลุ่มการรักษาขนาด 30 (30 โรงเรียนในแคลิฟอร์เนีย) ที่ใช้ซอฟต์แวร์เสริมทางคณิตศาสตร์ ในการวิเคราะห์อย่างง่ายฉันต้องการเปรียบเทียบการเจริญเติบโตทางคณิตศาสตร์เฉลี่ยของนักเรียนระหว่างกลุ่มการรักษาของเรากับกลุ่มควบคุมที่เปรียบเทียบกันได้ มีหลายโรงเรียนใน CA ที่ไม่ได้ใช้ซอฟต์แวร์ ฉันต้องการให้กลุ่มควบคุมรวมโรงเรียนที่คล้ายคลึงกัน (คะแนนพื้นฐานของพวกเขาคล้ายกับโรงเรียนสอนบำบัดที่มีข้อผิดพลาดที่สมเหตุสมผล) นอกจากนี้ฉันต้องการให้กลุ่มตัวอย่างเป็นกลุ่มรักษา 3 เท่า (ที่นี่ 90 โรงเรียน) มีตัวเลือกมากมายให้เลือก 90 โรงเรียนจากกว่า 1,000 โรงเรียนในแคลิฟอร์เนีย คุณจะเลือกกลุ่มควบคุมอย่างไร

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.