สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
การคำนวณกำลังไฟ / ขนาดตัวอย่างสำหรับการศึกษาไบโอมาร์คเกอร์
เรามีไบโอมาร์คเกอร์ที่มีศักยภาพในการทำนายว่าผู้ป่วยจะเป็นมะเร็งหรือไม่ ผลการทดสอบไบโอมาร์คเกอร์คือเลขฐานสองเป็นบวกหรือลบ เราต้องการทราบถึงจำนวนผู้ป่วยที่ต้องทดสอบเพื่อตรวจสอบว่าไบโอมาร์คเกอร์นี้เป็นตัวทำนายที่ดีหรือไม่ จากการอ่านบนอินเทอร์เน็ตดูเหมือนว่าวิธีที่จะไปคือดูความไว (สำหรับจำนวนเคส) และความเฉพาะเจาะจง (สำหรับจำนวนของการควบคุม) ขอแนะนำว่าคุณควรปฏิบัติต่อสถานการณ์นี้เป็นการทดสอบสัดส่วนตัวอย่างเดียว แต่ก็ยังไม่ชัดเจนว่าคุณควรประเมินความไวและช่วงที่คุณเตรียมไว้อย่างไร ถ้าพูดว่าฉันพิจารณาผู้ใช้ไบโอมาร์คเกอร์ที่มีความไวมากกว่า 0.8 ถึง "ดี" คุณจะตั้งค่าตัวแปรทั้งสองอย่างไร ฉันต้องการสมมติฐานว่างเปล่าของฉันที่จะเป็นไบโอมาร์คเกอร์ไม่ได้ดีไปกว่าการสุ่มเลือกเช่นความไว 0.5 ทุกคนสามารถให้ตัวอย่างของวิธีที่ดีที่สุดในการทำเช่นนี้ (โดยเฉพาะถ้ามันอยู่ใน R)
13 r  power 

2
จะเพิ่มตัวแปรสุ่มสองตัวแบบพึ่งพาได้อย่างไร?
ฉันรู้ว่าฉันไม่สามารถใช้การโน้มน้าวใจได้ ฉันมีตัวแปรสุ่มสองตัวคือ A และ B และพวกมันขึ้นอยู่กับ ฉันต้องการฟังก์ชันการกระจายแบบ A + B

2
ขั้นตอนที่ถูกต้องในการเลือกความล่าช้าเมื่อทำการทดสอบตัวนับ Johansen คืออะไร?
เมื่อทำการ preforming Johansen Cointegration test สำหรับ 2 time series (ในกรณีง่าย ๆ ) คุณจำเป็นต้องตัดสินใจว่าความล่าช้าที่คุณต้องการใช้ การทดสอบความล่าช้าที่แตกต่างกันให้ผลลัพธ์ที่แตกต่างกัน: สำหรับบางระดับความล่าช้าสมมติฐานว่างสามารถถูกปฏิเสธ แต่สำหรับคนอื่นมันไม่สามารถทำได้ คำถามของฉันคือวิธีการที่ถูกต้องโดยอิงจากข้อมูลอินพุตเพื่อตัดสินใจว่าฉันต้องใช้ความล่าช้าอะไรเมื่อทำการทดสอบ Johansen ล่วงหน้า ป.ล. ฉันส่งคำถามนี้ไปที่ quant.stackexchange แต่บางคนก็แนะนำว่ามันเหมาะสมกับกลุ่มนี้มากกว่า


5
ความน่าจะเป็นที่จะประสบความสำเร็จในลำดับ k ของการทดลอง n ของเบอร์นูลลี
ฉันพยายามที่จะหาความน่าจะเป็นที่จะได้ 8 การทดลองในแถวที่ถูกต้องในบล็อก 25 การทดลองคุณมี 8 บล็อกทั้งหมด (25 การทดลอง) เพื่อให้ได้การทดลอง 8 ครั้งที่ถูกต้องในแถว ความน่าจะเป็นของการทดลองใช้ถูกต้องตามการคาดเดาคือ 1/3 หลังจากได้ 8 ในแถวที่ถูกต้องบล็อกจะสิ้นสุด (ดังนั้นการได้รับมากกว่า 8 ในแถวที่ถูกต้องนั้นเป็นไปไม่ได้ในทางเทคนิค) ฉันจะค้นหาความน่าจะเป็นที่จะเกิดขึ้นได้อย่างไร ฉันคิดตามลำดับการใช้งาน (1/3) ^ 8 เนื่องจากความน่าจะเป็นที่จะได้ 8 ในแถวที่ถูกต้องมีโอกาส 17 ที่เป็นไปได้ที่จะได้ 8 ต่อเนื่องเป็นแถวในบล็อก 25 การทดลองถ้าฉันคูณ 17 ความเป็นไปได้ * 8 บล็อกที่ฉันได้รับ 136 จะเป็น 1- (1- (1/3) ^ 8) ^ 136 ให้โอกาสฉันที่จะได้ 8 …

2
วิธีการทดสอบว่าตัวอย่างของข้อมูลที่เหมาะกับครอบครัวของการกระจายแกมม่าหรือไม่?
ฉันมีตัวอย่างของข้อมูลซึ่งสร้างจากตัวแปรสุ่มแบบต่อเนื่อง X และจากฮิสโตแกรมที่ฉันวาดด้วย R ฉันเดาว่าบางทีการกระจายของ X เป็นไปตามการแจกแจงแกมม่าบางอย่าง แต่ฉันไม่รู้พารามิเตอร์ที่แน่นอนของการกระจายแกมม่านี้ คำถามของฉันคือวิธีทดสอบว่าการแจกแจง X เป็นของตระกูลการแจกแจงแกมมาหรือไม่? มีความดีของการทดสอบแบบพอดีเช่นการทดสอบ Kolmogorov-Smirnov การทดสอบ Anderson-Darling และอื่น ๆ แต่ข้อ จำกัด อย่างหนึ่งเมื่อใช้การทดสอบเหล่านี้คือพารามิเตอร์ของการแจกแจงทางทฤษฎีควรทราบล่วงหน้า ใครช่วยกรุณาบอกวิธีแก้ปัญหานี้ได้ไหม

2
การเลือกรูปแบบที่ไม่ซ้อนกัน
ทั้งการทดสอบอัตราส่วนความน่าจะเป็นและ AIC เป็นเครื่องมือสำหรับการเลือกระหว่างสองรุ่นและทั้งสองแบบนั้นขึ้นอยู่กับความน่าจะเป็นบันทึก แต่ทำไมการทดสอบอัตราส่วนความน่าจะเป็นไม่สามารถใช้ในการเลือกระหว่างแบบจำลองสองแบบที่ไม่ซ้อนกันในขณะที่ AIC สามารถทำได้

4
มีแบบฝึกหัดใดบ้างเกี่ยวกับทฤษฎีความน่าจะเป็นแบบเบย์หรือแบบจำลองกราฟิกโดยใช้ตัวอย่าง?
ฉันเคยเห็นการอ้างอิงถึงการเรียนรู้ทฤษฎีความน่าจะเป็นแบบเบย์ใน R และฉันสงสัยว่ามีอะไรมากกว่านี้บางทีใน Python โดยเฉพาะ มุ่งสู่การเรียนรู้ทฤษฎีความน่าจะเป็นแบบเบย์การอนุมานการประมาณความน่าจะเป็นสูงสุดแบบจำลองกราฟิกและการเรียงลำดับ?

2
คำอธิบายแบบจำลอง Tobit
เรามีผู้เข้าร่วม 100 คนในสองกลุ่มn = 50n=50n=50ในแต่ละกลุ่ม เราใช้การประเมินความสามารถในการทำงานขั้นพื้นฐานที่ 4 จุดเวลา การประเมินประกอบด้วยคำถามทั้งหมด 6 ข้อแต่ละข้อมีคะแนน 0 - 5 เราไม่มีคะแนนเป็นรายบุคคลสำหรับแต่ละคำถามเพียงคะแนนรวมที่อยู่ในช่วงตั้งแต่ 0 - 30 คะแนนที่สูงขึ้นหมายถึงการทำงานที่ดีขึ้น ปัญหาคือว่าการประเมินขั้นพื้นฐานมากและมีผลกระทบเพดานอย่างมีนัยสำคัญ ผลลัพธ์มีความเบ้ทางลบมาก ผู้เข้าร่วมส่วนใหญ่ทำคะแนนได้ใกล้เคียงกับ 30 โดยเฉพาะอย่างยิ่งที่ 3 คะแนนติดตามเวลา มีความเป็นไปได้ที่ผู้เข้าร่วมที่ทำคะแนนได้ไม่เท่ากันจะมีความสามารถอย่างเท่าเทียมกัน: ผู้เข้าร่วมบางคนมีคะแนนเพียงแค่ 30 คะแนนและคนอื่น ๆ ได้คะแนน 30 ด้วยความง่ายดายและจะได้คะแนนสูงกว่ามาก เซ็นเซอร์จากด้านบน ฉันต้องการเปรียบเทียบทั้งสองกลุ่มและเมื่อเวลาผ่านไป แต่เห็นได้ชัดว่านี่เป็นเรื่องยากมากเนื่องจากลักษณะของผลลัพธ์ การแปลงรูปแบบใด ๆ ก็ไม่ได้สร้างความแตกต่าง ฉันได้รับการแนะนำว่ารูปแบบบิทที่ดีที่สุดคือการติดตั้งสำหรับการประเมินนี้และฉันสามารถเรียกใช้การวิเคราะห์ในการวิจัยโดยใช้ตัวอย่างจากกระดาษอาร์เน่ Henningen ของประมาณรุ่นถดถอยเซ็นเซอร์ใน R โดยใช้แพคเกจ อย่างไรก็ตามฉันมีเพียงความรู้พื้นฐานทางสถิติและพบว่าข้อมูลเกี่ยวกับโมเดล Tobit นั้นค่อนข้างซับซ้อน ฉันต้องสามารถอธิบายโมเดลนี้ในภาษาธรรมดาและฉันไม่สามารถหาคำอธิบายภาษาธรรมดาถั่วและสลักเกลียวว่าแบบจำลอง Tobit …

3
การถดถอยปกติกับการถดถอยเมื่อตัวแปรต่างกัน
ฉันแค่พยายามที่จะเข้าใจว่าความสัมพันธ์ระหว่างการถดถอยแบบพหุ / แบบธรรมดากับการถดถอยแบบพหุ / แบบง่ายเมื่อตัวแปรแตกต่างกัน ตัวอย่างเช่นฉันกำลังวิเคราะห์ความสัมพันธ์ระหว่างยอดเงินฝาก ( ) เทียบกับอัตราตลาด ( ) ถ้าฉันเรียกใช้การถดถอยเชิงเส้นอย่างง่ายความสัมพันธ์นั้นเป็นค่าลบและค่อนข้างสำคัญ (ประมาณ -.74) อย่างไรก็ตามถ้าฉันใช้บันทึกและ ความแตกต่างของตัวแปรตามและความแตกต่างของตัวแปรอิสระดังนั้นสมการของฉันคือที่ถดถอยด้วย , สหสัมพันธ์ของฉันและ R ^ 2 ไม่มีความหมายเลย ( )R T dYTYTY_TRTRTR_TddLN( YT)dln⁡(YT)d\, \ln(Y_T)R 2 = .004dR ( T)dR(T)d\, R(T)R2= .004R2=.004R^2 = .004 ฉันแค่สงสัยว่าต่ำหมายถึงอะไร? นั่นหมายความว่าแบบจำลองของฉันไม่เหมาะสมหรือฉันไม่สนใจเมื่อฉันดูข้อมูลที่แตกต่างกันหรือไม่? ฉันรู้จากข้อมูลว่ามีความสัมพันธ์อย่างมีนัยสำคัญระหว่างตัวแปรดั้งเดิมสองตัว แต่สำหรับแบบจำลองของฉันฉันต้องดูตัวแปรที่แตกต่างกันดังนั้นเพียงแค่สงสัยว่าจะทำอย่างไรกับเรื่องนี้R 2R2R2R^2R2R2R^2

4
จะหาข้อมูลดิบเกี่ยวกับการทดลองทางคลินิกได้ที่ไหน? [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้เป็นไปตามหัวข้อสำหรับการตรวจสอบข้าม ปิดให้บริการใน2 ปีที่ผ่านมา ฉันต้องการใช้ข้อมูลดิบเกี่ยวกับการทดลองทางคลินิกสำหรับการสอบปลายปีของนักศึกษาปริญญาโทของฉัน ข้อมูลเหล่านี้สามารถจัดการกับโมเลกุลชนิดใดก็ได้ตราบใดที่การทดลองเสร็จสมบูรณ์ (ระยะที่ 1 ถึง 4) คุณมีความคิดที่จะหาชุดข้อมูลฟรีดังกล่าวบนเว็บหรือไม่? ขอขอบคุณ.

2
ใช้การทดสอบนัยสำคัญทางสถิติเพื่อตรวจสอบความถูกต้องของผลการวิเคราะห์กลุ่ม
ฉันกำลังสำรวจการใช้การทดสอบนัยสำคัญทางสถิติ (SST) เพื่อตรวจสอบผลลัพธ์ของการวิเคราะห์คลัสเตอร์ ฉันพบเอกสารหลายฉบับเกี่ยวกับหัวข้อนี้เช่น "ความสำคัญทางสถิติของการทำคลัสเตอร์สำหรับข้อมูลมิติข้อมูลตัวอย่างขนาดเล็ก " โดยLiu, Yufeng และคณะ (2008) " ในการทดสอบความสำคัญในการวิเคราะห์กลุ่ม " โดยBock (1985) แต่ฉันสนใจที่จะค้นหาวรรณกรรมบางฉบับที่โต้แย้งว่า SST ไม่เหมาะสมที่จะตรวจสอบผลลัพธ์ของการวิเคราะห์กลุ่ม แหล่งเดียวที่ฉันได้พบอ้างว่าเป็นหน้าเว็บของผู้จำหน่ายซอฟต์แวร์ เพื่อชี้แจง: ฉันสนใจที่จะทดสอบว่าโครงสร้างคลัสเตอร์ที่สำคัญพบว่าเป็นผลมาจากการวิเคราะห์กลุ่มหรือไม่ดังนั้นฉันต้องการทราบเอกสารที่สนับสนุนหรือ refuting ข้อกังวล "เกี่ยวกับความเป็นไปได้ของการทดสอบหลังผลของข้อมูลเชิงสำรวจ การวิเคราะห์ที่ใช้ในการค้นหากลุ่ม " ฉันเพิ่งพบกระดาษจากปี 2003 " วิธีการจัดกลุ่มและการจำแนกประเภท " โดยMilligan และ Hirtleกล่าวว่าการใช้ ANOVA นั้นเป็นการวิเคราะห์ที่ไม่ถูกต้องเนื่องจากข้อมูลไม่มีการสุ่มมอบหมายให้กับกลุ่ม

3
ฉันจะเปรียบเทียบความชันของการถดถอยแบบ bootstrapped ได้อย่างไร
ขอให้เราสมมติว่าฉันมีชุดข้อมูลสองชุดโดยมีการสังเกตnคู่ข้อมูลของตัวแปรอิสระxและตัวแปรตามแต่ละy ให้เราคิดต่อไปว่าฉันต้องการสร้างการกระจายตัวของความถดถอยสำหรับแต่ละชุดข้อมูลโดยการบูตการสำรวจ (โดยการแทนที่) Nครั้งและคำนวณการถดถอยy = a + bxแต่ละครั้ง. ฉันจะเปรียบเทียบการแจกแจงสองแบบเพื่อบอกว่าลาดต่างกันอย่างมีนัยสำคัญได้อย่างไร การทดสอบ U สำหรับการทดสอบความแตกต่างระหว่างค่ามัธยฐานของการแจกแจงจะขึ้นอยู่กับ N อย่างมากนั่นคือยิ่งฉันทำการย้ำอีกครั้งบ่อยครั้งเท่าไหร่ ฉันจะต้องคำนวณการทับซ้อนระหว่างการแจกแจงเพื่อกำหนดความแตกต่างที่สำคัญได้อย่างไร

3
การเลือกแบบจำลอง: การถดถอยโลจิสติก
สมมติว่าเรามีตัวแปรและผลไบนารีตัวแปรYโควาเรียเหล่านี้บางประเภทมีหลายระดับ อื่น ๆ อย่างต่อเนื่อง คุณจะเลือกรุ่นที่ดีที่สุดได้อย่างไร กล่าวอีกนัยหนึ่งคุณจะเลือกเพื่อนร่วมรัฐใดที่จะรวมอยู่ในแบบจำลองได้อย่างไรx 1 , … , x n ynnnx1, … , xnx1,…,xnx_1, \dots, x_nYyy คุณจะสร้างแบบจำลองกับ covariates แต่ละรายการโดยใช้การถดถอยโลจิสติกอย่างง่ายและเลือกอันที่มีความสัมพันธ์สำคัญหรือไม่?Yyy

2
ฉันสามารถทำ PCA โดยใช้มาตรการซ้ำเพื่อลดข้อมูลได้หรือไม่
ฉันมีการทดลอง 3 ครั้งต่อสัตว์ 87 ตัวในแต่ละบริบทของ 2 (ข้อมูลที่หายไปบางส่วนไม่มีข้อมูลที่ขาดหายไป = 64 สัตว์) ในบริบทที่ฉันมีมาตรการที่เฉพาะเจาะจงจำนวนมาก (เวลาที่จะป้อนจำนวนครั้งที่กลับมาเพื่อที่อยู่อาศัยและอื่น ๆ ) ดังนั้นฉันต้องการที่จะพัฒนา 2-3 คะแนนพฤติกรรมคอมโพสิตที่อธิบายพฤติกรรมในบริบทที่ (เรียกพวกเขาC1, C2, C3) ฉันต้องการสิ่งC1นั้นซึ่งมีความหมายเหมือนกันในการทดลองทั้ง 3 และ 87 สัตว์เพื่อที่ฉันจะได้ทำการถดถอยเพื่อตรวจสอบผลกระทบของอายุเพศสายเลือดและสัตว์แต่ละตัวที่มีต่อพฤติกรรม จากนั้นฉันต้องการตรวจสอบC1ความเกี่ยวข้องกับคะแนนพฤติกรรมในบริบทอื่น ๆ ภายในอายุที่เฉพาะเจาะจง (ณ วันที่ 1 กิจกรรมในบริบทที่ 1 ทำนายกิจกรรมในบริบทที่ 2 ได้หรือไม่) หากนี่ไม่ใช่การวัดซ้ำ PCA จะทำงานได้ดี - ทำ PCA ในหลายมาตรการของบริบทจากนั้นใช้ PC1, PC2 ฯลฯ เพื่อตรวจสอบความสัมพันธ์ (Spearman correlations) ระหว่าง …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.