คำถามของฉันสามารถใช้ถ้อยคำใหม่เป็น "วิธีการประเมินข้อผิดพลาดการสุ่มตัวอย่างโดยใช้ข้อมูลขนาดใหญ่" โดยเฉพาะอย่างยิ่งสำหรับสิ่งพิมพ์วารสาร นี่คือตัวอย่างที่แสดงให้เห็นถึงความท้าทาย
จากชุดข้อมูลที่มีขนาดใหญ่มาก (ผู้ป่วยที่ไม่ซ้ำกันมากกว่า 100,000 รายและยาที่กำหนดจากโรงพยาบาล 100 แห่ง) ฉันสนใจที่จะประเมินสัดส่วนของผู้ป่วยที่ทานยาโดยเฉพาะ มันตรงไปตรงมาเพื่อให้ได้สัดส่วนนี้ ช่วงความเชื่อมั่นของมัน (เช่นพารามิเตอร์หรือ bootstrap) แน่น / แคบอย่างไม่น่าเชื่อเพราะ n มีขนาดใหญ่มาก ในขณะที่โชคดีที่มีตัวอย่างขนาดใหญ่ฉันยังคงค้นหาวิธีการประเมินนำเสนอและ / หรือแสดงภาพความน่าจะเป็นข้อผิดพลาดบางรูปแบบ ในขณะที่ดูเหมือนว่าไม่ช่วยเหลือ (ถ้าไม่ทำให้เข้าใจผิด) เพื่อใส่ / แสดงช่วงความเชื่อมั่น (เช่น 95% CI: .65878 - .65881) แต่ก็ดูเหมือนว่าเป็นไปไม่ได้ที่จะหลีกเลี่ยงบางข้อความเกี่ยวกับความไม่แน่นอน
โปรดแจ้งให้เราทราบว่าคุณคิดอย่างไร ฉันจะขอบคุณวรรณกรรมใด ๆ ในหัวข้อนี้ วิธีในการหลีกเลี่ยงความมั่นใจในข้อมูลแม้จะมีกลุ่มตัวอย่างขนาดใหญ่