สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
ทำไมการทดสอบอิสระใช้การแจกแจงแบบไคสแควร์?
การความเหมาะสมของจะใช้สถิติต่อไปนี้: ในการทดสอบโดยอนุญาตให้ ตรงตามเงื่อนไขหนึ่งใช้ - การกระจายเพื่อคำนวณ p-value ที่กำหนดเป็นจริงหนึ่งจะสังเกตเห็นค่าดังกล่าวในตัวอย่างตัวแทนที่มีขนาดเดียวกันχ2χ2\chi^2χ20=∑i=1n(Oi−Ei)2Eiχ02=∑i=1n(Oi−Ei)2Ei \chi_0^2=\sum_{i=1}^n\frac{(O_i-E_i)^2}{E_i} χ2χ2\chi^2H0H0H_0 อย่างไรก็ตามเพื่อให้สถิติทำตามกระจาย (ที่มีองศาอิสระ ) จะต้องเป็นจริงที่: สำหรับอิสระมาตรฐานปกติ( Wikipedia ) เงื่อนไขสำหรับการทดสอบมีดังนี้ (อีกครั้งจากWikipedia ):χ20χ02\chi_0^2χ2χ2\chi^2n−1n−1n-1∑i=1n(Oi−Ei)2Ei=∑i=1n−1Z2i∑i=1n(Oi−Ei)2Ei=∑i=1n−1Zi2 \sum_{i=1}^n\frac{(O_i-E_i)^2}{E_i}=\sum_{i=1}^{n-1}Z_i^2 ZiZiZ_i ตัวแทนตัวอย่างประชากร ตัวอย่างขนาดใหญ่ จำนวนเซลล์ที่คาดไว้มีขนาดใหญ่เพียงพอ ความเป็นอิสระระหว่างแต่ละประเภท จากเงื่อนไข (1,2) เป็นที่ชัดเจนว่าเราตอบสนองเงื่อนไขสำหรับการอนุมานจากตัวอย่างไปยังประชากร (3) ดูเหมือนจะเป็นข้อสันนิษฐานที่ต้องการเนื่องจากแยกกันซึ่งอยู่ในตัวส่วนนั้นไม่ส่งผลให้มีการแจกแจงแบบใกล้ชิดต่อเนื่องสำหรับแต่ละและถ้ามันไม่ใหญ่พอมีข้อผิดพลาดที่สามารถแก้ไขได้ด้วยเยต 'การแก้ไข - นี่ดูเหมือนจะมาจากความจริงที่ว่าการกระจายแบบไม่ต่อเนื่องนั้นเป็นแบบ "ปูพื้น" อย่างต่อเนื่องดังนั้นการเปลี่ยนแปลงทีละสำหรับแต่ละอันจะแก้ไขสิ่งนี้EiEiE_iZiZiZ_i1/21/21/2 ความจำเป็นของ (4) ดูเหมือนว่าจะมีประโยชน์ในภายหลัง แต่ฉันไม่สามารถดูได้ว่า ตอนแรกฉันคิดว่าจำเป็นสำหรับสถิติเพื่อให้ตรงกับการแจกแจง สิ่งนี้นำฉันไปสู่ข้อสันนิษฐานที่น่าสงสัยว่าซึ่งผิดอย่างแน่นอน ในความเป็นจริงเป็นที่ชัดเจนจากการลดขนาดของทั้งสองด้านของความเสมอภาคจากเป็นซึ่งไม่สามารถเกิดขึ้นได้Zi=Oi−EiEi√Zi=Oi−EiEiZ_i=\frac{O_i-E_i}{\sqrt{E_i}}Oi−Ei∼N(0,Ei−−√)Oi−Ei∼N(0,Ei)O_i-E_i\sim \mathcal{N}(0, \sqrt{E_i})nnnn−1n−1n-1 มันได้กลายเป็นที่ชัดเจนขอบคุณคำอธิบายของ whuberไม่จำเป็นต้องเท่ากับแต่ละคำเพราะ (หมายเหตุการลดจำนวนของตัวแปรสรุปเงิน) สำหรับมาตรฐานตัวแปรสุ่มปกติซึ่งเป็นหน้าที่ที่เป็นอิสระZiZiZ_iOi−EiEi√Oi−EiEi\frac{O_i-E_i}{\sqrt{E_i}}χ20=∑n−1i=1Z2iχ02=∑i=1n−1Zi2\chi_0^2=\sum_{i=1}^{n-1}Z_i^2ZiZiZ_i ดังนั้นคำถามของฉันคือติดตามการอย่างไร สิ่งที่ชนิดของการรวมกันของแต่ละแง่ผลในภาวะปกติมาตรฐาน …

2
-test ครับ
ฉันเพิ่งอ่านในนิตยสารวิทยาศาสตร์ที่ได้รับความนิยม (PM) จากเยอรมัน, 02/2013, หน้า 38) เกี่ยวกับการทดลองที่น่าสนใจ (ไม่มีแหล่งที่มา, น่าเสียดาย) มันดึงดูดความสนใจของฉันเพราะฉันสงสัยในความสำคัญของผลลัพธ์ แต่ข้อมูลที่ให้นั้นเพียงพอสำหรับการทำซ้ำการทดสอบทางสถิติ นักวิจัยสงสัยว่าการได้รับความเย็นในสภาพอากาศหนาวเย็นช่วยเพิ่มโอกาสที่จะเป็นหวัดได้หรือไม่ ดังนั้นพวกเขาสุ่มแบ่งนักเรียน 180 คนออกเป็นสองกลุ่ม กลุ่มหนึ่งต้องแช่เท้าในน้ำเย็นเป็นเวลา 20 นาที อีกคนเก็บรองเท้าไว้ ฉันคิดว่าการจัดการที่ตลก แต่ในทางกลับกันฉันไม่ใช่หมอและหมออาจจะคิดว่าตลก ประเด็นด้านจริยธรรมกัน อย่างไรก็ตามหลังจาก 5 วันนักเรียน 13 คนในกลุ่มการรักษามีอาการหวัด แต่เพียง 5 คนในกลุ่มที่สวมรองเท้า อัตราส่วนอัตราต่อรองของการทดลองนี้คือ 2.87 ด้วยขนาดตัวอย่างที่ค่อนข้างเล็กฉันเริ่มสงสัยว่าความแตกต่างนี้อาจมีนัยสำคัญหรือไม่ ดังนั้นฉันจึงทำการทดสอบสองครั้ง การทดสอบอย่างง่ายครั้งแรกของความเท่าเทียมกันของสัดส่วนโดยใช้การประมาณปกติ การทดสอบนี้มีz=1.988z=1.988z=1.988กับp=0.0468p=0.0468p=0.0468 0.0468 ฉันเดาว่านี่คือสิ่งที่นักวิจัยทดสอบ นี่เป็นสิ่งสำคัญอย่างแท้จริง อย่างไรก็ตามการทดสอบ z นี้ใช้ได้เฉพาะในกลุ่มตัวอย่างขนาดใหญ่เท่านั้นหากฉันไม่ผิดเนื่องจากการประมาณปกติ นอกจากนี้อัตราความชุกค่อนข้างน้อยและฉันสงสัยว่าสิ่งนี้อาจไม่ส่งผลกระทบต่ออัตราความครอบคลุมของช่วงความเชื่อมั่นของผลกระทบ ดังนั้นความพยายามครั้งที่สองของฉันคือการทดสอบความเป็นอิสระของไคสแควร์ทั้งการจำลองด้วย Monte-Carlo และ Pearson Chi-square มาตรฐาน ที่นี่ผมพบว่าค่า …

5
Recursive (ออนไลน์) อัลกอริธึมกำลังสองน้อยที่สุดที่ทำให้เป็นมาตรฐาน
ทุกคนสามารถชี้นำฉันไปในทิศทางของอัลกอริทึมแบบออนไลน์ (แบบเรียกซ้ำ) สำหรับการทำให้เป็นมาตรฐาน Tikhonov (กำลังสองน้อยที่สุดเป็นมาตรฐาน) ได้หรือไม่? ในการตั้งค่าออฟไลน์ฉันจะคำนวณβ^=(XTX+λI)−1XTYβ^=(XTX+λI)−1XTY\hat\beta=(X^TX+λI)^{−1}X^TYโดยใช้ชุดข้อมูลดั้งเดิมของฉันซึ่งพบλλλโดยใช้การตรวจสอบความถูกต้องแบบครอส n-fold ใหม่yyyค่าสามารถคาดการณ์ไว้สำหรับให้xxxใช้การ yy=xTβ^y=xTβ^y=x^T\hat\beta ในการตั้งค่าออนไลน์ฉันจะวาดจุดข้อมูลใหม่อย่างต่อเนื่อง ฉันจะอัปเดตβ^β^\hat\betaเมื่อฉันดึงตัวอย่างข้อมูลเพิ่มเติมใหม่โดยไม่ทำการคำนวณใหม่ทั้งหมดในชุดข้อมูลทั้งหมด (ต้นฉบับ + ใหม่)

4
การทดสอบสมมติฐานสำหรับความแตกต่างของค่ามัธยฐานในกลุ่มตัวอย่างมากกว่าสองตัวอย่าง
คำถาม คะแนนการทดสอบของคนสามกลุ่มจะถูกบันทึกเป็นเวกเตอร์แยกในอาร์ set.seed(1) group1 <- rnorm(100, mean = 75, sd = 10) group2 <- rnorm(100, mean = 85, sd = 10) group3 <- rnorm(100, mean = 95, sd = 10) ฉันต้องการทราบว่ามีความแตกต่างที่สำคัญในค่ามัธยฐานระหว่างกลุ่มเหล่านี้หรือไม่ ฉันรู้ว่าฉันสามารถทดสอบกลุ่ม 1 กับกลุ่ม 2 ได้โดยใช้การทดสอบ Wilcoxon เช่นนั้น wilcox.test(group1, group2) อย่างไรก็ตามการเปรียบเทียบครั้งนี้มีเพียงสองกลุ่มเท่านั้นและฉันต้องการเปรียบเทียบทั้งสามกลุ่มพร้อมกัน ฉันต้องการทดสอบสถิติที่ให้ค่า ap ที่ระดับนัยสำคัญ 0.05 มีคนช่วยได้ไหม แก้ไข # 1 - …

1
อัตราส่วนของความน่าจะเป็นเทียบกับอัตราส่วนของ PDF
ฉันใช้ Bayes เพื่อแก้ปัญหาการจัดกลุ่ม หลังจากทำการคำนวณบางอย่างฉันก็จำเป็นต้องได้รับอัตราส่วนของความน่าจะเป็นสองอย่าง: P(A)/P(B)P(A)/P(B)P(A)/P(B) เพื่อให้สามารถที่จะได้รับP(H|D)P(H|D)P(H|D) ) ความน่าจะเป็นเหล่านี้ได้มาจากการรวมกันของ KD หลายตัวแปร 2D สองแบบตามที่อธิบายไว้ในคำตอบนี้ : P(A)=∬x,y:f^(x,y)&lt;f^(ra,sa)f^(x,y)dxdyP(A)=∬x,y:f^(x,y)&lt;f^(ra,sa)f^(x,y)dxdyP(A) = \iint_{x, y : \hat{f}(x, y) < \hat{f}(r_a, s_a)} \hat{f}(x,y)\,dx\,dy P(B)=∬x,y:g^(x,y)&lt;g^(rb,sb)g^(x,y)dxdyP(B)=∬x,y:g^(x,y)&lt;g^(rb,sb)g^(x,y)dxdyP(B) = \iint_{x, y : \hat{g}(x, y) < \hat{g}(r_b, s_b)} \hat{g}(x,y)\,dx\,dy โดยที่และคือ KDEs และการรวมเข้าด้วยกันนั้นทำสำหรับทุกจุดใต้ thresholdsและs_b) ทั้งสอง KDEs ใช้เคอร์เนล Gaussian ภาพตัวแทนของ KDE คล้ายกับคนที่ฉันกำลังทำงานกับสามารถมองเห็นได้ที่นี่: การบูรณาการประมาณค่าความหนาแน่นของเคอร์เนลในแบบ 2Df^(x,y)f^(x,y)\hat{f}(x, y)g^(x,y)g^(x,y)\hat{g}(x, y)f^(ra,sa)f^(ra,sa)\hat{f}(r_a, …

3
เหตุผลที่เข้าใจได้ง่ายว่าเหตุใดข้อมูลฟิชเชอร์ของ Binomial จึงแปรผกผันกับ
มันสับสน / พัดใจของฉันที่มีความแปรปรวนทวินามสัดส่วนกับP) เท่าข้อมูลฟิชเชอร์เป็นสัดส่วนกับ(1-P)} อะไรคือสาเหตุของสิ่งนี้? ทำไมข้อมูลฟิชเชอร์ที่ลดลง ? นั่นคือเหตุผลว่าทำไมการอนุมานที่ยากที่สุดที่ ?1p(1−p)p(1−p)p(1-p) p=0.5p=0.51p(1−p)1p(1−p)\frac{1}{p(1-p)}p=0.5p=0.5p=0.5p=0.5p=0.5p=0.5 บริบท: ฉันกำลังทำงานกับเครื่องคิดเลขขนาดตัวอย่างและสูตรสำหรับขนาดตัวอย่างที่ต้องการเป็นปัจจัยที่เพิ่มขึ้นของซึ่งเป็นผลมาจากการประมาณค่าความแปรปรวนในการหาค่าp ( 1 - p )NNNp(1−p)p(1−p)p(1-p)

10
คำทั่วไปที่มีความหมายทางสถิติโดยเฉพาะ
ฉันไม่ใช่นักสถิติ แต่งานวิจัยของฉันเกี่ยวข้องกับสถิติ (การวิเคราะห์ข้อมูลการอ่านวรรณกรรม ฯลฯ ) ฉันได้รับการเตือนอีกครั้งจากความคิดเห็นเกี่ยวกับหนึ่งในคำถามของฉันที่โพสต์ที่นี่ว่ามีคำทั่วไปที่มีความหมายเฉพาะหรือความหมายเฉพาะสำหรับผู้ที่ฝึกฝนอย่างดีในด้านสถิติ การมีรายการคำศัพท์ดังกล่าวและอาจเป็นวลีพร้อมความคิดเห็น

2
MLE หมายถึงเรารู้ PDF ของข้อมูลของเราเสมอหรือไม่และ EM หมายถึงเราไม่?
ฉันมีคำถามเชิงแนวคิดง่ายๆที่ฉันต้องการชี้แจงเกี่ยวกับ MLE (การประเมินความน่าจะเป็นสูงสุด) และสิ่งที่เชื่อมโยงกับ EM (การคาดหวังสูงสุด) ตามที่ฉันเข้าใจแล้วถ้ามีคนบอกว่า "เราใช้ MLE" หมายความว่าพวกเขามีรูปแบบที่ชัดเจนของ PDF ในข้อมูลของพวกเขาหรือไม่ สำหรับฉันดูเหมือนว่าคำตอบสำหรับเรื่องนี้คือใช่ อีกวิธีหนึ่งถ้ามีคนบอกว่า "MLE" เมื่อใดก็ตามก็มีความเป็นธรรมที่จะถามพวกเขาว่าพวกเขากำลังสมมติว่าเป็น PDF สิ่งนี้จะถูกต้องหรือไม่ สุดท้ายบน EM ความเข้าใจของฉันก็คือใน EM เราไม่รู้จริงหรือจำเป็นต้องรู้ PDF พื้นฐานของข้อมูลของเรา นี่คือความเข้าใจของฉัน ขอบคุณ.

2
สัญชาตญาณเบื้องหลังฟังก์ชันความหนาแน่นของการแจกแจงแบบ t
ฉันกำลังศึกษาเกี่ยวกับการแจกแจงค่า t ของนักเรียนและฉันเริ่มสงสัยว่าจะได้รับฟังก์ชันความหนาแน่นของการแจกแจงแบบ t (จากวิกิพีเดีย, http://en.wikipedia.org/wiki/Student%27s_t-distribution ) ได้อย่างไร: f(t)=Γ(v+12)vπ−−√Γ(v2)(1+t2v)−v+12f(t)=Γ(v+12)vπΓ(v2)(1+t2v)−v+12f(t) = \frac{\Gamma(\frac{v+1}{2})}{\sqrt{v\pi}\:\Gamma(\frac{v}{2})}\left(1+\frac{t^2}{v} \right)^{-\frac{v+1}{2}} โดยที่คือองศาอิสระและคือฟังก์ชันแกมม่า สัญชาตญาณของฟังก์ชั่นนี้คืออะไร? ฉันหมายถึงถ้าฉันดูฟังก์ชันความน่าจะเป็นแบบกระจายมวลแบบทวินามมันก็สมเหตุสมผลสำหรับฉัน แต่ฟังก์ชั่นความหนาแน่นของการแจกแจงแบบ t ทำให้ฉันไม่เข้าใจเลย ... มันไม่ง่ายเลยตั้งแต่แรกพบ หรือสัญชาตญาณเพียงว่ามันมีรูปทรงระฆังและมันตอบสนองความต้องการของเรา?vvvΓΓ\Gamma ขอบคุณสำหรับความช่วยเหลือใด ๆ :)

2
ฉันจะรวมค่า p bootstrapped กับชุดข้อมูลที่มีการคูณทวีคูณได้อย่างไร
ฉันกังวลกับปัญหาที่ฉันต้องการบู๊ต p-value สำหรับการประมาณของจากข้อมูล imputed (MI) ที่คูณกัน แต่มันก็ไม่ชัดเจนสำหรับฉันที่จะรวมค่า p-ข้ามชุด MIθθ\theta สำหรับชุดข้อมูล MI วิธีการมาตรฐานในการเข้าถึงความแปรปรวนโดยประมาณทั้งหมดใช้กฎของรูบิน ดูที่นี่สำหรับการตรวจสอบการรวมชุดข้อมูล MI รากที่สองของความแปรปรวนทั้งหมดทำหน้าที่เป็นประมาณการข้อผิดพลาดมาตรฐานของ\อย่างไรก็ตามสำหรับบางตัวประมาณค่าความแปรปรวนทั้งหมดยังไม่ทราบว่าเป็นรูปแบบปิดหรือการกระจายตัวตัวอย่างไม่ปกติ สถิติอาจไม่ได้รับการแจกแจงแบบทีไม่ใช่แบบไม่แสดงอาการθ / s E ( θ )θθ\thetaθ / s e ( θ )θ/se(θ){\theta}/{se(\theta)} ดังนั้นในกรณีข้อมูลที่สมบูรณ์ตัวเลือกหนึ่งทางเลือกคือการบูตสถิติเพื่อค้นหาความแปรปรวนค่า p และช่วงความมั่นใจแม้ว่าการกระจาย samling ไม่ปกติและไม่ทราบรูปแบบปิด ในกรณี MI มีสองตัวเลือก: รวมกลุ่มความแปรปรวนที่เริ่มต้นผ่านชุดข้อมูล MI พูลค่า p-value หรือขอบเขตความมั่นใจในชุดข้อมูล MI ตัวเลือกแรกจะใช้กฎของรูบินอีกครั้ง อย่างไรก็ตามฉันเชื่อว่านี่เป็นปัญหาหากมีการแจกแจงตัวอย่างที่ไม่ปกติ ในสถานการณ์นี้ (หรือโดยทั่วไปในทุกสถานการณ์) ค่า p bootstrapped สามารถนำมาใช้โดยตรง …

5
ความถี่ระยะ / ความถี่เอกสารผกผัน (TF / IDF): น้ำหนัก
ฉันมีชุดข้อมูลที่แสดงถึง 1,000 เอกสารและคำทั้งหมดที่ปรากฏในนั้น ดังนั้นแถวแสดงถึงเอกสารและคอลัมน์เป็นตัวแทนของคำ ดังนั้นสำหรับตัวอย่างเช่นค่าในเซลล์ย่อมาจากคำว่าครั้งญเกิดขึ้นในเอกสารฉัน ตอนนี้ฉันต้องค้นหา 'น้ำหนัก' ของคำโดยใช้วิธี tf / idf แต่จริง ๆ แล้วฉันไม่รู้วิธีการทำสิ่งนี้ มีคนช่วยฉันออกได้ไหม(i,j)(i,j)(i,j)jjjiii

2
เหตุใดบางคนทดสอบสมมติฐานตัวแบบถดถอยเหมือนกับข้อมูลดิบของพวกเขาและคนอื่น ๆ ทดสอบพวกเขาในส่วนที่เหลือ
ฉันเป็นนักศึกษาปริญญาเอกสาขาจิตวิทยาเชิงทดลองและฉันพยายามอย่างหนักเพื่อพัฒนาทักษะและความรู้เกี่ยวกับวิธีการวิเคราะห์ข้อมูลของฉัน จนกระทั่งปีที่ 5 ของฉันในด้านจิตวิทยาฉันคิดว่ารูปแบบการถดถอย (เช่น ANOVA) ถือว่าเป็นสิ่งต่อไปนี้: ความปกติของข้อมูล ความแปรปรวนเป็นเนื้อเดียวกันสำหรับข้อมูลและอื่น ๆ หลักสูตรระดับปริญญาตรีของฉันทำให้ฉันเชื่อว่าข้อสันนิษฐานนั้นเกี่ยวกับข้อมูล อย่างไรก็ตามในปีที่ 5 ผู้สอนของฉันบางคนขีดเส้นใต้ข้อเท็จจริงที่ว่าข้อสันนิษฐานนั้นเกี่ยวกับข้อผิดพลาด (ประมาณโดยค่าตกค้าง) และไม่ใช่ข้อมูลดิบ เมื่อเร็ว ๆ นี้ฉันกำลังพูดถึงคำถามสมมติฐานกับเพื่อนร่วมงานของฉันบางคนที่ยอมรับว่าพวกเขาค้นพบความสำคัญของการตรวจสอบสมมติฐานเกี่ยวกับส่วนที่เหลือเฉพาะในปีสุดท้ายของมหาวิทยาลัย ถ้าฉันเข้าใจดีโมเดลที่เหมือนการถดถอยจะทำให้ข้อสันนิษฐานผิดพลาด ดังนั้นจึงเหมาะสมที่จะตรวจสอบสมมติฐานเกี่ยวกับส่วนที่เหลือ ถ้าใช่ทำไมบางคนตรวจสอบสมมติฐานเกี่ยวกับข้อมูลดิบ? เป็นเพราะขั้นตอนการตรวจสอบดังกล่าวประมาณว่าเราจะได้อะไรจากการตรวจสอบสิ่งที่เหลืออยู่? ฉันจะขัดจังหวะด้วยความสงสัยเกี่ยวกับปัญหานี้กับบางคนที่มีความรู้ที่แม่นยำกว่าเพื่อนร่วมงานของฉันและฉันฉันขอขอบคุณล่วงหน้าสำหรับคำตอบของคุณ

5
ข้อมูลพลิกเหรียญของ John Kerrich
ใครสามารถแนะนำสถานที่ที่จะได้รับผลของการโยน 10,000 เหรียญ (เช่นทั้งหมด 10,000 หัวและก้อย) ดำเนินการโดย John Kerrich ในช่วงสงครามโลกครั้งที่สอง?

1
ความแตกต่างระหว่างการคาดการณ์“ ในตัวอย่าง” และ“ หลอกออกจากตัวอย่าง”
มีความแตกต่างอย่างชัดเจนระหว่างการคาดการณ์ในตัวอย่างและการคาดการณ์ออกจากตัวอย่างหลอก ทั้งสองมีความหมายในบริบทของการประเมินและเปรียบเทียบแบบจำลองการพยากรณ์

4
Goodness-of-fit สำหรับกลุ่มตัวอย่างที่มีขนาดใหญ่มาก
ฉันรวบรวมตัวอย่างที่มีขนาดใหญ่มาก (&gt; 1,000,000) ของข้อมูลที่จัดหมวดหมู่ในแต่ละวันและต้องการดูข้อมูลที่ดูแตกต่างกันอย่างมากระหว่างวันเพื่อตรวจหาข้อผิดพลาดในการรวบรวมข้อมูล ฉันคิดว่าการใช้การทดสอบแบบพอดี (โดยเฉพาะการทดสอบแบบ G) จะเป็นแบบทดสอบที่ดี การกระจายที่คาดหวังจะได้รับจากการกระจายของวันก่อนหน้า แต่เนื่องจากขนาดตัวอย่างของฉันมีขนาดใหญ่มากการทดสอบจึงมีพลังสูงมากและให้ผลบวกผิด ๆ มากมาย กล่าวคือแม้แต่ความผันผวนรายวันที่น้อยมากก็จะให้ค่า p ใกล้ศูนย์ ฉันสิ้นสุดการคูณสถิติการทดสอบของฉันด้วยค่าคงที่ (0.001) ซึ่งมีการตีความที่ดีของการสุ่มตัวอย่างข้อมูลในอัตรานั้น บทความนี้ดูเหมือนจะเห็นด้วยกับวิธีนี้ พวกเขาพูดว่า: จัตุรัสจิ่วเป็นที่น่าเชื่อถือที่สุดโดยมีกลุ่มตัวอย่างประมาณ 100 ถึง 2,500 คน ฉันกำลังมองหาความคิดเห็นที่เชื่อถือได้เพิ่มเติมเกี่ยวกับเรื่องนี้ หรืออาจเป็นทางเลือกในการแก้ปัญหาผลบวกปลอมเมื่อรันการทดสอบทางสถิติกับชุดข้อมูลขนาดใหญ่

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.