สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
อัลกอริทึม Apriori ในภาษาอังกฤษธรรมดา?
ฉันอ่านบทความเกี่ยวกับ Apriori ฉันมีปัญหาในการทำความเข้าใจกับลูกพรุนและเข้าร่วมขั้นตอน ทุกคนสามารถอธิบายได้ว่าอัลกอริทึม Apriori ทำงานอย่างไรในเงื่อนไขง่าย ๆ (เช่นสามเณรอย่างฉันสามารถเข้าใจได้ง่าย) มันจะดีถ้ามีคนอธิบายกระบวนการทีละขั้นตอนที่เกี่ยวข้อง

4
เราสามารถละทิ้งข้อมูลจากการวิจัยเพราะมันไม่สำคัญหรือไม่?
ผมเคยเจอประโยคนี้ในขณะที่อ่านบทความเกี่ยวกับ sciencemag.org ในท้ายที่สุดการตอบสนองจากนักวิจัยเพียง 7600 คนใน 12 ประเทศถูกรวมเข้าด้วยกันเพราะข้อมูลที่เหลือไม่ถือว่ามีนัยสำคัญทางสถิติ นี่เป็นวิธีที่เหมาะสมในการทำวิจัยหรือไม่? ที่จะออกผลเพราะพวกเขาไม่ถือว่ามีนัยสำคัญทางสถิติ?

2
ทดสอบความแตกต่างของ quantile-Q ระหว่างกลุ่มหรือไม่?
สำหรับตัวแปร Y บางตัวที่แบ่งออกเป็น 3 กลุ่ม (X) ฉันต้องการเปรียบเทียบกลุ่มและสำหรับสมมติฐานที่ว่าควอนไทล์ 90% นั้นเหมือนกันระหว่างทั้งสามกลุ่ม ฉันสามารถใช้การทดสอบอะไรได้บ้าง ทางเลือกหนึ่งที่ฉันคิดว่าใช้การถดถอยแบบควอไทล์มีทางเลือกอื่น ๆ ฉันคิดว่าถ้าฉันต้องการเปรียบเทียบค่ามัธยฐานฉันสามารถใช้การทดสอบ kruskal วอลลิส (แม้ว่ามันจะขึ้นอยู่กับอันดับ แต่ถ้าฉันจำได้อย่างถูกต้องมันจะให้ผลลัพธ์ที่เหมือนกันเมื่อการกระจายตัวที่เหลือเป็นสมมาตร) ขอบคุณ

4
เหตุใดจึงต้องมีการทดสอบแบบ t เนื่องจากเรามีการทดสอบ z
ใครสามารถให้คำอธิบายว่าทำไมการทดสอบแบบทดสอบ "เกิดขึ้น"? ฉันถูกสอนให้ใช้การทดสอบ t เมื่อคุณไม่ทราบค่าเบี่ยงเบนมาตรฐานของประชากร (เช่นคุณรู้ค่าเบี่ยงเบนมาตรฐานของตัวอย่างของคุณ) แต่ฉันไม่แน่ใจว่าทำไมจึงทำให้แตกต่างจากการทดสอบ z .

7
ชุดข้อมูลสำหรับตัวอย่างการสร้างภาพข้อมูลการสอนและการวิจัย
ฉันกำลังค้นหาชุดข้อมูลที่มีอยู่ที่เราสามารถใช้เพื่อทดสอบเทคนิคหลายชุดข้อมูลที่เรากำลังทำการวิจัย ฉันรู้ว่ามีทรัพยากรหลายอย่างเช่นที่รวมอยู่ใน R (ลองplot(Orange)หรือดูที่นี่ ) แต่ฉันต้องการก้าวไปข้างหน้าหนึ่งก้าว: ชุดข้อมูลใดในโลกแห่งความจริงที่ดีที่สุดในการทดสอบเครื่องมือสร้างภาพข้อมูล คุณใช้ชุดข้อมูลใดในเอกสารวิชาการหรือสไลด์การสอนเกี่ยวกับชุดข้อมูล ตัวอย่างที่ดีที่สุดจากโลกแห่งความจริงที่จะแสดงให้เห็นข้อดีของการสร้างกราฟคืออะไร?

2
อนุญาตให้ใช้ข้อมูลเพื่อกำหนดค่า Priors จากนั้นเรียกใช้แบบจำลองด้วย Priors เหล่านี้ (เช่นนักบวชที่ขับเคลื่อนด้วยข้อมูลจากชุดข้อมูลเดียวกัน)
เป็นความเข้าใจของฉันที่เราไม่ควรอนุญาตให้มีชุดข้อมูลเดียวกับที่เรากำลังวิเคราะห์เพื่อขับเคลื่อน / กำหนดว่าการกระจายก่อนหน้านี้มีลักษณะอย่างไรในการวิเคราะห์แบบเบย์ โดยเฉพาะอย่างยิ่งมันไม่เหมาะสมที่จะกำหนดการกระจายก่อนหน้านี้สำหรับการวิเคราะห์แบบเบส์ตามสถิติสรุปจากชุดข้อมูลเดียวกันที่คุณจะใช้นักบวชเพื่อช่วยให้พอดีกับแบบจำลอง มีใครรู้บ้างเกี่ยวกับทรัพยากรที่พูดถึงเรื่องนี้โดยเฉพาะว่าไม่เหมาะสมหรือไม่? ฉันต้องการการอ้างอิงบางอย่างสำหรับปัญหานี้
9 bayesian  prior 

2
การสุ่มตัวอย่างจากการแจกแจงปกติแบบพับเท่ากับการสุ่มตัวอย่างจากการแจกแจงแบบปกติที่ถูกตัดทอนที่ 0 หรือไม่
ฉันต้องการจำลองจากความหนาแน่นปกติ (พูดค่าเฉลี่ย = 1, sd = 1) แต่ต้องการค่าบวกเท่านั้น วิธีหนึ่งคือการจำลองจากปกติและรับค่าสัมบูรณ์ ฉันคิดว่านี่เป็นเรื่องปกติที่ถูกพับ ฉันเห็นใน R มีฟังก์ชั่นสำหรับการสร้างตัวแปรแบบสุ่มที่ถูกตัดทอน หากฉันจำลองจากปกติที่ถูกตัดทอน (ตัดที่ 0) นี่จะเท่ากับวิธีการพับหรือไม่?

5
ความแตกต่างระหว่างการจัดกลุ่มกราฟและวิธีการตรวจหาชุมชนคืออะไร?
โดยทั่วไปเป้าหมายของการทำคลัสเตอร์กราฟและวิธีการตรวจหาชุมชนคือการคำนวณกลุ่ม มีความแตกต่างระหว่างพวกเขาหรือไม่?

3
อัลกอริทึมที่ดีที่สุดสำหรับการจำแนกข้อมูลมอเตอร์อนุกรมเวลา
ฉันกำลังทำงานในโครงการควบคุมเครื่อง เราสามารถวัดกระแสของมอเตอร์ในระหว่างการใช้งาน ข้อมูลตัวอย่างจากมอเตอร์สองตัวที่ทำงานได้สำเร็จอยู่ด้านล่าง ร่องรอยสีแดงแสดงกระแสไฟฟ้าจากมอเตอร์หนึ่งอันและสีน้ำเงินจะติดตามกระแสไฟฟ้าจากมอเตอร์อื่น ฉันต้องการลองใช้อัลกอริทึมในการระบุปัญหาเกี่ยวกับพฤติกรรมของเครื่อง ปัญหาอาจเกิดจากมอเตอร์กระแสไฟฟ้าสูงเกินไปใกล้กับศูนย์มอเตอร์กระแสไฟฟ้ากระแสที่เพิ่มขึ้นเมื่อสิ้นสุดการทำงานอนุกรมเวลาที่สั้นกว่าปกติสิ่งใดก็ตามที่ไม่เหมือนการทำงานทั่วไปด้านล่าง ใครช่วยแนะนำอัลกอริทึมที่ดีสำหรับการบรรลุนี้ สิ่งเดียวที่ฉันคุ้นเคยคือเครือข่ายประสาท ฉันใส่ไฟล์ Excel ของข้อมูลจริงที่มอเตอร์กระแส

6
จะจัดกลุ่มตัวแปรให้เป็นมาตรฐาน / มาตรฐานใน R ได้อย่างไร?
ล็อคแล้ว คำถามและคำตอบของคำถามนี้ถูกล็อคเนื่องจากคำถามอยู่นอกหัวข้อ แต่มีความสำคัญทางประวัติศาสตร์ ขณะนี้ไม่ยอมรับคำตอบหรือการโต้ตอบใหม่ ฟังก์ชั่นที่ฉันคุ้นเคยกับขนาดสเกลจากฐาน R, rescaleจาก ARM บางทีวิธีที่ดีที่สุดคือการใช้ตัวแปรบางส่วนของการใช้งานโดยระบุตัวแปรอย่างน้อยหนึ่งตัวเพื่อใช้เป็นตัวแปรการจัดกลุ่ม

1
วิธีตีความค่า p เป็น 0 หรือ 1 ได้อย่างไร
ฉันใช้การค้นหา ANOVA เช่นการมีปฏิสัมพันธ์ระหว่างเพศและระดับที่ฉันต้องการรู้ในสิ่งที่เกรดเด็กชายและเด็กหญิงแตกต่างกัน แต่ในหลาย ๆ กรณีฉันพบ (p) ค่า p-value 0 และ 1 เป็นไปได้อย่างไร ดูเหมือนจะไม่ถูกต้อง ... as.factor(gender) 1 16 16.2 2.6377 0.104396 as.factor(grade) 7 50077 7153.9 1165.4184 < 2.2e-16 *** as.factor(gender):as.factor(grade) 7 132 18.9 3.0795 0.003056 ** Residuals 7747 47555 6.1 --- Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 …
9 r 

3
ฉันจะจำลอง microdata การสำรวจสำมะโนประชากรสำหรับพื้นที่ขนาดเล็กโดยใช้ตัวอย่าง microdata 1% ที่สถิติขนาดใหญ่และมวลรวมในระดับพื้นที่ขนาดเล็กได้อย่างไร
ฉันต้องการทำการวิเคราะห์หลายตัวแปรในระดับบุคคลในระดับเล็ก ๆ ของการรวมกลุ่มทางภูมิศาสตร์ (เขตการเก็บรวบรวมสำมะโนประชากรของออสเตรเลีย) เห็นได้ชัดว่าการสำรวจสำมะโนประชากรไม่สามารถหาได้จากการรวมตัวเพียงเล็กน้อยด้วยเหตุผลความเป็นส่วนตัวดังนั้นฉันจึงตรวจสอบทางเลือกอื่น ๆ ตัวแปรที่น่าสนใจเกือบทั้งหมดจัดอยู่ในหมวดหมู่ ฉันมีสองชุดข้อมูลที่การกำจัดของฉัน: ตัวอย่างการสำรวจสำมะโนประชากร 1% นั้นมีอยู่ในระดับที่สูงกว่าของการรวมตัวเชิงพื้นที่ (พื้นที่ที่มีประชากรประมาณ 190,000 คนและการแยกเชิงพื้นที่ขนาดใหญ่ของประชากร ตารางความถี่สำหรับตัวแปรที่ฉันสนใจในระดับพื้นที่เล็ก ๆ (500 พื้นที่เล็ก ๆ หมายถึงป๊อป = 385, sd = 319, มัธยฐาน = 355) ฉันจะใช้ชุดข้อมูลทั้งสองนี้เพื่อจำลองการกระจายของประชากรในระดับพื้นที่ขนาดเล็กที่ใกล้เคียงกับประชากรจริงของพื้นที่ขนาดเล็กที่สุดได้อย่างไร ฉันขอขอบคุณที่อาจมีวิธีการประจำในการทำเช่นนี้; ถ้าเป็นเช่นนั้นตัวชี้ไปยังตำราหรือบทความในวารสารที่เกี่ยวข้องจะได้รับการชื่นชมอย่างมากมาย

3
เอฟเฟกต์แบบสุ่มสามารถใช้ได้กับตัวแปรเด็ดขาดเท่านั้นหรือไม่
คำถามนี้อาจฟังดูงี่เง่า แต่ ... ถูกต้องหรือไม่ว่าเอฟเฟกต์แบบสุ่มสามารถใช้กับตัวแปรเด็ดขาดเท่านั้น (เช่นรหัสบุคคล, รหัสประชากร, ... ) เช่นพูดxผมxix_i เป็นตัวแปรเด็ดขาด: Yผมyiy_i ~ βxผมβxi\beta_{x_i} βxผมβxi\beta_{x_i} ~ ยังไม่มีข้อความo r m ( μ ,δ2)Norm(μ,δ2)Norm(\mu, \delta^2) แต่จากหลักการแล้วเอฟเฟกต์แบบสุ่มไม่สามารถใช้กับตัวแปรต่อเนื่อง (เช่นความสูงมวล ... ) ได้Zผมziz_i: Yผมyiy_i ~ α + β⋅Zผมα+β⋅zi\alpha + \beta \cdot z_{i} เพราะมีค่าสัมประสิทธิ์เดียวเท่านั้น ββ\betaข้อใดไม่ถูก จำกัด ฟังดูมีเหตุผล แต่ฉันสงสัยว่าทำไมมันถึงไม่เคยถูกกล่าวถึงในวรรณคดีเชิงสถิติ! ขอบคุณ! แก้ไข:แต่ถ้าฉัน จำกัดziziz_i ชอบ ziziz_i ~ Norm(μ,δ2)Norm(μ,δ2)Norm(\mu, \delta^2)? มันมีผลแบบสุ่มหรือไม่? …

2
ทำความเข้าใจกับการวัดสมมติฐาน ANOVA ซ้ำ ๆ เพื่อการตีความที่ถูกต้องของเอาต์พุต SPSS
ฉันกำลังตรวจสอบว่าเงื่อนไขการให้รางวัลที่แตกต่างกันอาจมีผลต่อการปฏิบัติงานหรือไม่ ฉันมีข้อมูลจากการศึกษาขนาดเล็กที่มีสองกลุ่มโดยแต่ละกลุ่มมี n = 20 ฉันรวบรวมข้อมูลเกี่ยวกับงานที่เกี่ยวข้องกับประสิทธิภาพในเงื่อนไข "รางวัล" 3 แบบที่แตกต่างกัน งานเกี่ยวข้องกับการปฏิบัติงานในแต่ละเงื่อนไข 3 ครั้งสองครั้ง แต่สุ่มลำดับ ฉันต้องการดูว่ามีความแตกต่างในการปฏิบัติงานของแต่ละกลุ่มหรือไม่ในแต่ละเงื่อนไข "รางวัล" ที่แตกต่างกัน IV = ประเภทกลุ่ม DV = หมายถึงการวัดประสิทธิภาพการทำงานใน 3 เงื่อนไข ฉันมีผลลัพธ์จากการวัด ANOVA ซ้ำ ๆ และการเข้าถึงชุดข้อมูลดิบใน SPSS แต่ไม่แน่ใจว่าจะดำเนินการอย่างไร ฉันไม่สามารถหาคำแนะนำทีละขั้นตอนสำหรับการตีความนี้เนื่องจากข้อความของ Pallantค่อนข้าง จำกัด ปัญหาเฉพาะของฉันอยู่ในพื้นที่ต่อไปนี้: ฉันจะตรวจสอบความเป็นมาตรฐานของตัวแปรแต่ละตัวของฉันทีละตัวหรือรวมกันในแต่ละระดับของ IV หรือไม่? หากอยู่ในชุดค่าผสมฉันจะตรวจสอบได้อย่างไร ฉันจะตรวจสอบการทดสอบของ Mauchly ก่อนหรือไม่ หากมีการละเมิดหมายความว่าอย่างไร หากไม่ละเมิดหมายความว่าอย่างไร เมื่อไรที่จะดูตารางการทดสอบหลายตัวแปรหรือการทดสอบเอฟเฟกต์ในหัวข้อต่างๆ ฉันไม่แน่ใจว่าเมื่อใดที่เหมาะสมที่จะใช้ (หรือทั้งคู่?) มันจะโอเคที่จะดูการเปรียบเทียบแบบเป็นคู่เสมอหรือไม่? ดูเหมือนว่าใช้ง่ายหากมีผลหลายตัวแปรหรือในหัวข้อไม่ได้บ่งบอกความสำคัญ (เช่น …

2
การทดสอบความสำคัญของความสัมพันธ์สามรายการขึ้นไปโดยใช้การแปลงของฟิชเชอร์
หลังจากที่โพสต์ก่อนหน้านี้เท่าที่ฉันสามารถเข้าใจได้ถ้าฉันมีสามค่าสัมประสิทธิ์สหสัมพันธ์ฉันจะต้องทดสอบพวกเขาเป็นคู่เพื่อดูว่ามีความแตกต่างอย่างมีนัยสำคัญในหมู่พวกเขา ซึ่งหมายความว่าฉันจะต้องใช้การแปลง Fishers เพื่อหาคะแนน z ของ r แล้วตามด้วยค่า p ของ z (ซึ่งเครื่องคิดเลขที่แนะนำในโพสต์ก่อนหน้าทำขอบคุณ) แล้วตรวจสอบว่าค่า p สูงหรือต่ำกว่า ค่าอัลฟาของฉัน (0.05) สำหรับแต่ละคู่ เช่นถ้าอายุ 21 ถึง 30 ปีคือกลุ่มอายุ 1, 31 ถึง 40 ปีคือกลุ่มอายุ 2 และ 41 ถึง 50 ปีคือกลุ่มอายุ 2, การเปรียบเทียบความสัมพันธ์ระหว่างพฤติกรรมการช็อปปิ้งและการลดน้ำหนักของฉันจะเป็นอย่างไร: กลุ่ม 1 กับกลุ่ม 2 กลุ่ม 1 กับกลุ่ม 3 กลุ่ม 2 กับกลุ่ม 3 แทนที่จะทำการคำนวณสามแบบแยกกันมีวิธีการคำนวณเหล่านี้ทั้งหมดในขั้นตอนเดียวหรือไม่?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.