สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
ค่าสัมประสิทธิ์สหสัมพันธ์สหสัมพันธ์ (ICC) ที่มีหลายตัวแปร
สมมติว่าฉันได้วัดตัวแปรบางอย่างในพี่น้องซึ่งซ้อนกันภายในครอบครัว โครงสร้างข้อมูลมีลักษณะดังนี้: คุณค่าของครอบครัวพี่น้อง ------ ------- ----- 1 1 y_11 1 2 y_12 2 1 y_21 2 2 y_22 2 3 y_23 ... ... ... ฉันต้องการทราบความสัมพันธ์ระหว่างการวัดกับพี่น้องในครอบครัวเดียวกัน วิธีปกติในการทำเช่นนั้นคือการคำนวณ ICC ตามรูปแบบการสกัดกั้นแบบสุ่ม: res <- lme(yij ~ 1, random = ~ 1 | family, data=dat) getVarCov(res)[[1]] / (getVarCov(res)[[1]] + res$s^2) สิ่งนี้จะเทียบเท่ากับ: res <- gls(yij ~ …

2
ทำความเข้าใจกับการบูตสแตรปสำหรับการตรวจสอบความถูกต้องและการเลือกรุ่น
ฉันคิดว่าฉันเข้าใจว่าพื้นฐานของการบูตสแตรปทำงานอย่างไร แต่ฉันไม่แน่ใจว่าฉันเข้าใจว่าฉันสามารถใช้การบูตสแตรปเพื่อการเลือกรูปแบบหรือเพื่อหลีกเลี่ยงการ overfitting ได้อย่างไร ตัวอย่างเช่นสำหรับการเลือกแบบจำลองคุณจะเลือกแบบจำลองที่ให้ข้อผิดพลาดต่ำสุด (อาจแปรปรวนหรือไม่) ในตัวอย่างบูตสแตรป มีข้อความใดบ้างที่กล่าวถึงวิธีใช้การบูตสแตรปปิ้งสำหรับการเลือกรุ่นหรือการตรวจสอบความถูกต้อง? แก้ไข:ดูกระทู้นี้และคำตอบโดย @ mark999 สำหรับบริบทเพิ่มเติมหลังคำถามนี้

3
จะรายงานอัตราส่วนอันตรายจากโมเดลอันตรายตามสัดส่วนของ Cox เป็นภาษาอังกฤษได้อย่างไร
ความเข้าใจของฉันคืออัตราส่วนอันตรายจากโมเดลอันตรายตามสัดส่วนของ Cox เปรียบเทียบผลกระทบต่ออัตราอันตรายของปัจจัยที่กำหนดกับกลุ่มอ้างอิง คุณจะรายงานสิ่งนั้นต่อผู้ชมที่ไม่ทราบสถิติอย่างไร ลองทำตัวอย่างวลี สมมติว่าเราลงทะเบียนผู้คนในการศึกษาระยะเวลาก่อนที่จะซื้อโซฟา เราเซ็นเซอร์อย่างถูกต้องที่ 3 ปี สำหรับตัวอย่างนี้เรามีสองปัจจัย: อายุ <30 หรือ> = 30 ไม่ว่าจะเป็นแมว เปลี่ยนอัตราส่วนความเป็นอันตรายของ "เจ้าของแมว" ให้กับกลุ่มอ้างอิง (อายุ <30, "ไม่ได้เป็นเจ้าของแมว") คือ 1.2 และมีนัยสำคัญ (พูดว่า p <0.05) ฉันถูกต้องหรือไม่ที่จะบอกว่านั่นหมายถึงสิ่งเหล่านี้ทั้งหมด: เจ้าของแมวมีกิจกรรมเพิ่มเติม (ซื้อที่นอน) ภายใน 3 ปีหรือเวลาต่อการจัดกิจกรรม (ซื้อที่นอน) นั้นเร็วขึ้นสำหรับเจ้าของแมวหรือรวมสองสิ่งนี้เข้าด้วยกัน แก้ไข : สมมติว่าเหตุการณ์เป็นการซื้อครั้งแรกของโซฟาภายในระยะเวลา (ถ้ามี) รุ่นนี้ไม่ได้ช่วยให้เราวิเคราะห์การซื้อหลายรายการภายในระยะเวลา

4
วาดหลายแปลงบนกราฟเดียวใน R?
Rการใช้รหัสต่อไปนี้ผมพยายามที่จะวาดสี่แปลงในกราฟใน ฉันไม่พอใจกับตัวเลขเพราะมีช่องว่างจำนวนมากระหว่างแปลงดังนั้นความกว้างของแปลงไม่เพียงพอที่จะวิเคราะห์แปลง ใครช่วยฉันสร้างกราฟที่ดีที่มีสี่แปลง? ฉันจะเก็บเลเบลแกน x ได้ตั้งแต่ 1 ถึง 10 แทนที่จะเป็น 5 ป้ายเริ่มต้นได้อย่างไร ข้อมูล: a1: 11.013 13.814 13.831 13.714 13.787 13.734 13.778 13.771 13.823 13.659 a2: 5.181 7.747 8.314 8.061 7.920 8.153 8.540 8.845 7.881 8.301 ฉันใช้ข้อมูล a1 สำหรับ b1, c1 และ d1; ข้อมูล a2 สำหรับ b2, c2 และ d2 เฉพาะที่นี่ …

2
เป็นวิธีที่ดีที่สุดในการเรียนรู้พื้นฐานของความน่าจะเป็นที่จำเป็นสำหรับอัลกอริทึมการเรียนรู้เครื่องคืออะไร?
ฉันเข้าเรียนหลักสูตรความน่าจะเป็นที่มหาวิทยาลัยเมื่อไม่กี่ปีที่ผ่านมา แต่ตอนนี้ฉันต้องผ่านขั้นตอนวิธีการเรียนรู้ด้วยเครื่องตอนนี้และคณิตศาสตร์บางอย่างก็ยุ่งเหยิง โดยเฉพาะตอนนี้ฉันกำลังเรียนรู้อัลกอริทึม EM (การเพิ่มความคาดหวังสูงสุด) และดูเหมือนว่ามีการตัดการเชื่อมต่อขนาดใหญ่ระหว่างสิ่งที่จำเป็นกับสิ่งที่ฉันมี ฉันไม่ได้ขอหนังสือหรือเว็บไซต์ แต่เป็นวิธีการเรียนรู้หัวข้อเหล่านี้ให้มากพอที่จะเข้าใจอัลกอริทึมที่ใช้พวกเขาได้อย่างไร จำเป็นหรือไม่ที่จะต้องอ่านหนังสือและออกกำลังกายนับร้อย ๆ ครั้ง? หรือว่าเกินขนาดในแง่นี้ แก้ไข: หากนี่เป็นตำแหน่งที่ไม่ถูกต้องสำหรับคำถามนี้โปรดลงคะแนนเพื่อโยกย้าย :)

1
ทำซ้ำตารางที่ 18.1 จาก“ องค์ประกอบของการเรียนรู้เชิงสถิติ”
ตารางที่ 18.1 ในองค์ประกอบของการเรียนรู้ทางสถิติสรุปประสิทธิภาพของตัวแยกประเภทหลายตัวในชุดข้อมูลระดับ 14 ฉันกำลังเปรียบเทียบอัลกอริธึมใหม่กับ lasso และ elastic net สำหรับปัญหาการจำแนกประเภทมัลติคลาส การใช้glmnetเวอร์ชั่น 1.5.3 (R 2.13.0) ฉันไม่สามารถทำซ้ำจุดที่ 7 ( -multalomial multinomial) ในตารางซึ่งรายงานจำนวนยีนที่ใช้เป็น 269 และข้อผิดพลาดในการทดสอบคือ 13 out 54 ข้อมูลที่ใช้เป็นแบบนี้14 มะเร็งชุดข้อมูล ไม่ว่าฉันจะพยายามทำอะไรฉันจะได้แบบจำลองที่มีประสิทธิภาพสูงสุดโดยใช้ยีนใกล้เคียงกับ 170-180 ยีนที่มีข้อผิดพลาดในการทดสอบ 16 จาก 54 ข้อL1L1L_1 โปรดทราบว่าในตอนต้นของส่วน 18.3 ในหน้า 654 มีการอธิบายการประมวลผลข้อมูลล่วงหน้าบางส่วน ฉันได้ติดต่อผู้เขียนแล้วโดยไม่ตอบสนองและฉันถามว่าใครสามารถยืนยันว่ามีปัญหาในการทำซ้ำตารางหรือให้วิธีแก้ปัญหาในการสร้างตาราง

1
การหาค่าเฉลี่ยที่แท้จริงจากการสังเกตที่มีเสียงดัง
ฉันมีชุดข้อมูลขนาดใหญ่ของฟอร์ม (mean, stdev) ฉันต้องการลดสิ่งนี้ให้เป็นค่าเฉลี่ยเดียว (ดีกว่า) และส่วนเบี่ยงเบนมาตรฐานขนาดเล็ก (หวังว่า) เห็นได้ชัดว่าฉันสามารถคำนวณอย่างไรก็ตามเรื่องนี้ไม่ได้ใช้เวลาในบัญชีความจริงที่ว่าบางส่วนของจุดข้อมูลที่ถูกต้องอย่างมีนัยสำคัญมากกว่าคนอื่น ๆ∑ dเสื้อm e a nยังไม่มีข้อความ∑datameanN\frac{\sum data_{mean}}{N} เพื่อให้ง่ายฉันต้องการ preform น้ำหนักเฉลี่ยของจุดข้อมูลเหล่านี้ แต่ไม่ทราบว่าฟังก์ชันน้ำหนักควรอยู่ในรูปของค่าเบี่ยงเบนมาตรฐาน

5
R ทางเลือกเดียวของ BUGS [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้เป็นไปตามหัวข้อสำหรับการตรวจสอบข้าม ปิดเมื่อปีที่แล้ว ฉันกำลังติดตามหลักสูตรเกี่ยวกับสถิติแบบเบย์โดยใช้ BUGS และ R ตอนนี้ฉันรู้แล้วว่า BUGS มันเยี่ยมมาก แต่ฉันไม่ชอบการใช้โปรแกรมแยกต่างหากแทนที่จะเป็นอาร์ ฉันได้อ่านแล้วว่ามีแพ็คเกจ Bayesian ใหม่จำนวนมากใน R. มีรายการหรือการอ้างอิงว่ามีแพ็คเกจใดบ้างสำหรับสถิติ Bayesian และสิ่งเหล่านี้มีอะไรบ้าง และมีแพ็คเกจ R ที่เป็นทางเลือกสำหรับความยืดหยุ่นของ BUGS หรือไม่?
13 r  bayesian  bugs 

2
Boxplot เกี่ยวกับสองปัจจัยโดยใช้ ggplot2 ใน R
ล็อคแล้ว คำถามและคำตอบของคำถามนี้ถูกล็อคเนื่องจากคำถามอยู่นอกหัวข้อ แต่มีความสำคัญทางประวัติศาสตร์ ขณะนี้ไม่ยอมรับคำตอบหรือการโต้ตอบใหม่ ฉันใหม่สำหรับ R และแพ็คเกจใด ๆ ใน R. ฉันดูเอกสาร ggplot2 แต่ไม่พบสิ่งนี้ ฉันต้องการพล็อตกล่องของตัวแปรboxthisที่เกี่ยวกับสองปัจจัยและf1 f2นั่นคือสมมติว่าทั้งสองf1และf2เป็นตัวแปรปัจจัยและแต่ละคนมีสองค่าและboxthisเป็นตัวแปรต่อเนื่อง ฉันต้องการที่จะได้รับ 4 boxplots บนกราฟแต่ละสอดคล้องกับหนึ่งรวมกันจากการรวมกันไปได้ว่าf1และf2สามารถใช้ ฉันคิดว่าการใช้ฟังก์ชันพื้นฐานใน R สามารถทำได้โดย > boxplot(boxthis ~ f1 * f2 , data = datasetname) ขอบคุณล่วงหน้าสำหรับความช่วยเหลือใด ๆ
13 r  boxplot  ggplot2 

4
ข้อผิดพลาดกำลังสองเฉลี่ยใช้เพื่อประเมินความเหนือกว่าของตัวประมาณหนึ่งตัวเทียบกับอีกตัวหนึ่งหรือไม่?
สมมติว่าเรามีสองประมาณและสำหรับพารามิเตอร์บางxในการพิจารณาว่าตัวประมาณใดที่ "ดีกว่า" เราจะดูที่ MSE (หมายถึงข้อผิดพลาดกำลังสอง) หรือไม่ กล่าวอีกนัยหนึ่งเรามองไปที่โดยที่คืออคติของตัวประมาณและคือความแปรปรวนของตัวประมาณ MSE ที่ดีกว่าใดจะเป็นตัวประมาณที่แย่กว่านั้น?α 2 x M S E = β 2 + σ 2 β σ 2α1α1\alpha_1α2α2\alpha_2xxxMSE= β2+ σ2MSE=β2+σ2MSE = \beta^2+ \sigma^2ββ\betaσ2σ2\sigma^2
13 estimation  mse 

4
ใช้ ANOVA กับเปอร์เซ็นต์หรือไม่
ฉันมีตารางที่มีสี่กลุ่ม (4 กลุ่ม BMI) เป็นตัวแปรอิสระ (ตัวคูณ) ฉันมีตัวแปรตามนั่นคือ "ร้อยละแม่สูบบุหรี่ในการตั้งครรภ์" อนุญาตให้ใช้ ANOVA สำหรับสิ่งนี้หรือฉันต้องใช้ไคสแควร์หรือการทดสอบอื่น ๆ
13 anova 

6
Endogeneity กับ heterogeneity ที่ไม่ได้สังเกตเห็น
อะไรคือความแตกต่างระหว่างendogeneityและ heterogeneity ที่ไม่ได้สังเกตเห็น? ฉันรู้ว่า endogeneity มาจากตัวอย่างของตัวแปรที่ละเว้นหรือไม่ แต่เท่าที่ฉันเข้าใจความแตกต่างที่ไม่ได้สังเกตเห็นทำให้เกิดปัญหาเดียวกัน แต่ที่วางความแตกต่างระหว่างความคิดทั้งสองนี้ที่ไหน?

1
อัลกอริทึมที่เหมาะสมที่สุดสำหรับการแก้ปัญหาโจรติดอาวุธ?
ฉันได้อ่านเกี่ยวกับอัลกอริทึมจำนวนมากสำหรับการแก้ปัญหาโจรติดอาวุธเช่น -greedy, softmax และ UCB1 แต่ฉันมีปัญหาในการเรียงลำดับวิธีที่ดีที่สุดสำหรับการลดความเสียใจεε\epsilon มีอัลกอริธึมที่เหมาะสมที่สุดที่รู้จักกันดีในการแก้ปัญหาโจรติดอาวุธหรือไม่? มีทางเลือกของอัลกอริทึมที่ดูเหมือนว่าจะทำงานได้ดีที่สุดในทางปฏิบัติหรือไม่?

2
ภาวะแทรกซ้อนของการมีตัวอย่างขนาดเล็กมากในตัวแบบสมการโครงสร้าง
ฉันกำลังใช้โมเดลสมการโครงสร้าง (SEM) ใน Amos 18 ฉันกำลังมองหาผู้เข้าร่วม 100 คนสำหรับการทดสอบของฉัน (ใช้แบบหลวม ๆ ) ซึ่งถือว่าไม่น่าจะเพียงพอที่จะจัดการ SEM ที่ประสบความสำเร็จ ฉันได้รับการบอกซ้ำ ๆ ว่า SEM (พร้อมด้วย EFA, CFA) เป็นกระบวนการทางสถิติ "ตัวอย่างขนาดใหญ่" เรื่องสั้นสั้นฉันไม่ได้ทำให้ผู้เข้าร่วม 100 คน (น่าแปลกใจ!) และมีเพียง 42 หลังจากไม่รวมจุดข้อมูลที่มีปัญหาสองจุด ฉันก็ลองแบบจำลองต่อไปและด้วยความประหลาดใจของฉันมันก็ดูเหมือนจะเข้ากันได้ดีมาก! CFI> .95, RMSEA <.09, SRMR <.08 ตัวแบบไม่ง่ายจริง ๆ แล้วฉันจะบอกว่ามันค่อนข้างซับซ้อน ฉันมีตัวแปรแฝงอยู่สองตัวตัวหนึ่งมีสองตัวแปรที่สังเกตได้และอีก 5 ตัวแปรที่สังเกตได้ ฉันมีตัวแปรที่สังเกตเพิ่มเติมอีกสี่ตัวในโมเดล มีความสัมพันธ์มากมายระหว่างตัวแปรทางอ้อมและทางตรงโดยมีตัวแปรบางตัวที่อยู่ภายนอกถึงสี่คนเป็นตัวอย่าง ฉันค่อนข้างใหม่สำหรับ SEM; อย่างไรก็ตามบุคคลสองคนที่ฉันรู้ว่าคุ้นเคยกับ SEM บอกฉันว่าตราบใดที่การบ่งบอกความเหมาะสมนั้นดีผลกระทบนั้นสามารถตีความได้ …

4
การประยุกต์ใช้ความแปรปรวนในทางปฏิบัติคืออะไร?
ฉันกำลังสอนทฤษฎีความน่าจะเป็นของตัวเองและฉันไม่แน่ใจว่าฉันเข้าใจการใช้ความแปรปรวนใด ๆ ซึ่งตรงข้ามกับการเบี่ยงเบนมาตรฐาน ในสถานการณ์ฝึกที่ฉันกำลังดูความแปรปรวนมีขนาดใหญ่กว่าช่วงดังนั้นจึงไม่มีประโยชน์อย่างสังหรณ์ใจ
13 variance 

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.