สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

4
ทางเลือกที่รวดเร็วสำหรับอัลกอริทึม EM
มีทางเลือกอื่น ๆ สำหรับอัลกอริทึม EM สำหรับการเรียนรู้รูปแบบที่มีตัวแปรแฝง (โดยเฉพาะ pLSA) หรือไม่? ฉันโอเคกับการเสียสละความแม่นยำเพื่อความเร็ว

2
ผลลัพธ์ของการประมาณการ Monte Carlo ผลิตโดยการสุ่มตัวอย่างที่สำคัญ
ฉันทำงานเกี่ยวกับการสุ่มตัวอย่างที่สำคัญอย่างใกล้ชิดสำหรับปีที่ผ่านมาและมีคำถามปลายเปิดสองสามข้อที่ฉันหวังว่าจะได้รับความช่วยเหลือ ประสบการณ์เชิงปฏิบัติของฉันกับแผนการสุ่มตัวอย่างที่สำคัญคือพวกเขาสามารถสร้างค่าความแปรปรวนต่ำและค่าอคติต่ำได้เป็นครั้งคราว อย่างไรก็ตามบ่อยครั้งที่พวกเขามีแนวโน้มที่จะประเมินความผิดพลาดสูงที่มีความแปรปรวนตัวอย่างต่ำ แต่มีอคติสูงมาก ฉันสงสัยว่าทุกคนสามารถอธิบายได้อย่างชัดเจนว่าปัจจัยชนิดใดที่ส่งผลต่อความถูกต้องของการประมาณตัวอย่างที่สำคัญ? โดยเฉพาะอย่างยิ่งฉันสงสัยว่า: 1) การประมาณการตัวอย่างที่สำคัญรับประกันว่าจะรวมกันเป็นผลลัพธ์ที่ถูกต้องเมื่อการแจกแจงความเอนเอียงมีการสนับสนุนเช่นเดียวกับการกระจายแบบดั้งเดิมหรือไม่? ถ้าเป็นเช่นนั้นทำไมสิ่งนี้ถึงใช้เวลานานในการฝึกฝน? 2) มีความสัมพันธ์เชิงปริมาณระหว่างข้อผิดพลาดในการประมาณการที่เกิดจากการสุ่มตัวอย่างที่สำคัญและ "คุณภาพ" ของการแจกแจงการให้น้ำหนัก (เช่นเท่าใดมันตรงกับการกระจายศูนย์แปรปรวน) 3) บางส่วนอิงจาก 1) และ 2) - มีวิธีการวัดปริมาณ 'เท่าใด' ที่คุณต้องรู้เกี่ยวกับการแจกแจงก่อนที่คุณจะดีขึ้นโดยใช้การออกแบบการสุ่มตัวอย่างที่สำคัญกว่าวิธี Monte Carlo แบบง่าย ๆ

3
ทับทิมเป็นโต๊ะทำงานสถิติ
และนี่ก็เป็นคำถามที่เกี่ยวข้องอย่างมากกับงูหลามเป็นสถิติที่ปรับแต่งและExcel เป็นสถิติที่ปรับแต่ง ฉันรู้ว่ามีการอภิปรายอย่างมากเกี่ยวกับ Ruby กับ Python แต่นี่ไม่ใช่ประเด็นของคำถามนี้ ฉันคิดว่าทับทิมเร็วกว่าไพ ธ อนและการมีไวยากรณ์ที่เป็นธรรมชาติมาก ๆ อาจเป็นประโยชน์ต่อฉันในการเข้าใจสถิติและอาจเป็นทางเลือกที่ดีสำหรับ R (ซึ่งเป็นที่สนใจของฉันและถูกอ้างถึงในคำถามอื่น ๆ ของฉันที่นี่) ตัวอย่างเช่นหนึ่งในการบรรยายของ Google Tech ที่ฉันเคยเห็น (อ้างถึงคำถามที่เชื่อมโยงที่นี่ผู้สอนบ่นว่า R ช้าในขณะที่สร้างลูปสำหรับ) ด้วย Ruby ยังมี Rails อยู่ด้วยดังนั้นอาจมีความเป็นไปได้ที่จะนำทั้งสองอย่างมารวมกัน (Python มี Django แต่อีกครั้งฉันไม่เข้าใจ) ดังนั้นคำถามก็เหมือนกัน แต่สำหรับฉันใน Ruby: คุณสามารถแนะนำอะไรได้ถ้าฉันต้องการใช้ Ruby เป็น "สถิติ workbench" เพื่อแทนที่ R, SPSS, Python, Excelฯลฯ สิ่งที่ฉันจะได้รับและสูญเสียขึ้นอยู่กับประสบการณ์ของคุณ? โปรดทราบฉันกำลังพิจารณาคำถามนี้ตามคำถาม Python และ Excel …
13 r  python  software  ruby 

3
ความแตกต่างระหว่างการทดสอบแบบทางเดียวและแบบสองด้านใช่หรือไม่
ในขณะที่เรียนหลักสูตรสถิติของฉันฉันพยายามเข้าใจความแตกต่างระหว่างการทดสอบสมมติฐานแบบหนึ่งด้านและสองด้าน ทำไมการทดสอบแบบด้านเดียวจึงปฏิเสธค่า null ในขณะที่แบบทดสอบแบบสองด้านไม่ได้ ตัวอย่าง:

3
มีสูตรหรือกฎสำหรับการกำหนด sampSize ที่ถูกต้องสำหรับ randomForest หรือไม่?
ฉันกำลังเล่นกับป่าสุ่มและพบว่าโดยทั่วไปการเพิ่ม sampSize จะนำไปสู่ประสิทธิภาพที่ดีขึ้น มีกฎ / สูตร / ฯลฯ ที่แนะนำว่า sampSize ที่ดีที่สุดควรเป็นอะไรหรือมันเป็นการทดลองและข้อผิดพลาดหรือไม่? ฉันเดาอีกวิธีหนึ่งในการใช้ถ้อยคำ อะไรคือความเสี่ยงของฉันที่มีขนาดเล็กเกินไปของ sampSize หรือใหญ่เกินไป (overfitting?) คำถามนี้อ้างถึงการนำ R ฟอเรสต์มาใช้ในrandomForestแพคเกจแบบสุ่ม ฟังก์ชั่นrandomForestมีพารามิเตอร์sampSizeซึ่งอธิบายไว้ในเอกสารประกอบดังนี้ ขนาดตัวอย่างที่จะวาด สำหรับการจำแนกประเภทหาก sampsize เป็นเวกเตอร์ที่มีความยาวจำนวนชั้นการสุ่มตัวอย่างจะแบ่งเป็นชั้น ๆ และองค์ประกอบของ sampsize จะระบุจำนวนที่จะดึงออกมาจากชั้น
13 r  random-forest 

2
วิเคราะห์สัดส่วน
ฉันมีชุดข้อมูลที่มีหลายสัดส่วนที่รวมกันเป็น 1 ฉันสนใจที่จะเปลี่ยนสัดส่วนเหล่านี้ตามการไล่ระดับสี (ดูตัวอย่างด้านล่างสำหรับข้อมูลตัวอย่าง) gradient <- 1:99 A1 <- gradient * 0.005 A2 <- gradient * 0.004 A3 <- 1 - (A1 + A2) df <- data.frame(gradient = gradient, A1 = A1, A2 = A2, A3 = A3) require(ggplot2) require(reshape2) dfm <- melt(df, id = "gradient") ggplot(dfm, aes(x = gradient, …
13 r  multinomial 

6
Multicollinearity เมื่อการถดถอยส่วนบุคคลมีความสำคัญ แต่ VIF ต่ำ
ฉันมี 6 ตัวแปร ( ) ที่ผมใช้ในการทำนายYเมื่อทำการวิเคราะห์ข้อมูลของฉันฉันลองการถดถอยเชิงเส้นหลายครั้งก่อน จากนี้มีเพียงสองตัวแปรเท่านั้นที่มีนัยสำคัญ อย่างไรก็ตามเมื่อฉันรันการถดถอยเชิงเส้นเปรียบเทียบตัวแปรแต่ละตัวกับแต่ทั้งหมดนั้นมีนัยสำคัญ (ที่ใดก็ได้จากน้อยกว่า 0.01 ถึงน้อยกว่า 0.001) มันบอกว่านี่เป็นเพราะความหลากสีปีปีหน้าx1...x6x1...x6x_{1}...x_{6}yyyyyyppp การวิจัยครั้งแรกของฉันเกี่ยวกับเรื่องนี้แสดงให้เห็นการตรวจสอบสำหรับพหุโดยใช้VIFs ฉันดาวน์โหลดแพ็กเกจที่เหมาะสมจาก R และจบลงด้วยผลลัพธ์ VIF: 3.35, 3.59, 2.64, 2.24 และ 5.56 จากแหล่งข้อมูลต่าง ๆ ทางออนไลน์จุดที่คุณควรกังวลเกี่ยวกับความหลากหลายทางชีวภาพกับ VIF ของคุณคือที่ 4 หรือ 5 ตอนนี้ฉันกำลังนิ่งงันเกี่ยวกับความหมายของข้อมูลของฉัน ฉันหรือฉันไม่มีปัญหาเรื่องความสัมพันธ์หลายทาง? ถ้าฉันทำแล้วฉันจะทำอย่างไรต่อ (ฉันไม่สามารถรวบรวมข้อมูลเพิ่มเติมและตัวแปรเป็นส่วนหนึ่งของแบบจำลองที่ไม่เกี่ยวข้องอย่างเห็นได้ชัด) หากฉันไม่มีปัญหานี้สิ่งที่ฉันควรทำจากข้อมูลของฉันโดยเฉพาะอย่างยิ่งความจริงที่ว่าตัวแปรเหล่านี้มีความสำคัญสูง เป็นรายบุคคล แต่ไม่สำคัญเลยเมื่อรวมกัน แก้ไข:มีการถามคำถามบางอย่างเกี่ยวกับชุดข้อมูลดังนั้นฉันต้องการขยาย ... ในกรณีพิเศษนี้เรากำลังมองหาที่จะเข้าใจว่าการชี้นำทางสังคมที่เฉพาะเจาะจง (ท่าทางการจ้องมองและอื่น ๆ ) ส่งผลกระทบต่อความน่าจะเป็นของคนที่ผลิตคิวอื่น ๆ เราต้องการให้แบบจำลองของเรามีคุณสมบัติที่สำคัญทั้งหมดดังนั้นฉันจึงไม่สะดวกที่จะลบบางส่วนที่ดูเหมือนซ้ำซ้อน ไม่มีสมมติฐานใด ๆ …


4
ประโยชน์ของการใช้อัลกอริทึมทางพันธุกรรม
ทุกคนสามารถอธิบายถึงประโยชน์ของอัลกอริทึมทางพันธุกรรมให้ฉันเปรียบเทียบกับวิธีการค้นหาและการเพิ่มประสิทธิภาพแบบดั้งเดิมอื่น ๆ ได้หรือไม่

3
การแยกความแตกต่างขาดหายไปโดยการสุ่ม (MAR) จากการขาดหายไปอย่างสมบูรณ์แบบสุ่ม (MCAR)
ฉันมีสองสิ่งนี้อธิบายหลายครั้ง พวกเขาทำอาหารสมองของฉันต่อไป Missing Not at Random ทำให้รู้สึกไม่ถูกและ Missing Complete โดยสมบูรณ์ทำให้รู้สึกว่า ... มันเป็น Missing at Random ที่ไม่มาก ทำให้เกิดข้อมูลที่จะ MAR แต่ไม่ใช่ MCAR อะไร

2
สิ่งที่ยืนอยู่ในทางของเครือข่ายประสาทที่ถูกใช้ในแอพพลิเคชั่น
เครือข่ายPulsed หรือ Spikingรวมการเปลี่ยนแปลงของเมมเบรนของเซลล์ประสาทชีวภาพมากขึ้นซึ่งพัลส์จะนำข้อมูลไปยังชั้นถัดไป เซลล์ประสาทไม่จำเป็นต้อง "ยิง" ทั้งหมดในเวลาเดียวกันเช่นเดียวกับที่ทำใน backprop ทว่าดูเหมือนว่าจะมีอุปสรรคในการใช้โมเดลเหล่านี้สำหรับปัญหาการเรียนรู้ของเครื่อง มีปัญหาอะไรบ้างในแนวทางของผู้เรียนรู้ด้วยเครื่องจักรโดยใช้แบบจำลองที่มีความสมจริงทางชีวภาพมากกว่า

3
เคอร์เนลคืออะไรและอะไรที่ทำให้แตกต่างจากฟังก์ชั่นอื่น ๆ
ดูเหมือนว่าจะมีอัลกอริทึมการเรียนรู้ของเครื่องจำนวนมากที่อาศัยฟังก์ชั่นเคอร์เนล SVMs และ NNs เป็นชื่อ แต่มีสองอย่าง ดังนั้นความหมายของฟังก์ชั่นเคอร์เนลคืออะไรและข้อกำหนดสำหรับมันที่จะถูกต้องคืออะไร?

2
n-g ใดบ้างที่ทำให้เกิดการต่อต้าน
เมื่อทำการประมวลผลภาษาธรรมชาติเราสามารถใช้คลังข้อมูลและประเมินความน่าจะเป็นของคำถัดไปที่เกิดขึ้นในลำดับ n โดยปกติแล้ว n จะถูกเลือกเป็น 2 หรือ 3 (bigrams และ trigrams) มีจุดที่รู้กันหรือไม่ว่าการติดตามข้อมูลสำหรับห่วงโซ่ที่ n กลายเป็นการต่อต้านเนื่องจากระยะเวลาที่ใช้ในการจำแนกคลังข้อมูลเฉพาะครั้งเดียวในระดับนั้น หรือให้เวลาในการค้นหาความน่าจะเป็นจากพจนานุกรม (โครงสร้างข้อมูล)?

2
ตัวแปรตามสายวิวัฒนาการ: ANOVA?
ฉันเข้าใจว่าได้ค่าความแปรปรวนร่วมจากข้อมูลวิวัฒนาการทางพันธุกรรมเพื่อสร้างสำหรับตัวแปรสองตัวที่คุณกำลังทำการถดถอย แต่จะเกิดอะไรขึ้นถ้าคุณมีตัวแปรต่อเนื่องหนึ่งตัวซึ่งก่อนหน้านี้คุณได้แสดงให้เห็นว่าขึ้นอยู่กับไฟโตจีนีและตัวแปรอันดับหนึ่ง ลำดับหลังเป็นลำดับฉันไม่แน่ใจว่าจะเชื่อมโยงสิ่งนี้กับวิธีที่การพึ่งพาอาศัยสายวิวัฒนาการทำให้เกิดสถิติการทดสอบแบบเอนเอียงc o v ( X), วาย) = 0cov(X,Y)=0cov(X,Y) = 0 มันมีความหมายหรือไม่ที่จะคำนวณ Phylogenetic Independent Contrasts อิสระของ Felsenstein กับตัวแปรต่อเนื่องของคุณและใช้สำหรับ ANOVA ของคุณ? ค่า PIC คือ: คฉันเจ= ( Xผม- XJ)dฉันเจ--√Cij=(Xi−Xj)dijC_{ij} = \frac{(X_i - X_j)}{\sqrt{d_{ij}}} โดยที่คือXสำหรับสปีชีส์I , X jคือXสำหรับสปีชีส์j , และd i jคือระยะห่างระหว่างสปีชีส์iและjบนต้นไม้สายวิวัฒนาการXผมXiX_iXXXฉัน, XJi,Xji, X_jXXXJjjdฉันเจdijd_{ij}ผมiiJjj
13 anova  phylogeny 

1
คำตอบที่แท้จริงของคำถามวันเกิดคืออะไร?
"ชั้นเรียนต้องใหญ่แค่ไหนเพื่อสร้างโอกาสในการหาคนสองคนที่มีวันเกิดเดียวกันอย่างน้อย 50%" ฉันมีเพื่อน 360 คนบน Facebook และตามที่คาดไว้การกระจายวันเกิดของพวกเขาไม่เหมือนกันเลย ฉันมีหนึ่งวันกับที่มี 9 เพื่อนกับวันเกิดเดียวกัน (9 เดือนหลังจากวันหยุดใหญ่และวันวาเลนไทน์ดูเหมือนจะเป็นวันที่ยิ่งใหญ่ฮ่า ๆ .. ) ดังนั้นเนื่องจากบางวันมีโอกาสมากขึ้นสำหรับวันเกิดฉันจึงสมมติว่าจำนวน 23 คือส่วนบน มีการประเมินปัญหานี้ดีขึ้นหรือไม่?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.