สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

4
อะไรคือความแตกต่างระหว่าง autoencoders และ t-SNE
เท่าที่ฉันรู้ทั้งตัวเข้ารหัสอัตโนมัติและ t-SNE นั้นใช้สำหรับการลดขนาดแบบไม่เชิงเส้น อะไรคือความแตกต่างระหว่างพวกเขาและทำไมฉันถึงควรใช้อันหนึ่งกับอีกอัน?

2
การกระจายอย่างเป็นหมวดหมู่หมายถึงอะไร
นี่คือการกระจายประเภทที่แยกต่างหาก (เช่น: ทวินาม, เบอร์นูลลี, Multinomial) หรือการกระจายใด ๆ สามารถแสดงด้วยวิธีนี้ ใครบางคนสามารถอธิบายรายละเอียดด้วยตัวอย่างง่ายๆ

2
วิธีใช้ auto.arima เพื่อใส่ค่าที่หายไป
ฉันมีสวนสัตว์ซีรีส์ที่มีค่าหายไปมากมาย ฉันอ่านที่auto.arimaสามารถระบุค่าที่หายไปเหล่านี้ได้หรือไม่ ทุกคนสามารถสอนฉันถึงวิธีการทำได้หรือไม่? ขอบคุณมาก! นี่คือสิ่งที่ฉันได้ลอง แต่ไม่ประสบความสำเร็จ: fit <- auto.arima(tsx) plot(forecast(fit))
12 arima 

1
ปัญหาของการใช้ R-squared ในรุ่นอนุกรมเวลาคืออะไร
ฉันได้อ่านแล้วว่าการใช้ R-squared สำหรับอนุกรมเวลานั้นไม่เหมาะสมเพราะในบริบทของอนุกรมเวลา (ฉันรู้ว่ามีบริบทอื่น ๆ ) R-squared นั้นไม่เหมือนกันอีกต่อไป ทำไมนี้ ฉันพยายามค้นหามัน แต่ฉันไม่พบอะไรเลย โดยทั่วไปแล้วฉันไม่ได้ให้ความสำคัญกับ R-squared (หรือ Adjusted R-Squared) เมื่อฉันประเมินแบบจำลองของฉัน แต่เพื่อนร่วมงานจำนวนมากของฉัน (เช่นวิชาเอกธุรกิจ) นั้นหลงรัก R-Squared และฉันต้องการที่จะ อธิบายกับพวกเขาว่าทำไม R-Squared จึงไม่เหมาะสมในบริบทของอนุกรมเวลา

5
วิธีการคำนวณความแม่นยำและการเรียกคืนในเมทริกซ์ความสับสน 3 x 3
Predicted class Cat Dog Rabbit Actual class Cat 5 3 0 Dog 2 3 1 Rabbit 0 2 11 ฉันจะคำนวณความแม่นยำและเรียกคืนได้อย่างไรจึงง่ายต่อการคำนวณคะแนน F1 เมทริกซ์ความสับสนปกติเป็นมิติ 2 x 2 อย่างไรก็ตามเมื่อมันกลายเป็น 3 x 3 ฉันไม่รู้วิธีคำนวณความแม่นยำและการเรียกคืน

3
เป็นไปได้หรือไม่ที่จะใช้ KL divergence ระหว่างการกระจายแบบไม่ต่อเนื่องและต่อเนื่อง?
ฉันไม่ใช่นักคณิตศาสตร์ ฉันค้นหาอินเทอร์เน็ตเกี่ยวกับ KL Divergence สิ่งที่ฉันเรียนรู้คือ KL divergence วัดข้อมูลที่หายไปเมื่อเราประมาณการกระจายตัวแบบที่เกี่ยวกับการกระจายสัญญาณ ฉันได้เห็นสิ่งเหล่านี้ระหว่างการแจกแจงแบบต่อเนื่องหรือแบบแยก เราสามารถทำระหว่างต่อเนื่องและไม่ต่อเนื่องหรือในทางกลับกันได้หรือไม่?

3
ความแตกต่างระหว่างตัวแบบสมการพร้อมกันและตัวแบบสมการโครงสร้าง
ใครช่วยได้โปรดช่วยให้ฉันเข้าใจว่าอะไรคือความแตกต่างระหว่างแบบจำลองสมการพร้อมกันและแบบจำลองสมการโครงสร้าง (SEM) มันจะดีถ้ามีใครบางคนสามารถมอบวรรณกรรมให้ฉันได้ นอกจากนี้ยังมีวรรณกรรมที่ใช้ SEM ในบริบทของ Timeseries บ้างไหม? วรรณกรรมที่ฉันได้รับส่วนใหญ่จะอธิบาย SEM ในบริบทข้อมูลแบบตัดขวาง ขอบคุณ!

2
จำนวนการสังเกตขั้นต่ำสำหรับการถดถอยเชิงเส้นหลายครั้ง
ฉันกำลังถดถอยเชิงเส้นหลายเส้น ฉันมีการสังเกตการณ์ 21 ครั้งและตัวแปร 5 ตัว เป้าหมายของฉันคือการค้นหาความสัมพันธ์ระหว่างตัวแปร มีข้อมูลของฉันเพียงพอหรือไม่ที่จะทำการถดถอยหลายครั้ง? ผลการทดสอบทีเผยว่าตัวแปร 3 ตัวของฉันไม่มีนัยสำคัญ ฉันจำเป็นต้องทำการถดถอยอีกครั้งด้วยตัวแปรที่สำคัญ (หรือการถดถอยครั้งแรกของฉันเพียงพอที่จะได้ข้อสรุป) เมทริกซ์ความสัมพันธ์ของฉันมีดังนี้ var 1 var 2 var 3 var 4 var 5 Y var 1 1.0 0.0 0.0 -0.1 -0.3 -0.2 var 2 0.0 1.0 0.4 0.3 -0.4 -0.4 var 3 0.0 0.4 1.0 0.7 -0.7 -0.6 var …

3
วิธีการคำนวณความแตกต่างของสองลาด?
มีวิธีการที่จะเข้าใจหรือไม่ว่าสองบรรทัดขนานกัน (มากหรือน้อย)? ฉันมีสองบรรทัดที่สร้างขึ้นจากการถดถอยเชิงเส้นและฉันต้องการที่จะเข้าใจว่าพวกมันขนานกันหรือไม่ กล่าวอีกนัยหนึ่งฉันต้องการได้ความแตกต่างของความลาดชันของสองบรรทัดนี้ มีฟังก์ชั่น R เพื่อคำนวณสิ่งนี้หรือไม่? แก้ไข: ... และฉันจะได้ความชัน (เป็นองศา) ของเส้นการถดถอยเชิงเส้นได้อย่างไร

1
การทดสอบผลกระทบที่เกิดขึ้นพร้อมกันและล้าหลังในโมเดลผสมตามยาวที่มีตัวแปรแปรผันตามเวลา
เมื่อไม่นานมานี้มีคนบอกฉันว่ามันเป็นไปไม่ได้ที่จะรวม covariates ที่แปรผันตามเวลาในรูปแบบผสมตามยาวโดยไม่ได้แนะนำการล่าช้าของ covariates เหล่านี้ คุณสามารถยืนยัน / ปฏิเสธสิ่งนี้ได้หรือไม่? คุณมีการอ้างอิงเกี่ยวกับสถานการณ์นี้หรือไม่? ฉันเสนอสถานการณ์ง่าย ๆ เพื่อชี้แจง สมมติว่าฉันมีมาตรการซ้ำ ๆ (พูดมากกว่า 30 ครั้ง) ของตัวแปรเชิงปริมาณ (y, x1, x2, x3) ใน 40 วิชา ตัวแปรแต่ละตัวจะถูกวัด 30 ครั้งในแต่ละหัวข้อโดยแบบสอบถาม ที่นี่ข้อมูลสุดท้ายจะเป็น 4 800 การสังเกต (4 ตัวแปร X 30 ครั้ง X 40 วิชา) ซ้อนกันใน 40 วิชา ฉันต้องการทดสอบแยกต่างหาก (ไม่ใช่สำหรับการเปรียบเทียบรุ่น) สำหรับ: เอฟเฟกต์แบบซิงโครนัส (พร้อมกัน): อิทธิพลของ x1, …

2
อายุเฉลี่ยของอคติสำหรับการรับรองชื่อปรมาจารย์ตามกลุ่มอายุหรือไม่
มันได้รับการรู้จักกันสำหรับค่อนข้างบางเวลานั้นอายุที่อายุน้อยที่สุดที่ผู้เล่นหมากรุกจะมีคุณสมบัติสำหรับชื่อแกรนด์มาสเตอร์ได้ลดลงอย่างมีนัยสำคัญตั้งแต่ปี 1950 และในปัจจุบันมีอยู่เกือบ 30 ผู้เล่นที่กลายเป็นแกรนด์มาสเตอร์ก่อนวันเกิดปีที่ อย่างไรก็ตามมีคำถามเกี่ยวกับ Chess Stack Exchange ที่ถามว่าอายุเฉลี่ยของการเป็นปรมาจารย์คืออะไร? . มีคนโพสต์คำตอบที่เขา (ฉันคิดว่ามันเป็นเขา) ดูที่หกส่วนย่อยของ grandmasters และพบผลลัพธ์ต่อไปนี้: สำหรับผู้เล่นที่เกิดหลังปี 1945 ค่าเฉลี่ยจะสูงกว่า 26 ปีเล็กน้อย สำหรับผู้เล่นที่เกิดหลังปี 1970 ค่าเฉลี่ยจะสูงกว่า 23 ปีเล็กน้อย สำหรับผู้เล่นที่เกิดหลังปี 1975 ค่าเฉลี่ยจะสูงกว่าอายุ 22 ปีเล็กน้อย สำหรับผู้เล่นที่เกิดหลังปี 1980 ค่าเฉลี่ยอยู่ที่ 21 ปี สำหรับผู้เล่นที่เกิดหลังปี 1985 ค่าเฉลี่ยจะขี้อายเพียง 20 ปี สำหรับผู้เล่นที่เกิดหลังปี 2533 อายุเฉลี่ย 18.5 ปี (ยังไม่ชัดเจนสำหรับฉันเลยว่ากลุ่มแรกมีgrandmasters ทั้งหมดที่เกิดหลังปี 1945 (ซึ่งทำให้มันเป็น …

5
ฟังก์ชั่นการสูญเสียใดที่ฉันควรใช้สำหรับการตรวจจับแบบไบนารีในการตรวจจับใบหน้า / ไม่ใบหน้าใน CNN
ฉันต้องการใช้การเรียนรู้ลึกในการฝึกอบรมการตรวจจับใบหน้าไบนารี / ไม่ใช่ใบหน้าสิ่งที่สูญเสียฉันควรใช้ผมคิดว่ามันเป็นSigmoidCrossEntropyLossหรือบานพับการสูญเสีย ใช่แล้ว แต่ฉันสงสัยด้วยว่าฉันควรใช้ softmax แต่มีเพียงสองคลาสเท่านั้น?

3
วิธีการพูดคุยเกี่ยวกับ scatterplot กับหลายบรรทัดที่เกิดขึ้นใหม่?
เราวัดตัวแปรได้สองตัวและ scatterplot ดูเหมือนว่าจะแนะนำโมเดล "เชิงเส้น" หลายอัน มีวิธีการกลั่นโมเดลเหล่านี้หรือไม่? การระบุตัวแปรอิสระอื่น ๆ กลายเป็นเรื่องยาก ตัวแปรทั้งสองมีความเบ้ซ้ายอย่างหนัก (ต่อจำนวนน้อย) นี่เป็นการกระจายที่คาดหวังในโดเมนของเรา ความเข้มของจุดหมายถึงจำนวนเงินของจุดข้อมูล (บนขนาด) นี้y&gt; &lt; x , y &gt;เข้าสู่ระบบ10log10\log_{10}&lt; x , y&gt;&lt;x,y&gt; อีกวิธีหนึ่งมีวิธีการจัดกลุ่มคะแนนหรือไม่ ในสาขาของเรามันจะอ้างว่าตัวแปรทั้งสองเหล่านี้มีความสัมพันธ์เชิงเส้น เราพยายามที่จะเข้าใจ / อธิบายว่าทำไมข้อมูลของเราถึงไม่เป็นเช่นนั้น (หมายเหตุเรามี 17M data points) ปรับปรุง:ขอบคุณสำหรับคำตอบทั้งหมดต่อไปนี้เป็นคำชี้แจงที่ขอ: ตัวแปรทั้งสองเป็นจำนวนเต็มเท่านั้นซึ่งจะอธิบายรูปแบบบางอย่างใน scatterplot ของบันทึก โชคดีที่ตามนิยามแล้วค่าต่ำสุดของตัวแปรทั้งสองคือ 1 คะแนน 7M อยู่ที่ ("อธิบาย" โดยความเบ้ซ้ายของข้อมูล)&lt; 3 , 1 &gt;&lt;3,1&gt;<3,1> นี่คือแปลงที่ร้องขอ: บันทึกการกระจายล็อก: (ช่องว่างเกิดจากค่าจำนวนเต็ม) …

1
ความแตกต่างระหว่าง AIC () และ extractAIC () ใน R คืออะไร?
เอกสาร R สำหรับทั้งไม่ส่องแสงมาก สิ่งที่ฉันได้รับจากลิงค์นี้คือการใช้อย่างใดอย่างหนึ่งควรจะดี สิ่งที่ฉันไม่ได้รับคือทำไมพวกเขาไม่เท่ากัน ความจริง: ฟังก์ชั่นแบบขั้นตอนการถดถอยในการวิจัย, การใช้งานstep()extractAIC() ที่น่าสนใจการทำงานlm()รูปแบบและglm()'null' รุ่น (เฉพาะตัด) ในชุดข้อมูล 'mtcars ของ R ให้ผลลัพธ์ที่แตกต่างกันสำหรับและAICextractAIC() &gt; null.glm = glm(mtcars$mpg~1) &gt; null.lm = lm(mtcars$mpg~1) &gt; AIC(null.glm) [1] 208.7555 &gt; AIC(null.lm) [1] 208.7555 &gt; extractAIC(null.glm) [1] 1.0000 208.7555 &gt; extractAIC(null.lm) [1] 1.0000 115.9434 เป็นเรื่องแปลกเพราะทั้งสองรุ่นข้างต้นเหมือนกันและAIC()ให้ผลลัพธ์ที่เหมือนกันสำหรับทั้งคู่ ทุกคนสามารถโยนแสงในปัญหาหรือไม่

2
การติดตั้งการถดถอยเชิงเส้นหลายเส้นใน R: เศษเหลือที่เกี่ยวข้องโดยอัตโนมัติ
ฉันพยายามประเมินการถดถอยเชิงเส้นแบบหลายค่าใน R ด้วยสมการดังนี้ regr &lt;- lm(rate ~ constant + askings + questions + 0) askings askings &lt;- ts(...)และคำถามที่มีข้อมูลอนุกรมเวลารายไตรมาสสร้างด้วย ปัญหาตอนนี้คือฉันได้รับส่วนที่เหลือโดยอัตโนมัติ ฉันรู้ว่าเป็นไปได้ที่จะปรับให้พอดีกับการถดถอยโดยใช้ฟังก์ชัน gls แต่ฉันไม่รู้วิธีระบุโครงสร้างข้อผิดพลาด AR หรือ ARMA ที่ถูกต้องซึ่งฉันต้องนำไปใช้ในฟังก์ชัน gls ฉันจะลองประเมินอีกครั้งในตอนนี้ด้วย gls(rate ~ constant + askings + questions + 0, correlation=corARMA(p=?,q=?)) แต่น่าเสียดายที่ฉันไม่ใช่ผู้เชี่ยวชาญ R หรือผู้เชี่ยวชาญทางสถิติโดยทั่วไปในการระบุ p และ q ฉันจะพอใจถ้ามีคนให้คำแนะนำที่เป็นประโยชน์กับฉัน ขอบคุณล่วงหน้า! โจ

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.