สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
สมการโครงสร้าง: วิธีการระบุเอฟเฟกต์ปฏิสัมพันธ์ในแพ็คเกจ R lavaan
ฉันใช้แพ็กเกจ R lavaanเพื่อประมาณโมเดลสมการเชิงโครงสร้าง สมมุติว่าตัวแบบประกอบด้วยตัวแปรรายการภายนอก 1 ตัวซึ่งมี 1 ตัวแปรแฝงและตัวแปรอธิบาย 2 รายการ: group = {0,1} attitude1 = latent,scale age = respondent's age โมเดลลาวาที่ต้องการคือ (ไม่ทำงาน): model <- ' attitude1 =~ att1 + att2 + att3 outcome ~ age*group + attitude1*group' เป้าหมายของฉันคือในสิ่งที่สามารถทำได้ในการถดถอยเชิงเส้นเพื่อสร้างผลกระทบหลักและปฏิสัมพันธ์ระหว่างแต่ละตัวแปรและกลุ่ม สามารถทำได้หรือไม่
13 r  interaction  sem  lavaan 

1
ตัวแปรตามมาตรฐานภายในกลุ่มในโมเดลข้อมูลพาเนล?
การกำหนดมาตรฐานของตัวแปรตามภายในกลุ่มที่ระบุเหมาะสมหรือไม่? เอกสารการทำงานต่อไปนี้ (การชะลอการตัดไม้ทำลายป่าในกฎหมาย Amazon ราคาหรือนโยบาย, PDF ) ใช้ตัวแปรตามมาตรฐานเพื่อวิเคราะห์ผลของการเปลี่ยนแปลงนโยบายทั่วไปในบราซิลในการทำลายป่า การทำให้เป็นมาตรฐานมีดังนี้: Ynewit=Yit−Yi¯¯¯¯¯sd(Yit)Yitnew=Yit−Yi¯sd(Yit) Y^{new}_{it} = \frac{Y_{it} - \overline{Y_i}}{sd(Y_{it})} ผู้เขียนโต้เถียงสิ่งนี้ทำหน้าที่ "พิจารณาการเปลี่ยนแปลงที่สัมพันธ์กันในการเพิ่มขึ้นของการทำลายป่าในเขตเทศบาล" ผู้เขียนใช้การประมาณค่า FE (หน้า 12) สำหรับข้อมูลพาเนล รวมถึงการโพสต์นโยบายหลอกตาสำหรับแต่ละปีต่อไปนี้หลังจากที่กฎหมายใหม่ ควรตีความค่าสัมประสิทธิ์อย่างไรถ้าตัวแปรตามเป็นมาตรฐานในวิธีนี้ การสร้างมาตรฐานไม่ใช่การแหกคอกเนื่องจากมันให้คุณค่าสูงกว่าในการสังเกตที่กลุ่ม / เทศบาลมีประสบการณ์การเปลี่ยนแปลงที่ลดลงเมื่อเวลาผ่านไป?

2
เมื่อใดที่จะเข้าสู่ระบบ / ขยายตัวแปรของคุณเมื่อใช้โมเดลฟอเรสต์แบบสุ่ม?
ฉันกำลังถดถอยด้วยการสุ่มป่าเพื่อทำนายราคาตามคุณลักษณะหลายอย่าง โค้ดถูกเขียนเป็น Python โดยใช้ Scikit-learn คุณจะตัดสินใจว่าคุณควรแปลงตัวแปรของคุณโดยใช้exp/ logก่อนที่จะใช้เพื่อให้พอดีกับรูปแบบการถดถอยอย่างไร จำเป็นหรือไม่เมื่อใช้วิธี Ensemble เช่น Random Forest?

4
การแก้ไขข้อมูลไข้หวัดใหญ่ที่รักษาค่าเฉลี่ยรายสัปดาห์
แก้ไข ฉันได้พบกระดาษอธิบายขั้นตอนที่ฉันต้องการ ความแตกต่างเพียงอย่างเดียวคือกระดาษ interpolates ข้อมูลค่าเฉลี่ยรายเดือนเพื่อรายวันในขณะที่รักษาค่าเฉลี่ยรายเดือน Rฉันมีปัญหาในการดำเนินการวิธีการใน คำแนะนำใด ๆ ที่ชื่นชม เป็นต้นฉบับ สำหรับแต่ละสัปดาห์ฉันมีข้อมูลนับต่อไปนี้ (หนึ่งค่าต่อสัปดาห์): จำนวนที่ปรึกษาแพทย์ จำนวนผู้ป่วยไข้หวัดใหญ่ เป้าหมายของฉันคือการได้รับข้อมูลรายวันโดยการแก้ไข (ฉันคิดว่าเส้นโค้งเชิงเส้นหรือตัดทอน) สิ่งสำคัญคือฉันต้องการประหยัดค่าเฉลี่ยรายสัปดาห์นั่นคือค่าเฉลี่ยของข้อมูลที่ถูกแก้ไขทุกวันควรเท่ากับค่าที่บันทึกไว้ของสัปดาห์นี้ นอกจากนี้การแก้ไขควรจะราบรื่น ปัญหาหนึ่งที่อาจเกิดขึ้นคือหนึ่งสัปดาห์มีเวลาน้อยกว่า 7 วัน (เช่นตอนต้นหรือปลายปี) ฉันจะขอบคุณสำหรับคำแนะนำในเรื่องนี้ ขอบคุณมาก. นี่คือชุดข้อมูลตัวอย่างสำหรับปี 1995 ( อัพเดท ): structure(list(daily.ts = structure(c(9131, 9132, 9133, 9134, 9135, 9136, 9137, 9138, 9139, 9140, 9141, 9142, 9143, 9144, 9145, 9146, 9147, 9148, 9149, …

3
วิธีการคำนวณส่วนประกอบหลักหมุน varimax ใน R?
ฉันวิ่ง PCA เมื่อวันที่ 25 ตัวแปรและเลือกด้านบน 7 prcompเครื่องคอมพิวเตอร์ใช้ prc <- prcomp(pollutions, center=T, scale=T, retx=T) ฉันได้ทำการหมุน varimax กับส่วนประกอบเหล่านั้นแล้ว varimax7 <- varimax(prc$rotation[,1:7]) และตอนนี้ฉันต้องการ varimax หมุนข้อมูลที่หมุน PCA (เนื่องจากไม่ได้เป็นส่วนหนึ่งของวัตถุ varimax - เฉพาะเมทริกซ์การโหลดและเมทริกซ์การหมุน) ฉันอ่านว่าการทำเช่นนี้คุณคูณทรานสปอนของเมทริกซ์การหมุนโดยทรานสโพสของข้อมูลดังนั้นฉันจะทำสิ่งนี้: newData <- t(varimax7$rotmat) %*% t(prc$x[,1:7]) แต่นั่นก็ไม่สมเหตุสมผลเนื่องจากขนาดของเมทริกซ์ทรานส์ข้างต้นคือคูณและตามลำดับดังนั้นฉันจะเหลือเมทริกซ์เพียงแถวแทนที่จะเป็นแถว ... ไม่มีใครรู้ สิ่งที่ฉันทำผิดที่นี่หรือสิ่งสุดท้ายของฉันควรเป็นอย่างไร ฉันต้องเปลี่ยนกลับในภายหลังไหม?7×77×77\times 77 169337×169337×169337 \times 16933777169331693316933
13 r  pca  factor-rotation 

1
กลุ่มตัวอย่างเชิงมโนทัศน์ / ทฤษฎี - ทำไมต้องสนใจ?
ฉันหวังว่าคำถามนี้จะไม่ถูกทำเครื่องหมายว่า "กว้างเกินไป" และหวังว่าการอภิปรายจะเริ่มต้นขึ้นซึ่งจะเป็นประโยชน์ต่อทุกคน ในสถิติเราใช้เวลามากมายในการเรียนรู้ทฤษฎีตัวอย่างขนาดใหญ่ เราสนใจอย่างยิ่งในการประเมินคุณสมบัติของซีมโทติคของผู้ประมาณของเรารวมถึงว่าพวกมันไม่เอนเอียง, มีประสิทธิภาพ, การกระจายของซีมโทติคและอื่น ๆ asymptotic คำจะเชื่อมโยงอย่างมากกับสมมติฐานที่ว่า\n→∞n→∞n \rightarrow \infty ในความเป็นจริง แต่เรามักจะจัดการกับการ จำกัดnคำถามของฉันคือ:nnn 1) เราหมายถึงอะไรโดยกลุ่มตัวอย่างขนาดใหญ่? เราจะแยกความแตกต่างระหว่างตัวอย่างขนาดเล็กและขนาดใหญ่ได้อย่างไร 2) เมื่อเราพูดว่าเราหมายถึงว่าควรไปที่หรือไม่?n→∞n→∞n \rightarrow \inftynnn∞∞\infty ตัวอย่างสำหรับการแจกแจงทวินามต้องการประมาณ n = 30 เพื่อรวมเข้ากับการแจกแจงแบบปกติภายใต้ CLT เราควรมีหรือในกรณีนี้โดยเราหมายถึง 30 หรือมากกว่า!X¯X¯\bar{X}n→∞n→∞n \rightarrow \infty∞∞\infty 3) สมมติว่าเรามีตัวอย่างที่ จำกัด และสมมติว่าเรารู้ทุกอย่างเกี่ยวกับพฤติกรรมเชิงเส้นกำกับของตัวประมาณของเรา แล้วอะไรล่ะ สมมติว่าตัวประมาณของเราเป็นแบบไม่เชิงเส้นกำกับจากนั้นเรามีการประมาณแบบไม่เอนเอียงสำหรับพารามิเตอร์ที่เราสนใจในตัวอย่าง จำกัด ของเราหรือหมายความว่าถ้าเรามีแล้วเราก็จะไม่เอนเอียง?n→∞n→∞n \rightarrow \infty อย่างที่คุณเห็นจากคำถามข้างต้นฉันพยายามทำความเข้าใจปรัชญาเบื้องหลัง "Asymptotics ตัวอย่างขนาดใหญ่" และเรียนรู้ว่าทำไมเราถึงสนใจ ฉันต้องได้รับสัญชาติญาณสำหรับทฤษฎีบทที่ฉันเรียนรู้

1
การทำนายเกี่ยวกับโมเดลเอฟเฟกต์ผสม: จะทำอย่างไรกับเอฟเฟกต์แบบสุ่ม?
ลองพิจารณาชุดข้อมูลสมมุตินี้: set.seed(12345) num.subjects <- 10 dose <- rep(c(1,10,50,100), num.subjects) subject <- rep(1:num.subjects, each=4) group <- rep(1:2, each=num.subjects/2*4) response <- dose*dose/10 * group + rnorm(length(dose), 50, 30) df <- data.frame(dose=dose, response=response, subject=subject, group=group) เราสามารถใช้lmeเพื่อจำลองการตอบสนองด้วยโมเดลเอฟเฟกต์แบบสุ่ม: require(nlme) model <- lme(response ~ dose + group + dose*group, random = ~1|subject, df) ฉันต้องการใช้predictกับผลลัพธ์ของโมเดลนี้เพื่อรับการตอบสนองของหัวเรื่องทั่วไปของกลุ่ม 1 ถึงปริมาณ …

1
ความผิดพลาดในการบู๊ตแบบมาตรฐานและช่วงความเชื่อมั่นเหมาะสมหรือไม่ในกรณีที่การอนุมานแบบ homoscedasticity ถูกละเมิด?
ถ้าใน OLS regressions สองข้อสันนิษฐานว่ามีการละเมิด (การแจกแจงแบบปกติของข้อผิดพลาด homoscedasticity) การ bootstrapping ข้อผิดพลาดมาตรฐานและช่วงความเชื่อมั่นเป็นทางเลือกที่เหมาะสมเพื่อให้ได้ผลลัพธ์ที่มีความหมายโดยคำนึงถึงความสำคัญของสัมประสิทธิ์ regressor การทดสอบอย่างมีนัยสำคัญที่มีข้อผิดพลาดมาตรฐานที่บูตสแตรปและช่วงความมั่นใจยังคง "ทำงาน" อยู่กับความแตกต่างระหว่าง ถ้าใช่จะมีช่วงความเชื่อมั่นที่เกี่ยวข้องอะไรบ้างที่สามารถใช้ในสถานการณ์นี้ (เปอร์เซ็นต์ไทล์, BC, BCA) ท้ายที่สุดถ้าการบูตสแตรปมีความเหมาะสมในสถานการณ์นี้วรรณกรรมที่เกี่ยวข้องที่จำเป็นต้องอ่านและอ้างถึงข้อสรุปนี้คืออะไร คำใบ้ใด ๆ ที่จะได้รับการชื่นชมอย่างมาก!

3
คลัสเตอร์ข้อมูลขนาดใหญ่ใน R และการสุ่มตัวอย่างมีความเกี่ยวข้องหรือไม่
ฉันยังใหม่กับวิทยาศาสตร์ข้อมูลและมีปัญหาในการค้นหากลุ่มในชุดข้อมูลที่มี 200,000 แถวและ 50 คอลัมน์ใน R เนื่องจากข้อมูลมีทั้งตัวเลขและตัวแปรที่กำหนดวิธีการแบบ K-mean ซึ่งใช้การวัดระยะทางแบบยุคลิดจึงไม่เป็นทางเลือกที่เหมาะสม ดังนั้นฉันจึงหันไปหา PAM แอกเนสและ hclust ซึ่งยอมรับเมทริกซ์ระยะทางเป็นอินพุต วิธีเดซี่สามารถทำงานกับข้อมูลแบบผสม แต่เมทริกซ์ระยะทางนั้นใหญ่เกินไป: 200,000 เท่า 200,000 มีขนาดใหญ่กว่า 2 ^ 31-1 มาก (ขีด จำกัด ความยาวเวกเตอร์ก่อน R 3.0.0) R 3.0.0 ใหม่ที่เผยแพร่เมื่อวานนี้รองรับเวกเตอร์ยาวที่มีความยาวมากกว่า 2 ^ 31-1 แต่เมทริกซ์สองเท่าของ 200,000 โดย 200,000 ต้องใช้ RAM ต่อเนื่องที่มีขนาดใหญ่กว่า 16Gb ซึ่งเป็นไปไม่ได้ในเครื่องของฉัน ฉันอ่านเกี่ยวกับการคำนวณแบบขนานและแพ็คเกจหน่วยความจำขนาดใหญ่และไม่แน่ใจว่าพวกเขาจะช่วยได้อย่างไร: ถ้าฉันใช้เดซี่มันจะสร้างเมทริกซ์ขนาดใหญ่ที่ไม่สามารถใส่หน่วยความจำได้ ฉันยังอ่านเกี่ยวกับการโพสต์เกี่ยวกับการสุ่มตัวอย่าง: การสุ่มตัวอย่างมีความเกี่ยวข้องในช่วงเวลาของ 'ข้อมูลขนาดใหญ่' หรือไม่ …

1
สิ่งที่อาจเกิดขึ้นในตารางฉุกเฉิน?
Merriam-Websterพจนานุกรมกำหนดผูกพันเหตุการณ์หรือสถานการณ์ 1 : likely but not certain to happen : possible 2 : not logically necessary; especially : empirical 3 a : happening by chance or unforeseen causes b : subject to chance or unseen effects : unpredictable c : intended for use in circumstances not completely foreseen 4 : …

3
สิ่งที่เหลือตามปกติหมายถึงอะไรและสิ่งนี้บอกอะไรฉันเกี่ยวกับข้อมูลของฉัน
คำถามพื้นฐานสวย: การกระจายตัวตามปกติของเศษซากจากการถดถอยเชิงเส้นหมายความว่าอย่างไร ในแง่ของสิ่งนี้สะท้อนให้เห็นถึงข้อมูลเดิมของฉันจากการถดถอยอย่างไร ฉันนิ่งงันโดยสิ้นเชิงขอบคุณมาก

4
การทำพล็อตค่าเฉลี่ยในฮิสโตแกรมนั้นเหมาะสมหรือไม่?
"โอเค" เพื่อเพิ่มเส้นแนวตั้งลงในฮิสโตแกรมเพื่อให้เห็นภาพค่าเฉลี่ยหรือไม่ ดูเหมือนว่าจะโอเคสำหรับฉัน แต่ฉันไม่เคยเห็นสิ่งนี้มาในตำราและสิ่งที่ชอบดังนั้นฉันสงสัยว่าจะมีการประชุมบางประเภทที่จะไม่ทำอย่างนั้นหรือ กราฟเป็นกระดาษคำฉันแค่ต้องการให้แน่ใจว่าฉันจะไม่ละเมิดกฎสถิติที่สำคัญที่ไม่ได้พูด :)

3
ฉันจะทำนายราคาต่อรองที่ทีมดอดจ์บอลจะชนะได้อย่างไรโดยอ้างอิงจากประวัติการชนะของผู้เล่น
ลองนึกภาพมี 80 ผู้เล่นดอดจ์บอลในโลก แต่ละคนเล่นดอดจ์บอลหลายพันเกมกับผู้เล่น 79 คนตามลำดับแบบสุ่มมากหรือน้อย นี่คือโลกที่ไม่มีทีม (เช่นผู้เล่นทุกคนมีโอกาสถูกร่างในแต่ละทีมในแต่ละเกม) ฉันรู้ว่าอัตราการชนะก่อนหน้าของผู้เล่นแต่ละคน (เช่นหนึ่งชนะ 46% ของเกมก่อนหน้านี้ทั้งหมดและอีกชนะ 56% ของเกมก่อนหน้าของเขาทั้งหมด) ให้บอกว่ามีการแข่งขันขึ้นมาและฉันรู้ว่าใครกำลังเล่นในแต่ละทีม ฉันรู้อัตราการชนะครั้งก่อนของพวกเขาด้วย วิธีที่ดีที่สุดในการคำนวณความน่าจะเป็นของแต่ละทีมที่ชนะขึ้นอยู่กับองค์ประกอบของทีมคืออะไร? หากต้องการการคำนวณขั้นสูง (เช่นการถดถอยโลจิสติก) แจ้งให้เราทราบข้อมูลเฉพาะบางอย่าง ฉันค่อนข้างคุ้นเคยกับ SPSS แต่ฉันไม่ต้องการถามคำถามติดตาม นอกจากนี้ฉันจะสำรวจความถูกต้องของวิธีการของฉันโดยใช้ข้อมูลเก็บถาวรได้อย่างไร ฉันรู้ว่ามันจะไม่ถูกตัดออกอย่างชัดเจนเนื่องจากผู้เล่นส่วนใหญ่วางตัวประมาณ 40-60% แต่ก็ยัง โดยเฉพาะเจาะจงว่าอะไรคือโอกาสที่ทีม A จะชนะ? A - ประกอบด้วยบุคคลที่มีอัตราการชนะก่อนหน้า 52%, 54%, 56%, 58%, 60% B - ประกอบด้วยบุคคลที่มีอัตราการชนะก่อนหน้านี้ 48%, 55%, 56%, 58%, 60% (นี่เป็นเพียงตัวอย่างแบบสุ่มสำหรับวัตถุประสงค์ในการอธิบายสองทีมที่ดีงาม) แก้ไข: มีวิธีเริ่มต้นด้วยอัลกอริทึมที่ง่ายมากแล้วดูว่ามันทำงานอย่างไร บางทีเราอาจสรุปเปอร์เซ็นต์ของแต่ละทีมและคาดการณ์ว่าส่วนที่มีเปอร์เซ็นต์สูงสุดจะชนะ …

3
ผลรวมของตัวแปรสุ่มแกมมาอิสระสองตัว
จากบทความของ Wikipedia เกี่ยวกับการกระจาย Gamma : ถ้าและโดยที่และเป็นตัวแปรสุ่มอิสระแล้วtheta)Y ∼ G a m m a ( b , θ )X∼Gamma(a,θ)X∼Gamma(a,θ)X\sim\mathrm{Gamma}(a,\theta)Y∼Gamma(b,θ)Y∼Gamma(b,θ)Y\sim\mathrm{Gamma}(b,\theta)Y X + Y ∼ G a m m a ( a + b , θ )XXXYYYX+ Y∼ G a m m a ( a + b , θ )X+Y∼Gamma(a+b,θ)X+Y\sim \mathrm{Gamma}(a+b, \theta) แต่ฉันไม่เห็นข้อพิสูจน์ใด ๆ …

3
สถิติ F, ค่า F-critical และ P-value
ฉันใหม่มากในพื้นที่นี้และฉันมีความเข้าใจแนวคิดของการปฏิเสธสมมติฐานว่างตามผลลัพธ์จากตาราง ANOVA F ที่คำนวณได้และค่าวิกฤตมีความสัมพันธ์กับค่า p อย่างไร และถ้า F ที่คำนวณได้มากกว่า 1 นั่นแสดงว่าสมมติฐานว่างควรถูกปฏิเสธเสมอแม้ว่า p-value จะน้อยกว่า alpha หรือไม่? ขออภัยถ้าคำถามเหล่านี้เป็นสัญญาณของความไม่รู้ของฉัน แต่ฉัน 57 และกลับไปโรงเรียนหลังจาก 35 ปีที่ขาดหายไป! ขอบคุณสำหรับความช่วยเหลือ
13 anova 

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.