สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
ปัจจัย
ในการวิเคราะห์องค์ประกอบหลักองค์ประกอบหลักแรกคือทิศทางk orthogonal ที่มีความแปรปรวนสูงสุด กล่าวอีกนัยหนึ่งองค์ประกอบหลักตัวแรกถูกเลือกให้เป็นทิศทางของความแปรปรวนสูงสุดองค์ประกอบหลักที่สองถูกเลือกให้เป็นทิศทางมุมฉากไปยังทิศทางแรกกับความแปรปรวนสูงสุดและอื่น ๆkkkkkk มีการตีความที่คล้ายกันสำหรับการวิเคราะห์ปัจจัยหรือไม่ ตัวอย่างเช่นฉันคิดว่าปัจจัยแรกคือปัจจัยที่อธิบายองค์ประกอบนอกแนวทแยงของเมทริกซ์สหสัมพันธ์เดิมได้ดีที่สุด(ในแง่ของการพูดข้อผิดพลาดกำลังสองระหว่างเมทริกซ์สหสัมพันธ์เดิมและเมทริกซ์สหสัมพันธ์ที่กำหนดโดย ปัจจัย). นี่เป็นเรื่องจริง (หรือมีบางอย่างที่คล้ายกันที่เราสามารถพูดได้)?kkk

9
หนังสือสำหรับภาพรวมทั่วไปและแนวคิดของวิธีการทางสถิติ
ฉันสนใจเกี่ยวกับศักยภาพของการวิเคราะห์ทางสถิติสำหรับการจำลอง / การพยากรณ์ / การประเมินฟังก์ชั่น ฯลฯ อย่างไรก็ตามฉันไม่รู้อะไรมากเกี่ยวกับเรื่องนี้และความรู้ทางคณิตศาสตร์ของฉันยังค่อนข้าง จำกัด - ฉันเป็นนักศึกษาระดับปริญญาตรีด้านวิศวกรรมซอฟต์แวร์ ฉันกำลังมองหาหนังสือที่จะให้ฉันเริ่มต้นกับบางสิ่งที่ฉันอ่านต่อไป: การถดถอยเชิงเส้นและการถดถอยแบบอื่น ๆ วิธีการแบบเบส์วิธีการมอนเต้คาร์โลการเรียนรู้ของเครื่อง ฯลฯ ฉันก็ต้องการเริ่มต้นด้วย R เช่นกัน มีหนังสือเล่มหนึ่งที่รวมทั้งสองอย่างนี้เข้าด้วยกัน โดยเฉพาะอย่างยิ่งฉันต้องการให้หนังสืออธิบายสิ่งต่าง ๆ ในเชิงแนวคิดและไม่ได้อยู่ในรายละเอียดทางเทคนิคมากเกินไป - ฉันต้องการให้สถิติใช้งานได้ง่ายสำหรับฉันเพราะฉันเข้าใจว่ามีสถิติความเสี่ยงที่ผิดพลาดจำนวนมาก ฉันอยู่นอกหลักสูตรยินดีที่จะอ่านหนังสือมากขึ้นเพื่อปรับปรุงความเข้าใจในหัวข้อที่ฉันเห็นว่ามีค่า

2
จำนวนพารามิเตอร์ในโมเดลมาร์คอฟ
ฉันต้องการใช้ BIC สำหรับการเลือกรุ่น HMM: BIC = -2*logLike + num_of_params * log(num_of_data) ดังนั้นฉันจะนับจำนวนพารามิเตอร์ในโมเดล HMM ได้อย่างไร พิจารณา HMM แบบ 2 สถานะง่ายๆโดยที่เรามีข้อมูลต่อไปนี้: data = [1 2 1 1 2 2 2 1 2 3 3 2 3 2 1 2 2 3 4 5 5 3 3 2 6 6 5 6 4 …


3
ฉันจะได้อะไรถ้าฉันพิจารณาผลลัพธ์เป็นลำดับแทนที่จะเป็นหมวดหมู่?
มีวิธีการที่แตกต่างกันสำหรับการทำนายของตัวแปรลำดับและตัวแปรเด็ดขาด สิ่งที่ฉันไม่เข้าใจคือความแตกต่างนี้สำคัญอย่างไร มีตัวอย่างง่าย ๆ ที่สามารถบอกได้ชัดเจนว่าเกิดอะไรขึ้นถ้าฉันสั่งออเดอร์? ภายใต้สถานการณ์ใดมันไม่สำคัญ? ตัวอย่างเช่นหากตัวแปรอิสระทุกหมวดหมู่ / ลำดับก็จะมีความแตกต่าง? คำถามที่เกี่ยวข้องนี้มุ่งเน้นไปที่ประเภทของตัวแปรอิสระ ที่นี่ฉันถามเกี่ยวกับตัวแปรผลลัพธ์ แก้ไข: ฉันเห็นจุดที่ใช้โครงสร้างคำสั่งซื้อเพื่อลดจำนวนพารามิเตอร์โมเดล แต่ฉันก็ยังไม่มั่นใจจริงๆ นี่คือตัวอย่าง (นำมาจากบทนำสู่การถดถอยโลจิสติกที่ได้รับคำสั่งซึ่งเท่าที่ฉันสามารถเห็นการถดถอยโลจิสติกอันดับไม่ดีกว่าการถดถอยโลจิสติกพหุนาม library(nnet) library(MASS) gradapply <- read.csv(url("http://www.ats.ucla.edu/stat/r/dae/ologit.csv"), colClasses=c("factor", "factor", "factor", "numeric")) ordered_result <- function() { train_rows <- sample(nrow(gradapply), round(nrow(gradapply)*0.9)) train_data <- gradapply[train_rows,] test_data <- gradapply[setdiff(1:nrow(gradapply), train_rows),] m <- polr(apply~pared+gpa, data=train_data) pred <- predict(m, test_data) return(sum(pred==test_data$apply)) } …

1
สูตรขนาดตัวอย่างสำหรับการทดสอบ F หรือไม่
ฉันสงสัยว่ามีสูตรขนาดตัวอย่างเช่นสูตรของ Lehr ที่ใช้กับการทดสอบ F หรือไม่ สูตรของ Lehr สำหรับการทดสอบ t คือโดยที่คือขนาดของเอฟเฟกต์ ( เช่น ) สิ่งนี้สามารถทำให้เป็นปกติได้ถึงโดยที่เป็นค่าคงที่ที่ขึ้นอยู่กับอัตราของประเภทพลังงานที่ต้องการและไม่ว่าจะทำการทดสอบด้านเดียวหรือสองด้านn=16/Δ2n=16/Δ2n = 16 / \Delta^2ΔΔ\Delta Δ=(μ1−μ2)/σΔ=(μ1−μ2)/σ\Delta = (\mu_1 - \mu_2) / \sigman=c/Δ2n=c/Δ2n = c / \Delta^2ccc ฉันกำลังมองหาสูตรที่คล้ายกันสำหรับการทดสอบ F สถิติการทดสอบของฉันได้รับการแจกจ่ายภายใต้ทางเลือกเนื่องจากไม่ใช่ F กลางที่มีองศาอิสระและพารามิเตอร์ที่ไม่ใช่ศูนย์กลางโดยที่ขึ้นอยู่กับพารามิเตอร์ประชากรเท่านั้นซึ่งไม่เป็นที่รู้จัก . พารามิเตอร์ได้รับการแก้ไขโดยการทดลองและคือขนาดตัวอย่าง เป็นการดีที่ฉันกำลังมองหาสูตร (รูปแบบที่รู้จักกันดี) ของรูปแบบ โดยที่ขึ้นอยู่กับอัตราของฉันและพลังเท่านั้นk,nk,nk,nnλnλn \lambdaλλ\lambdakkknnnn=cg(k,λ)n=cg(k,λ)n = \frac{c}{g(k,\lambda)}ccc ขนาดตัวอย่างควรเป็นไปตาม ที่คือ CDF ของ F ที่ไม่ได้เป็นศูนย์กลางพร้อมพารามิเตอร์ dof …

2
การจัดกลุ่มข้อมูลเชิงพื้นที่ใน R
ฉันมีชุดข้อมูลอุณหภูมิพื้นผิวทะเล (SST) รายเดือนและฉันต้องการใช้วิธีการคลัสเตอร์บางอย่างเพื่อตรวจหาภูมิภาคที่มีรูปแบบ SST ที่คล้ายกัน ฉันมีชุดของไฟล์ข้อมูลรายเดือนที่ใช้งานตั้งแต่ปี 1985 ถึง 2009 และต้องการใช้การจัดกลุ่มกับแต่ละเดือนเป็นขั้นตอนแรก แต่ละไฟล์มีข้อมูลที่ gridded สำหรับ 3,584,16 จุดที่ประมาณ 50% เป็นที่ดินและมีการทำเครื่องหมายด้วยค่า 99.99 ที่จะเป็น NA รูปแบบข้อมูลคือ: lon lat sst -10.042 44.979 12.38 -9.998 44.979 12.69 -9.954 44.979 12.90 -9.910 44.979 12.90 -9.866 44.979 12.54 -9.822 44.979 12.37 -9.778 44.979 12.37 -9.734 44.979 12.51 -9.690 44.979 …
12 r  clustering  spatial 


2
วิธีใช้การวิเคราะห์องค์ประกอบหลักเพื่อเลือกตัวแปรสำหรับการถดถอย
ฉันกำลังใช้การวิเคราะห์องค์ประกอบหลักเพื่อเลือกตัวแปรที่จะใช้ในการสร้างแบบจำลอง ในตอนนี้ฉันทำการวัด A, B และ C ในการทดลองของฉัน - สิ่งที่ฉันอยากรู้คือฉันสามารถทำการวัดน้อยลงและหยุดการบันทึก C และหรือ B เพื่อประหยัดเวลาและความพยายามได้หรือไม่? ฉันพบว่าตัวแปรทั้ง 3 ตัวโหลดอย่างหนักในองค์ประกอบหลักตัวแรกซึ่งคิดเป็น 60% ของความแปรปรวนในข้อมูลของฉัน คะแนนองค์ประกอบบอกฉันว่าถ้าฉันเพิ่มตัวแปรเหล่านี้เข้าด้วยกันในอัตราส่วนที่แน่นอน (aA + bB + cC) ฉันสามารถรับคะแนนบน PC1 สำหรับแต่ละกรณีในชุดข้อมูลของฉันและสามารถใช้คะแนนนี้เป็นตัวแปรในการสร้างแบบจำลอง แต่นั่นไม่อนุญาตให้ฉันหยุดการวัด B และ C ถ้าฉันยกกำลังสองของ A และ B และ C บน PC1 ฉันพบว่าตัวแปร A คิดเป็น 65% ของความแปรปรวนใน PC1 และตัวแปร B คิดเป็น 50% ของความแปรปรวนใน …

1
เงื่อนไข homoskedasticity เทียบกับ heteroskedasticity
จากเศรษฐมิติโดย Fumio Hayashi (Chpt 1): ไม่มีเงื่อนไข Homoskedasticity: ช่วงเวลาที่สองของข้อผิดพลาด E (εᵢ²) เป็นค่าคงที่ตลอดการสังเกต รูปแบบการทำงาน E (εᵢ² | xi) เป็นค่าคงที่ตลอดการสังเกต เงื่อนไข Homoskedasticity: ข้อ จำกัด ที่ช่วงเวลาที่สองของข้อผิดพลาด E (εᵢ²) เป็นค่าคงที่ตลอดการสังเกตถูกยกขึ้น ดังนั้นช่วงเวลาที่สองตามเงื่อนไข E (εᵢ² | xi) สามารถแตกต่างกันในการสังเกตผ่านการพึ่งพาที่เป็นไปได้ในxᵢ ดังนั้นคำถามของฉัน: เงื่อนไข Homoskedasticity แตกต่างจาก Heteroskedasticity อย่างไร ความเข้าใจของฉันคือว่ามี heteroskedasticity เมื่อช่วงเวลาที่สองแตกต่างจากการสังเกต (xᵢ)

2
การค้นหาความแม่นยำของการจำลองสถานการณ์ของ Monte Carlo
พื้นหลัง ฉันออกแบบการจำลองมอนติคาร์โลที่รวมเอาท์พุทของชุดของแบบจำลองและฉันต้องการให้แน่ใจว่าการจำลองจะช่วยให้ฉันสามารถเรียกร้องที่สมเหตุสมผลเกี่ยวกับความน่าจะเป็นของผลลัพธ์ที่จำลองและความแม่นยำของการประมาณความน่าจะเป็น การจำลองจะพบว่ามีความเป็นไปได้ที่คณะลูกขุนที่ดึงมาจากชุมชนที่ระบุจะลงโทษจำเลยที่หนึ่ง นี่คือขั้นตอนของการจำลอง: ใช้ข้อมูลที่มีอยู่แล้วสร้างแบบจำลองความน่าจะเป็นแบบโลจิสติกส์ ( M ) โดยการลงคะแนน“ juror first ballot vote” บนตัวทำนายกลุ่มประชากร ใช้วิธีการ Monte Carlo เพื่อจำลองM 1,000 เวอร์ชัน(เช่น 1,000 สัมประสิทธิ์สำหรับพารามิเตอร์รุ่น) เลือกรุ่นหนึ่งใน 1,000 รุ่น ( M i ) Empanel 1,000 คณะลูกขุนโดยการสุ่มเลือก 12 คณะลูกขุน 12 คนจาก "ชุมชน" ( C ) ของบุคคลที่มีการแจกแจงลักษณะประชากร deterministically คำนวณความน่าจะเป็นครั้งแรกของการลงคะแนนเสียงการโหวตว่ามีความผิดในแต่ละตุลาการใช้Mฉัน แสดงผลคะแนนที่น่าจะเป็น "ลูกขุน" ในการลงคะแนนเสียงแบบกำหนด (ขึ้นอยู่กับว่ามันมีค่ามากกว่าหรือน้อยกว่าค่าที่เลือกแบบสุ่มระหว่าง 0-1) พิจารณา“ การลงคะแนนเสียงรอบสุดท้าย” …

1
ทดสอบความเท่าเทียมกันของแบบจำลองที่ไม่ซ้อนกัน
สมมติว่าเป็นฟังก์ชันเชิงเส้นของxและหุ่นd สมมติฐานของฉันอยู่ที่dตัวเองเป็นเหมือนดัชนีประสมของเวกเตอร์ของตัวแปรอื่น ๆ Z ผมได้รับการสนับสนุนในการนี้ในM N O VของZ (เช่นซี1 , ซี2 , ... , Z n ) บนd มีวิธีใดที่จะทดสอบความเท่ากันของโมเดลทั้งสองนี้:yyyxxxddddddZZZMANOVAMANOVAMANOVAZZZz1z1z_1z2z2z_2znznz_nddd รุ่น 1: y=b0+b1⋅x+b2⋅d+e1y=b0+b1⋅x+b2⋅d+e1y = b_0 + b_1 \cdot x + b_2\cdot d + e_1 รุ่น 2: y=g0+Z⋅G+e2y=g0+Z⋅G+e2y = g_0 + Z\cdot G + e_2 โดยที่คือเวกเตอร์คอลัมน์ของพารามิเตอร์GGG

2
ทดสอบความแตกต่างใน AIC ของรุ่นที่ไม่ซ้อนกันสองแบบ
จุดรวมของ AIC หรือเกณฑ์ข้อมูลอื่น ๆ นั้นดีกว่าน้อยกว่า ดังนั้นถ้าฉันมีสองรุ่น M1: y = a0 + XA + e และ M2: y = b0 + ZB + u และถ้า AIC ของรุ่นแรก (A1) น้อยกว่ารุ่นที่สอง (A2) ดังนั้น M1 จะมี แบบที่ดีขึ้นจากมุมมองของทฤษฎีข้อมูล แต่มีเกณฑ์มาตรฐานลัดสำหรับความแตกต่างของ A1-A2 หรือไม่? จริง ๆ แล้วมีจำนวนน้อยเท่าใด อีกนัยหนึ่งมีการทดสอบสำหรับ (A1-A2) ที่นอกเหนือจากการมองด้วยตาหรือไม่ แก้ไข: Peter / Dmitrij ... ขอบคุณที่ตอบกลับ ที่จริงนี่เป็นกรณีที่ความเชี่ยวชาญที่สำคัญของฉันขัดแย้งกับความเชี่ยวชาญทางสถิติของฉัน โดยพื้นฐานแล้วปัญหาไม่ได้เลือกระหว่างสองรุ่น …
12 regression  aic 

4
เพียร์สันสหสัมพันธ์ของชุดข้อมูลที่มีค่าเบี่ยงเบนมาตรฐานอาจเป็นศูนย์หรือไม่
ฉันมีปัญหาในการคำนวณสัมประสิทธิ์สหสัมพันธ์ของชุดข้อมูลที่มีค่าเบี่ยงเบนมาตรฐานอาจเป็นศูนย์ (เช่นข้อมูลทั้งหมดมีค่าเท่ากัน) สมมติว่าฉันมีชุดข้อมูลสองชุดต่อไปนี้: float x[] = {2, 2, 2, 3, 2}; float y[] = {2, 2, 2, 2, 2}; สัมประสิทธิ์สหสัมพันธ์ "r" จะถูกคำนวณโดยใช้สมการต่อไปนี้: float r = covariance(x, y) / (std_dev(x) * std_dev(y)); อย่างไรก็ตามเนื่องจากข้อมูลทั้งหมดในชุดข้อมูล "y" มีค่าเท่ากันค่าเบี่ยงเบนมาตรฐาน std_dev (y) จะเป็นศูนย์และ "r" จะไม่ถูกกำหนด มีวิธีแก้ไขปัญหานี้หรือไม่? หรือฉันควรใช้วิธีอื่นในการวัดความสัมพันธ์ของข้อมูลในกรณีนี้?

3
เปลี่ยนจากการใช้ซอฟต์แวร์ทางสถิติเพื่อทำความเข้าใจสมการทางคณิตศาสตร์หรือไม่
บริบท: ฉันเป็นนักศึกษาปริญญาเอกด้านจิตวิทยา เช่นเดียวกับนักศึกษาปริญญาเอกจิตวิทยาหลายคนฉันรู้วิธีการวิเคราะห์ทางสถิติต่าง ๆ โดยใช้ซอฟต์แวร์ทางสถิติจนถึงเทคนิคต่าง ๆ เช่น PCA การจำแนกต้นไม้และการวิเคราะห์กลุ่ม แต่ก็ไม่เป็นที่น่าพอใจเพราะแม้ว่าฉันสามารถอธิบายได้ว่าทำไมฉันถึงวิเคราะห์และตัวบ่งชี้ความหมายฉันไม่สามารถอธิบายได้ว่าเทคนิคทำงานอย่างไร ปัญหาที่แท้จริงคือซอฟต์แวร์ทางสถิติที่เข้าใจง่าย แต่มีข้อ จำกัด ในการเรียนรู้เทคนิคใหม่ในบทความนั้นฉันต้องเข้าใจวิธีการอ่านสมการทางคณิตศาสตร์ ในปัจจุบันฉันไม่สามารถคำนวณค่าลักษณะเฉพาะหรือค่า K สมการเป็นเหมือนภาษาต่างประเทศสำหรับฉัน คำถาม: มีคำแนะนำที่ครอบคลุมที่ช่วยในการทำความเข้าใจสมการในบทความวารสารหรือไม่? แก้ไข: ฉันคิดว่าคำถามนั้นจะอธิบายได้ด้วยตนเองมากกว่า: เหนือความซับซ้อนบางอย่างสัญกรณ์ทางสถิติกลายเป็นคำพูดพล่อยๆสำหรับฉัน; สมมติว่าฉันต้องการโค้ดฟังก์ชั่นของตัวเองใน R หรือ C ++ เพื่อทำความเข้าใจกับเทคนิค แต่มีสิ่งกีดขวาง ฉันไม่สามารถแปลงสมการเป็นโปรแกรม และจริง ๆ : ฉันไม่รู้สถานการณ์ในโรงเรียนปริญญาเอกของสหรัฐอเมริกา แต่ในเหมือง (ฝรั่งเศส) หลักสูตรเดียวที่ฉันสามารถติดตามได้คือการเคลื่อนไหวเกี่ยวกับครอกศตวรรษที่ 16 ...

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.