สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
การใช้แพคเกจสถิติใน R สำหรับการจัดกลุ่ม kmeans
ฉันมีปัญหาในการทำความเข้าใจกับแพคเกจคลัสเตอร์หนึ่งหรือสองด้าน ฉันกำลังติดตามตัวอย่างจากQuick-Rอย่างใกล้ชิด แต่ไม่เข้าใจการวิเคราะห์หนึ่งหรือสองอย่าง ฉันได้รวมรหัสที่ฉันใช้สำหรับตัวอย่างนี้โดยเฉพาะ ## Libraries library(stats) library(fpc) ## Data mydata = structure(list(a = c(461.4210925, 1549.524107, 936.42856, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 131.4349206, 0, 762.6110846, 3837.850406), b = c(19578.64174, 2233.308842, 4714.514274, 0, 2760.510002, 1225.392118, 3706.428246, 2693.353714, 2674.126613, 592.7384164, 1820.976961, 1318.654162, 1075.854792, 1211.248996, 1851.363623, …
10 r  clustering 

2
การเซ็นเซอร์ / การตัดปลายใน JAGS
ฉันมีคำถามเกี่ยวกับวิธีแก้ไขปัญหาการตรวจสอบใน JAGS ฉันสังเกตการผสมแบบสองตัวแปรตามปกติซึ่งค่า X มีข้อผิดพลาดในการวัด ฉันต้องการจำลอง 'ค่าเฉลี่ย' ที่แท้จริงของค่าการตรวจสอบที่สังเกตได้ ⌈xtrue+ϵ⌉=xobserved ϵ∼N(0,sd=.5)⌈xtrue+ϵ⌉=xobserved ϵ∼N(0,sd=.5)\begin{align*} \lceil x_{true}+\epsilon \rceil = x_{observed} \ \epsilon \sim N(0,sd=.5) \end{align*} นี่คือสิ่งที่ฉันมีตอนนี้: for (i in 1:n){ x[i,1:2]~dmnorm(mu[z[i],1:2], tau[z[i],1:2,1:2]) z[i]~dcat(prob[ ]) } Y ยังมีข้อผิดพลาดในการวัด สิ่งที่ฉันต้องการทำคืออะไรเช่นนี้: for (i in 1:n){ x_obs[i] ~ dnorm(x_true[i],prec_x)I(x_true[i],) y_obs[i] ~ dnorm(y_true[i],prec_y) c(x_true[i]:y_true[i])~dmnorm(mu[ z [ i ],1:2], tau[z[i],1:2,1:2]) …

4
การสร้างอินเตอร์เฟส MATLAB และ R กับ C5.0 ของ Ross Quinlan
ฉันกำลังพิจารณาการสร้างอินเตอร์เฟส MATLAB และ R ให้กับC5.0ของRoss Quinlan (สำหรับผู้ที่ไม่คุ้นเคย C5.0 เป็นอัลกอริทึมต้นไม้ตัดสินใจและแพ็คเกจซอฟต์แวร์ส่วนขยายC4.5 ) และฉันพยายาม รับความรู้สึกขององค์ประกอบที่ฉันจะต้องเขียน เอกสารเดียวที่ฉันพบสำหรับ C5.0 อยู่ที่นี่ซึ่งเป็นแบบฝึกหัดสำหรับ See5 (อินเทอร์เฟซ Windows กับ C5.0?) tarไฟล์มาพร้อมกับ Makefile แต่ไม่มีไฟล์ Readme หรือเอกสารใด ๆ เพิ่มเติม จากสิ่งที่ฉันอ่านในบทช่วยสอนด้านบน C5.0 ใช้การแทนค่าแบบ ASCII เพื่อจัดการอินพุตและเอาต์พุตและฉันกำลังพิจารณาสร้างอินเตอร์เฟสที่ส่งผ่านข้อมูลไบนารีโดยตรงระหว่าง MATLAB หรือ R และ C5.0 การแสดงข้อมูลของ C5.0 ถูกใช้โดยซอฟต์แวร์การเรียนรู้ / การจำแนกประเภทอื่น ๆ หรือไม่? มีใครลองสร้าง MATLAB หรือ R อินเตอร์เฟสกับ ID3, …

2
ความแตกต่างระหว่างการใช้การถดถอยริดจ์ใน R และ SAS
ผมได้อ่านคำอธิบายของการถดถอยสันในการประยุกต์ใช้เชิงเส้นสถิติรุ่นที่ 5 เอ็ดบทที่ 11. การถดถอยสันจะทำในข้อมูลไขมันในร่างกายที่มีอยู่ที่นี่ หนังสือเรียนตรงกับผลลัพธ์ใน SAS ซึ่งมีค่าสัมประสิทธิ์การแปลงกลับในรูปแบบที่เหมาะสมเป็น: Y= - 7.3978 + 0.5553 X1+ 0.3681 X2- 0.1917 X3Y=−7.3978+0.5553X1+0.3681X2−0.1917X3 Y=-7.3978+0.5553X_1+0.3681X_2-0.1917X_3 สิ่งนี้แสดงให้เห็นจาก SAS เมื่อ: proc reg data = ch7tab1a outest = temp outstb noprint; model y = x1-x3 / ridge = 0.02; run; quit; proc print data = temp; where _ridge_ = …

3
วิธีการประมาณพารามิเตอร์สำหรับการกระจาย Zipf ตัดทอนจากตัวอย่างข้อมูล?
ฉันมีปัญหากับพารามิเตอร์การประมาณสำหรับ Zipf สถานการณ์ของฉันมีดังต่อไปนี้: ฉันมีชุดตัวอย่าง (วัดจากการทดลองที่สร้างการโทรที่ควรทำตามการแจกแจงแบบ Zipf) ฉันต้องแสดงให้เห็นว่าเครื่องกำเนิดนี้สร้างสายด้วยการกระจาย zipf จริงๆ ฉันอ่านคำถาม & คำตอบนี้แล้วจะคำนวณค่าสัมประสิทธิ์ของกฎหมายของ Zipf จากความถี่สูงสุดหนึ่งชุดได้อย่างไร แต่ฉันไปถึงผลลัพธ์ที่ไม่ดีเพราะฉันใช้การแจกแจงที่ถูกตัดทอน ตัวอย่างเช่นถ้าฉันตั้งค่า "s" เป็น "0.9" สำหรับกระบวนการสร้างถ้าฉันพยายามประเมินค่า "s" ตามที่เขียนไว้ใน Q&A ที่รายงานฉันได้รับ "s" เท่ากับ 0.2 ca ฉันคิดว่านี่เป็นเพราะความจริงที่ว่าฉันใช้การกระจาย TRUNCATED (ฉันต้อง จำกัด zipf ด้วยจุดที่ถูกตัดทอนมันถูกตัดทอน) ฉันจะประมาณค่าพารามิเตอร์ด้วยการกระจาย zipf ที่ถูกตัดทอนได้อย่างไร

2
ข้อความที่ดีสำหรับการสุ่มใหม่หรือไม่
กลุ่มสามารถแนะนำข้อความ / ทรัพยากรการแนะนำที่ดีให้กับเทคนิคการสุ่มตัวอย่างใหม่ได้หรือไม่? โดยเฉพาะฉันสนใจทางเลือกในการทดสอบแบบพาราเมตริกคลาสสิก (เช่นการทดสอบ t, ANOVA, ANCOVA) สำหรับการเปรียบเทียบกลุ่มเมื่อข้อสมมติฐานเช่นภาวะปกติถูกละเมิดอย่างชัดเจน ประเภทของปัญหาตัวอย่างที่ฉันต้องการให้ความรู้แก่ตัวเองว่าวิธีที่ดีกว่าในการแก้ไขอาจเกี่ยวข้องกับบางสิ่งเช่น: I) 2 กลุ่ม: การรักษาและการควบคุม Dependent Var: การเปลี่ยนแปลงในบัญชีดอลลาร์ดุลหลังจากการแทรกแซง Covariate: ดอลลาร์ล่วงหน้าของบัญชีการแทรกแซง ปัญหาเกี่ยวกับการใช้ ANCOVA: หลายวิชาจะไม่มีการเปลี่ยนแปลงใด ๆ (ศูนย์จำนวนมาก) II) 2 กลุ่ม: การรักษาและการควบคุม Dependent Var: เพิ่มบัญชีใหม่แล้ว Covariate: จำนวนการแทรกแซงล่วงหน้าของบัญชี * วิชาจำนวนมากจะไม่มีบัญชีเพิ่ม (ศูนย์จำนวนมาก) ฉันสามารถใช้ bootstrap ได้หรือไม่? การทดสอบการเปลี่ยนรูป? นี่คือประเภทของการวิเคราะห์ที่ฉันต้องการใช้วิธีการ resampling nonparametric

2
วิธีการใดของเคอร์เนลที่ให้ความน่าจะเป็นผลลัพธ์ที่ดีที่สุด
เมื่อเร็ว ๆ นี้ฉันได้ใช้การปรับขนาดเอาต์พุต SVM ของแพลตเพื่อประเมินความน่าจะเป็นของเหตุการณ์เริ่มต้น ทางเลือกที่ตรงกว่าดูเหมือนจะเป็น "Kernel logistic Regression" (KLR) และ "Import Vector Machine" ที่เกี่ยวข้อง ใครสามารถบอกได้ว่าวิธีการของเคอร์เนลที่ให้ความน่าจะเป็น - เอาท์พุทเป็นปัจจุบันของศิลปะ? มีการนำ R-KLR ไปใช้งานจริงหรือไม่? ขอบคุณมากสำหรับความช่วยเหลือของคุณ!

3
การประมาณค่าแบบจำลองเลขชี้กำลัง
รูปแบบเลขชี้กำลังเป็นรูปแบบที่อธิบายโดยสมการต่อไปนี้: yi^=β0⋅eβ1x1i+…+βkxkiyi^=β0⋅eβ1x1i+…+βkxki\hat{y_{i}}=\beta_{0}\cdot e^{\beta_{1}x_{1i}+\ldots+\beta_{k}x_{ki}} วิธีที่ใช้กันมากที่สุดที่ใช้ในการประเมินแบบจำลองนี้คือการทำให้เป็นเส้นตรงซึ่งสามารถทำได้อย่างง่ายดายโดยการคำนวณลอการิทึมของทั้งสองฝ่าย อะไรคือแนวทางอื่น ๆ ? ฉันสนใจเป็นพิเศษสำหรับผู้ที่สามารถจัดการในการสังเกตyi=0yi=0y_{i}=0 อัปเดต 31.01.2011 ฉันตระหนักถึงความจริงที่ว่ารุ่นนี้ไม่สามารถสร้างศูนย์ได้ ฉันจะอธิบายรายละเอียดเล็กน้อยเกี่ยวกับสิ่งที่ฉันทำตัวแบบและทำไมฉันถึงเลือกรุ่นนี้ สมมติว่าเราต้องการทำนายจำนวนเงินที่ลูกค้าใช้ในร้าน แน่นอนว่าลูกค้าจำนวนมากกำลังมองหาอยู่และพวกเขาไม่ได้ซื้ออะไรเลยทำไมมี 0 ฉันไม่ต้องการใช้แบบจำลองเชิงเส้นเพราะมันสร้างค่าลบจำนวนมากซึ่งไม่สมเหตุสมผล เหตุผลอื่นคือโมเดลนี้ทำงานได้ดีจริง ๆ ดีกว่าแบบเส้นตรงมาก ฉันใช้อัลกอริทึมทางพันธุกรรมเพื่อประมาณค่าพารามิเตอร์เหล่านั้นดังนั้นมันจึงไม่ใช่วิธีการทางวิทยาศาสตร์ ตอนนี้ฉันอยากจะรู้วิธีจัดการกับปัญหาโดยใช้วิธีการทางวิทยาศาสตร์มากขึ้น สามารถสันนิษฐานได้ว่าตัวแปรส่วนใหญ่หรือทั้งหมดเป็นตัวแปรไบนารี่

1
พล็อตเส้นการถดถอยแบบต่อเนื่อง
มีวิธีการพล็อตบรรทัดการถดถอยของตัวแบบทีละชิ้นเช่นนี้นอกเหนือจากการใช้linesเพื่อพล็อตแต่ละเซ็กเมนต์แยกจากกันหรือใช้geom_smooth(aes(group=Ind), method="lm", fill=FALSE)? m.sqft <- mean(sqft) model <- lm(price~sqft+I((sqft-m.sqft)*Ind)) # sqft, price: continuous variables, Ind: if sqft>mean(sqft) then 1 else 0 plot(sqft,price) abline(reg = model) Warning message: In abline(reg = model) : only using the first two of 3regression coefficients ขอบคุณ.

4
ฉันจะประมาณความหนาแน่นของพารามิเตอร์ที่ไม่ได้ศูนย์ใน R ได้อย่างไร?
ฉันมีชุดข้อมูลที่มีศูนย์จำนวนมากที่มีลักษณะดังนี้: set.seed(1) x <- c(rlnorm(100),rep(0,50)) hist(x,probability=TRUE,breaks = 25) ฉันต้องการวาดเส้นสำหรับความหนาแน่นของมัน แต่density()ฟังก์ชั่นใช้หน้าต่างย้ายที่คำนวณค่าลบของ x lines(density(x), col = 'grey') มีdensity(... from, to)ข้อโต้แย้ง แต่สิ่งเหล่านี้ดูเหมือนจะตัดทอนการคำนวณเท่านั้นไม่เปลี่ยนหน้าต่างเพื่อให้ความหนาแน่นที่ 0 สอดคล้องกับข้อมูลที่สามารถเห็นได้โดยพล็อตต่อไปนี้: lines(density(x, from = 0), col = 'black') (หากการแก้ไขมีการเปลี่ยนแปลงฉันคาดว่าเส้นสีดำจะมีความหนาแน่นสูงกว่าที่ 0 กว่าเส้นสีเทา) มีทางเลือกอื่นสำหรับฟังก์ชั่นนี้ที่จะช่วยให้การคำนวณความหนาแน่นดีขึ้นที่ศูนย์หรือไม่?
10 r  probability  kde 

5
สร้างค่าหลายตัวแปรสุ่มจากข้อมูลเชิงประจักษ์
ฉันกำลังทำงานกับฟังก์ชั่น Monte Carlo สำหรับการประเมินมูลค่าสินทรัพย์หลายรายการที่มีผลตอบแทนที่สัมพันธ์กันบางส่วน ขณะนี้ฉันเพิ่งสร้างเมทริกซ์ความแปรปรวนร่วมและฟีดไปยังrmvnorm()ฟังก์ชันใน R (สร้างค่าสุ่มที่สัมพันธ์กัน) อย่างไรก็ตามเมื่อพิจารณาการกระจายของผลตอบแทนของสินทรัพย์จะไม่ได้รับการกระจายตามปกติ นี่เป็นคำถามสองส่วนจริง ๆ : 1) ฉันจะประมาณ PDF หรือ CDF บางประเภทได้อย่างไรเมื่อฉันมีข้อมูลโลกแห่งความจริงโดยไม่ต้องมีการแจกแจง 2) ฉันจะสร้างค่าที่สัมพันธ์กันเช่น rmvnorm ได้อย่างไร แต่สำหรับการแจกแจงที่ไม่รู้จัก (และไม่ปกติ) นี้? ขอบคุณ! การแจกแจงนั้นไม่เหมาะสมกับการแจกแจงใด ๆ ฉันคิดว่ามันจะเป็นอันตรายมากที่จะใช้พารามิเตอร์และจากนั้นใช้สำหรับการประเมิน monte carlo ไม่มี bootstrap หรือวิธี "empirical monte carlo" ที่ฉันสามารถดูได้หรือไม่?
10 mcmc  monte-carlo  pdf 

2
จะคำนวณช่วงความเชื่อมั่นของสัมประสิทธิ์การถดถอยใน PLS ได้อย่างไร?
แบบจำลองพื้นฐานของPLSคือ matrixและ vectorกำหนดสัมพันธ์กับ ที่คือเวลาแฝงเมทริกซ์และเป็นคำที่มีเสียงรบกวน (sssumingอยู่กึ่งกลาง)X n y X = T P ′ + E , y = T q ′ + f , T n × k E , f X , yn × mn×mn \times mXXXnnnYyyX=TP′+E,X=TP′+E,X = T P' + E, y=Tq′+f,y=Tq′+f,y = T q' + f,TTTn×kn×kn \times kE,fE,fE, …

3
แหล่งข้อมูลสำหรับการเรียนรู้เกี่ยวกับการถดถอยอนุกรมเวลาแบบเผด็จการ
"การปลอมแบบน่าเกรงขาม" (ในบริบทของอนุกรมเวลา) และคำที่เกี่ยวข้องเช่นการทดสอบรูทยูนิทเป็นสิ่งที่ฉันได้ยินมามากมายเกี่ยวกับเรื่องนี้ แต่ไม่เข้าใจเลย มันเกิดขึ้นเมื่อใดโดยสัญชาตญาณ (ฉันเชื่อว่ามันเป็นตอนที่อนุกรมเวลาสองชุดของคุณถูกรวมกันนั่นคือชุดค่าผสมเชิงเส้นบางส่วนของชุดแบบคงที่ แต่ฉันไม่เห็นว่าทำไมตัวกรองควรนำไปสู่ ฉันกำลังมองหาความเข้าใจระดับสูงของการทดสอบ cointegration / unit root / Granger causality เกี่ยวกับการถดถอยแบบเผ็ด ดังนั้นการตอบสนองที่กำหนดเองหรือลิงก์ไปยังการอ้างอิงที่ฉันสามารถเรียนรู้เพิ่มเติมจะดีมาก

1
ใน R“ glmnet” พอดีกับการสกัดกั้นหรือไม่?
glmnetฉันกำลังกระชับรูปแบบเชิงเส้นในการวิจัยโดยใช้ โมเดลดั้งเดิม (ที่ไม่ทำให้เป็นปกติ) ถูกติดตั้งโดยใช้lmและไม่มีเทอมคงที่ (นั่นคือในรูปแบบlm(y~0+x1+x2,data)) glmnetใช้เมทริกซ์ของผู้ทำนายและเวกเตอร์ของการตอบสนอง ฉันอ่านglmnetเอกสารแล้วและไม่สามารถเอ่ยถึงคำศัพท์คงที่ได้ ดังนั้นมีวิธีขอglmnetให้บังคับให้พอดีเชิงเส้นผ่านจุดกำเนิดหรือไม่
10 r  regression  lasso 

3
แพ็คเกจ R สำหรับการรวมระดับปัจจัยสำหรับการจัดทำดัชนี?
หากสงสัยว่ามีใครวิ่งข้ามแพ็คเกจ / ฟังก์ชั่นใน R ที่จะรวมระดับของปัจจัยที่มีสัดส่วนของระดับทั้งหมดในปัจจัยน้อยกว่าขีด จำกัด บางอย่าง? โดยเฉพาะอย่างยิ่งหนึ่งในขั้นตอนแรกในการเตรียมข้อมูลที่ฉันดำเนินการคือการยุบปัจจัยที่กระจัดกระจายในระดับต่างๆ (พูดในระดับที่เรียกว่า 'อื่น ๆ ') ที่ไม่ได้ประกอบด้วยอย่างน้อย 2% ของทั้งหมด สิ่งนี้ทำโดยไม่ได้รับอนุญาตและทำเมื่อวัตถุประสงค์คือเพื่อจำลองกิจกรรมบางอย่างในการตลาด (ไม่ใช่การตรวจจับการฉ้อโกงซึ่งเหตุการณ์เหล่านั้นมีความสำคัญน้อยมาก) ฉันกำลังมองหาฟังก์ชั่นที่จะยุบระดับจนกระทั่งได้สัดส่วนตามเกณฑ์ UPDATE: ขอบคุณคำแนะนำที่ดีเหล่านี้ฉันเขียนฟังก์ชั่นได้อย่างง่ายดาย ฉันรู้ว่ามันเป็นไปได้ที่จะยุบระดับด้วยสัดส่วน <ต่ำสุดและยังคงมีระดับที่ถูกถอดรหัสเป็น <ต่ำสุดซึ่งต้องการการเพิ่มระดับต่ำสุดพร้อมสัดส่วน> ต่ำสุด มีแนวโน้มที่จะมีประสิทธิภาพมากขึ้น แต่ดูเหมือนจะทำงาน การปรับปรุงต่อไปคือการหาวิธีจับ "กฎ" สำหรับการใช้ตรรกะการยุบกับข้อมูลใหม่ (ชุดการตรวจสอบหรือข้อมูลในอนาคต) collapseFactors<- function(tableName,minPercent=5,fillIn ="RECODED" ) { for (i in 1:ncol(tableName)) { if(is.factor(tableName[,i]) == TRUE) #process just factors { sortedTable<-sort(prop.table(table(tableName[,i]))) numberToCollapse<-length(sortedTable[sortedTable<(minPercent/100)]) if …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.