สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
พลังงานสำหรับการทดสอบตัวอย่างสองตัวอย่าง
ฉันพยายามที่จะเข้าใจการคำนวณพลังงานสำหรับกรณีของการทดสอบตัวอย่างอิสระสองรายการ (ไม่ได้สมมติความแปรปรวนเท่ากันดังนั้นฉันจึงใช้ Satterthwaite) นี่คือแผนภาพที่ฉันพบเพื่อช่วยให้เข้าใจกระบวนการ: ดังนั้นฉันจึงสันนิษฐานว่าให้สิ่งต่อไปนี้เกี่ยวกับประชากรสองคนและกำหนดขนาดตัวอย่าง: mu1<-5 mu2<-6 sd1<-3 sd2<-2 n1<-20 n2<-20 ฉันสามารถคำนวณค่าวิกฤตภายใต้ null ที่เกี่ยวข้องกับการมีความน่าจะเป็นหางส่วนบน 0.05: df<-(((sd1^2/n1)+(sd2^2/n2)^2)^2) / ( ((sd1^2/n1)^2)/(n1-1) + ((sd2^2/n2)^2)/(n2-1) ) CV<- qt(0.95,df) #equals 1.730018 แล้วคำนวณสมมติฐานทางเลือก (ซึ่งสำหรับกรณีนี้ฉันได้เรียนรู้คือ "การกระจายตัวทีไม่ใช่ศูนย์กลาง") ฉันคำนวณเบต้าในแผนภาพด้านบนโดยใช้การแจกแจงที่ไม่ใช่ศูนย์กลางและค่าวิกฤตที่พบข้างต้น นี่คือสคริปต์แบบเต็มใน R: #under alternative mu1<-5 mu2<-6 sd1<-3 sd2<-2 n1<-20 n2<-20 #Under null Sp<-sqrt(((n1-1)*sd1^2+(n2-1)*sd2^2)/(n1+n2-2)) df<-(((sd1^2/n1)+(sd2^2/n2)^2)^2) / ( ((sd1^2/n1)^2)/(n1-1) + ((sd2^2/n2)^2)/(n2-1) ) …

3
จะประเมินความดีของแบบที่ไม่เชิงเส้นได้อย่างไร [ปิด]
เป็นการยากที่จะบอกสิ่งที่ถูกถามที่นี่ คำถามนี้คลุมเครือคลุมเครือไม่สมบูรณ์กว้างเกินไปหรือโวหารและไม่สามารถตอบได้อย่างสมเหตุสมผลในรูปแบบปัจจุบัน สำหรับความช่วยเหลือในการทำความเข้าใจคำถามนี้เพื่อที่จะสามารถเปิด, ไปที่ศูนย์ช่วยเหลือ ปิดให้บริการใน7 ปีที่ผ่านมา ฉันมีรูปแบบไม่เชิงเส้นโดยที่Φคือ cdf ของการแจกแจงแบบปกติมาตรฐานและ f เป็นแบบไม่เชิงเส้น (ดูด้านล่าง) ฉันต้องการทดสอบความดีพอดีของโมเดลนี้ด้วยพารามิเตอร์aต่อข้อมูลของฉัน( x 1 , y 1 ) , ( x 2 , y 2 ) , … , ( x n , y n )y=Φ(f(x,a))+εy=Φ(f(x,a))+εy=\Phi(f(x,a)) + \varepsilonΦΦ\Phiaaa(x1,y1),(x2,y2),…,(xn,yn)(x1,y1),(x2,y2),…,(xn,yn)(x_1,y_1),(x_2,y_2),\dots,(x_n,y_n)หลังจากที่มีการใช้ในการประมาณค่าความน่าจะเป็นสูงสุดที่จะหา การทดสอบที่เหมาะสมจะเป็นอย่างไร ฉันต้องการใช้การทดสอบนี้เพื่อติดป้ายกำกับข้อมูลไม่ดีพอและระบุว่าควรรวบรวมข้อมูลเพิ่มเติมหรือไม่aaa ผมมองในการใช้อันซ์ซึ่งเปรียบเทียบรุ่นนี้กับรุ่นอิ่มตัวที่มีของการทดสอบของความดีของพอดีสอดคล้องกันโดยใช้กระจาย สิ่งนี้จะเหมาะสมหรือไม่ สิ่งที่ฉันได้อ่านเกี่ยวกับความเบี่ยงเบนส่วนใหญ่นั้นนำไปใช้กับ GLMs ซึ่งไม่ใช่สิ่งที่ฉันมี หากการทดสอบแบบเบี่ยงเบนมีความเหมาะสมสมมติฐานใดที่จำเป็นต้องมีเพื่อให้การทดสอบมีผลχ2n−1χn−12\chi^2_{n-1} อัปเดต: สำหรับx>1,a>0ในกรณีนี้ช่วยได้f=x−1ax2+1√f=x−1ax2+1f = …

3
โมเดล Markov ที่ซ่อนอยู่และอัลกอริทึมการเพิ่มความคาดหวังสูงสุด
ใครสามารถอธิบายได้ว่าแบบจำลองของมาร์คอฟที่ซ่อนอยู่เกี่ยวข้องกับการเพิ่มความคาดหวังสูงสุดได้อย่างไร ฉันได้ผ่านการเชื่อมโยงมากมาย แต่ไม่สามารถมาพร้อมกับมุมมองที่ชัดเจน ขอบคุณ!

2
จะเปรียบเทียบเมทริกซ์สหสัมพันธ์สองตัวหรือมากกว่าได้อย่างไร
ฉันมีเมทริกซ์สหสัมพันธ์คำนวณกับชุด(m \ times n)ข้อมูล (สังเกต) โดยใช้ฟังก์ชั่นของPPP( n × n )(n×n)(n \times n)PPP( m × n )(ม.×n)(m \times n)corrcoef ฉันจะเปรียบเทียบและวิเคราะห์เมทริกซ์ความสัมพันธ์Pเหล่านี้PPPด้วยความเคารพซึ่งกันและกันได้อย่างไร การทดสอบวิธีการและ / หรือจุดตรวจคืออะไร

1
ตัวอย่างหมายถึงการประมาณการกระจายตัวที่ดีที่สุดในแง่หนึ่ง
ตามกฎ (จำนวนมาก / อ่อนแอ) ของจำนวนมากให้คะแนนตัวอย่างบางส่วนของการกระจายตัวอย่างของพวกมันหมายถึงf ∗ ( { x i , i = 1 , ... , N } ) : = 1{ xผม∈ Rn, i = 1 , … , N}{xi∈Rn,i=1,…,N}\{x_i \in \mathbb{R}^n, i=1,\ldots,N\}แปลงเป็นการกระจายตัวหมายถึงทั้งความน่าจะเป็นและในขณะที่ขนาดตัวอย่างN ไปไม่มีที่สิ้นสุดฉ* * * *( { xผม, i = 1 , … , N} ) : …

2
อนุกรมเวลาที่ผิดปกติอย่างมาก
ฉันมีข้อมูลสำหรับประชากรปลาจำนวนหนึ่งที่สุ่มตัวอย่างในช่วงเวลาประมาณ 5 ปี แต่ในรูปแบบที่ผิดปกติมาก บางครั้งมีเดือนระหว่างตัวอย่างบางครั้งมีหลายตัวอย่างในหนึ่งเดือน นอกจากนี้ยังมีจำนวน 0 จำนวน วิธีจัดการกับข้อมูลดังกล่าว? ฉันสามารถวาดกราฟได้อย่างง่ายดายใน R แต่กราฟไม่สว่างโดยเฉพาะเพราะมันเป็นหลุมเป็นบ่อมาก ในแง่ของการสร้างแบบจำลอง - ด้วยสปีชีส์ที่จำลองเป็นฟังก์ชั่นของสิ่งต่าง ๆ - อาจเป็นโมเดลผสม ยินดีต้อนรับการอ้างอิงหรือความคิดใด ๆ รายละเอียดบางอย่างในการตอบสนองต่อความคิดเห็น มีประมาณ 15 ชนิด ฉันกำลังพยายามที่จะรับความคิดเกี่ยวกับแนวโน้มหรือฤดูกาลของปลาแต่ละตัวและดูว่าสปีชีส์สัมพันธ์กันอย่างไร (ลูกค้าของฉันต้องการตารางที่มีความสัมพันธ์อย่างง่าย ๆ ) เป้าหมายคือการอธิบายและการวิเคราะห์ไม่ใช่การทำนาย การแก้ไขเพิ่มเติม: ฉันพบบทความนี้โดย K. Rehfield และคณะซึ่งแนะนำให้ใช้เมล็ดเกาส์เซียนเพื่อประเมิน ACF สำหรับอนุกรมเวลาที่ผิดปกติอย่างมาก http://www.nonlin-processes-geophys.net/18/389/2011/npg-18-389-2011.pdf

4
การปรับปรุงการจำแนกประเภท SVM ของโรคเบาหวาน
ฉันใช้ SVM เพื่อทำนายโรคเบาหวาน ฉันใช้ชุดข้อมูลBRFSSเพื่อจุดประสงค์นี้ ชุดข้อมูลมีขนาดและเบ้ ร้อยละของในตัวแปรเป้าหมายคือขณะที่s เป็นการส่วนที่เหลืออีก\%432607 × 136432607×136432607 \times 136Y89 %11 %11%11\%N89 %89%89\% ฉันกำลังใช้เพียง15ออกจาก136ตัวแปรอิสระจากชุดข้อมูล หนึ่งในเหตุผลในการลดชุดข้อมูลคือต้องมีตัวอย่างการฝึกอบรมเพิ่มเติมเมื่อNAละเว้นแถวที่มีs 15ตัวแปรเหล่านี้ถูกเลือกหลังจากใช้วิธีการทางสถิติเช่นต้นไม้สุ่มการถดถอยโลจิสติกส์และการค้นหาว่าตัวแปรใดมีความสำคัญจากตัวแบบผลลัพธ์ ตัวอย่างเช่นหลังจากรันการถดถอยโลจิสติกเราใช้p-valueในการสั่งซื้อตัวแปรที่สำคัญที่สุด วิธีการเลือกตัวแปรของฉันถูกต้องหรือไม่ ข้อเสนอแนะใด ๆ ที่จะยินดีอย่างมาก ต่อไปนี้คือRการดำเนินการของฉัน library(e1071) # Support Vector Machines #-------------------------------------------------------------------- # read brfss file (huge 135 MB file) #-------------------------------------------------------------------- y <- read.csv("http://www.hofroe.net/stat579/brfss%2009/brfss-2009-clean.csv") indicator <- c("DIABETE2", "GENHLTH", "PERSDOC2", "SEX", "FLUSHOT3", "PNEUVAC3", "X_RFHYPE5", …

2
เมื่อใดจึงจะใช้การกระจายของนักเรียนหรือปกติในการถดถอยเชิงเส้น
ฉันกำลังดูปัญหาและในการทดสอบสัมประสิทธิ์บางครั้งฉันเห็นคนที่ใช้การแจกแจงของนักเรียนและบางครั้งฉันเห็นการแจกแจงแบบปกติ กฎคืออะไร?

3
ความน่าจะเป็นของเหตุการณ์ที่ไม่สามารถวัดได้
เรารู้จากทฤษฎีการวัดว่ามีเหตุการณ์ที่ไม่สามารถวัดได้เช่นพวกเขาไม่สามารถวัดได้จากเกอ เราเรียกเหตุการณ์ที่มีความน่าจะเป็นซึ่งการวัดความน่าจะเป็นไม่ได้กำหนดไว้อย่างไร เราจะสร้างข้อความประเภทใดเกี่ยวกับเหตุการณ์ดังกล่าว

6
เปรียบเทียบ R-squared จาก Random Forest สองรุ่นที่แตกต่างกัน
ฉันใช้แพ็คเกจสุ่มป่าไม้ใน R เพื่อพัฒนาโมเดลฟอเรสต์แบบสุ่มเพื่อพยายามอธิบายผลลัพธ์อย่างต่อเนื่องในชุดข้อมูล "กว้าง" ที่มีตัวทำนายมากกว่าตัวอย่าง โดยเฉพาะฉันเหมาะสมกับโมเดล RF หนึ่งตัวที่อนุญาตให้กระบวนการเลือกชุดตัวแปรพยากรณ์ 75 ตัวที่ฉันคิดว่าสำคัญ ฉันกำลังทดสอบว่าตัวแบบนั้นทำนายผลที่แท้จริงสำหรับชุดการทดสอบที่สงวนไว้อย่างไรโดยใช้วิธีการโพสต์ที่นี่ก่อนหน้านี้คือ ... หรือใน R: 1 - sum((y-predicted)^2)/sum((y-mean(y))^2) แต่ตอนนี้ฉันมีตัวแปรทำนายอีก 25 ตัวที่ฉันสามารถเพิ่มได้ เมื่อใช้ชุดตัวทำนาย ~ 100 ตัวR²จะสูงกว่า ฉันต้องการที่จะทดสอบทางสถิติในคำอื่น ๆ เมื่อใช้ชุดของ ~ 100 ทำนายที่จะทดสอบแบบจำลองอย่างมีนัยสำคัญที่ดีกว่าในการทดสอบข้อมูลกว่ารุ่นพอดีโดยใช้ ~ 75 พยากรณ์ นั่นคือR²จากการทดสอบโมเดล RF บนชุดข้อมูลแบบเต็มสูงกว่าR²อย่างมากจากการทดสอบโมเดล RF บนชุดข้อมูลที่ลดลง นี่เป็นสิ่งสำคัญสำหรับฉันที่จะทดสอบเพราะนี่คือข้อมูลนำร่องและการได้รับผู้ทำนายเพิ่มอีก 25 คนนั้นมีค่าใช้จ่ายสูงและฉันจำเป็นต้องรู้ว่าฉันควรจ่ายเงินเพื่อวัดผู้ทำนายเหล่านั้นในการศึกษาติดตามครั้งใหญ่กว่าหรือไม่ ฉันพยายามคิดถึงวิธี resampling / permutation บางอย่าง แต่ไม่มีสิ่งใดในใจ

3
เกณฑ์สำหรับสัมประสิทธิ์สหสัมพันธ์เพื่อระบุนัยสำคัญทางสถิติของสหสัมพันธ์ในเมทริกซ์สหสัมพันธ์
ฉันได้คำนวณเมทริกซ์สหสัมพันธ์ของชุดข้อมูลซึ่งมีจุดข้อมูล 455 จุดแต่ละจุดมี 14 ลักษณะ ดังนั้นมิติของเมทริกซ์สหสัมพันธ์จึงเท่ากับ 14 x 14 ฉันสงสัยว่ามีเกณฑ์สำหรับค่าของสัมประสิทธิ์สหสัมพันธ์ซึ่งชี้ให้เห็นว่ามีความสัมพันธ์อย่างมีนัยสำคัญระหว่างสองของลักษณะเหล่านั้น ฉันมีค่าอยู่ระหว่าง -0.2 ถึง 0.85 และฉันคิดว่าสิ่งสำคัญคือสิ่งที่สูงกว่า 0.7 มีค่าทั่วไปสำหรับค่าสัมประสิทธิ์สหสัมพันธ์ซึ่งควรได้รับการพิจารณาสำหรับเกณฑ์หรือเป็นเพียงบริบทขึ้นอยู่กับชนิดข้อมูลที่ฉันกำลังตรวจสอบ?

1
มีแนวคิดของข้อมูล“ เพียงพอ” สำหรับการฝึกอบรมแบบจำลองทางสถิติหรือไม่?
ฉันทำงานเกี่ยวกับการสร้างแบบจำลองทางสถิติค่อนข้างมากเช่น Hidden Markov Models และ Gaussian Mixture Models ฉันเห็นว่าแบบจำลองการฝึกอบรมที่ดีในแต่ละกรณีเหล่านี้จำเป็นต้องใช้ข้อมูลจำนวนมาก (> 20,000 ประโยคสำหรับ HMMs) ที่นำมาจากสภาพแวดล้อมที่คล้ายคลึงกันเป็นการใช้งานครั้งสุดท้าย คำถามของฉันคือ: มีแนวคิดของข้อมูลการฝึกอบรมที่ "เพียงพอ" ในวรรณกรรมหรือไม่ ข้อมูลการฝึกอบรม "ดีพอ" เท่าใด ฉันจะคำนวณจำนวนประโยคที่จำเป็นสำหรับโมเดล "ดี" (ที่ให้ความแม่นยำในการรู้จำที่ดี (> 80%)) เพื่อฝึกอบรมได้อย่างไร ฉันจะรู้ได้อย่างไรว่าแบบจำลองได้รับการฝึกฝนอย่างเหมาะสมหรือไม่ สัมประสิทธิ์ในแบบจำลองจะเริ่มแสดงความผันผวนแบบสุ่มหรือไม่? ถ้าเป็นเช่นนั้นฉันจะแยกความผันผวนแบบสุ่มและการเปลี่ยนแปลงจริงเนื่องจากการอัปเดตโมเดลได้อย่างไร โปรดอ่านคำถามนี้ซ้ำในกรณีที่ต้องการแท็กเพิ่มเติม

2
มีแบบจำลองสถิติพอดี (เช่น AIC หรือ BIC) ที่สามารถใช้สำหรับสัมบูรณ์แทนการเปรียบเทียบแบบเปรียบเทียบได้หรือไม่
ฉันไม่คุ้นเคยกับวรรณกรรมนี้ดังนั้นโปรดยกโทษให้ฉันถ้านี่เป็นคำถามที่ชัดเจน เนื่องจาก AIC และ BIC ขึ้นอยู่กับการเพิ่มโอกาสให้มากที่สุดดูเหมือนว่าพวกเขาสามารถนำมาใช้เพื่อทำการเปรียบเทียบแบบเปรียบเทียบระหว่างชุดของแบบจำลองที่พยายามให้พอดีกับชุดข้อมูลที่กำหนด ตามความเข้าใจของฉันมันไม่สมเหตุสมผลเลยที่จะคำนวณ AIC สำหรับรุ่น A บนชุดข้อมูล 1 คำนวณ AIC สำหรับรุ่น B ในชุดข้อมูล 2 จากนั้นเปรียบเทียบค่า AIC ทั้งสองและตัดสินว่า (เช่น) รุ่น A เหมาะกับชุดข้อมูล 1 ดีกว่ารุ่น B เหมาะกับชุดข้อมูล 2 หรือบางทีฉันเข้าใจผิดและนั่นเป็นสิ่งที่สมเหตุสมผลที่ต้องทำ โปรดแจ้งให้เราทราบ คำถามของฉันคือ: มีแบบจำลองสถิติพอดีที่สามารถใช้สำหรับสัมบูรณ์แทนการเปรียบเทียบแบบเปรียบเทียบได้หรือไม่ สำหรับโมเดลเชิงเส้นบางอย่างเช่นจะทำงานได้ มันมีช่วงที่กำหนดไว้และมีระเบียบวินัยความคิดเฉพาะเกี่ยวกับสิ่งที่เป็นค่า "ดี" ฉันกำลังมองหาบางอย่างที่กว้างกว่าและคิดว่าฉันสามารถเริ่มต้นด้วยการส่งผู้เชี่ยวชาญมาที่นี่ ฉันแน่ใจว่ามีบางคนเคยคิดเกี่ยวกับสิ่งนี้มาก่อน แต่ฉันไม่รู้จักคำศัพท์ที่เหมาะสมเพื่อทำการค้นหาที่มีประสิทธิภาพใน Google ScholarR2R2R^2 ความช่วยเหลือใด ๆ ที่จะได้รับการชื่นชม

1
จะเปลี่ยนฟังก์ชั่นให้เป็นความหนาแน่นของความน่าจะเป็นในขณะที่รักษารูปร่างของฟังก์ชันได้อย่างไร?
ฉันมีชุดของฟังก์ชั่นแต่ละคนควรจะเป็นตัวแทนของความหนาแน่นของตัวแปรสุ่มในตัวแทน แต่ละฟังก์ชั่นยังมีโดเมนซึ่งอธิบายถึงค่าของตัวแปรสุ่มที่ถูกต้อง ตอนนี้ถ้าฉันจำคลาสสถิติของฉันได้อย่างถูกต้องถ้าฉันนำส่วนใดส่วนหนึ่งของฟังก์ชั่นข้ามค่าที่อธิบายโดยโดเมนของฟังก์ชั่นที่ฉันควรได้รับค่า 1.0 สิ่งนี้ไม่ได้เกิดขึ้น มีเทคนิคการทำให้เป็นมาตรฐานที่สามารถเปลี่ยนฟังก์ชั่นให้เป็นความหนาแน่นของความน่าจะเป็นที่แท้จริง แต่ยังคงรักษารูปร่างของฟังก์ชันหรือไม่ ฟังก์ชั่นทั้งหมดอยู่ในรูปแบบโดยที่คือตัวแปรสุ่มและยังคงค่าคงที่xa,b,cabx+cabx+c\frac{a}{bx}+cxxxa,b,ca,b,ca,b,c

3
รวมสองชุดเวลาโดยเฉลี่ยจุดข้อมูล
ฉันต้องการรวมการคาดการณ์และการย้อนกลับ (กล่าวคือค่าที่ผ่านมาที่คาดการณ์) ของข้อมูลอนุกรมเวลาที่ตั้งค่าไว้ในอนุกรมเวลาหนึ่งโดยลดข้อผิดพลาดการคาดคะเนค่าเฉลี่ยกำลังสองลง สมมติว่าฉันมีอนุกรมเวลาตั้งแต่ 2001-2010 โดยมีช่องว่างสำหรับปี 2550 ฉันสามารถคาดการณ์ปี 2007 โดยใช้ข้อมูล 2001-2007 (เส้นสีแดง - เรียกว่า ) และกลับโดยใช้ข้อมูล 2008-2009 (สีน้ำเงินอ่อน) สาย - เรียกมันว่า )Y bYfYfY_fYbYbY_b ฉันต้องการรวมจุดข้อมูลของและเป็นจุดข้อมูลที่ระบุ Y_i ในแต่ละเดือน จะเป็นการดีที่ฉันต้องการที่จะได้รับน้ำหนักดังกล่าวว่าจะช่วยลดข้อผิดพลาดในการทำนาย Mean Squared (MSPE) ของY_iหากเป็นไปไม่ได้ฉันจะหาค่าเฉลี่ยระหว่างจุดข้อมูลของอนุกรมเวลาสองชุดได้อย่างไรY b w Y iYfYfY_fYbYbY_bwwwYiYiY_i Yi=w⋅Yf+(1−w)⋅YbYi=w⋅Yf+(1−w)⋅YbY_i = w\cdot Y_f + (1-w)\cdot Y_b เป็นตัวอย่างรวดเร็ว: tt_f <- ts(1:12, start = 2007, freq …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.