สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
อนุกรมเวลาตามฤดูกาลหมายถึงอนุกรมเวลาที่อยู่กับที่หรือหยุดนิ่ง
หากฉันมีอนุกรมเวลาที่มีฤดูกาลนี่จะทำให้ซีรีส์หยุดโดยอัตโนมัติหรือไม่? สัญชาตญาณของฉัน (อาจปิด) คือมันไม่ได้ ฤดูกาลหมายถึงซีรีส์ขึ้นและลงรอบค่าคงที่ .... บางอย่างเช่นคลื่นไซน์ ดังนั้นตรรกะนี้อนุกรมเวลาที่มีฤดูกาลคือซีรีย์นิ่ง (อ่อน) (ค่าเฉลี่ยคงที่) มันผิดหรือเปล่า? ทำไม?

1
ความคงที่เชิงพื้นที่ที่แท้จริง: มันไม่ได้ใช้เฉพาะกับความล่าช้าเล็ก ๆ เท่านั้นหรือ
จากคำจำกัดความของความนิ่งที่แท้จริง: E[ Z( x ) - Z( x - h ) ] = 0E[Z(x)−Z(x−h)]=0E[Z(x)-Z(x-h)] = 0 สมมติฐานนี้ใช้เป็นตัวอย่างใน kriging ธรรมดาแทนที่จะสมมติค่าเฉลี่ยคงที่ทั่วทั้งพื้นที่เราถือว่าค่าเฉลี่ยคงที่ในพื้นที่ หากค่าเฉลี่ยคงที่ในละแวกใกล้เคียงเราคาดหวังความแตกต่างระหว่างการวัดสองค่าใกล้กันเป็นศูนย์ แต่เมื่อค่าเฉลี่ยแตกต่างกันไปตามพื้นที่เราไม่คาดหวังความแตกต่างของค่าที่อยู่ห่างจากกันเป็นศูนย์หรือไม่ ดังนั้นการสันนิษฐานของความนิ่งภายในไม่ควร: E[Z(x)−Z(x−h)]=0E[Z(x)−Z(x−h)]=0E[Z(x)-Z(x-h)] = 0สำหรับh→0h→0h \to 0
10 spatial 

1
การจัดการข้อมูลมีข้อผิดพลาด 'คิดราคา' ในการวิเคราะห์เชิงสถิติหรือไม่
ตกลงคำเตือนอย่างยุติธรรม - นี่เป็นคำถามเชิงปรัชญาที่ไม่เกี่ยวข้องกับตัวเลข ฉันได้คิดมากเกี่ยวกับข้อผิดพลาดที่คืบคลานเข้าไปในชุดข้อมูลเมื่อเวลาผ่านไปและวิธีการที่นักวิเคราะห์ควรปฏิบัติต่อ - หรือว่าควรจะมีความสำคัญอย่างไร สำหรับพื้นหลังฉันกำลังทำการวิเคราะห์เกี่ยวกับการศึกษาระยะยาวที่เกี่ยวข้องกับชุดข้อมูลจำนวนมากที่อาจถูกรวบรวมโดยคน 25 คนในช่วง 7-8 ปีที่ผ่านมา - ไม่มีใครเคยนำข้อมูลทั้งหมดมาสู่โครงสร้างที่สอดคล้องกัน (นั่นคืองานของฉัน) ฉันทำการป้อนข้อมูลจำนวนมาก (คัดลอกจากสมุดบันทึกของแล็บเก่า) และฉันก็พบข้อผิดพลาดเล็ก ๆ น้อย ๆ ที่คนอื่นทำรวมถึงการค้นหารายการข้อมูลที่อ่านยากหรือเป็นไปไม่ได้ส่วนใหญ่เป็นเพราะหมึก ได้จางหายไปเมื่อเวลาผ่านไป ฉันใช้บริบทเพื่อ 'คาดเดาที่ดีที่สุด' เกี่ยวกับสิ่งที่ข้อมูลพูดและออกจากจุดข้อมูลโดยสิ้นเชิงถ้าฉันไม่แน่ใจ แต่ฉันคิดถึงความจริงที่ว่าทุกครั้งที่มีการคัดลอกข้อมูลความถี่ของข้อผิดพลาดจะเพิ่มขึ้นอย่างหลีกเลี่ยงไม่ได้จนกว่าข้อมูลต้นฉบับจะสูญหายอย่างสมบูรณ์ ดังนั้นสิ่งนี้ทำให้ฉันมีความคิด: นอกเหนือจากข้อผิดพลาดของเครื่องมือ / การวัดและข้อผิดพลาดในการบันทึกมีองค์ประกอบ 'ข้อผิดพลาดในการจัดการข้อมูลพื้นฐาน' ที่จะเพิ่มขึ้นเมื่อเวลาผ่านไปและด้วยการจัดการข้อมูลมากขึ้น อีกวิธีหนึ่งในการระบุกฎข้อที่ 2 ของอุณหพลศาสตร์ใช่ไหมเอนโทรปีของข้อมูลจะเพิ่มขึ้นเสมอ) ดังนั้นฉันสงสัยว่าควรมี 'การแก้ไข' ที่นำเสนอเพื่ออธิบายประวัติชีวิตของชุดข้อมูลหรือไม่ (คล้ายกับการแก้ไข Bonferroni) กล่าวอีกนัยหนึ่งเราควรสมมติว่าชุดข้อมูลที่เก่ากว่าหรือมากกว่าที่คัดลอกนั้นมีความแม่นยำน้อยกว่าและหากเป็นเช่นนั้น แต่แล้วความคิดอื่น ๆ ของฉันก็คือความผิดพลาดนั้นเป็นส่วนหนึ่งของการรวบรวมข้อมูลและการจัดการข้อมูลและเนื่องจากการทดสอบทางสถิติทั้งหมดได้รับการพัฒนาด้วยข้อมูลในโลกแห่งความจริงบางทีแหล่งที่มาของข้อผิดพลาดเหล่านี้ นอกจากนี้ประเด็นที่ควรกล่าวถึงอีกประการหนึ่งคือเนื่องจากข้อผิดพลาดของข้อมูลเป็นแบบสุ่มพวกเขามีแนวโน้มที่จะลดความแข็งแรงของการค้นพบมากกว่าที่จะปรับปรุง - กล่าวอีกนัยหนึ่งข้อผิดพลาดในการจัดการข้อมูลจะทำให้เกิดข้อผิดพลาดประเภทที่ 2 . ดังนั้นในบริบทจำนวนมากหากคุณกำลังใช้ข้อมูลเก่า …
10 dataset  error 

2
ทำไมข้อผิดพลาดการวัดในตัวแปรตามไม่ทำให้เกิดผลลัพธ์
เมื่อมีข้อผิดพลาดในการวัดในตัวแปรอิสระฉันเข้าใจว่าผลลัพธ์นั้นจะเอนเอียงกับ 0 เมื่อตัวแปรที่ขึ้นอยู่กับการวัดที่มีข้อผิดพลาดพวกเขาบอกว่ามันมีผลต่อข้อผิดพลาดมาตรฐาน แต่สิ่งนี้ไม่สมเหตุสมผลสำหรับฉันเพราะเรา การประเมินผลของไม่ได้อยู่ในตัวแปรดั้งเดิมแต่มีผลต่ออื่น ๆรวมถึงข้อผิดพลาด ดังนั้นสิ่งนี้จะไม่ส่งผลกระทบต่อประมาณการ ในกรณีนี้ฉันสามารถใช้ตัวแปรเครื่องมือเพื่อลบปัญหานี้ได้หรือไม่XXXYYYYYY

1
แสดงว่าถ้า
ปัจจุบันติดอยู่ที่นี่ฉันรู้ว่าฉันควรใช้ค่าเบี่ยงเบนเฉลี่ยของการแจกแจงทวินาม แต่ฉันไม่สามารถหา

3
glm ใน R - pvalue ใดที่แสดงให้เห็นถึงความดีของแบบเต็มรูปแบบ?
ฉันกำลังเรียกใช้ glms ใน R (โมเดลเชิงเส้นเชิงเส้นทั่วไป) ฉันคิดว่าฉันรู้จัก pvalues ​​- จนกระทั่งฉันเห็นว่าการเรียกสรุปสำหรับ glm ไม่ได้ให้ตัวแทน pvalue ที่เอาชนะคุณของโมเดลทั้งหมด - อย่างน้อยก็ไม่ได้อยู่ในตำแหน่งที่โมเดลเชิงเส้นทำ ฉันสงสัยว่าสิ่งนี้จะได้รับเป็นค่าสำหรับการสกัดกั้นที่ด้านบนของตารางค่าสัมประสิทธิ์ ดังนั้นในตัวอย่างต่อไปนี้ในขณะที่ Wind.speed .. knots และ canopy_density อาจมีความสำคัญต่อตัวแบบเราจะรู้ได้อย่างไรว่าตัวแบบนั้นสำคัญหรือไม่ ฉันจะรู้ได้อย่างไรว่าจะเชื่อใจคุณค่าเหล่านี้หรือไม่ ฉันถูกสงสัยหรือไม่ว่า Pr (> | z |) สำหรับ (Intercept) แสดงถึงความสำคัญของตัวแบบ? รุ่นนี้มีความหมายหรือไม่? ขอบคุณ! ฉันควรทราบว่าการใช้การทดสอบแบบ F จะไม่ทำให้เกิดความเสียหายเนื่องจากฉันได้รับข้อความแสดงข้อผิดพลาดที่บอกว่าการทดสอบแบบ F ในครอบครัวแบบทวินามนั้นไม่เหมาะสม Call: glm(formula = Empetrum_bin ~ Wind.speed..knots. + canopy_density, family = …

3
การวิเคราะห์อนุกรมเวลากับการเรียนรู้ของเครื่อง?
แค่คำถามทั่วไป หากคุณมีข้อมูลอนุกรมเวลาจะใช้เทคนิคอนุกรมเวลา (aka ARCH, GARCH และอื่น ๆ ) ได้อย่างไรเมื่อใช้เทคนิคการเรียนรู้ด้วยเครื่อง / สถิติ (KNN, การถดถอย) หากมีคำถามที่คล้ายกันที่มีอยู่ในการประเมินค่าข้ามจุดโปรดชี้ฉันไปทางนั้น - มองแล้วไม่สามารถหาคำถามได้

4
ทำไมไม่บันทึกการแปลงตัวแปรทั้งหมดที่ไม่เป็นที่สนใจหลัก?
หนังสือและการอภิปรายมักระบุว่าเมื่อเผชิญกับปัญหา (ซึ่งมีไม่กี่) กับตัวทำนาย, log-transformimg มันเป็นไปได้ ตอนนี้ฉันเข้าใจว่าสิ่งนี้ขึ้นอยู่กับการแจกแจงและความปกติในตัวทำนายไม่ได้เป็นข้อสันนิษฐานของการถดถอย แต่การบันทึกการเปลี่ยนแปลงจะทำให้ข้อมูลมีความสม่ำเสมอมากขึ้นได้รับผลกระทบจากค่าผิดปกติน้อยลงเรื่อย ๆ ฉันคิดเกี่ยวกับการบันทึกการเปลี่ยนตัวแปรต่อเนื่องทั้งหมดของฉันซึ่งไม่ได้เป็น interesr หลักเช่นตัวแปรที่ฉันปรับเท่านั้น มันผิดหรือเปล่า? ดี? ไร้ประโยชน์?

2
วิธีที่ดีที่สุดในการสร้างแผนภูมิการเติบโต
ฉันต้องสร้างแผนภูมิ (คล้ายกับแผนภูมิการเจริญเติบโต) สำหรับเด็กอายุ 5 ถึง 15 ปี (เพียง 5,6,7 และอื่น ๆ ไม่มีค่าเศษส่วนเช่น 2.6 ปี) สำหรับตัวแปรสุขภาพที่ไม่เป็นลบต่อเนื่องและใน ช่วง 50-150 (มีเพียงไม่กี่ค่าที่อยู่นอกช่วงนี้) ฉันต้องสร้างกราฟไทล์เปอร์ไทล์ 90th, 95 และ 99 และสร้างตารางสำหรับเปอร์เซนต์เหล่านี้ ขนาดตัวอย่างประมาณ 8000 ฉันตรวจสอบและพบวิธีที่เป็นไปได้ดังต่อไปนี้: ค้นหา quantiles แล้วใช้วิธีเหลืองเพื่อให้ได้เส้นโค้งที่ราบรื่นจาก quantiles เหล่านี้ ระดับของความนุ่มนวลสามารถปรับได้โดยใช้พารามิเตอร์ 'span' ใช้วิธี LMS (Lambda-Mu-Sigma) (เช่นใช้ gamlss หรือแพ็คเกจ VGAM ใน R) ใช้การถดถอยเชิงปริมาณ ใช้ค่าเฉลี่ยและค่า SD ของแต่ละกลุ่มอายุในการประมาณเปอร์เซ็นต์ไทล์สำหรับอายุนั้นและสร้างกราฟไทล์ไทล์ไทล์ วิธีที่ดีที่สุดที่จะทำคืออะไร? โดย 'ดีที่สุด' …

1
การทำนายความน่าจะเป็นป่าแบบสุ่มเทียบกับคะแนนโหวตส่วนใหญ่
Scikit เรียนรู้ดูเหมือนว่าจะใช้การทำนายความน่าจะเป็นแทนการลงคะแนนเสียงข้างมากสำหรับเทคนิคการรวมตัวแบบโดยไม่มีการอธิบายว่าทำไม (1.9.2.1. ป่าสุ่ม) มีคำอธิบายที่ชัดเจนว่าเพราะเหตุใด นอกจากนี้ยังมีบทความหรือบทความทบทวนที่ดีสำหรับเทคนิคการรวมตัวแบบต่างๆที่สามารถนำมาใช้สำหรับการบรรจุถุงแบบฟอเรสต์? ขอบคุณ!

2
เอาต์พุตของ Scikit SVM ในการจัดประเภทแบบหลายคลาสจะให้ฉลากเหมือนกันเสมอ
ฉันกำลังใช้ Scikit เรียนรู้ด้วยรหัสต่อไปนี้: clf = svm.SVC(C=1.0, tol=1e-10, cache_size=600, kernel='rbf', gamma=0.0, class_weight='auto') จากนั้นจัดทำและคาดการณ์ชุดข้อมูลที่มีป้ายกำกับ 7 รายการที่แตกต่างกัน ฉันได้ผลลัพธ์ที่แปลก ไม่ว่าจะใช้เทคนิคการตรวจสอบความถูกต้องแบบไขว้ใดฉันใช้ป้ายกำกับที่คาดการณ์ไว้ในชุดการตรวจสอบความถูกต้องจะเป็นป้ายกำกับ 7 ฉันพยายามที่พารามิเตอร์อื่น ๆ บางคนรวมทั้งคนเริ่มต้นเล่ม ( svm.SVC()) แต่ตราบใดที่การใช้วิธีการที่ฉันเคอร์เนลrbfแทนpolyหรือlinearมันก็จะไม่ทำงานในขณะที่มันทำงานจริงๆดีสำหรับการและpolylinear นอกจากนี้ฉันได้ลองทำนายข้อมูลรถไฟแทนข้อมูลการตรวจสอบแล้วและมันก็พอดี ไม่มีใครเห็นปัญหาแบบนี้มาก่อนและรู้ว่าเกิดอะไรขึ้นที่นี่? ฉันไม่เคยดูรายละเอียดชั้นเรียนของฉัน แต่ฉันรู้ว่ามันควรจะประมาณ 30% ของพวกเขาคือ 7, 14% คือ 4 ฉันลองใช้การปรับใช้ 1-vs-rest ด้วยตนเองและยังไม่เป็นประโยชน์

1
bayesglm (แขน) กับ MCMCpack
ทั้งbayesglm()(ในแพ็คเกจ R) และฟังก์ชั่นต่าง ๆ ในแพ็คเกจ MCMCpack มีวัตถุประสงค์เพื่อทำการประมาณค่าแบบจำลองเชิงเส้นแบบเบย์แบบเบย์ แต่ฉันไม่แน่ใจว่าพวกเขากำลังคำนวณสิ่งเดียวกัน ฟังก์ชั่น MCMCpack ใช้โซ่มาร์คอฟ Monte Carlo เพื่อให้ได้ตัวอย่าง (ขึ้นอยู่กับ) จากส่วนหลังของข้อต่อสำหรับพารามิเตอร์รุ่น bayesglm()ในทางกลับกันผลิตผล ฉันไม่แน่ใจ ดูเหมือนbayesglm()จะสร้างการประมาณค่าแบบจุดซึ่งจะทำให้การประมาณค่า MAP (สูงสุดหลัง) แทนที่จะเป็นการประมาณแบบเบย์แบบเต็ม แต่มีsim()ฟังก์ชั่นที่ดูเหมือนว่าสามารถใช้ในการดึงหลังได้ บางคนสามารถอธิบายความแตกต่างในการใช้งานทั้งสองอย่างได้ไหม สามารถbayesglm() + sim()ผลิตหลังดึงที่แท้จริงหรือมันเป็นประมาณบางชนิด?

3
วิธีการดึงข้อมูลจากเมทริกซ์สแคทเทอร์พล็อตเมื่อคุณมี N ขนาดใหญ่ข้อมูลแยกและตัวแปรจำนวนมาก
ฉันกำลังเล่นกับชุดข้อมูลมะเร็งเต้านมและสร้าง scatterplot ของคุณลักษณะทั้งหมดเพื่อให้ได้ไอเดียว่าอันไหนมีผลมากที่สุดในการทำนายคลาสmalignant(สีน้ำเงิน) ของbenign(สีแดง) ฉันเข้าใจว่าแถวนั้นแทนแกน x และคอลัมน์แทนแกน y แต่ฉันไม่เห็นว่าการสังเกตใดที่ฉันสามารถทำได้เกี่ยวกับข้อมูลหรือคุณลักษณะจากสแกตเตอร์แปลงนี้ ฉันกำลังมองหาความช่วยเหลือในการตีความ / ทำการสังเกตเกี่ยวกับข้อมูลจาก scatterplot นี้หรือถ้าฉันควรใช้การสร้างภาพข้อมูลอื่น ๆ เพื่อให้เห็นภาพข้อมูลนี้ ฉันใช้รหัส R link <- "http://www.cs.iastate.edu/~cs573x/labs/lab1/breast-cancer-wisconsin.arff" breast <- read.arff(link) cols <- character(nrow(breast)) cols[] <- "black" cols[breast$class == 2] <- "red" cols[breast$class == 4] <- "blue" pairs(breast, col=cols)

1
ความสอดคล้องของ 2SLS พร้อมกับตัวแปรภายนอก Binary
ฉันได้อ่านว่าตัวประมาณค่า 2SLS ยังคงสอดคล้องกันแม้จะมีตัวแปร endogenous แบบไบนารี ( http://www.stata.com/statalist/archive/2004-07/msg00699.html ) ในระยะแรกจะใช้โมเดลการรักษาแบบ Probit แทนแบบจำลองเชิงเส้น มีหลักฐานที่เป็นทางการใด ๆ ที่แสดงว่า 2SLS ยังคงสอดคล้องกันแม้ในระยะที่ 1 เป็น probit หรือ logit model? แล้วถ้าผลออกมาเป็นเลขฐานสองล่ะ? ฉันเข้าใจว่าถ้าเรามีผลลัพธ์แบบไบนารีและตัวแปร endogenous แบบไบนารี (ขั้นตอนที่ 1 และ 2 เป็นทั้งแบบไบนารี probit / logit) การเลียนแบบวิธี 2SLS จะสร้างการประมาณที่ไม่สอดคล้องกัน มีหลักฐานอย่างเป็นทางการสำหรับเรื่องนี้หรือไม่? หนังสือเศรษฐมิติของ Wooldridge มีการพูดคุยกันบ้าง แต่ฉันคิดว่ามันไม่มีข้อพิสูจน์ที่ชัดเจนในการแสดงความไม่ลงรอยกัน data sim; do i=1 to 500000; iv=rand("normal",0,1); x2=rand("normal",0,1); …

2
วิธีตรวจสอบการคาดการณ์ของอนุกรมเวลา
หนึ่งในประเด็นสำคัญที่นักพยากรณ์ประสบคือถ้าซีรีส์ที่กำหนด สามารถคาดการณ์ได้หรือไม่? ฉันสะดุดกับบทความเรื่อง " เอนโทรปีในฐานะตัวบ่งชี้การพยากรณ์ของ Priori " โดย Peter Catt ที่ใช้Entropimate Entropy (ApEn) เป็นตัวชี้วัดที่สัมพันธ์กันเพื่อกำหนดชุดเวลาที่กำหนด บทความกล่าวว่า "ค่า ApEn ที่เล็กลงบ่งชี้ว่ามีโอกาสมากขึ้นที่ชุดข้อมูลจะตามด้วยข้อมูลที่คล้ายกัน (ความเป็นปกติ) ในทางกลับกันค่าที่ใหญ่กว่าของ ApEn บ่งชี้ว่าโอกาสที่ข้อมูลที่คล้ายกันซ้ำกันจะลดลง การสุ่มและความซับซ้อนของระบบ " และตามด้วยสูตรทางคณิตศาสตร์สำหรับการคำนวณ ApEn นี่เป็นวิธีการที่น่าสนใจเพราะให้ค่าตัวเลขที่สามารถใช้ในการประเมินความคาดการณ์ในแง่ที่เกี่ยวข้อง ฉันไม่รู้ว่า Entropy หมายถึงอะไรฉันกำลังอ่านเพิ่มเติมเกี่ยวกับเรื่องนี้ มีแพคเกจที่เรียกว่าเป็นpracmaในRที่ช่วยให้คุณคำนวณ Apen เพื่อวัตถุประสงค์ในการอธิบายฉันใช้อนุกรมเวลา 3 แบบและคำนวณตัวเลข ApEn อันดับ 1:ซีรี่ส์เวลาของ AirPassenger ที่มีชื่อเสียง - ถูกกำหนดไว้สูงและเราควรคาดการณ์ได้ง่าย Series 2: Sunspot Time Series - ถูกกำหนดไว้อย่างดี แต่ควรคาดการณ์ได้น้อยกว่า …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.