สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
ความสัมพันธ์ที่สามารถบรรลุได้สำหรับตัวแปรสุ่มแบบเลขชี้กำลัง
ช่วงของความสัมพันธ์ที่สามารถบรรลุได้สำหรับคู่ของตัวแปรสุ่มแบบกระจายและโดยที่คืออะไร พารามิเตอร์อัตรา?X1∼Exp(λ1)X1∼Exp(λ1)X_1 \sim {\rm Exp}(\lambda_1)X2∼Exp(λ2)X2∼Exp(λ2)X_2 \sim {\rm Exp}(\lambda_2)λ1,λ2>0λ1,λ2>0\lambda_1, \lambda_2 > 0

2
การพยากรณ์อนุกรมเวลารายชั่วโมงโดยมีรายวันรายสัปดาห์และรายปี
การแก้ไขที่สำคัญ: ฉันต้องการจะพูดขอบคุณมากสำหรับเดฟและนิคจนถึงตอนนี้สำหรับคำตอบของพวกเขา ข่าวดีก็คือฉันได้วนไปทำงาน (หลักการยืมมาจากโพสต์ของศ. Hydnman ในการพยากรณ์ชุด) ในการรวมการสืบค้นที่คงค้าง: a) ฉันจะเพิ่มจำนวนการทำซ้ำสูงสุดสำหรับ auto.arima ได้อย่างไร - ดูเหมือนว่ามีตัวแปรภายนอกจำนวนมาก auto.arima กำลังกดปุ่มการทำซ้ำสูงสุดก่อนที่จะมาบรรจบกับรุ่นสุดท้าย โปรดแก้ไขฉันหากฉันเข้าใจผิด b) หนึ่งคำตอบจาก Nick เน้นว่าการคาดคะเนของฉันสำหรับช่วงเวลารายชั่วโมงนั้นมาจากช่วงเวลารายชั่วโมงเท่านั้นและไม่ได้รับอิทธิพลจากเหตุการณ์ที่เกิดขึ้นก่อนหน้านี้ในวันนั้น สัญชาตญาณของฉันจากการจัดการกับข้อมูลนี้บอกฉันว่าสิ่งนี้ไม่ควรทำให้เกิดปัญหาสำคัญ แต่ฉันเปิดรับข้อเสนอแนะเกี่ยวกับวิธีจัดการกับสิ่งนี้ c) เดฟชี้ให้เห็นว่าฉันต้องการวิธีการที่ซับซ้อนกว่านี้ในการระบุเวลารอคอย / เวลาล่าช้าโดยรอบตัวแปรตัวทำนายของฉัน ใครบ้างมีประสบการณ์กับวิธีการเขียนโปรแกรมนี้ใน R? ฉันคาดหวังว่าจะมีข้อ จำกัด แต่ฉันต้องการใช้โครงการนี้ให้ไกลที่สุดเท่าที่จะทำได้และฉันไม่สงสัยเลยว่าสิ่งนี้จะต้องใช้กับผู้อื่นที่นี่เช่นกัน d) แบบสอบถามใหม่ แต่เกี่ยวข้องกับงานที่ทำโดยอัตโนมัติ - auto.arima พิจารณาผู้จดทะเบียนเมื่อเลือกคำสั่งซื้อหรือไม่ ฉันพยายามที่จะคาดการณ์การเข้าชมร้านค้า ฉันต้องการความสามารถในการบัญชีสำหรับวันหยุดที่เคลื่อนไหวปีอธิกสุรทินและกิจกรรมประปราย บนพื้นฐานนี้ฉันรวบรวมว่า ARIMAX เป็นทางออกที่ดีที่สุดของฉันโดยใช้ตัวแปรภายนอกเพื่อลองและจำลองแบบฤดูกาลตามฤดูกาลรวมถึงปัจจัยต่างๆดังกล่าวข้างต้น ข้อมูลจะถูกบันทึกตลอด 24 ชั่วโมงทุก ๆ ชั่วโมง นี่เป็นการพิสูจน์ว่าเป็นปัญหาเนื่องจากจำนวนศูนย์ในข้อมูลของฉันโดยเฉพาะอย่างยิ่งในช่วงเวลาของวันที่เห็นปริมาณการเข้าชมต่ำมากบางครั้งก็ไม่มีเลยเมื่อเปิดร้าน นอกจากนี้เวลาเปิดทำการค่อนข้างไม่แน่นอน นอกจากนี้เวลาในการคำนวณยังมีขนาดใหญ่มากเมื่อทำการคาดการณ์ว่าเป็นอนุกรมเวลาที่สมบูรณ์หนึ่งชุดที่มีข้อมูลย้อนหลัง …

2
Heteroskedasticity และภาวะปกติ
ฉันมีการถดถอยเชิงเส้นที่ค่อนข้างดีฉันเดา (สำหรับโครงการมหาวิทยาลัยดังนั้นฉันจึงไม่จำเป็นต้องแม่นยำอย่างแท้จริง) ประเด็นคือถ้าฉันพล็อตส่วนที่เหลือเทียบกับค่าที่คาดการณ์ไว้มี (ตามครูของฉัน) มีคำใบ้ของ heteroskedasticity แต่ถ้าฉันพล็อต QQ-Plot ของส่วนที่เหลือก็เป็นที่ชัดเจนว่าพวกมันกระจายตามปกติ ยิ่งกว่านั้นการทดสอบชาปิโร่เกี่ยวกับส่วนที่เหลือมีค่าเท่ากับดังนั้นฉันคิดว่าไม่ต้องสงสัยเลยว่าโดยปกติการกระจายตัวของสิ่งที่เหลืออยู่พีพีp0.80.80.8 คำถาม:จะมีค่า heteroskedasticity ในการทำนายค่าได้อย่างไรถ้ามีการแจกแจงเศษตกค้างตามปกติ?

1
test vs -tests?
ฉันพยายามคิดให้ชัดเจนว่าอะไรคือความแตกต่างระหว่างการทดสอบและการทดสอบztttzzz เท่าที่ฉันสามารถบอกได้ว่าสำหรับการทดสอบทั้งสองคลาสเราใช้สถิติการทดสอบเดียวกันซึ่งเป็นรูปแบบบางอย่าง b^−Cseˆ(b^)b^−Cse^(b^)\frac{\hat{b} - C}{\widehat{\operatorname{se}}(\hat{b})} ที่เป็นตัวอย่างสถิติคือการอ้างอิงบางอย่าง (ที่ตั้ง) ค่าคงที่ (ซึ่งขึ้นอยู่กับรายการของการทดสอบ) และเป็นมาตรฐาน ข้อผิดพลาดของ{ข} C ^ SE (ข )ขb^b^\hat{b}CCCseˆ(b^)se^(b^)\widehat{\operatorname{se}}(\hat{b})b^b^\hat{b} แตกต่างเพียงแล้วระหว่างทั้งสองชั้นของการทดสอบก็คือว่าในกรณีของ -tests สถิติการทดสอบข้างต้นดังต่อไปนี้ -distribution (สำหรับตัวอย่างที่กำหนดบางองศาของเสรีภาพ ) ในขณะที่ในกรณีของ -tests, สถิติการทดสอบเดียวกันดังต่อไปนี้การกระจายมาตรฐานปกติ1) (นี่เป็นการชี้ให้เห็นว่าการเลือกของ -test หรือ -test นั้นควบคุมโดยตัวอย่างที่มีขนาดใหญ่พอหรือไม่)t d z N ( 0 , 1 ) z tttttttdddZZzยังไม่มีข้อความ( 0 , 1 )ยังไม่มีข้อความ(0,1)\mathcal{N}(0, 1)ZZzเสื้อเสื้อt ถูกต้องหรือไม่

1
การวิเคราะห์ปัจจัยแบบไดนามิกเทียบกับแบบจำลองพื้นที่ของรัฐ
แพ็คเกจ MARSS ใน R เสนอฟังก์ชันสำหรับการวิเคราะห์ตัวประกอบแบบไดนามิก ในแพคเกจนี้ตัวแบบไดนามิกแฟคเตอร์ถูกเขียนเป็นรูปแบบพิเศษของแบบจำลองพื้นที่รัฐและพวกเขาคิดว่าแนวโน้มทั่วไปเป็นไปตามกระบวนการ AR (1) เนื่องจากฉันไม่คุ้นเคยกับสองวิธีนี้ฉันจึงมาพร้อมกับคำถามสองข้อ: การวิเคราะห์ปัจจัยแบบไดนามิกเป็นรูปแบบพิเศษของแบบจำลองพื้นที่ของรัฐหรือไม่ ความแตกต่างระหว่างสองวิธีคืออะไร? นอกจากนี้การวิเคราะห์ปัจจัยแบบไดนามิกไม่จำเป็นต้องถือว่าแนวโน้มทั่วไปเป็นกระบวนการ AR (1) มีแพ็คเกจใดบ้างที่อนุญาตให้มีแนวโน้มทั่วไปว่าเป็น ARIMA ตามฤดูกาล (หรือบางอย่าง) กระบวนการ?

1
การจัดการแบบจำลองการถดถอยโลจิสติก
ฉันต้องการเข้าใจว่าโค้ดต่อไปนี้กำลังทำอะไร คนที่เขียนรหัสไม่สามารถใช้งานได้ที่นี่อีกต่อไปและเกือบจะไม่มีเอกสารทั้งหมด ฉันถูกขอให้ตรวจสอบโดยคนที่คิดว่า " เป็นแบบจำลองการถดถอยโลจิสติกแบบเบย์ " bglm <- function(Y,X) { # Y is a vector of binary responses # X is a design matrix fit <- glm.fit(X,Y, family = binomial(link = logit)) beta <- coef(fit) fs <- summary.glm(fit) M <- t(chol(fs$cov.unscaled)) betastar <- beta + M %*% rnorm(ncol(M)) p <- …

3
การสร้างแบบจำลองทางคณิตศาสตร์แบบเครือข่ายประสาทเทียมเป็นแบบกราฟิก
ฉันกำลังดิ้นรนเพื่อให้การเชื่อมต่อทางคณิตศาสตร์ระหว่างเครือข่ายประสาทและแบบจำลองกราฟิก ในแบบกราฟิกความคิดนั้นง่ายมาก: การแจกแจงความน่าจะเป็นเป็นตัวประกอบตามกลุ่มในกราฟโดยทั่วไปแล้วศักยภาพนั้นเป็นของตระกูลเอ็กซ์โพเนนเชียล มีเหตุผลที่เท่าเทียมกันสำหรับโครงข่ายประสาทเทียมหรือไม่? เราสามารถแสดงการแจกแจงความน่าจะเป็นเหนือหน่วย (ตัวแปร) ในเครื่อง จำกัด Boltzmann หรือซีเอ็นเอ็นเป็นฟังก์ชันของพลังงานหรือผลิตภัณฑ์พลังงานระหว่างหน่วยหรือไม่ นอกจากนี้การแจกแจงความน่าจะเป็นแบบจำลองโดย RBM หรือเครือข่ายความเชื่อลึก (เช่นกับ CNNs) ของตระกูลเอ็กซ์โปเนนเชียลหรือไม่? ผมหวังที่จะพบข้อความที่ formalizes การเชื่อมต่อระหว่างชนิดปัจจุบันนี้เครือข่ายประสาทและสถิติในลักษณะเดียวกับที่จอร์แดนและเวนไรท์ได้สำหรับรุ่นกราฟิกกับพวกเขารุ่นกราฟิกครอบครัวเอกและแปรผันอนุมาน ตัวชี้ใด ๆ จะดีมาก

2
การตีความพล็อต QQ
พิจารณารหัสและผลลัพธ์ต่อไปนี้: par(mfrow=c(3,2)) # generate random data from weibull distribution x = rweibull(20, 8, 2) # Quantile-Quantile Plot for different distributions qqPlot(x, "log-normal") qqPlot(x, "normal") qqPlot(x, "exponential", DB = TRUE) qqPlot(x, "cauchy") qqPlot(x, "weibull") qqPlot(x, "logistic") ดูเหมือนว่าพล็อต QQ สำหรับบันทึกปกติเกือบจะเหมือนกับพล็อต QQ สำหรับ weibull เราจะแยกแยะพวกมันได้อย่างไร นอกจากนี้หากคะแนนอยู่ในพื้นที่ที่กำหนดโดยเส้นสีดำด้านนอกสองเส้นนั่นแสดงว่ามันเป็นไปตามการแจกแจงที่ระบุหรือไม่?

2
จะทราบได้อย่างไรว่ามีเศษที่เกี่ยวข้องโดยอัตโนมัติจากกราฟิกหรือไม่
เมื่อคุณทำการถดถอยแบบ OLS และพล็อตค่าส่วนที่เหลือที่เกิดขึ้นคุณจะบอกได้อย่างไรว่าส่วนที่เหลือมีความสัมพันธ์โดยอัตโนมัติ ฉันรู้ว่ามีการทดสอบสำหรับเรื่องนี้ (Durbin, Breusch-Godfrey) แต่ฉันก็สงสัยว่าถ้าคุณสามารถดูพล็อตที่จะวัดว่าการหาค่าอัตโนมัตรอาจเป็นปัญหา (เพราะสำหรับ heteroskedasticity

4
การถดถอยปัวซองมีข้อดีอะไรบ้างในกรณีนี้การถดถอยเชิงเส้น
ฉันได้รับชุดข้อมูลที่มีจำนวนรางวัลที่นักเรียนได้รับจากโรงเรียนมัธยมแห่งหนึ่งซึ่งผู้ทำนายจำนวนรางวัลที่ได้รับนั้นรวมถึงประเภทของโปรแกรมที่นักเรียนลงทะเบียนและคะแนนสอบปลายภาคในวิชาคณิตศาสตร์ ฉันสงสัยว่าถ้าใครสามารถบอกฉันได้ว่าทำไมแบบจำลองการถดถอยเชิงเส้นอาจไม่เหมาะสมในตัวอย่างนี้และทำไมมันจะดีกว่าถ้าใช้การถดถอยแบบปัวซอง ขอบคุณ

1
อะไรคือความแตกต่างระหว่างสถิติ / วิธีการแจกฟรีและสถิติที่ไม่ใช่พารามิเตอร์
จากวิกิพีเดีย ความหมายแรกของเทคนิคที่ไม่ใช้พารามิเตอร์ครอบคลุมที่ไม่พึ่งพาข้อมูลที่เป็นของการแจกจ่ายเฉพาะ สิ่งเหล่านี้รวมถึง: วิธีการแจกฟรีซึ่งไม่ขึ้นอยู่กับสมมติฐานที่ว่าข้อมูลถูกดึงออกมาจากการแจกแจงความน่าจะเป็นที่กำหนด เช่นนี้มันเป็นสิ่งที่ตรงกันข้ามกับสถิติเชิงพารามิเตอร์ มันรวมถึงแบบจำลองทางสถิติที่ไม่ใช่พารามิเตอร์การอนุมานและการทดสอบทางสถิติ สถิติที่ไม่ใช่พารามิเตอร์ (ในแง่ของสถิติเหนือข้อมูลซึ่งถูกกำหนดให้เป็นฟังก์ชันในตัวอย่างที่ไม่มีการพึ่งพาพารามิเตอร์) ซึ่งการตีความไม่ได้ขึ้นอยู่กับประชากรที่เหมาะสมกับการแจกแจงแบบพาราเมตริก สถิติที่อยู่บนพื้นฐานของการสังเกตเป็นตัวอย่างหนึ่งของสถิติดังกล่าวและสิ่งเหล่านี้มีบทบาทสำคัญในแนวทางที่ไม่ใช่พารามิเตอร์หลายอย่าง ฉันไม่เห็นความแตกต่างระหว่างสองกรณี: วิธีการแจกฟรีและสถิติที่ไม่ใช่พารามิเตอร์ พวกเขาทั้งสองไม่คิดว่าข้อมูลมาจากการแจกแจงบ้างไหม? พวกเขาต่างกันอย่างไร ขอบคุณและขอแสดงความนับถือ!

1
ฟังก์ชันต้นทุนสำหรับการตรวจสอบแบบจำลองการถดถอยของปัวซอง
สำหรับข้อมูลนับที่ฉันรวบรวมฉันใช้การถดถอยปัวซองเพื่อสร้างแบบจำลอง ฉันไม่นี้โดยใช้ฟังก์ชั่นในการวิจัยที่ผมใช้glm family = "poisson"เพื่อประเมินตัวแบบที่เป็นไปได้ (ฉันมีตัวทำนายหลายตัว) ฉันใช้ AIC จนถึงตอนนี้ดีมาก ตอนนี้ฉันต้องการทำการตรวจสอบข้าม ฉันประสบความสำเร็จในการทำสิ่งนี้โดยใช้cv.glmฟังก์ชั่นจากbootแพ็คเกจ จากเอกสารของcv.glmฉันเห็นว่าเช่นสำหรับข้อมูลทวินามคุณต้องใช้ฟังก์ชั่นค่าใช้จ่ายเฉพาะเพื่อรับข้อผิดพลาดการทำนายที่มีความหมาย อย่างไรก็ตามฉันไม่รู้เลยว่าฟังก์ชั่นค่าใช้จ่ายใดเหมาะสมfamily = poissonและการค้นหาโดย Google ที่กว้างขวางไม่ได้ให้ผลลัพธ์ที่เฉพาะเจาะจง คำถามของฉันคือทุกคนมีแสงที่จะหลั่งซึ่งฟังก์ชันต้นทุนเหมาะสมสำหรับcv.glmกรณีของ poisson glm

1
เหมาะสมกับฟังก์ชันเลขชี้กำลังโดยใช้กำลังสองน้อยที่สุดเทียบกับโมเดลเชิงเส้นทั่วไปกับสี่เหลี่ยมจัตุรัสไม่เชิงเส้นน้อยที่สุด
ฉันมีชุดข้อมูลที่แสดงถึงการสลายตัวแบบเลขชี้กำลัง ฉันต้องการใส่ฟังก์ชั่นเลขชี้กำลังกับข้อมูลนี้ ฉันได้ลองบันทึกการเปลี่ยนตัวแปรการตอบสนองแล้วใช้กำลังสองน้อยที่สุดเพื่อให้พอดีกับเส้น ใช้โมเดลเชิงเส้นทั่วไปที่มีฟังก์ชั่นบันทึกการเชื่อมโยงและการกระจายแกมม่ารอบ ๆ ตัวแปรตอบสนอง; และใช้กำลังสองน้อยที่สุดแบบไม่เชิงเส้น ฉันได้รับคำตอบที่แตกต่างกันสำหรับสัมประสิทธิ์สองตัวของฉันในแต่ละวิธีแม้ว่ามันจะคล้ายกันทั้งหมด ที่ฉันมีความสับสนคือฉันไม่แน่ใจว่าวิธีใดดีที่สุดที่จะใช้และทำไม ใครบางคนช่วยเปรียบเทียบและเปรียบเทียบวิธีการเหล่านี้ได้ไหม ขอบคุณ.y=Beaxy=Beaxy = Be^{ax}

2
การตีความผลลัพธ์ของ k-หมายถึงการจัดกลุ่มใน R
ฉันใช้kmeansคำสั่งของ R ในการดำเนินการอัลกอริธึม k-mean บนชุดข้อมูล iris ของ Anderson ฉันมีคำถามเกี่ยวกับพารามิเตอร์บางอย่างที่ฉันได้รับ ผลลัพธ์ที่ได้คือ: Cluster means: Sepal.Length Sepal.Width Petal.Length Petal.Width 1 5.006000 3.428000 1.462000 0.246000 ในกรณีนี้ "คลัสเตอร์หมายถึง" หมายถึงอะไร มันหมายถึงระยะทางของวัตถุทั้งหมดในกลุ่มหรือไม่ นอกจากนี้ในส่วนสุดท้ายฉันมี: Within cluster sum of squares by cluster: [1] 15.15100 39.82097 23.87947 (between_SS / total_SS = 88.4 %) ค่านั้น 88.4% สิ่งที่สามารถตีความได้?

1
คุณจะตรวจพบได้อย่างไรว่ากระบวนการแบบเกาส์เซียนนั้นเกินความเหมาะสม
ฉันกำลังฝึกอบรมกระบวนการเกาส์เซียนด้วยเคอร์เนล ARD ที่มีพารามิเตอร์จำนวนมากโดยการเพิ่มความเป็นไปได้ของข้อมูลให้น้อยที่สุดแทนที่จะเป็นการตรวจสอบข้าม ฉันสงสัยว่ามันกระชับเกินไป ฉันจะทดสอบข้อสงสัยนี้ได้อย่างไรในบริบทของเบย์

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.