สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
นักสถิติใช้ Jeffreys 'มาก่อนในการใช้งานจริงหรือไม่?
เมื่อฉันเรียนรู้เกี่ยวกับ Jeffreys 'ก่อนหน้าในการอนุมานสถิติระดับบัณฑิตศึกษาของฉันอาจารย์ของฉันทำให้มันฟังดูเหมือนว่ามันน่าสนใจส่วนใหญ่ด้วยเหตุผลทางประวัติศาสตร์มากกว่าเพราะใครจะเคยใช้มัน จากนั้นเมื่อฉันทำการวิเคราะห์ข้อมูลแบบเบย์เราไม่เคยถูกขอให้ใช้นักบวชของเจฟฟรีย์ ไม่มีใครใช้จริงเหล่านี้ในทางปฏิบัติ ถ้าเป็นเช่นนั้น (หรือถ้าไม่) ทำไมหรือทำไมไม่ ทำไมนักสถิติบางคนถึงไม่จริงจัง

4
วิธีการเลือกว่าจะออกจากคิวรถบัสหรืออยู่ที่นั่นโดยใช้ทฤษฎีความน่าจะเป็น?
ตอนนี้ฉันกำลังคิดถึงบางสิ่งอยู่และเนื่องจากฉันไม่ค่อยมีความเชี่ยวชาญในทฤษฎีความน่าจะเป็นฉันจึงคิดว่านี่อาจเป็นสถานที่ที่ดีในการถามคำถามนี้ นี่คือสิ่งที่เกิดขึ้นกับฉันในคิวยาวของระบบขนส่งสาธารณะ สมมติว่าคุณอยู่ในสถานีขนส่งและคุณรู้ว่ารถบัส (หรือรถเมล์หลายคัน) จะมาในอนาคต (ในระหว่างวัน) แต่คุณไม่รู้ช่วงเวลาที่แน่นอน คุณจินตนาการถึงความน่าจะเป็นที่รถบัสจะมาถึงภายในห้านาที ดังนั้นคุณรอห้านาที แต่รถไม่มาถึง ตอนนี้ความน่าจะเป็นน้อยกว่าหรือสูงกว่าความเป็นจริงที่คุณจินตนาการไว้หรือไม่ คำถามคือถ้าคุณใช้อดีตเพื่อทำนายอนาคตบางทีคุณอาจจะไม่ได้มองโลกในแง่ดีเกี่ยวกับรถบัสที่เดินทางมาถึง แต่บางทีคุณอาจคิดว่ามันทำให้เหตุการณ์มีโอกาสมากขึ้น: เนื่องจากรถบัสยังมาไม่ถึงมีเวลาไม่กี่นาทีในแต่ละวันและความน่าจะเป็นที่สูงขึ้น คิดห้านาทีสุดท้ายของวัน คุณเคยไปที่นั่นทั้งวันและไม่มีรถประจำทางมา ดังนั้นการตัดสิน แต่เพียงผู้เดียวในอดีตคุณไม่สามารถคาดเดาได้ว่ารถบัสจะมาถึงภายในห้านาทีถัดไป แต่เนื่องจากคุณแน่ใจว่ามีรถบัสมาถึงก่อนที่จะสิ้นสุดวันและมีเพียงห้านาทีสำหรับวันที่จะสิ้นสุดคุณสามารถมั่นใจได้ 100% ว่ารถบัสจะมาถึงภายในห้านาที ดังนั้นคำถามคือถ้าฉันจะคำนวณความน่าจะเป็นและเลื่อนออกจากคิวฉันควรใช้วิธีการแบบใด มันเป็นเพราะบางครั้งฉันก็เลิกและทันใดนั้นรถก็มาถึง แต่บางครั้งฉันก็รอแล้วก็รอและรถก็ไม่มา หรือบางทีคำถามทั้งหมดนี้เป็นเรื่องไร้สาระและนั่นเป็นเพียงการสุ่มอย่างน่ากลัว?

2
ขอบเขตข้อผิดพลาดที่เหมาะสำหรับครอบครัว: การใช้ชุดข้อมูลซ้ำในการศึกษาที่แตกต่างกันของคำถามอิสระทำให้เกิดปัญหาการทดสอบหลายครั้งหรือไม่
หากทีมนักวิจัยทำการทดสอบหลายชุด (สมมติฐาน) ในชุดข้อมูลที่ระบุมีหนังสือรับรองจำนวนหนึ่งที่ยืนยันว่าพวกเขาควรใช้รูปแบบการแก้ไขสำหรับการทดสอบหลายรายการ (Bonferroni ฯลฯ ) แม้ว่าการทดสอบจะเป็นอิสระ คำถามของฉันคือสิ่งนี้: ตรรกะเดียวกันนี้ใช้กับหลาย ๆ ทีมที่ทดสอบสมมติฐานในชุดข้อมูลเดียวกันหรือไม่? กล่าวอีกวิธีหนึ่ง - อะไรคืออุปสรรคในการคำนวณข้อผิดพลาดที่เหมาะกับครอบครัว นักวิจัยควร จำกัด การใช้ชุดข้อมูลซ้ำเพื่อการสำรวจเท่านั้นหรือไม่

1
การประมาณค่าความแปรปรวนของประชากรถ้ารู้ค่าเฉลี่ยประชากร
ฉันรู้ว่าเราใช้เพื่อประเมินความแปรปรวนของประชากร ฉันจำได้ว่าวิดีโอจาก Khan Academy ที่สัญชาตญาณที่ได้รับคือค่าเฉลี่ยที่เราคาดไว้อาจจะเล็กน้อยจากค่าจริงดังนั้นระยะทางจะยิ่งใหญ่กว่าจริง ๆ ดังนั้นเราหารด้วยน้อยกว่า (แทน ) เพื่อให้ได้ค่าที่มากขึ้นส่งผลให้การประเมินดีขึ้น และผมจำได้อ่านที่ไหนสักแห่งที่ฉันไม่จำเป็นต้องแก้ไขนี้ถ้าฉันมีที่เกิดขึ้นจริงของประชากรเฉลี่ยแทน{x} ดังนั้นฉันจะประมาณ แต่ฉันไม่สามารถหามันได้อีก มันจริงหรอ? ใครช่วยชี้ให้ฉันได้บ้าง1n−1∑i(xi−x¯)21n−1∑i(xi−x¯)2\frac1{n-1}\sum\limits_i(x_i - \bar{x})^2xi−x¯xi−x¯x_i - \bar{x}n−1n−1n-1nnnμμ\mux¯x¯\bar{x}1n∑i(xi−μ)21n∑i(xi−μ)2\frac1{n}\sum\limits_i(x_i - \mu)^2
11 variance  sample 

1
การเลือกแบบจำลอง Bayesian ใน PyMC3
ฉันใช้ PyMC3 เพื่อเรียกใช้แบบจำลอง Bayesian กับข้อมูลของฉัน ฉันใหม่สำหรับการสร้างแบบจำลอง Bayesian แต่จากการโพสต์บล็อกบางส่วน Wikipedia และQAจากเว็บไซต์นี้ดูเหมือนว่าจะเป็นแนวทางที่ถูกต้องในการใช้ตัวประกอบ Bayes และเกณฑ์ BIC เพื่อเลือกรูปแบบที่ดีที่สุดในการแสดงข้อมูลของฉัน ข้อมูลของฉัน) ในการคำนวณปัจจัย Bayes ฉันต้องการโอกาสที่สัมพันธ์กันสำหรับโมเดลที่ฉันต้องการเปรียบเทียบ อาจจะสับสนเล็กน้อยสำหรับฉัน แต่ฉันคิดว่ามีสองวิธีที่จะได้รับโอกาส (แก้ไขฉันหากฉันผิด): วิธีพีชคณิตเมื่อแบบจำลองง่าย: ดูตัวอย่างหน้าวิกิพีเดียของ Bayes วิธีตัวเลข: นี่คือสิ่งที่ PyMC3 กับอัลกอริทึม MCMC ฉันจะเข้าถึงโอกาสและเปรียบเทียบแบบจำลองของฉันใน PyMC3 ได้อย่างไร ฉันพบmodel.logpวิธีซึ่งตามเอกสารคือ "ฟังก์ชั่นความหนาแน่นของความน่าจะเป็นบันทึก" ฉันสามารถใช้สิ่งนั้นเพื่อสร้างโอกาสได้หรือไม่? คำถามโบนัส: เมื่อมีการเปรียบเทียบทั้งสองรุ่นอัตราส่วนระหว่างความน่าจะเป็นทั้งสองจะถูกคำนวณ จะเกิดอะไรขึ้นถ้าคุณต้องการเปรียบเทียบหลายรุ่น ตัวอย่าง PyMC3 ที่เป็นรูปธรรมจะมีประโยชน์มาก!

2
แบบจำลอง logit แบบเบส์ - คำอธิบายที่เข้าใจง่าย?
ฉันต้องยอมรับว่าก่อนหน้านี้ฉันไม่เคยได้ยินคำศัพท์นั้นในชั้นเรียนระดับปริญญาตรีหรือปริญญาโทเลย การถดถอยโลจิสติกหมายถึง Bayesian หมายความว่าอย่างไร ฉันกำลังมองหาคำอธิบายเกี่ยวกับการเปลี่ยนจากโลจิสติกส์ธรรมดาเป็นโลจิสติกส์แบบเบย์ดังต่อไปนี้: นี่คือสมการในรูปแบบการถดถอยเชิงเส้น:\E(y)=β0+β1x1+...+βnxnE(y)=β0+β1x1+...+βnxnE(y) = \beta_0 + \beta_1x_1 + ... + \beta_nx_n นี่คือสมการในรูปแบบการถดถอยโลจิสติก:\ สิ่งนี้จะกระทำเมื่อ y เป็นหมวดหมู่LN( E( y)1 - E( y)) = β0+ β1x1+ . . . + βnxnln⁡(E(y)1−E(y))=β0+β1x1+...+βnxn\ln(\frac{E(y)}{1-E(y)}) = \beta_0 + \beta_1x_1 + ... + \beta_nx_n สิ่งที่เราทำคือการเปลี่ยนแปลงเพื่อ\ LN (\ frac {E (y)} {1-E (y)})ln ( E ( …

1
มีการแจกแจงจำนวนเท่าไรใน GLM
ฉันได้ระบุสถานที่หลายแห่งในตำราเรียนที่อธิบาย GLM ด้วยการแจกแจง 5 แบบ ได้แก่ (, Gamma, Gaussian, Binomial, Inverse Gaussian, & Poisson) นี่คือสุดขั้วในหน้าที่ของครอบครัวในอาร์ บางครั้งฉันเจอการอ้างอิงถึง GLM ที่มีการแจกแจงเพิ่มเติม ( ตัวอย่าง ) บางคนสามารถอธิบายได้ว่าทำไม 5 เหล่านี้จึงพิเศษหรืออยู่ใน GLM เสมอ แต่บางครั้งคนอื่นก็เป็นเช่นนั้น? จากสิ่งที่ฉันได้เรียนรู้จนถึงตอนนี้การแจกแจง GLM ในตระกูลเอ็กซ์โปเนนเชียลนั้นอยู่ในรูปแบบ: โดยที่คือพารามิเตอร์การกระจายและเป็นพารามิเตอร์ที่ยอมรับf(y;θ,ϕ)=exp{yθ−b(θ)ϕ+c(y,ϕ)}f(y;θ,ϕ)=exp⁡{yθ−b(θ)ϕ+c(y,ϕ)}f(y;\theta,\phi)=\exp\left\{\frac{y\theta-b(\theta)}{\phi}+c(y,\phi)\right\}ϕϕ\phiθθ\theta ไม่สามารถแปลงการกระจายใด ๆ ให้พอดีกับ GLM ได้หรือไม่

3
การจำลองทัศนศึกษาบราวเนียนโดยใช้สะพานบราวเนียน?
ฉันต้องการจำลองกระบวนการทัศนศึกษาแบบบราวเนียน (การเคลื่อนไหวแบบบราวเนียนที่ปรับเงื่อนไขจะเป็นค่าบวกเสมอเมื่อถึงที่ ) เนื่องจากกระบวนการทัศนศึกษา Brownian เป็นสะพาน Brownian ที่มีเงื่อนไขว่าจะเป็นบวกอยู่เสมอฉันจึงหวังที่จะจำลองการเคลื่อนที่ของทัศนศึกษา Brownian โดยใช้สะพาน Brownian0 t = 10<t<10<t<10 \lt t \lt 1000t=1t=1t=1 ใน R ฉันใช้แพ็คเกจ 'e1017' เพื่อจำลองกระบวนการบราวเนียนบริดจ์ ฉันจะใช้กระบวนการบราวน์บราวน์นี้เพื่อสร้างการเดินทางแบบบราวเนียนได้อย่างไร

2
อะไรคือความแตกต่างระหว่างการถดถอยของแนวสันโดยใช้ glmnet ของ R และ Scikit-Learn ของ Python?
ฉันกำลังอ่านส่วน LAB §6.6เกี่ยวกับการถดถอยของสัน / Lasso ในหนังสือ'บทนำสู่การเรียนรู้เชิงสถิติด้วยแอปพลิเคชันใน R'โดย James, Witten, Hastie, Tibshirani (2013) โดยเฉพาะอย่างยิ่งฉันพยายามใช้โมเดล scikit-Learn Ridgeกับชุดข้อมูล 'Hitters' จากแพ็คเกจ R 'ISLR' ฉันสร้างฟีเจอร์ชุดเดียวกันตามที่แสดงในรหัส R แล้ว อย่างไรก็ตามฉันไม่สามารถใกล้เคียงกับผลลัพธ์จากglmnet()โมเดลได้ ฉันเลือกพารามิเตอร์การปรับแต่ง L2 หนึ่งพารามิเตอร์เพื่อทำการเปรียบเทียบ (อาร์กิวเมนต์ 'alpha' ใน scikit เรียนรู้) งูหลาม: regr = Ridge(alpha=11498) regr.fit(X, y) http://nbviewer.ipython.org/github/JWarmenhoven/ISL-python/blob/master/Notebooks/Chapter%206.ipynb R: โปรดทราบว่าการโต้แย้งalpha=0ในglmnet()หมายความว่าโทษ L2 ควรใช้ (Ridge ถดถอย) เอกสารเตือนไม่ให้ป้อนค่าเดียวlambdaแต่ผลลัพธ์จะเหมือนกับใน ISL ซึ่งมีการใช้เวกเตอร์ ridge.mod <- glmnet(x,y,alpha=0,lambda=11498) …

1
โดยรวมค่า p และค่า p คู่ตามตัวอักษร?
ฉันได้รับการติดตั้งทั่วไปเชิงเส้นรูปแบบ มีโอกาสบันทึกเป็นL_uy=β0+β1x1+β2x2+β3x3,y=β0+β1x1+β2x2+β3x3,y=\beta_0+\beta_1x_1+\beta_2x_2+\beta_3x_3,LuLuL_u ตอนนี้ฉันต้องการทดสอบว่าสัมประสิทธิ์เหมือนกันหรือไม่ ครั้งแรกโดยรวมการทดสอบ: โอกาสเข้าสู่ระบบของการลดรูปแบบเป็นL_rโดยการทดสอบอัตราส่วนแบบเต็มรูปแบบเป็นอย่างดีกว่าหนึ่งลดลงด้วยpy=β0+β1⋅(x1+x2+x3)y=β0+β1⋅(x1+x2+x3)y=\beta_0+\beta_1\cdot(x_1+x_2+x_3)LrLrL_rp=0.02p=0.02p=0.02 ถัดไป ? รูปแบบที่ลดลงคือการ yผลลัพธ์คือไม่แตกต่างจากกับβ1=β2β1=β2\beta_1=\beta_2y=β0+β1⋅(x1+x2)+β2x3y=β0+β1⋅(x1+x2)+β2x3y=\beta_0+\beta_1\cdot(x_1+x_2)+\beta_2x_3β1β1\beta_1β2β2\beta_2p=0.15p=0.15p=0.15 p ในทำนองเดียวกัน ? พวกเขาแตกต่างกับβ1=β3β1=β3\beta_1=\beta_3p=0.007p=0.007p=0.007 p สุดท้าย ? พวกเขาจะไม่แตกต่างกันกับpβ2=β3β2=β3\beta_2=\beta_3p=0.12p=0.12p=0.12 นี่ค่อนข้างสับสนสำหรับฉันเพราะฉันคาดว่าโดยรวมจะเล็กกว่าเนื่องจากเห็นได้ชัดว่าเป็นเกณฑ์ที่เข้มงวดกว่า (ผู้ที่สร้างppp0.0070.0070.007β1=β2=β3β1=β2=β3\beta_1=\beta_2=\beta_3β1=β3β1=β3\beta_1=\beta_3p=0.007p=0.007p=0.007 ) นั่นคือเนื่องจากฉัน "มั่นใจ" แล้วที่ไม่ถือฉันควรจะ "มั่นใจมากขึ้น" ที่ไม่ถือ ดังนั้นของฉัน0.0070.0070.007β1=β3β1=β3\beta_1=\beta_3β1=β2=β3β1=β2=β3\beta_1=\beta_2=\beta_3pppควรลงไป ฉันกำลังทดสอบพวกเขาผิดหรือเปล่า? มิฉะนั้นฉันผิดในเหตุผลข้างต้นที่ไหน

2
เหตุใดจึงเป็นเรื่องผิดปกติในการรายงานช่วงเวลาความเชื่อมั่นสำหรับค่ามัธยฐาน?
เหตุใดจึงเป็นเรื่องผิดปกติในการค้นหาช่วงความมั่นใจที่รายงานไว้ในเอกสารจากวิทยาศาสตร์ประยุกต์ ฉันทำงานเกี่ยวกับวิทยาศาสตร์คอมพิวเตอร์เป็นส่วนใหญ่ แต่มักจะอ่านบทความจาก (สังคม) จิตวิทยาสังคมวิทยาและการวางผังเมือง ฉันจำไม่ได้ว่าเคยเห็น CI สำหรับคนกลางรายงาน ในขณะเดียวกันเมื่อศึกษาช่วงความมั่นใจและเป็นเช่นนั้นฉันเห็นได้ชัดว่าในทุกสถานการณ์ที่ค่ามัธยฐานเป็นตัวบ่งชี้ที่ดีกว่าสำหรับข้อมูลของตัวเองนี่เป็นค่าประมาณที่ควรนำเสนอ มีเหตุผลทางทฤษฎีว่าทำไมการนำเสนอ CIs สำหรับค่ามัธยฐานจึงไม่ธรรมดา

2
ทำไมความน่าจะเป็นสูงสุดที่ จำกัด จึงให้ผลต่างประมาณที่ดีขึ้น (ไม่เอนเอียง)?
ฉันกำลังอ่านบทความทฤษฎีของ Doug Bates บนแพ็คเกจ lme4 ของ R เพื่อทำความเข้าใจกับ nitty-gritty ของแบบจำลองที่ผสมกันและพบผลลัพธ์ที่น่าสนใจที่ฉันต้องการทำความเข้าใจให้ดีขึ้นเกี่ยวกับการใช้โอกาสสูงสุดแบบ จำกัด (REML) เพื่อประเมินความแปรปรวน . ในมาตรา 3.3 ในเกณฑ์ REML เขากล่าวว่าการใช้ REML ในการประมาณค่าความแปรปรวนเกี่ยวข้องอย่างใกล้ชิดกับการใช้องศาความเป็นอิสระในการแก้ไขเมื่อประเมินความแปรปรวนจากส่วนเบี่ยงเบนที่เหลืออยู่ในตัวแบบเชิงเส้นพอดี โดยเฉพาะอย่างยิ่ง "แม้ว่าโดยปกติจะไม่ได้มาในลักษณะนี้" องศาของการแก้ไขอิสรภาพสามารถทำได้โดยการประเมินความแปรปรวนผ่านการปรับให้เหมาะสมของ "เกณฑ์ REML" (Eq. (28)) เกณฑ์ REML นั้นมีความเป็นไปได้เพียงอย่างเดียว แต่พารามิเตอร์เชิงเส้นพอดีได้ถูกกำจัดโดยการทำให้เป็นขอบ (แทนที่จะตั้งค่าให้เท่ากับการประมาณแบบพอดีซึ่งจะทำให้ความแปรปรวนตัวอย่างแบบเอนเอียง) ฉันทำคณิตศาสตร์และตรวจสอบผลลัพธ์ที่อ้างสิทธิ์สำหรับโมเดลเชิงเส้นอย่างง่ายที่มีเอฟเฟกต์คงที่เท่านั้น สิ่งที่ฉันกำลังดิ้นรนคือการตีความ มีมุมมองบางอย่างที่เป็นธรรมชาติหรือไม่ที่จะได้รับการประมาณค่าความแปรปรวนโดยการปรับความน่าจะเป็นที่พารามิเตอร์ทางพอดีได้ถูกทำให้ลดลง? มันให้ความรู้สึกเหมือนกับ Bayesian ราวกับว่าฉันกำลังคิดถึงโอกาสที่จะเป็นหลังและปรับพารามิเตอร์ที่เหมาะสมเหมือนพวกมันเป็นตัวแปรสุ่ม หรือเหตุผลหลักเกี่ยวกับคณิตศาสตร์เพียงอย่างเดียว - มันทำงานในกรณีเชิงเส้น แต่ยังเป็น generalizable?

1
การเลือกคุณสมบัติแบบใดที่สามารถใช้ทดสอบไคสแควร์ได้
ที่นี่ฉันถามเกี่ยวกับสิ่งที่คนอื่นทำกันโดยทั่วไปเพื่อใช้การทดสอบไคสแควร์สำหรับการเลือกคุณสมบัติ WRT ในการเรียนรู้แบบมีผู้สอน หากฉันเข้าใจอย่างถูกต้องพวกเขาจะทดสอบความเป็นอิสระระหว่างแต่ละคุณลักษณะและผลลัพธ์และเปรียบเทียบค่า p ระหว่างการทดสอบสำหรับแต่ละคุณลักษณะหรือไม่ ในhttp://en.wikipedia.org/wiki/Pearson%27s_chi-squared_test , การทดสอบไคสแควร์ของเพียร์สันเป็นการทดสอบทางสถิติที่ใช้กับชุดของข้อมูลที่เป็นหมวดหมู่เพื่อประเมินว่ามีความเป็นไปได้ที่ความแตกต่างที่สังเกตได้ระหว่างเซตเกิดขึ้นโดยบังเอิญ ... การทดสอบความเป็นอิสระประเมินว่าการสังเกตแบบจับคู่กับตัวแปรสองตัวที่แสดงในตารางฉุกเฉินหรือไม่นั้นเป็นอิสระจากกัน (เช่นการตอบแบบสำรวจจากคนต่างชาติเพื่อดูว่าสัญชาติของคนนั้นเกี่ยวข้องกับการตอบสนองหรือไม่) ดังนั้นตัวแปรทั้งสองที่ต้องทดสอบความเป็นอิสระโดยการทดสอบจะต้องจัดหมวดหมู่หรือไม่ต่อเนื่อง (อนุญาตให้สั่งนอกเหนือจากหมวดหมู่) แต่ไม่ต่อเนื่องกัน? จากhttp://scikit-learn.org/stable/modules/feature_selection.htmlพวกเขา ดำเนินการทดสอบχ2χ2\chi^2กับชุดข้อมูล irisเพื่อดึงเฉพาะคุณสมบัติที่ดีที่สุดสองอย่าง ในชุดข้อมูล irisคุณลักษณะทั้งหมดเป็นตัวเลขและต่อเนื่องมูลค่าและผลลัพธ์คือเลเบลคลาส (หมวดหมู่) การทดสอบความเป็นอิสระของไคสแควร์นำไปใช้กับคุณลักษณะต่อเนื่องได้อย่างไร ในการใช้การทดสอบความเป็นอิสระของไคสแควร์กับชุดข้อมูลเราต้องแปลงฟีเจอร์ต่อเนื่องเป็นฟีเจอร์ที่แยกออกจากกันโดยเริ่มจากการทำ binning (เช่นการแยกโดเมนแรกต่อเนื่องของฟีเจอร์ออกเป็นถังขยะแล้วเปลี่ยนฟีเจอร์นั้น ๆ )? เหตุการณ์ที่เกิดขึ้นในถังขยะหลายรูปแบบนั้นมีคุณลักษณะหลายอย่าง (เกิดขึ้นหรือไม่เกิดขึ้นในแต่ละถังขยะ) ดังนั้นการทดสอบความเป็นอิสระของไคสแควร์จึงสามารถใช้ได้กับพวกมันใช่ไหม? โดยวิธีการที่ฉันเดาเราสามารถใช้การทดสอบความเป็นอิสระของไคสแควร์กับคุณสมบัติและผลลัพธ์ของชนิดใด ๆถูกต้อง? สำหรับส่วนผลลัพธ์เราสามารถเลือกฟีเจอร์สำหรับการจัดหมวดหมู่ไม่เพียง แต่สำหรับการถดถอยโดยการทดสอบความเป็นอิสระของไคสแควร์โดยการสรุปผลลัพธ์อย่างต่อเนื่องใช่มั้ย เว็บไซต์เรียนรู้ scikitยังกล่าวว่า คำนวณสถิติไคสแควร์ระหว่างคุณลักษณะที่ไม่เป็นลบและคลาส คะแนนนี้สามารถใช้เพื่อเลือกคุณสมบัติ n_features ที่มีค่าสูงสุดสำหรับสถิติทดสอบไคสแควร์จาก X ซึ่งต้องมีเฉพาะคุณสมบัติที่ไม่เป็นลบเช่น booleans หรือความถี่ (เช่นจำนวนคำในการจำแนกเอกสาร) เทียบกับ ชั้นเรียน ทำไมการทดสอบจึงต้องการคุณสมบัติที่ไม่จำเป็น หากคุณสมบัติไม่มีสัญญาณ แต่มีการจัดหมวดหมู่หรือไม่ต่อเนื่องการทดสอบยังสามารถใช้กับมันได้หรือไม่? …

1
วิธีการตีความสีที่เหลือในพล็อตโมเสค?
นี่คือพล็อตโมเสคของชุดข้อมูลตารางฉุกเฉินHairEyeColorอธิบายไว้ที่นี่ ฉันจะตีความสีที่แสดงถึงสิ่งตกค้างได้อย่างไร อะไรคือความแตกต่างระหว่างของเพียร์สันที่มีค่าสูงและค่าบวก (แสดงเป็นสีน้ำเงิน) เมื่อเทียบกับค่าต่ำและค่าลบที่แสดงเป็นสีแดง

2
รับองศาอิสระจาก lmer
ฉันเหมาะสมกับโมเดล lmer ด้วยสิ่งต่อไปนี้ (แม้ว่าจะเป็นเอาต์พุต): Random effects: Groups Name Std.Dev. day:sample (Intercept) 0.09 sample (Intercept) 0.42 Residual 0.023 ฉันต้องการสร้างช่วงความมั่นใจสำหรับแต่ละเอฟเฟกต์โดยใช้สูตรต่อไปนี้: ( n - 1 ) s2χ2α / 2 , n - 1, ( n - 1 ) s2χ21 - α / 2 , n - 1(n-1)s2χα/2,n-12,(n-1)s2χ1-α/2,n-12 \frac{(n-1)s^2}{\chi^2_{\alpha/2, n-1}},\frac{(n-1)s^2}{\chi^2_{1-\alpha/2,n-1}} มีวิธีที่จะออกจากองศาอิสระอย่างสะดวกสบายไหม

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.