สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
สูตรความน่าจะเป็นสำหรับการแจกแจงหลายตัวแปร - เบอโนลลี
ฉันต้องการสูตรสำหรับความน่าจะเป็นของเหตุการณ์ในการแจกแจงแบบ N-Variate Bernoulliได้รับความน่าจะเป็นสำหรับองค์ประกอบเดี่ยวและคู่ขององค์ประกอบ{IJ} ฉันสามารถให้ค่าเฉลี่ยและความแปรปรวนร่วมของกัน P ( X i = 1 ) = p i P ( X i = 1 ∧ X j = 1 ) = p i j XX∈ { 0 , 1 }nX∈{0,1}nX\in\{0,1\}^nP( Xผม= 1 ) = pผมP(Xi=1)=piP(X_i=1)=p_iP( Xผม= 1 ∧ XJ= 1 ) =pฉันเจP(Xi=1∧Xj=1)=pijP(X_i=1 \wedge X_j=1)=p_{ij}XXX …

3
GLMNET หรือ LARS สำหรับการคำนวณโซลูชัน LASSO?
ฉันต้องการรับค่าสัมประสิทธิ์สำหรับปัญหา LASSO | | Y- Xβ| | +λ | | β| |1.||Y−Xβ||+λ||β||1.||Y-X\beta||+\lambda ||\beta||_1. ปัญหาคือฟังก์ชั่น glmnet และ lars ให้คำตอบที่ต่างกัน สำหรับฟังก์ชั่น glmnet ฉันขอสัมประสิทธิ์ของλ / | | Y| |λ/||Y||\lambda/||Y||แทนที่จะเป็นλλ\lambdaแต่ฉันยังได้คำตอบที่ต่างออกไป คาดหวังหรือไม่ ความสัมพันธ์ระหว่างลาร์สλλ\lambdaและ glmnet λλ\lambdaคืออะไร? ฉันเข้าใจว่า glmnet นั้นเร็วกว่าสำหรับปัญหา LASSO แต่ฉันอยากจะรู้ว่าวิธีใดที่มีประสิทธิภาพมากกว่า deps_stats ฉันกลัวว่าขนาดของชุดข้อมูลของฉันมีขนาดใหญ่มากจน LARS ไม่สามารถจัดการได้ในขณะที่ glmnet สามารถจัดการกับชุดข้อมูลขนาดใหญ่ของฉันได้ mpiktas ฉันต้องการหาคำตอบของ (Y-Xb) ^ 2 + L \ sum …

2
การวิเคราะห์เชิงสำรวจของข้อผิดพลาดการพยากรณ์เชิงพื้นที่
ข้อมูล:ฉันทำงานเมื่อเร็ว ๆ นี้ในการวิเคราะห์คุณสมบัติสุ่มของเขตข้อมูลเชิงพื้นที่ของข้อผิดพลาดการคาดการณ์การผลิตพลังงานลม อย่างเป็นทางการอาจกล่าวได้ว่าเป็นกระบวนการ จัดทำดัชนีสองครั้งในเวลา (ด้วยและ ) และหนึ่งครั้งในอวกาศ ( ) โดยที่เป็นจำนวนของการมองไปข้างหน้าครั้ง (เท่ากับบางสิ่งรอบตัว , สุ่มตัวอย่างอย่างสม่ำเสมอ),คือจำนวน "เวลาคาดการณ์" (เช่นเวลาที่มีการออกการคาดการณ์ประมาณ 30,000 ในกรณีของฉันสุ่มตัวอย่างเป็นประจำ) และ thpH24Tn( ϵพีt + h | เสื้อ)t = 1 … , T;h = 1 , … , H,p = p1, … , pn(ϵt+h|tp)t=1…,T;h=1,…,H,p=p1,…,pn \left (\epsilon^p_{t+h|t} \right )_{t=1\dots,T;\; h=1,\dots,H,\;p=p_1,\dots,p_n}เสื้อttชั่วโมงhhพีppHHH242424TTTnnnเป็นจำนวนตำแหน่งเชิงพื้นที่ (ไม่ gridded ประมาณ 300 …

1
อัตราส่วนความน่าจะเป็นและการเปรียบเทียบตัวแบบเบย์ให้ทางเลือกที่ดีกว่าและเพียงพอสำหรับการทดสอบสมมติฐานว่างหรือไม่?
ในการตอบสนองต่อร่างกายที่เพิ่มขึ้นของนักสถิติและนักวิจัยที่วิพากษ์วิจารณ์ยูทิลิตี้ของการทดสอบสมมติฐานว่าง (NHT) สำหรับวิทยาศาสตร์เป็นความพยายามสะสมสมาคมจิตวิทยาอเมริกันกองเรือรบในการอนุมานทางสถิติหลีกเลี่ยงการห้ามทันที NHT แต่แทนที่จะแนะนำว่านักวิจัย รายงานขนาดเอฟเฟกต์เพิ่มเติมจากค่า p ที่ได้จาก NHT อย่างไรก็ตามขนาดของเอฟเฟกต์นั้นไม่สามารถสะสมได้ง่ายในการศึกษา วิธีการวิเคราะห์ Meta สามารถสะสมการกระจายขนาดผล แต่โดยทั่วไปขนาดคำนวณเป็นอัตราส่วนระหว่างขนาดผลดิบและ "เสียง" ไม่ได้อธิบายในข้อมูลของการทดลองที่กำหนดหมายความว่าการกระจายขนาดของผลกระทบไม่เพียง ความแปรปรวนในขนาดที่แท้จริงของผลกระทบในการศึกษา แต่ยังมีความแปรปรวนในการแสดงของเสียงในการศึกษา ในทางตรงกันข้ามการวัดทางเลือกของความแข็งแรงของเอฟเฟกต์อัตราส่วนความน่าจะเป็นช่วยให้ตีความได้ง่ายทั้งบนพื้นฐานการศึกษาโดยการศึกษาและสามารถรวบรวมได้ง่ายในการศึกษาเพื่อการวิเคราะห์อภิมาน ในแต่ละการศึกษาโอกาสที่จะแสดงน้ำหนักของหลักฐานสำหรับแบบจำลองที่มีผลกระทบที่กำหนดเมื่อเทียบกับแบบจำลองที่ไม่ได้มีผลกระทบและโดยทั่วไปสามารถรายงานเป็นตัวอย่างเช่น "การคำนวณอัตราส่วนความน่าจะเป็นสำหรับผลของ X เผยหลักฐานเพิ่มเติมอีก 8 เท่าสำหรับเอฟเฟกต์มากกว่าโมฆะที่เกี่ยวข้อง " ยิ่งไปกว่านั้นอัตราส่วนความน่าจะเป็นยังอนุญาตให้แสดงถึงความแข็งแกร่งของการค้นพบโมฆะได้อย่างง่าย ๆ ในขณะที่อัตราส่วนความน่าจะเป็นต่ำกว่า 1 แสดงสถานการณ์ที่โมฆะได้รับการสนับสนุนและรับส่วนกลับของค่านี้แทนน้ำหนักของหลักฐาน โดยเฉพาะอย่างยิ่ง อัตราส่วนความน่าจะเป็นทางคณิตศาสตร์เป็นอัตราส่วนของความแปรปรวนที่ไม่ได้อธิบายของทั้งสองรุ่นซึ่งแตกต่างกันเฉพาะในความแปรปรวนที่อธิบายโดยผลกระทบและจึงไม่ได้เป็นแนวคิดขนาดใหญ่ออกจากขนาดผล ในอีกทางหนึ่งการคำนวณอัตราส่วนความน่าจะเป็น meta-analytic ซึ่งแสดงถึงน้ำหนักของหลักฐานสำหรับผลในการศึกษาเป็นเพียงเรื่องของการใช้ผลิตภัณฑ์ของอัตราส่วนความน่าจะเป็นในการศึกษา ดังนั้นฉันยืนยันว่าสำหรับวิทยาศาสตร์ที่กำลังมองหาเพื่อสร้างระดับของหลักฐานขั้นต้นในความโปรดปรานของผลกระทบ / แบบจำลองอัตราส่วนความน่าจะเป็นเป็นวิธีที่จะไป มีกรณีที่เหมาะสมยิ่งขึ้นซึ่งโมเดลสามารถสร้างความแตกต่างได้เฉพาะในขนาดเฉพาะของเอฟเฟกต์ซึ่งในกรณีนี้การแสดงช่วงเวลาที่เราเชื่อว่าข้อมูลสอดคล้องกับค่าพารามิเตอร์เอฟเฟกต์อาจต้องการ อันที่จริงคณะทำงาน APA ยังแนะนำให้มีการรายงานช่วงเวลาความเชื่อมั่นซึ่งสามารถนำมาใช้ในการนี้ แต่ฉันสงสัยว่านี่เป็นวิธีการที่ไม่ดี ช่วงความเชื่อมั่นมักตีความผิดอย่างน่าเศร้า ( โดยนักเรียนและนักวิจัยเหมือนกัน ) ฉันยังกลัวว่าความสามารถของพวกเขาสำหรับใช้ใน NHT …

7
ทำความเข้าใจกับทฤษฎีสถิติและการใช้งาน
ฉันเพิ่งสำเร็จการศึกษาระดับปริญญาโทด้านการแพทย์และชีวภาพพร้อมกับคณิตศาสตร์วิศวกรรมเป็นพื้นหลัง แม้ว่าโปรแกรมการศึกษาของฉันจะมีหลักสูตรจำนวนมากเกี่ยวกับสถิติทางคณิตศาสตร์ (ดูด้านล่างสำหรับรายการ) ซึ่งฉันจัดการด้วยคะแนนที่ค่อนข้างสูง แต่ฉันก็จบลงด้วยการสูญเสียการจ้องมองทั้งทฤษฎีและการประยุกต์ใช้สถิติ ฉันต้องบอกว่าเมื่อเทียบกับคณิตศาสตร์ "บริสุทธิ์" สถิติจริง ๆ แล้วสมเหตุสมผลสำหรับฉัน โดยเฉพาะอย่างยิ่งสัญลักษณ์และภาษาที่ใช้โดยนักสถิติส่วนใหญ่ (รวมถึงผู้บรรยายที่ผ่านมาของฉัน) นั้นซับซ้อนและน่ารำคาญและแทบไม่มีทรัพยากรใด ๆ ที่ฉันเคยเห็นมาจนถึงตอนนี้ (รวมถึงวิกิพีเดีย) มีตัวอย่างง่าย ๆ .. นี่คือพื้นหลัง; ฉันยังตระหนักถึงความจริงที่ขมขื่นที่ฉันไม่สามารถมีอาชีพในฐานะนักวิจัย / วิศวกรโดยที่ไม่ยึดมั่นกับสถิติโดยเฉพาะอย่างยิ่งในสาขาชีวสารสนเทศศาสตร์ ฉันหวังว่าฉันจะได้รับคำแนะนำจากนักสถิติ / นักคณิตศาสตร์ที่มีประสบการณ์มากขึ้น ฉันจะเอาชนะปัญหาที่ฉันได้กล่าวถึงข้างต้นได้อย่างไร คุณรู้จักแหล่งข้อมูลที่ดีหรือไม่ เช่นหนังสือ e-books หลักสูตรเปิด (ผ่าน iTunes หรือ OpenCourseware สำหรับอดีต) ฯลฯ แก้ไข:ตามที่ฉันได้กล่าวถึงฉันค่อนข้างลำเอียง (ลบ) ต่อวรรณกรรมส่วนใหญ่ภายใต้ชื่อเรื่องทั่วไปของสถิติและเนื่องจากฉันไม่สามารถซื้อหนังสือเรียนขนาดใหญ่ (และแพง) จำนวนมากต่อสาขาของสถิติสิ่งที่ฉันต้องการ ในแง่ของหนังสือเป็นสิ่งที่คล้ายกับสิ่งที่Tipler & Mosca สำหรับฟิสิกส์ แต่สำหรับสถิติ สำหรับผู้ที่ไม่รู้เกี่ยวกับ Tipler มันเป็นตำราเรียนขนาดใหญ่ที่ครอบคลุมเนื้อหาส่วนใหญ่ที่อาจพบได้ในระหว่างการศึกษาระดับสูง …

5
จะพิสูจน์ได้อย่างไรว่าการให้คะแนนของ Elo หรือการจัดอันดับหน้ามีความหมายสำหรับชุดของฉัน
ฉันมีชุดผู้เล่น พวกเขาเล่นกัน (คู่) คู่ของผู้เล่นจะถูกสุ่มเลือก ในเกมใด ๆ ผู้เล่นคนหนึ่งชนะและอีกคนหนึ่งแพ้ ผู้เล่นเล่นกัน จำกัด จำนวนเกม (ผู้เล่นบางคนเล่นเกมมากขึ้นบางคนน้อย) ดังนั้นฉันมีข้อมูล (ผู้ชนะต่อใครและกี่ครั้ง) ตอนนี้ฉันคิดว่าผู้เล่นทุกคนมีอันดับที่กำหนดความน่าจะเป็นในการชนะ ฉันต้องการตรวจสอบว่าข้อสมมติฐานนี้เป็นจริงหรือไม่ แน่นอนฉันสามารถใช้ระบบการจัดอันดับ Eloหรืออัลกอริทึม PageRankเพื่อจัดอันดับการคำนวณสำหรับผู้เล่นทุกคน แต่ด้วยการคำนวณเรตติ้งฉันไม่ได้พิสูจน์ว่าพวกเขา (เรตติ้ง) มีอยู่จริงหรือพวกเขาหมายถึงอะไร กล่าวอีกนัยหนึ่งฉันต้องการมีวิธีพิสูจน์ (หรือตรวจสอบ) ว่าผู้เล่นมีจุดแข็งที่แตกต่างกัน ฉันจะทำมันได้อย่างไร ADDED จะเจาะจงมากขึ้นฉันมีผู้เล่น 8 คนและเพียง 18 เกม ดังนั้นจึงมีผู้เล่นหลายคู่ที่ไม่ได้เล่นกันเองและมีคู่มากที่เล่นกันเพียงครั้งเดียว ผลก็คือฉันไม่สามารถประมาณความน่าจะเป็นของการชนะสำหรับผู้เล่นคู่หนึ่ง ตัวอย่างเช่นฉันเห็นว่ามีผู้เล่นที่ชนะ 6 ครั้งใน 6 เกม แต่บางทีมันอาจเป็นเรื่องบังเอิญ

5
การถดถอยแบบลอจิสติกและการสุ่มตัวอย่าง
ฉันเหมาะสมการถดถอยโลจิสติกแบบขั้นตอนในชุดของข้อมูลใน SPSS ในขั้นตอนนี้ฉันปรับโมเดลของฉันเป็นชุดย่อยแบบสุ่มที่มีค่าประมาณ 60% ของกลุ่มตัวอย่างทั้งหมดมีประมาณ 330 ราย สิ่งที่ฉันคิดว่าน่าสนใจคือทุกครั้งที่ฉันสุ่มตัวอย่างข้อมูลของฉันอีกครั้งฉันจะได้รับตัวแปรที่แตกต่างกันออกมาในรูปแบบสุดท้าย มีผู้ทำนายไม่กี่คนที่ปรากฏตัวในรุ่นสุดท้ายเสมอ คำถามของฉันคือสิ่งนี้ วิธีที่ดีที่สุดในการจัดการกับสิ่งนี้คืออะไร? ฉันหวังว่าจะเห็นการรวมกันของตัวแปรทำนาย แต่นั่นไม่ใช่กรณี บางรุ่นมีความรู้สึกที่เข้าใจง่ายกว่ามากจากมุมมองด้านปฏิบัติการ (และจะอธิบายได้ง่ายกว่ากับผู้มีอำนาจตัดสินใจ) และคนอื่น ๆ ก็พอดีกับข้อมูลที่ดีกว่าเล็กน้อย ในระยะสั้นเนื่องจากมีการสับเปลี่ยนตัวแปรคุณจะแนะนำให้จัดการกับสถานการณ์ของฉันได้อย่างไร ขอบคุณมากล่วงหน้า

1
LARS เทียบกับโคตรของโคตร
ข้อดีและข้อเสียของการใช้ LARS [1] เมื่อเทียบกับการใช้โคตรของพิกัดสำหรับการถดถอยเชิงเส้นแบบ L1 ที่เหมาะสมคืออะไร ฉันสนใจในเรื่องของประสิทธิภาพเป็นหลัก (ปัญหาของฉันมักจะNอยู่ในหลักแสนและp<20) อย่างไรก็ตามข้อมูลเชิงลึกอื่น ๆ ก็จะได้รับการชื่นชมเช่นกัน แก้ไข: เนื่องจากฉันได้โพสต์คำถาม, chl ได้ชี้ให้เห็นกระดาษ [2] โดย Friedman และคณะที่พิกัดโคตรถูกแสดงว่าเร็วกว่าวิธีอื่นมาก หากเป็นกรณีนี้ฉันควรเป็นผู้ประกอบการเพียงแค่ลืมเกี่ยวกับ LARS ในความโปรดปรานของการสืบเชื้อสายมาประสานงาน? [1] Efron, Bradley; Hastie เทรเวอร์; Johnstone, Iain และ Tibshirani, Robert (2004) "การถดถอยมุมน้อยที่สุด" พงศาวดารของสถิติ 32 (2): pp 407–499 [2] Jerome H. Friedman, Trevor Hastie, Rob Tibshirani, "เส้นทางการทำให้เป็นมาตรฐานสำหรับตัวแบบเชิงเส้นทั่วไปผ่านพิกัดโคตร", วารสารซอฟท์แวร์สถิติ, อัตรา …

2
แหล่งข้อมูลออนไลน์สำหรับการเรียนรู้สถิติแบบฝึกหัด (พร้อมโซลูชัน)
ปัจจุบันฉันทำงานเป็นผู้ช่วยสอนในมหาวิทยาลัยของฉันในหลักสูตรสถิติเบื้องต้น (สำหรับนักศึกษาแพทย์) ออฟไลน์มีหนังสือมากมายพร้อมข้อมูลเพื่อช่วยเหลือครู อย่างไรก็ตามสิ่งที่ฉันสนใจที่จะรู้คือถ้าคุณอาจนำฉันไปยังแหล่งข้อมูล (ดี) ใด ๆที่ให้แบบฝึกหัด (พร้อมคำตอบ) ในสถิติซึ่งมีให้ทางออนไลน์ (เช่น: บันทึกของครู) เนื้อหาวิชาอาจอยู่ในช่วงระหว่างสถิติเชิงพรรณนาความน่าจะเป็นและการอนุมานเชิงสถิติเชิงพารามิเตอร์ / ไม่ใช่เชิงพารามิเตอร์

1
คำนวณข้อผิดพลาดมาตรฐาน Newey-West โดยไม่มีวัตถุ lm ใน R
ฉันถามคำถามนี้เมื่อวานนี้ใน StackOverflow และได้รับคำตอบ แต่เราเห็นพ้องกันว่ามันดูค่อนข้างแฮ็คและอาจมีวิธีที่ดีกว่าในการดู คำถาม: ฉันต้องการคำนวณข้อผิดพลาดมาตรฐาน Newey-West (HAC) สำหรับเวกเตอร์ (ในกรณีนี้เวกเตอร์ที่มีผลตอบแทนสต็อก) ฟังก์ชั่นNeweyWest()ในsandwichแพ็คเกจทำสิ่งนี้ แต่รับlmวัตถุเป็นอินพุต วิธีการแก้ไธ MEYS นำเสนอเป็นโครงการเวกเตอร์บน 1 NeweyWest()ซึ่งจะเปลี่ยนเวกเตอร์ของฉันเป็นสิ่งตกค้างที่จะป้อนเข้าสู่ นั่นคือ: as.numeric(NeweyWest(lm(rnorm(100) ~ 1))) สำหรับความแปรปรวนของค่าเฉลี่ย ฉันควรจะทำอย่างนี้ไหม หรือมีวิธีที่จะทำสิ่งที่ฉันต้องการโดยตรงมากกว่านี้อีกไหม ขอบคุณ!

1
การคำนวณค่ามัธยฐานของค่ามัธยฐาน
ฉันทำการรายงานอสังหาริมทรัพย์หลายครั้งและราคามักจะถูกรายงานโดยเฉพาะอย่างยิ่งโดย NAR (National Association Of Realtors) อย่างที่ฉันบอกได้พวกเขาจะได้รับราคาเฉลี่ยของอสังหาริมทรัพย์จากแต่ละพื้นที่เท่านั้น คำถามของฉันคือควรคำนวณค่ามัธยฐานแห่งชาติอย่างไรเนื่องจากข้อ จำกัด ของข้อมูล ในฐานะที่เป็นค่ามัธยฐานของค่ามัธยฐานเป็นค่าเฉลี่ยแบบง่าย ๆ ของค่ามัธยฐานหรือค่าเฉลี่ยถ่วงน้ำหนักของค่ามัธยฐานหรือสิ่งที่แตกต่างอย่างสิ้นเชิง? ประการที่สองการประมาณเหล่านี้จะถูกต้องแม่นยำเพียงใด ฉันรู้ว่า NAR ไม่ได้รับตารางการทำธุรกรรมทั้งหมดดังนั้นการประมาณค่ามัธยฐานที่แม่นยำของการเป็นตัวแทนยังคงอยู่ในระดับประเทศหรือไม่ โดยเฉพาะอย่างยิ่งฉันถามเพราะความหนาแน่นในระดับภูมิภาคและราคาและผลต่างของตลาดมีขนาดใหญ่มาก
13 median 

4
การเปรียบเทียบก้อยของการแจกแจงตัวอย่างสองแบบ
ฉันมีชุดข้อมูลสองชุดที่มีศูนย์กลางอยู่ที่ประมาณศูนย์โดยประมาณ แต่ฉันสงสัยว่ามันมีก้อยต่างกัน ฉันรู้ว่าการทดสอบสองสามข้อเพื่อเปรียบเทียบการกระจายตัวกับการแจกแจงแบบปกติ แต่ฉันต้องการเปรียบเทียบการกระจายสองแบบโดยตรง มีการทดสอบอย่างง่าย ๆ เพื่อเปรียบเทียบความอุดมสมบูรณ์ของหางของการแจกแจง 2 แบบหรือไม่? ขอบคุณ fRed

1
ฉันสามารถทำการวินิจฉัยการบรรจบกันของ MCMC แบบกึ่งอัตโนมัติเพื่อตั้งค่าความยาวเบิร์นอินได้หรือไม่?
ฉันต้องการให้ตัวเลือกการเบิร์นอินสำหรับเครือข่าย MCMC โดยอัตโนมัติเช่นโดยการลบแถว n แรกตามการวิเคราะห์การลู่เข้า ขั้นตอนนี้จะปลอดภัยโดยอัตโนมัติในระดับใด แม้ว่าฉันจะยังตรวจสอบ autocorrelation, การติดตาม mcmc และ PDF อีกครั้งมันก็ดีถ้ามีทางเลือกในการเบิร์นอินแบบอัตโนมัติ คำถามของฉันเป็นเรื่องทั่วไป แต่มันจะดีถ้าคุณสามารถให้ข้อมูลเฉพาะสำหรับการจัดการกับ R mcmc.object; ฉันใช้แพ็คเกจ rjags และ coda ใน R
13 r  bayesian  mcmc 

1
การตีความ / การใช้ความหนาแน่นของเคอร์เนล
นี่อาจเป็นคำถามที่ไร้เดียงสา แต่นี่จะไป หากฉันมีชุดข้อมูลเชิงประจักษ์และปรับความหนาแน่นของเคอร์เนลให้เหมาะสมจากนั้นรับค่าเดี่ยวใหม่ซึ่งอาจมาจากกระบวนการเดียวกันซึ่งสร้างชุดข้อมูลดั้งเดิมฉันสามารถกำหนดความน่าจะเป็นที่ค่าใหม่นี้เป็นของชุดได้หรือไม่ / ประมวลผลโดยอ่านค่าออกจากแกน y ที่ค่าใหม่บนแกน x ตัดกันเส้นความหนาแน่นเคอร์เนลและหารด้วยพื้นที่ใต้เส้นความหนาแน่น?
13 kde 

2
การทำความเข้าใจเกณฑ์ AIC และ Schwarz
ฉันกำลังใช้โมเดลโลจิสติก ชุดข้อมูลโมเดลจริงมีตัวแปรมากกว่า 100 ตัว แต่ฉันเลือกชุดข้อมูลทดสอบที่มีตัวแปรประมาณ 25 ตัว ก่อนหน้านั้นฉันยังสร้างชุดข้อมูลซึ่งมีตัวแปร 8-9 ตัว ฉันถูกบอกว่าค่า AIC และ SC สามารถนำมาใช้เพื่อเปรียบเทียบแบบจำลอง ฉันสังเกตว่าโมเดลมีค่า SC สูงกว่าแม้ว่าตัวแปรจะมีค่า p ต่ำ (เช่น 0053) สำหรับสัญชาตญาณของฉันแบบจำลองที่มีตัวแปรที่มีระดับนัยสำคัญที่ดีควรทำให้ค่า SC และ AIC ต่ำ แต่นั่นไม่ได้เกิดขึ้น ใครก็ได้ช่วยอธิบายให้ฟังหน่อยได้ไหม ในระยะสั้นฉันต้องการถามคำถามต่อไปนี้: จำนวนตัวแปรเกี่ยวข้องกับ SC AIC หรือไม่ ฉันควรมุ่งเน้นที่ค่า p หรือค่า SC AIC ต่ำหรือไม่ อะไรคือวิธีทั่วไปในการลดค่า SC AIC

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.