สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
ค่าที่ทำนายไว้ส่งคืนโดยฟังก์ชัน Pred () ใน R เมื่อใช้ข้อมูลต้นฉบับเป็นอินพุตคืออะไร
หลังจากรันการถดถอยของแบบฟอร์มreg <- lm(y ~ x1 + x2, data=example)บนชุดข้อมูลฉันสามารถรับค่าที่ทำนายได้โดยใช้ predict(reg, example, interval="prediction", level=0.95) ฉันสงสัยว่าค่าที่ทำนายไว้จริงหมายถึงอะไรเมื่อฉันใช้การถดถอยเพื่อทำนายชุดข้อมูลที่แท้จริง ฉันไม่ควรได้รับค่าดั้งเดิมหรือไม่?
11 r  regression 

1
สิ่งที่ต้องอ่านจากฟังก์ชั่นออโต้คอร์สัมพันธ์
เมื่อให้อนุกรมเวลาเราสามารถประมาณค่าความสัมพันธ์ระหว่างฟังก์ชันและพล็อตได้เช่นตามที่เห็นด้านล่าง อะไรคือความเป็นไปได้ที่จะอ่านเกี่ยวกับอนุกรมเวลาจากฟังก์ชั่นความสัมพันธ์อัตโนมัตินี้? ยกตัวอย่างเช่นเป็นไปได้หรือไม่ที่จะให้เหตุผลเกี่ยวกับความคงที่ของอนุกรมเวลา แก้ไข : ที่นี่ฉันได้รวม ACF ของซีรีส์ที่แตกต่างกับล่าช้ามากขึ้น

1
ช่วงความเชื่อมั่นสำหรับความแตกต่างในอนุกรมเวลา
ฉันมีโมเดลสุ่มที่ใช้ในการจำลองอนุกรมเวลาของกระบวนการบางอย่าง ฉันสนใจผลของการเปลี่ยนพารามิเตอร์หนึ่งค่าเป็นค่าเฉพาะและต้องการแสดงความแตกต่างระหว่างอนุกรมเวลา (พูดแบบจำลอง A และแบบจำลอง B) และช่วงความเชื่อมั่นแบบจำลองบางประเภท ฉันทำการจำลองสถานการณ์จากรุ่น A และพวงจากรุ่น B แล้วลบค่ามัธยฐานในแต่ละจุดเพื่อค้นหาความแตกต่างของค่ามัธยฐานตลอดเวลา ฉันใช้วิธีการเดียวกันเพื่อค้นหา 2.5 และ 97.5 quantiles ดูเหมือนว่าจะเป็นวิธีที่อนุรักษ์นิยมมากเนื่องจากฉันไม่ได้พิจารณาแต่ละชุดเวลาร่วมกัน (เช่นแต่ละจุดถือว่าเป็นอิสระจากชุดอื่น ๆ ทั้งหมดในเวลาก่อนหน้าและอนาคต) มีวิธีที่ดีกว่าในการทำเช่นนี้?

2
ความสัมพันธ์ระหว่างตัวแปรเด็ดขาด
มีจำนวนมากเกี่ยวกับ collinearity ที่เกี่ยวกับการทำนายแบบต่อเนื่อง แต่ไม่มากนักที่ฉันสามารถค้นหาในตัวทำนายแบบหมวดหมู่ ฉันมีข้อมูลประเภทนี้แสดงไว้ด้านล่าง ปัจจัยแรกคือตัวแปรทางพันธุกรรม (นับอัลลีล) ปัจจัยที่สองคือประเภทของโรค เห็นได้ชัดว่ายีนนำหน้าโรคและเป็นปัจจัยในการแสดงอาการที่นำไปสู่การวินิจฉัย อย่างไรก็ตามการวิเคราะห์อย่างสม่ำเสมอโดยใช้ผลบวกของสี่เหลี่ยมจัตุรัสที่มีประเภท II หรือ III ดังเช่นที่ใช้กันทั่วไปในทางจิตวิทยากับ SPSS คิดถึงผลกระทบที่เกิดขึ้น การวิเคราะห์สแควร์สจำนวนหนึ่งเป็นการวิเคราะห์แบบหยิบมันขึ้นมาเมื่อป้อนคำสั่งที่เหมาะสมเพราะมันขึ้นอยู่กับลำดับ นอกจากนี้มีแนวโน้มว่าจะมีส่วนประกอบเพิ่มเติมในกระบวนการของโรคซึ่งไม่เกี่ยวข้องกับยีนที่ไม่ได้ระบุอย่างดีกับประเภท II หรือ III ดูanova (lm1)ด้านล่าง vs lm2 หรือ Anova ข้อมูลตัวอย่าง: set.seed(69) iv1 <- sample(c(0,1,2), 150, replace=T) iv2 <- round(iv1 + rnorm(150, 0, 1), 0) iv2 <- ifelse(iv2<0, 0, iv2) iv2 <- ifelse(iv2>2, …

7
มันเหมาะสมหรือไม่ที่จะศึกษาแปลงของเศษเหลือที่เกี่ยวกับตัวแปรตาม
ฉันอยากจะรู้ว่ามันเหมาะสมหรือไม่ที่จะศึกษาพล็อตเรื่องที่เกี่ยวข้องกับตัวแปรตามเมื่อฉันมีการถดถอยแบบไม่แปร ถ้ามันสมเหตุสมผลแล้วความสัมพันธ์เชิงเส้นแรงการเติบโตที่เพิ่มขึ้นระหว่างส่วนที่เหลือ (บนแกน y) และค่าประมาณของตัวแปรตาม (บนแกน x) คืออะไร?

2
การใช้งานและการตีความที่เหมาะสมของตัวแบบแกมม่าที่ไม่พองตัว
ข้อมูลประกอบ:ฉันเป็นนักชีวสถิติกำลังต่อสู้กับชุดข้อมูลของอัตราการแสดงออกของเซลล์ การศึกษาเปิดเผยโฮสต์ของเซลล์ที่รวบรวมในกลุ่มจากผู้บริจาคต่าง ๆ เพื่อเปปไทด์บางอย่าง เซลล์อาจแสดงตัวบ่งชี้ทางชีวภาพบางอย่างเพื่อตอบสนองหรือไม่ทำเช่นนั้น อัตราการตอบกลับจะถูกบันทึกไว้สำหรับผู้บริจาคแต่ละกลุ่ม อัตราการตอบสนอง (แสดงเป็นเปอร์เซ็นต์) เป็นผลลัพธ์ของดอกเบี้ยและการได้รับเปปไทด์เป็นตัวทำนาย โปรดสังเกตว่าการสังเกตนั้นมีการรวมกลุ่มกันภายในผู้บริจาค เนื่องจากฉันมีข้อมูลสรุปเท่านั้นฉันจึงยังคงรักษาอัตราการตอบกลับของผู้บริจาคให้เป็นข้อมูลต่อเนื่อง (อย่างน้อยตอนนี้) ภาวะแทรกซ้อนเกิดจากความจริงที่ว่าฉันมีเลขศูนย์ในข้อมูลของฉัน มากเกินไปที่จะเพิกเฉย ฉันกำลังพิจารณารูปแบบแกมม่าที่ไม่พองตัวเพื่อจัดการกับความจริงที่ว่าฉันได้บิดเบือนข้อมูลอย่างต่อเนื่องควบคู่กับการมีศูนย์รวมเกินศูนย์ ฉันได้พิจารณาแบบจำลอง Tobit ด้วยเช่นกัน แต่สิ่งนี้ดูด้อยกว่าเพราะถือว่าการเซ็นเซอร์ในขอบเขตที่ต่ำกว่าเมื่อเทียบกับศูนย์ของแท้ (นักเศรษฐศาสตร์อาจบอกว่า คำถาม:โดยทั่วไปแล้วการใช้แบบจำลองแกมม่าที่ไม่ต้องพองเมื่อใดจึงเหมาะสมที่จะใช้? นั่นคืออะไรคือสมมติฐาน? และคนเราตีความการอนุมานได้อย่างไร? ฉันจะขอบคุณสำหรับการเชื่อมโยงไปยังเอกสารที่กล่าวถึงเรื่องนี้ถ้าคุณมี ฉันได้พบลิงก์ใน SAS-Lซึ่ง Dale McLerran ให้รหัส NLMIXED สำหรับแบบจำลองแกมม่าที่ไม่มีการพองตัวดังนั้นมันจึงเป็นไปได้ อย่างไรก็ตามฉันจะเกลียดที่จะเรียกเก็บเงินจากคนตาบอด

3
วิธีการทำแผนภูมิวาฟเฟิลใน R?
ล็อคแล้ว คำถามและคำตอบของคำถามนี้ถูกล็อคเนื่องจากคำถามอยู่นอกหัวข้อ แต่มีความสำคัญทางประวัติศาสตร์ ขณะนี้ไม่ยอมรับคำตอบหรือการโต้ตอบใหม่ ฉันจะพล็อตแผนภูมิวาฟเฟิลเป็นทางเลือกแทนการใช้แผนภูมิวงกลมใน R ได้อย่างไร help.search("waffle") No help files found with alias or concept or title matching ‘waffle’ using fuzzy matching. ที่ใกล้ที่สุดที่ฉันพบ googling ออกมี mosaicplots

7
หากความสัมพันธ์ไม่ได้หมายความถึงความเป็นเหตุเป็นผลค่าของการทราบความสัมพันธ์ระหว่างตัวแปรสองตัวคืออะไร
สมมติว่าในฐานะเจ้าของธุรกิจ (หรือการตลาดหรือใครก็ตามที่เข้าใจพล็อตการกระจาย) จะแสดงพล็อตการกระจายของสองตัวแปร: จำนวนโฆษณาเทียบกับจำนวนการขายผลิตภัณฑ์ต่อเดือนในช่วง 5 ปีที่ผ่านมา (หรืออื่น ๆ มีตัวอย่างมากขึ้นฉันเพิ่งทำสิ่งนี้ขึ้นมา) ตอนนี้เขา / เธอเห็นพล็อตการกระจายและได้รับการบอกว่าสัมประสิทธิ์สหสัมพันธ์ (corr) คือ: 1 หรือ 0.5 หรือ 0.11 หรือ 0 หรือ -0.75 หรือ -1 โดยทั่วไปค่าที่ถูกต้องสำหรับ corr คำถาม: สิ่งนี้มีความหมายอย่างไรต่อผู้มีอำนาจตัดสินใจหรือผู้บริโภคในแผนการกระจาย การตัดสินใจแบบใดที่เราสามารถทำได้โดยอาศัยสิ่งนี้ Ie: การเห็นความสัมพันธ์ระหว่างตัวแปรสองตัวกับอะไรคือสิ่งที่เราสามารถทำอะไรกับข้อมูลนั้นได้อย่างโดดเดี่ยว? เป็นเพียงการดูว่าควรพิจารณาสิ่งใดและไม่ควรรวมอยู่ในการวิเคราะห์การถดถอยหรือมีการใช้งานจริงมากขึ้นหรือไม่? แค่อยากรู้อยากเห็นฉันได้ทำงานกับเทคนิคนี้เสมอ แต่ฉันได้รับการบอกว่าความสัมพันธ์ด้วยตัวมันเองนั้นไม่ได้ใช้ประโยชน์อะไรมาก - ดังนั้นการใช้ "IS" คืออะไร?

2
การหาจำนวนของ gaussians ในส่วนผสม จำกัด กับทฤษฎีบทของ Wilks?
สมมติว่าผมมีชุดของอิสระสังเกต univariate กันกระจายและสองสมมติฐานเกี่ยวกับวิธีการถูกสร้าง:xxxxxx H0H0H_0 : มาจากการแจกแจงแบบเกาส์เดียวโดยไม่ทราบค่าเฉลี่ยและความแปรปรวนxxx HAHAH_A : มาจากการผสมผสานของสอง Gaussians ที่ไม่ทราบค่าเฉลี่ยความแปรปรวนและสัมประสิทธิ์การผสมxxx หากฉันเข้าใจอย่างถูกต้องนี่เป็นแบบจำลองที่ซ้อนกันเนื่องจากแบบจำลองที่หมายถึงสามารถอธิบายได้ในแง่ของหากคุณ จำกัด พารามิเตอร์ของ Gaussians ทั้งสองให้เหมือนกันหรือ จำกัด สัมประสิทธิ์การผสมให้เป็นศูนย์สำหรับหนึ่งในสอง Gaussians H0H0H_0HAHAH_A ดังนั้นดูเหมือนว่าคุณจะสามารถใช้อัลกอริทึม EM เพื่อประเมินพารามิเตอร์ของแล้วใช้ทฤษฎีบทของวิลก์สเพื่อพิจารณาว่าโอกาสของข้อมูลภายใต้นั้นสูงกว่าของอย่างมีนัยสำคัญไม่ มีความเชื่อเล็กน้อยในข้อสันนิษฐานว่าอัลกอริทึม EM จะมาบรรจบกันกับความเป็นไปได้สูงสุดที่นี่ แต่เป็นสิ่งที่ฉันยินดีทำHAHAH_AHAHAH_AH0H0H_0 ฉันลองสิ่งนี้ในการจำลอง monte carlo โดยสมมติว่ามีอิสระมากกว่า 3 องศา H 0 (ค่าเฉลี่ยและความแปรปรวนสำหรับ Gaussian ที่สองและพารามิเตอร์การผสม) เมื่อฉันจำลองข้อมูลจาก H 0ฉันได้รับการแจกแจงแบบ P-value ที่ไม่สม่ำเสมอและได้รับการเสริมคุณค่าสำหรับค่า P ขนาดเล็ก (หาก EM ไม่ได้มาบรรจบกันกับความเป็นไปได้สูงสุดที่แท้จริงจะมีสิ่งตรงกันข้ามเกิดขึ้นแน่นอน) เกิดอะไรขึ้นกับการประยุกต์ใช้ทฤษฎีบทของวิลก์สที่สร้างอคตินี้HAHAH_AH0H0H_0H0H0H_0

2
ฉันควรรันการถดถอยแบบแยกกันสำหรับทุกชุมชนหรือชุมชนสามารถเป็นตัวแปรควบคุมในรูปแบบรวมได้หรือไม่
ฉันใช้โมเดล OLS พร้อมตัวแปรดัชนีสินทรัพย์อย่างต่อเนื่องในฐานะ DV ข้อมูลของฉันถูกรวบรวมจากชุมชนที่คล้ายกันสามแห่งในพื้นที่ใกล้เคียงทางภูมิศาสตร์ใกล้กัน อย่างไรก็ตามเรื่องนี้ฉันคิดว่ามันสำคัญที่จะต้องใช้ชุมชนเป็นตัวแปรควบคุม ชุมชนกลายเป็นสิ่งสำคัญในระดับ 1% (คะแนน t--4.52) ชุมชนเป็นตัวแปรที่ระบุ / หมวดหมู่ที่เข้ารหัสเป็น 1,2,3 สำหรับ 1 ใน 3 ชุมชนที่แตกต่างกัน คำถามของฉันคือถ้าความสำคัญระดับสูงนี้หมายความว่าฉันควรทำการถดถอยในชุมชนทีละรายการแทนที่จะเป็นการรวมตัว มิฉะนั้นการใช้ชุมชนเป็นตัวแปรควบคุมเป็นหลักทำเช่นนั้น?

8
นักโทษที่ผิดธรรมดา
ฉันได้รับการออกกำลังกายและฉันก็ไม่สามารถเข้าใจได้ นักโทษที่ผิดธรรมดานักโทษสามคนที่ถูกกักตัวเดี่ยว A, B และ C ถูกตัดสินประหารชีวิตในวันเดียวกัน แต่เนื่องจากมีวันหยุดประจำชาติผู้ว่าราชการจังหวัดจึงตัดสินว่าจะได้รับการให้อภัย นักโทษจะได้รับแจ้งเรื่องนี้ แต่บอกว่าพวกเขาจะไม่ทราบว่าจะให้คนใดคนหนึ่งรอดชีวิตจนกว่าจะถึงวันที่กำหนดไว้สำหรับการประหารชีวิต ผู้ต้องหาคนหนึ่งพูดกับผู้คุม "ฉันรู้แล้วว่าอย่างน้อยหนึ่งนักโทษอีกสองคนจะถูกประหารดังนั้นหากคุณบอกชื่อผู้ถูกประหารชีวิตฉันจะไม่ให้ข้อมูลเกี่ยวกับการประหารชีวิตของฉัน" . ผู้คุมยอมรับสิ่งนี้และบอกเขาว่า C จะต้องตายอย่างแน่นอน เหตุผลก่อนหน้านี้“ ก่อนที่ฉันจะรู้ตัว C จะต้องถูกประหารชีวิตฉันมีโอกาส 1 ใน 3 ที่จะได้รับการให้อภัย ตอนนี้ฉันรู้ว่า B หรือตัวฉันเองจะได้รับการอภัยอัตราต่อรองที่ได้รับการปรับปรุงเป็น 1 ใน 2 " แต่ผู้คุมชี้ว่า“ คุณอาจได้ข้อสรุปที่คล้ายกันถ้าฉันบอกว่า B จะตายและฉันก็ต้องตอบทั้ง B หรือ C ดังนั้นทำไมคุณต้องถาม?” โอกาสในการได้รับการอภัยโทษคืออะไรและเพราะอะไร สร้างคำอธิบายที่จะทำให้คนอื่นเชื่อว่าคุณพูดถูก คุณสามารถแก้ไขปัญหานี้โดยทฤษฎีบทของเบย์โดยการวาดเครือข่ายความเชื่อหรือโดยสามัญสำนึก วิธีใดก็ตามที่คุณเลือกควรทำให้คุณเข้าใจแนวคิดเรื่องความน่าจะเป็นแบบมีเงื่อนไขอย่างหลอกลวงมากยิ่งขึ้น นี่คือการวิเคราะห์ของฉัน: ดูเหมือนว่าปัญหา Monty Hallแต่จะไม่มาก ถ้า A บอกว่าI …


1
วิธีการทำการวิเคราะห์ความแปรปรวนแบบผสมขนาด 4 คูณ 4 ด้วยความแตกต่างระหว่างและภายในเรื่องโดยใช้ R?
ผู้ใช้ระดับเริ่มต้นของ R ที่นี่ต้องดิ้นรนกับมาตรการ ANOVA ซ้ำ ๆ ฉันมีชุดข้อมูลที่ประกอบด้วยหนึ่งระหว่างปัจจัยของกลุ่มวิชาที่มี 4 ระดับ (เขียนเป็นตัวแปรเดียวที่เรียกว่า 'กลุ่ม') และอีกหนึ่งรายการอยู่ในกลุ่มวิชาที่มี 4 ระดับ (เขียนเป็นตัวแปรแยกกันสี่ชุดคือ 'DV1', 'DV2', 'DV3 ',' DV4 ') ฉันมีวัตถุประสงค์ดังต่อไปนี้: ใช้มาตรการ ANOVA ซ้ำ ๆ โดยรวม เปรียบเทียบกลุ่มโดยใช้ความแตกต่างที่กำหนดเอง (เช่นในคำสั่ง LMATRIX ใน SPSS) เปรียบเทียบระดับต่างๆของ DV โดยใช้ความแตกต่างที่กำหนดเอง (เช่นในคำสั่ง MMATRIX ใน SPSS) ทำการรวมกันของ 2) และ 3) พร้อมกันดังนั้นฉันจึงเปรียบเทียบเฉพาะบางกลุ่มในระดับที่แน่นอนของปัจจัยภายในเรื่อง ใช้ชุดความแตกต่างที่ไม่รวมกับศูนย์ ฉันรู้ว่าฉันสามารถทำสิ่งนี้ใน SPSS ได้โดยไม่มีปัญหา แต่ฉันไม่สามารถเข้าใจวิธีการทำเช่นนี้ได้ใน R. …

2
คู่แบบเบย์คืออะไรกับการทดสอบสองตัวอย่างที่มีความแปรปรวนไม่เท่ากัน
ฉันกำลังมองหาคู่แบบเบย์ของการทดสอบสองตัวอย่างที่มีความแปรปรวนไม่เท่ากัน (การทดสอบ Welch) ฉันกำลังมองหาการทดสอบหลายตัวแปรเช่นสถิติ T ของ Hotelling อ้างอิงชื่นชม สำหรับกรณีหลายตัวแปรสมมติว่าเรามีและ( z 1 , ⋯ , z N )โดยที่y i (resp z i ) เป็นทางลัดสำหรับค่าเฉลี่ยตัวอย่างส่วนเบี่ยงเบนมาตรฐานและจำนวนตัวอย่าง ของคะแนน เราสามารถสรุปได้ว่าจำนวนของจุดที่เป็นค่าคงที่ในชุดข้อมูลที่ทั้งค่าเบี่ยงเบนมาตรฐานเหมือนกันทุกปีผม (รับผิดชอบZ ฉัน ) และนั่นหมายถึงตัวอย่างของY ฉัน (รับผิดชอบZ ฉัน(y1,⋯,yN)(y1,⋯,yN)(y_1,\cdots,y_N)(z1, ⋯,zN)(z1,⋯,Zยังไม่มีข้อความ)(z_1,\cdots,z_N)YผมYผมy_iZผมZผมz_iYผมYผมy_iZผมZผมz_iYผมYผมy_iZผมZผมz_i) มีความสัมพันธ์กัน หากคุณพล็อตตัวอย่างหมายถึงพวกมันติดตามซึ่งกันและกันและโดยการเชื่อมต่อคุณจะได้รับฟังก์ชั่นที่เปลี่ยนแปลงอย่างราบรื่น ตอนนี้ในบางส่วนฟังก์ชั่นเห็นด้วยกับฟังก์ชั่นzแต่ในส่วนอื่น ๆ มันไม่ได้เพราะm e a n ( y i ) - m e a n …

3
ทำไมผลิตภัณฑ์ของค่าสัมประสิทธิ์การถดถอยของตัวแปร bivariate ของเส้น -on-และ -on- line เท่ากับกำลังสองของความสัมพันธ์?
มีรูปแบบการถดถอยเป็นที่กับและซึ่งมีค่าสัมประสิทธิ์สหสัมพันธ์ของ0.60302Y=a+bXY=a+bXY = a + bXa=1.6a=1.6a = 1.6b=0.4b=0.4b=0.4r=0.60302r=0.60302r = 0.60302 ถ้าและจะเปลี่ยนแล้วรอบ ๆ และสมการที่จะกลายเป็นที่และก็ยังมีค่าของ0.60302XXXYYYX=c+dYX=c+dYX = c + dYc=0.4545c=0.4545c=0.4545d=0.9091d=0.9091d=0.9091rrr0.603020.603020.60302 ฉันหวังว่าคนที่สามารถอธิบายได้ว่าทำไมยังเป็น0.60302(d×b)0.5(d×b)0.5(d\times b)^{0.5}0.603020.603020.60302

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.