สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

4
การลดจำนวนตัวแปรในการถดถอยหลายครั้ง
ฉันมีชุดข้อมูลขนาดใหญ่ซึ่งประกอบด้วยค่าของตัวแปรทางการเงินหลายร้อยตัวที่สามารถใช้ในการถดถอยหลายครั้งเพื่อทำนายพฤติกรรมของกองทุนดัชนีในช่วงเวลาหนึ่ง ฉันต้องการลดจำนวนของตัวแปรให้เหลือเพียงสิบหรือมากกว่านั้นในขณะที่ยังคงรักษาพลังการทำนายได้มากที่สุด เพิ่มเติม: ชุดของตัวแปรที่ลดลงจะต้องเป็นชุดย่อยของชุดตัวแปรดั้งเดิมเพื่อที่จะรักษาความหมายทางเศรษฐกิจของตัวแปรดั้งเดิมไว้ ตัวอย่างเช่นฉันไม่ควรลงท้ายด้วยชุดค่าผสมเชิงเส้นหรือมวลรวมของตัวแปรดั้งเดิม ความคิด (อาจไร้เดียงสา) บางอย่างเกี่ยวกับวิธีการทำเช่นนี้: ดำเนินการถดถอยเชิงเส้นที่เรียบง่ายกับตัวแปรแต่ละตัวและเลือกสิบมีขนาดใหญ่ที่สุดค่า แน่นอนไม่มีการรับประกันว่าตัวแปรที่ดีที่สุดสิบตัวที่รวมกันจะเป็นกลุ่มที่ดีที่สุดของสิบคนR2R2R^2 ทำการวิเคราะห์ส่วนประกอบหลักและลองค้นหาตัวแปรสิบตัวแรกที่มีความสัมพันธ์มากที่สุดกับแกนหลักสองสามตัวแรก ฉันไม่คิดว่าฉันสามารถทำการถดถอยแบบลำดับชั้นได้เนื่องจากตัวแปรนั้นไม่ซ้อนกันจริงๆ การลองชุดค่าผสมที่เป็นไปได้ทั้งหมดของตัวแปรสิบตัวนั้นเป็นไปไม่ได้เนื่องจากไม่มีชุดค่าผสมมากเกินไป มีวิธีการมาตรฐานในการจัดการกับปัญหานี้ในการลดจำนวนตัวแปรในการถดถอยหลายครั้งหรือไม่? ดูเหมือนว่านี่จะเป็นปัญหาที่พบได้บ่อยพอที่จะมีวิธีการมาตรฐาน คำตอบที่เป็นประโยชน์มากคือคำตอบที่ไม่เพียง แต่กล่าวถึงวิธีมาตรฐาน แต่ยังให้ภาพรวมของวิธีการและสาเหตุ อีกวิธีหนึ่งถ้าไม่มีวิธีการแบบมาตรฐาน แต่มีหลายวิธีที่มีจุดแข็งและจุดอ่อนที่แตกต่างกันคำตอบที่มีประโยชน์มากก็คือคำตอบที่เป็นประโยชน์ ความคิดเห็นของ whuber ด้านล่างแสดงว่าคำขอในย่อหน้าสุดท้ายนั้นกว้างเกินไป แต่ฉันจะยอมรับว่าเป็นคำตอบที่ดีสำหรับรายการของวิธีการที่สำคัญบางทีอาจมีคำอธิบายสั้น ๆ ของแต่ละวิธี เมื่อฉันมีเงื่อนไขฉันสามารถขุดรายละเอียดในแต่ละตัวเอง

1
จะคำนวณการวัดความแม่นยำตาม RMSE ได้อย่างไร? ชุดข้อมูลขนาดใหญ่ของฉันกระจายตามปกติหรือไม่
ฉันมีชุดข้อมูลหลายชุดตามคำสั่งของคะแนนหลายพัน ค่าในแต่ละชุดข้อมูลคือ X, Y, Z หมายถึงพิกัดในอวกาศ ค่า Z แสดงถึงความแตกต่างในการยกระดับที่คู่พิกัด (x, y) โดยทั่วไปในฟิลด์ GIS ของฉันข้อผิดพลาดการยกระดับจะถูกอ้างอิงใน RMSE โดยการลบจุดความจริงภาคพื้นดินไปยังจุดวัด (จุดข้อมูล LiDAR) โดยปกติแล้วจะใช้จุดตรวจสอบข้อเท็จจริงขั้นต่ำ 20 จุด การใช้ค่า RMSE นี้ตาม NDEP (แนวทางระดับความสูงของดิจิตอลแห่งชาติ) และแนวทางของ FEMA จะสามารถคำนวณการวัดความแม่นยำได้: ความแม่นยำ = 1.96 * RMSE ความแม่นยำนี้ถูกระบุว่า: "ความแม่นยำในแนวดิ่งพื้นฐานคือค่าที่ความแม่นยำในแนวดิ่งสามารถประเมินและเปรียบเทียบได้อย่างเท่าเทียมกันในชุดข้อมูลความแม่นยำขั้นพื้นฐานจะคำนวณที่ระดับความเชื่อมั่น 95% ในฐานะฟังก์ชันของแนวตั้ง RMSE" ฉันเข้าใจว่า 95% ของพื้นที่ภายใต้เส้นโค้งการแจกแจงแบบปกติตั้งอยู่ภายใน 1.96 * std.deviation แต่ไม่เกี่ยวข้องกับ RMSE โดยทั่วไปฉันถามคำถามนี้: การใช้ RMSE …

1
ความแตกต่างระหว่าง GLM และ GEE คืออะไร?
อะไรคือความแตกต่างระหว่างโมเดล GLM (การถดถอยโลจิสติก) กับตัวแปรการตอบสนองแบบไบนารีซึ่งรวมถึงเรื่องและเวลาเป็น covariates และโมเดล GEE แบบอะนาล็อกซึ่งคำนึงถึงความสัมพันธ์ระหว่างการวัดที่จุดเวลาหลายจุด? GLM ของฉันดูเหมือนว่า: Y(binary) ~ A + B1X1(subject id) + B2X2(time) + B3X3(interesting continuous covariate) ด้วยฟังก์ชั่นการเชื่อมโยง logit ฉันกำลังมองหาคำอธิบายง่ายๆ (มุ่งเป้าไปที่นักวิทยาศาสตร์สังคม) ว่าทำไมเวลาจึงได้รับการปฏิบัติแตกต่างกันในสองโมเดลและสิ่งที่เกี่ยวข้องกับการตีความ

1
พล็อตการทำนายที่แตกต่างจาก coxph การอยู่รอดและ rms cph
ฉันได้สร้างตัวเองรุ่นของฉันเพิ่มขึ้นเล็กน้อยจาก termplot ที่ฉันใช้ในตัวอย่างนี้คุณสามารถค้นหาได้ที่นี่ ฉันโพสต์ก่อนหน้านี้บนSOแต่ยิ่งฉันคิดเกี่ยวกับมันมากขึ้นฉันเชื่อว่านี่อาจเกี่ยวข้องกับการตีความของโมเดลอันตราย Cox Proportional มากกว่าการเข้ารหัสจริง ปัญหา เมื่อฉันมองไปที่พล็อตอัตราส่วนอันตรายผมคาดว่าจะมีจุดอ้างอิงที่ช่วงความเชื่อมั่นตามธรรมชาติคือ 0 และเป็นกรณีนี้เมื่อฉันใช้ CPH () จากrms packageแต่ไม่เมื่อฉันใช้ coxph (ที่) survival packageจาก พฤติกรรมที่ถูกต้องโดย coxph () และถ้าเป็นเช่นนั้นจุดอ้างอิงคืออะไร? นอกจากนี้ตัวแปรดัมมี่ใน coxph () มีช่วงเวลาและค่าอื่นที่ไม่ใช่e0e0e^0? ตัวอย่าง นี่คือรหัสทดสอบของฉัน: # Load libs library(survival) library(rms) # Regular survival survobj <- with(lung, Surv(time,status)) # Prepare the variables lung$sex <- factor(lung$sex, levels=1:2, labels=c("Male", …
9 r  survival  cox-model 

1
จะตัดสินผู้ชนะอย่างยุติธรรมในงานวิทยาศาสตร์ระดับภูมิภาคได้อย่างไร?
ฉันต้องการความช่วยเหลือในการหาวิธีที่ถูกต้องในการคำนวณผู้ชนะในงานวิทยาศาสตร์ของเรา ฉันไม่ต้องการให้ฉันไม่รู้ถึงสถิติและคณิตศาสตร์เพื่อให้เด็กมีโอกาสชนะ (ทุนการศึกษาจำนวนมาก & ผลประโยชน์ความก้าวหน้าในการเดิมพัน) ขอบคุณล่วงหน้าสำหรับความช่วยเหลือของ. พื้นหลังเล็กน้อยของวิธีการตั้งค่าสิ่งต่าง ๆ : โดยทั่วไปงานของเรามีโครงการนักศึกษาประมาณ 600 โครงการ โครงการเหล่านี้เสร็จสมบูรณ์และนำเสนอโดยนักเรียนเป็นรายบุคคลหรือเป็นทีมของนักเรียน ทีมสามารถประกอบด้วยเด็ก 2 หรือ 3 คน นักเรียนแบ่งออกเป็นสองแผนก: ระดับประถมศึกษา (ระดับ 6-8) และระดับมัธยมศึกษา (เกรด 9-12) แต่ละแผนกมีประเภทที่แตกต่างกัน: 9 หมวดหมู่สำหรับโครงการระดับประถมศึกษาและ 17 หมวดหมู่สำหรับโครงการแผนกรอง รางวัลจะมอบให้สำหรับที่หนึ่งที่สองและสามสำหรับแต่ละหมวดหมู่ในแต่ละหมวด รางวัลชมเชยที่มอบรางวัลนั้นมอบให้สำหรับตำแหน่งนอกเหนือจากที่สาม สำหรับแต่ละโครงการเรามอบหมายผู้ตัดสินระหว่าง 4 ถึง 6 คน เราทำสิ่งที่ได้รับมอบหมายตามคุณสมบัติของผู้ตัดสินความพึงพอใจในหมวดหมู่และประสบการณ์การตัดสินที่ผ่านมาของพวกเขา (มีประสบการณ์มากขึ้นถูกมอบหมายให้ทำงานในแผนกอาวุโส) วิธีการตัดสินคะแนนโครงการ: สำหรับแต่ละโครงการมี 5 เกณฑ์ที่กำหนดคะแนน แต่ละเกณฑ์สามารถมอบให้ระหว่าง 1 ถึง 20 คะแนน เกณฑ์ทั่วไปคือ: วัตถุประสงค์ …

1
การบัญชีสำหรับพารามิเตอร์ที่ไม่ต่อเนื่องหรือไบนารีในเกณฑ์ข้อมูลเบย์
BIC ลงโทษตามจำนวนพารามิเตอร์ เกิดอะไรขึ้นถ้าพารามิเตอร์บางตัวเป็นตัวแปรตัวบ่งชี้ไบนารีบางประเภท นับเป็นพารามิเตอร์แบบเต็มหรือไม่ แต่ผมสามารถรวมพารามิเตอร์ไบนารีในตัวแปรที่ไม่ต่อเนื่องหนึ่งที่จะนำค่าใน\} สิ่งเหล่านี้จะนับเป็นพารามิเตอร์หรือพารามิเตอร์เดียวหรือไม่ม.ม.m{ 0 , 1 , . . ,2ม.- 1 }{0,1,...,2ม.-1}\{0,1,...,2^m-1\}ม.ม.m

1
เมื่อใดจึงจะเลือก PCA กับ LSA / LSI
คำถาม: มีแนวทางทั่วไปเกี่ยวกับคุณลักษณะของข้อมูลอินพุตที่สามารถใช้ในการตัดสินใจระหว่างการใช้ PCA กับ LSA / LSI หรือไม่ สรุปโดยย่อของ PCA กับ LSA / LSI: การวิเคราะห์องค์ประกอบหลัก (PCA) และการวิเคราะห์ความหมายแฝง (LSA) หรือดัชนีความหมายแฝง (LSI) มีความคล้ายคลึงกันในแง่ที่ว่าพวกเขาทั้งหมดอาศัยพื้นฐานการประยุกต์ใช้การสลายตัวของค่าเอกฐาน (SVD) กับเมทริกซ์ LSA และ LSI เป็นเท่าที่ฉันสามารถบอกได้ในสิ่งเดียวกัน LSA แตกต่างจาก PCA ไม่ใช่พื้นฐาน แต่ในแง่ของวิธีการที่รายการเมทริกซ์จะถูกประมวลผลล่วงหน้าก่อนที่จะใช้ SVD ใน LSA ขั้นตอนก่อนการประมวลผลโดยทั่วไปจะเกี่ยวข้องกับการทำให้เมทริกซ์การนับเป็นมาตรฐานที่คอลัมน์สอดคล้องกับ 'เอกสาร' และแถวสอดคล้องกับคำบางชนิด รายการอาจถูกคิดว่าเป็นการนับจำนวนการเกิดคำสำหรับเอกสาร ใน PCA ขั้นตอนก่อนการประมวลผลเกี่ยวข้องกับการคำนวณเมทริกซ์ความแปรปรวนร่วมจากเมทริกซ์ดั้งเดิม เมทริกซ์ดั้งเดิมนั้นมีแนวคิด 'ทั่วไป' มากกว่าในกรณีของ LSA ในกรณีที่มีความกังวล PCA คอลัมน์มักจะพูดถึงการอ้างอิงตัวอย่างเวกเตอร์ทั่วไปและแถวจะกล่าวถึงตัวแปรแต่ละตัวที่ถูกวัด เมทริกซ์ความแปรปรวนร่วมนั้นเป็นไปตามนิยามสี่เหลี่ยมจัตุรัสและสมมาตรและในความเป็นจริงมันไม่จำเป็นที่จะใช้ …

2
เกิดข้อผิดพลาดเมื่อเรียกใช้ glmnet ใน multinomial [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามดังนั้นจึงเป็นหัวข้อสำหรับการตรวจสอบข้าม ปิดให้บริการใน9 เดือนที่ผ่านมา ปัญหาที่กล่าวถึงในคำถามนี้ได้รับการแก้ไขในรุ่น 1.7.3 ของแพ็คเกจ glmnet ฉันมีปัญหาบางอย่างในการใช้ glmnet กับ family = multinomial และสงสัยว่าได้พบสิ่งที่คล้ายกันหรืออาจบอกฉันได้ว่าฉันทำอะไรผิด เมื่อฉันใส่ข้อมูลจำลองของฉันเองข้อผิดพลาด "ข้อผิดพลาดในการใช้งาน (nz, 1, ค่ามัธยฐาน): สลัว (X) ต้องมีความยาวเป็นบวก" ได้รับรายงานเมื่อฉันทำงานcv.glmnetซึ่งนอกเหนือจากการพูดว่า "มันไม่ทำงาน" ไม่ได้ให้ข้อมูลกับฉันอย่างมหาศาล y=rep(1:3,20) #=> 60 element vector set.seed(1011) x=matrix(y+rnorm(20*3*10,sd=0.4),nrow=60) # 60*10 element matrix glm = glmnet(x,y,family="multinomial") #=> returns without error crossval = cv.glmnet(x,y,family="multinomial") …
9 r  multinomial  glmnet 

1
วิธีที่ดีที่สุดในการจัดการชุดข้อมูลมัลติคลาสที่ไม่สมดุลด้วย SVM
ฉันกำลังพยายามสร้างแบบจำลองการทำนายด้วย SVM บนข้อมูลที่ไม่สมดุล เลเบล / เอาต์พุตของฉันมีสามคลาส, บวก, เป็นกลางและลบ ฉันจะบอกว่าตัวอย่างบวกทำประมาณ 10 - 20% ของข้อมูลของฉันเป็นกลางประมาณ 50 - 60% และลบประมาณ 30 - 40% ฉันพยายามที่จะสร้างความสมดุลให้กับชั้นเรียนเนื่องจากค่าใช้จ่ายที่เกี่ยวข้องกับการทำนายที่ไม่ถูกต้องในชั้นเรียนนั้นไม่เหมือนกัน วิธีหนึ่งคือการสุ่มข้อมูลการฝึกอบรมซ้ำและสร้างชุดข้อมูลที่มีความสมดุลเท่ากันซึ่งใหญ่กว่าแบบเดิม ที่น่าสนใจเมื่อฉันทำเช่นนั้นฉันมักจะได้รับการคาดการณ์ที่ดีกว่าสำหรับชั้นเรียนอื่น (เช่นเมื่อฉันสร้างความสมดุลให้กับข้อมูลฉันเพิ่มจำนวนตัวอย่างสำหรับชั้นเรียนที่เป็นบวก แต่จากการคาดการณ์ตัวอย่าง ทุกคนสามารถอธิบายได้โดยทั่วไปว่าทำไมสิ่งนี้เกิดขึ้น ถ้าฉันเพิ่มจำนวนตัวอย่างสำหรับคลาสลบฉันจะได้อะไรที่คล้ายกับคลาสบวกจากการคาดการณ์ตัวอย่าง (เช่นการคาดคะเนที่ดีขึ้น) นอกจากนี้ยังเปิดกว้างมากสำหรับความคิดอื่น ๆ เกี่ยวกับวิธีที่ฉันสามารถจัดการกับข้อมูลที่ไม่สมดุลทั้งผ่านการกำหนดค่าใช้จ่ายที่แตกต่างกันในการจัดประเภทที่ผิดพลาดหรือการใช้ตุ้มน้ำหนักระดับใน LibSVM (ไม่แน่ใจว่าจะเลือก /

1
วิธีกำหนด“ ตัวอย่าง” คืออะไร?
หากฉันให้คุณสามตัวเลขที่เป็นอิสระและเหมือนกันจากการแจกแจงแบบปกติมาตรฐานจากนั้นฉันจะให้คุณสามตัวอย่างหรือหนึ่งตัวอย่าง? หากคำตอบคือตัวอย่างหนึ่งก็มีชื่อสั้น ๆ สำหรับสิ่งที่ฉันให้คุณสามข้อ?

2
วิธีปรับให้พอดีกับการถดถอยเช่นใน R?
ฉันมีข้อมูลอนุกรมเวลาที่ตัวแปรที่วัดได้นั้นเป็นจำนวนเต็มบวกแบบไม่ต่อเนื่อง (นับ) ฉันต้องการทดสอบว่ามีแนวโน้มสูงขึ้นเมื่อเวลาผ่านไป (หรือไม่) ตัวแปรอิสระ (x) อยู่ในช่วง 0-500 และตัวแปรที่ขึ้นต่อกัน (y) อยู่ในช่วง 0-8 ฉันคิดว่าฉันตอบคำถามนี้โดยปรับการถดถอยของแบบฟอร์มy = floor(a*x + b)โดยใช้กำลังสองน้อยที่สุดธรรมดา (OLS) ฉันจะทำสิ่งนี้โดยใช้ R (หรือ Python) ได้อย่างไร มีแพ็คเกจที่มีอยู่สำหรับมันหรือฉันดีกว่าที่จะเขียนอัลกอริทึมของตัวเอง? PS: ฉันรู้ว่านี่ไม่ใช่เทคนิคในอุดมคติ แต่ฉันต้องทำการวิเคราะห์ที่ค่อนข้างง่ายที่ฉันสามารถเข้าใจได้จริง - พื้นหลังของฉันคือชีววิทยาไม่ใช่คณิตศาสตร์ ฉันรู้ว่าฉันกำลังละเมิดสมมติฐานเกี่ยวกับข้อผิดพลาดในตัวแปรที่วัดได้และความเป็นอิสระของการวัดเมื่อเวลาผ่านไป
9 r  regression  python 

1
คำแนะนำสำหรับนักศึกษาระดับบัณฑิตศึกษาในวิชาสถิติ
ฉันเริ่มปริญญาเอกสาขาสถิติในปีนี้และฉันกำลังมองหาแนวทางปฏิบัติที่ดีที่สุดคำแนะนำและ (คำแนะนำจากเมตาดาต้า) เกี่ยวกับวิธีการเติบโตและกลายเป็นนักวิจัยด้านวิชาการที่ดีในสาขาสถิติ / ML ยินดีต้อนรับความคิดและการเชื่อมโยงทั่วไป แต่เพื่อเริ่มต้นการพลิกบอลต่อไปนี้เป็นคำถามมากมายที่รวบรวมจากบทความที่ดีเยี่ยมของ Michael Steele " คำแนะนำสำหรับนักศึกษาระดับบัณฑิตศึกษาในสถิติ " (ถ้าฉันขาดคำถามสำคัญหรือคำถามบางข้อ ไม่มีความหมาย - โปรดแสดงความคิดเห็นด้วย): กระดาษกับวิทยานิพนธ์ - เราควรมุ่งเน้นไปที่การตีพิมพ์บทความในระหว่างปริญญาเอกของเขาเท่าไหร่ เอกสารหนึ่งควรมีความปรารถนาที่จะเขียนจริง? เราควรพยายามตีพิมพ์ในวารสารใด (คำถามที่เกี่ยวข้องlink1 , link2 ) ควรใช้เวลากี่ชั่วโมงต่อวันในการวิจัย (การพัฒนา / การจัดการกับคำถามการวิจัยของคุณ) และการเรียนรู้ (อ่านเอกสารใหม่ / หลักสูตรที่เข้าร่วม) ใครจะไปหา "หัวข้อยอดนิยม" ที่ไหนหรือดีกว่า - "เร็ว ๆ นี้จะเป็นหัวข้อยอดนิยม" ( link1 , link2 ) เมื่อพบ "หัวข้อน่าสนใจ" แล้วเราจะเรียนรู้พื้นฐานของปัญหาในหลายแง่มุมได้อย่างไรโดยเน้นที่ด้านเดียว เห็นได้ชัดว่าคำถามเหล่านี้กว้างมากและมีหลายมุมสำหรับการคิด / …
9 careers  phd  academia 

1
จะรวมการพยากรณ์ได้อย่างไรเมื่อตัวแปรตอบสนองในตัวแบบการพยากรณ์แตกต่างกันอย่างไร
บทนำ ในการรวมการคาดการณ์หนึ่งในโซลูชั่นยอดนิยมขึ้นอยู่กับการประยุกต์ใช้เกณฑ์ข้อมูลบางอย่าง การยกตัวอย่างเช่น Akaike เกณฑ์โดยประมาณสำหรับรุ่นหนึ่งสามารถคำนวณความแตกต่างของจากแล้วRP_j = E ^ {(AIC ^ * - AIC_j) / 2}อาจจะตีความว่าเป็น ความน่าจะเป็นแบบสัมพัทธ์ของ model jเป็นค่าจริง น้ำหนักนั้นถูกกำหนดเป็นAICjAICjAIC_jjjjAICjAICjAIC_jAIC∗=minjAICjAIC∗=minjAICjAIC^* = \min_j{AIC_j}RPj=e(AIC∗−AICj)/2RPj=e(AIC∗−AICj)/2RP_j = e^{(AIC^*-AIC_j)/2}jjj wj=RPj∑jRPjwj=RPj∑jRPjw_j = \frac{RP_j}{\sum_j RP_j} ปัญหา ความยากลำบากที่ฉันพยายามเอาชนะคือแบบจำลองนั้นประมาณจากตัวแปรตอบสนอง (ภายนอก) ที่แปรเปลี่ยนไป ตัวอย่างเช่นบางรุ่นขึ้นอยู่กับอัตราการเติบโตประจำปีและอีกรุ่น - จากอัตราการเติบโตรายไตรมาส ดังนั้นค่าAIC_j ที่แยกออกมาAICjAICjAIC_jจะไม่สามารถเปรียบเทียบกันได้โดยตรง พยายามแก้ปัญหา เนื่องจากสิ่งที่สำคัญคือความแตกต่างของAICAICAICที่สามารถใช้AICของโมเดลพื้นฐานAICAICAIC(ตัวอย่างเช่นฉันพยายามแยกlm(y~-1)โมเดลโดยไม่มีพารามิเตอร์ใด ๆ ) ที่ไม่แปรเปลี่ยนไปจากการตอบสนองการแปลงตัวแปรการตอบสนองแล้วเปรียบเทียบความแตกต่างระหว่างโมเดลjjj th และ ฐานรูปแบบAICAICAICAICนี่ แต่มันดูเหมือนว่ายังคงเป็นจุดที่อ่อนแอ - ความแตกต่างเป็นผลกระทบจากการเปลี่ยนแปลงของตัวแปรการตอบสนอง สรุปข้อสังเกต หมายเหตุตัวเลือกเช่น "ประมาณโมเดลทั้งหมดในตัวแปรตอบกลับเดียวกัน" …

4
จะบอกปริมาณได้อย่างไรว่าข้อมูล 1D มีการทำคลัสเตอร์ประมาณ 1 หรือ 3 ค่าหรือไม่
ฉันได้รับข้อมูลบางอย่างในเวลาระหว่างหัวใจเต้นของมนุษย์ ข้อบ่งชี้หนึ่งของการเต้นนอกมดลูก (พิเศษ) คือช่วงเวลาเหล่านี้มีการทำคลัสเตอร์ประมาณสามค่าแทนที่จะเป็นหนึ่ง ฉันจะได้รับการวัดเชิงปริมาณของสิ่งนี้ได้อย่างไร ฉันกำลังมองหาเพื่อเปรียบเทียบชุดข้อมูลหลายชุดและฮิสโตแกรม 100 bin สองรายการนี้เป็นตัวแทนของชุดข้อมูลทั้งหมด ฉันสามารถเปรียบเทียบความแปรปรวนได้ แต่ฉันต้องการให้อัลกอริทึมของฉันสามารถตรวจสอบว่ามีหนึ่งหรือสามกลุ่มในแต่ละกรณีโดยไม่เปรียบเทียบกับกรณีอื่น ๆ นี่คือการประมวลผลแบบออฟไลน์ดังนั้นจึงมีพลังในการคำนวณจำนวนมากหากจำเป็น

4
วิธีการใช้ตัวแปรจำลองโดยใช้ตัวแปร n-1
ถ้าฉันมีตัวแปรที่มี 4 ระดับในทางทฤษฎีฉันต้องใช้ตัวแปร 3 ตัว ในทางปฏิบัติสิ่งนี้เกิดขึ้นจริงได้อย่างไร? ฉันจะใช้ 0-3 ฉันจะใช้ 1-3 และปล่อยว่างไว้ที่ 4 หรือไม่? ข้อเสนอแนะใด ๆ หมายเหตุ: ฉันจะทำงานในอาร์ UPDATE: จะเกิดอะไรขึ้นถ้าฉันใช้คอลัมน์เดียวที่ใช้ 1-4 สอดคล้องกับโฆษณา มันจะทำงานหรือแนะนำปัญหาหรือไม่

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.