สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

4
การวิเคราะห์องค์ประกอบหลักและการถดถอยในไพ ธ อน
ฉันกำลังพยายามหาวิธีที่จะสร้างผลงานใน Python ที่ฉันทำใน SAS การใช้ชุดข้อมูลนี้ซึ่งมีปัญหาความหลากหลายทางหลายระดับฉันต้องการทำการวิเคราะห์องค์ประกอบหลักใน Python ฉันได้ดู scikit-learn และ statsmodels แต่ฉันไม่แน่ใจว่าจะเอาท์พุทของพวกเขาและแปลงเป็นโครงสร้างผลลัพธ์เดียวกันกับ SAS สำหรับสิ่งหนึ่ง SAS ดูเหมือนว่าจะดำเนินการ PCA บนเมทริกซ์สหสัมพันธ์เมื่อคุณใช้PROC PRINCOMPแต่ส่วนใหญ่ (ทั้งหมด?) ของไลบรารี Python ดูเหมือนจะใช้ SVD ในชุดข้อมูลคอลัมน์แรกคือตัวแปรตอบกลับและอีก 5 รายการถัดไปคือตัวแปรทำนายที่เรียกว่า pred1-pred5 ใน SAS เวิร์กโฟลว์ทั่วไปคือ: /* Get the PCs */ proc princomp data=indata out=pcdata; var pred1 pred2 pred3 pred4 pred5; run; /* Standardize the response …

3
จะตรวจสอบได้อย่างไรว่าข้อมูลของฉันตรงกับการกระจายปกติหรือไม่
ฉันต้องการตรวจสอบRว่าข้อมูลของฉันตรงกับการแจกแจงแบบล็อกปกติหรือแบบ Pareto ฉันจะทำสิ่งนั้นได้อย่างไร อาจks.testช่วยให้ฉันทำเช่นนั้นได้ แต่ฉันจะรับพารามิเตอร์αα\alphaและkkkสำหรับการกระจาย Pareto สำหรับข้อมูลของฉันได้อย่างไร

1
ฝึกอบรมโครงข่ายประสาทเทียม
ฉันกำลังทำงานกับซอฟต์แวร์จดจำใบหน้าที่ใช้เครือข่ายประสาทเทียมเพื่อจดจำใบหน้า จากการอ่านของฉันฉันได้รวบรวมว่าเครือข่ายประสาทเทียมได้แบ่งปันน้ำหนักเพื่อประหยัดเวลาในการฝึก แต่วิธีหนึ่งจะปรับการกระจายกลับเพื่อให้สามารถใช้ในโครงข่ายประสาทเทียม ในการแพร่กระจายย้อนกลับหนึ่งใช้สูตรที่คล้ายกับสิ่งนี้ในการฝึกอบรมน้ำหนัก New Weight = Old Weight + LEARNING_RATE * 1 * Output Of InputNeuron * Delta อย่างไรก็ตามเนื่องจากในเครือข่ายประสาทเทียมน้ำหนักที่ใช้ร่วมกันจึงมีการใช้น้ำหนักแต่ละเซลล์ร่วมกับเซลล์ประสาทหลายตัวดังนั้นฉันจะตัดสินใจได้อย่างไรว่าOutput of InputNeuronจะใช้อุปกรณ์ใด กล่าวอีกนัยหนึ่งเนื่องจากน้ำหนักถูกแชร์ฉันจะตัดสินใจได้อย่างไรว่าต้องเปลี่ยนน้ำหนักด้วย

3
มีตัวอย่างอะไรของตัวแปรที่ซ่อนอยู่ในการทดลองที่มีการควบคุมในสิ่งพิมพ์?
ในบทความนี้: ตัวแปรที่ซุ่มซ่อน: บางตัวอย่าง Brian L. Joiner ฉบับสถิติชาวอเมริกัน 35, ฉบับที่ 4, พ.ย. , 1981 227-233 Brian Joiner อ้างว่า "การสุ่มไม่ใช่ยาครอบจักรวาล" ตรงข้ามกับข้อความทั่วไปเช่นข้อความด้านล่าง: การทดสอบที่ออกแบบมาอย่างดีประกอบด้วยคุณสมบัติการออกแบบที่ช่วยให้นักวิจัยสามารถกำจัดตัวแปรภายนอกซึ่งเป็นคำอธิบายสำหรับความสัมพันธ์ที่สังเกตได้ระหว่างตัวแปรอิสระกับตัวแปรตาม ตัวแปรภายนอกเหล่านี้เรียกว่าตัวแปรซุ่มซ่อน ข้อความที่นำมาจากคำถามนี้และไม่มีแหล่งที่มา แต่จากประสบการณ์ของฉันมันเป็นตัวแทนของทัศนคติที่แพร่หลาย: ตัวอย่างของ Lurking Variable และสังเกตการณ์ที่มีอิทธิพล ตัวอย่างหนึ่งที่ให้ไว้คือเมื่อทำการทดสอบความปลอดภัย (การก่อมะเร็งโดยเฉพาะ) ของสีย้อมอาหารสีแดง # 40 บนสัตว์ฟันแทะในอายุเจ็ดสิบผลของตำแหน่งกรงก็พบว่าทำให้การศึกษาสับสน ตอนนี้ฉันได้อ่านบทความวารสารมากมายที่ศึกษาการก่อมะเร็งในสัตว์ฟันแทะ การอภิปรายเพิ่มเติมของการศึกษาเหล่านี้สามารถพบได้ที่นี่: กรณีศึกษาสถิติในกระบวนการกำกับดูแล: การทดลอง FD&C Red No. 40 ฉันไม่พบรุ่นที่ไม่ได้ชำระเงิน แต่นี่เป็นข้อความที่ตัดตอนมา: ในการประชุมเดือนมกราคมเรานำเสนอการวิเคราะห์เบื้องต้น (14) ที่เปิดเผยความสัมพันธ์ที่แข็งแกร่งระหว่างแถวกรงและอัตราการเสียชีวิต RE (reticulo-endothelial tumor) ซึ่งมีความหลากหลายตั้งแต่ …

4
ลักษณนามสำหรับฉลากระดับที่ไม่แน่นอน
สมมติว่าฉันมีชุดของอินสแตนซ์ที่เกี่ยวข้องกับป้ายชื่อคลาส ไม่สำคัญว่าจะติดป้ายกำกับอินสแตนซ์เหล่านี้อย่างไรแต่ความแน่นอนของการเป็นสมาชิกคลาสของพวกเขาคืออะไร แต่ละ instancs อยู่ในระดับเดียวเท่านั้น สมมติว่าฉันสามารถวัดความแน่นอนของการเป็นสมาชิกแต่ละคลาสด้วยแอตทริบิวต์ที่ระบุซึ่งมีค่าตั้งแต่ 1 ถึง 3 (แน่นอนมากถึงไม่แน่ใจตามลำดับ) มีตัวจําแนกบางประเภทที่คํานึงถึงความแน่นอนดังกล่าวหรือไม่และถ้าใช่มันมีอยู่ในชุดเครื่องมือ WEKA หรือไม่? ฉันคิดว่าสถานการณ์นี้เกิดขึ้นค่อนข้างบ่อยตัวอย่างเช่นเมื่ออินสแตนซ์ถูกจำแนกตามมนุษย์ซึ่งไม่แน่ใจว่าสมบูรณ์แบบเสมอไป ในกรณีของฉันฉันต้องจำแนกรูปภาพและบางครั้งรูปภาพอาจเป็นของมากกว่าหนึ่งคลาส หากสิ่งนี้เกิดขึ้นฉันให้ชั้นเรียนมีความไม่แน่นอนสูง แต่ยังคงจัดประเภทไว้ด้วยคลาสเดียวเท่านั้น หรือมีวิธีอื่นในการแก้ไขปัญหานี้โดยไม่มีตัวจําแนกพิเศษ? เช่นเดียวกับการจัดหมวดหมู่ "แน่นอน" สำหรับการฝึกอบรมเท่านั้น? ฉันกลัวว่าในกรณีนี้จะมีการจัดประเภทผิดพลาดมากกว่าเนื่องจากคดี "ชายแดน" ไม่ครอบคลุม

3
ระยะทางระหว่างสองแบบเกาส์นผสมเพื่อประเมินโซลูชันคลัสเตอร์
ฉันใช้การจำลองอย่างรวดเร็วเพื่อเปรียบเทียบวิธีการจัดกลุ่มที่แตกต่างกันและในปัจจุบันมีอุปสรรคพยายามประเมินโซลูชั่นคลัสเตอร์ ฉันรู้เกี่ยวกับการตรวจสอบความถูกต้องหลายอย่าง (จำนวนมากที่พบในcluster.stats ()ใน R) แต่ฉันคิดว่าสิ่งเหล่านี้จะถูกใช้ดีที่สุดถ้าจำนวนกลุ่มโดยประมาณจริงเท่ากับจำนวนจริงของกลุ่ม ฉันต้องการรักษาความสามารถในการวัดประสิทธิภาพของวิธีการแก้ปัญหาการจัดกลุ่มเมื่อไม่ได้ระบุจำนวนที่ถูกต้องของกลุ่มในการจำลองแบบดั้งเดิม (เช่นการจำลองข้อมูลวิธีการแก้ปัญหาของกลุ่มที่สามที่จำลองเป็น 4 กลุ่ม สารละลาย). สำหรับข้อมูลของคุณกลุ่มจะถูกจำลองเพื่อให้มีเมทริกซ์ความแปรปรวนร่วมเหมือนกัน ฉันคิดว่า KL แตกต่างระหว่างสองส่วนผสมของ Gaussians จะเป็นประโยชน์ในการใช้ แต่ไม่มีวิธีแก้ปัญหาแบบปิด ( Hershey และ Olson (2007) ) และการใช้แบบจำลอง Monte Carlo เริ่มมีราคาแพง มีวิธีแก้ไขปัญหาอื่น ๆ ที่อาจใช้งานง่าย (แม้ว่าจะเป็นเพียงการประมาณ)?

2
พล็อตขอบเขตการตัดสินใจสำหรับ perceptron
ฉันพยายามพล็อตขอบเขตการตัดสินใจของอัลกอริทึม Perceptron และฉันสับสนมากเกี่ยวกับบางสิ่ง อินสแตนซ์อินพุตของฉันอยู่ในรูปแบบโดยทั่วไปอินสแตนซ์อินพุต 2D ( x 1และx 2 ) และค่าเป้าหมายคลาสไบนารี ( y ) [1 หรือ 0][ ( x1, x2) ,y][(x1,x2),Y][(x_{1},x_{2}), y]x1x1x_{1}x2x2x_{2}YYy เวกเตอร์น้ำหนักของฉันจึงอยู่ในรูปแบบ: ][ w1, w2][W1,W2][w_{1}, w_{2}] ตอนนี้ฉันต้องรวมพารามิเตอร์ bias เพิ่มเติมและด้วยเหตุนี้เวกเตอร์น้ำหนักของฉันกลายเป็นเวกเตอร์3 × 1หรือไม่ มันคือ1 × 3เวกเตอร์ ฉันคิดว่าควรเป็น1 × 3เนื่องจากเวกเตอร์มีเพียง 1 แถวและคอลัมน์ nW0W0w_{0}3 × 13×13 \times 11 ×31×31 \times 31 × 31×31 …

1
แรงจูงใจเบื้องหลังขั้นตอนวิธีฟอเรสต์แบบสุ่ม
วิธีการที่ฉันคุ้นเคยกับการสร้างฟอเรสต์แบบสุ่มมีดังนี้: (จากhttp://www.stat.berkeley.edu/~breiman/RandomForests/cc_home.htm ) เพื่อสร้างต้นไม้ในป่าเรา: บูตตัวอย่างขนาด N ที่ N คือขนาดของชุดการฝึกอบรมของเรา ใช้ตัวอย่าง bootstrapped นี้เป็นชุดการฝึกอบรมสำหรับต้นไม้นี้ ที่แต่ละโหนดของต้นไม้สุ่มเลือก m ของคุณสมบัติ M ของเรา เลือกคุณสมบัติที่ดีที่สุดของ m เหล่านี้เพื่อแยก (โดยที่ m เป็นพารามิเตอร์ของป่าสุ่มของเรา) ปลูกต้นไม้แต่ละต้นให้มากที่สุดเท่าที่จะทำได้เช่นไม่มีการตัดแต่งกิ่ง ในขณะที่อัลกอริทึมนี้สมเหตุสมผลในระดับขั้นตอนและให้ผลลัพธ์ที่ดีแน่นอนฉันไม่ชัดเจนว่าแรงจูงใจทางทฤษฎีอยู่เบื้องหลังขั้นตอนที่ 1, 2 และ 3 ใครสามารถอธิบายสิ่งที่กระตุ้นให้คนที่มากับขั้นตอนนี้และทำไมมัน ทำงานได้ดีเหรอ ตัวอย่างเช่น: ทำไมเราต้องดำเนินการขั้นตอนที่ 1 ดูเหมือนว่าเรากำลังทำ bootstrapping เพื่อจุดประสงค์ในการลดความแปรปรวนตามปกติ

2
ทำไมโมเดลเอฟเฟกต์แบบสุ่มต้องการให้เอฟเฟ็กต์ไม่เกี่ยวข้องกับตัวแปรอินพุตในขณะที่โมเดลเอฟเฟกต์คงที่อนุญาตให้มีความสัมพันธ์กัน?
จากวิกิพีเดีย มีสมมติฐานทั่วไปสองข้อเกี่ยวกับเอฟเฟกต์เฉพาะของแต่ละบุคคล, สมมติฐานเอฟเฟกต์แบบสุ่มและสมมติฐานผลกระทบคงที่ สมมติฐานผลกระทบแบบสุ่ม (ทำในรูปแบบผลกระทบแบบสุ่ม) คือว่าผลกระทบเฉพาะบุคคลจะไม่เกี่ยวข้องกับตัวแปรอิสระ ข้อสันนิษฐานผลกระทบคงที่คือผลกระทบเฉพาะบุคคลมีความสัมพันธ์กับตัวแปรอิสระ หากการสันนิษฐานผลกระทบแบบสุ่มถือแบบจำลองผลกระทบแบบสุ่มมีประสิทธิภาพมากขึ้นกว่าแบบจำลองผลกระทบคงที่ อย่างไรก็ตามหากสมมติฐานนี้ไม่ได้เก็บไว้ (เช่นหากการทดสอบ Durbin – Watson ล้มเหลว) โมเดลเอฟเฟกต์แบบสุ่มจะไม่สอดคล้องกัน ฉันสงสัยว่าทำไมตัวแบบเอฟเฟกต์แบบสุ่มต้องการให้เอฟเฟกต์แบบสุ่มไม่เกี่ยวข้องกับตัวแปรอินพุตในขณะที่โมเดลเอฟเฟกต์แบบคงที่จะทำให้เอฟเฟกต์สัมพันธ์กับตัวแปรอินพุต ขอบคุณ!

3
พล็อตสะสม / สะสม (หรือ“ การแสดงเส้นโค้ง Lorenz”)
ฉันไม่รู้ว่าแปลงดังกล่าวเรียกว่าอะไรฉันจึงตั้งคำถามโง่ ๆ สมมติว่าฉันมีชุดข้อมูลที่สั่งซื้อดังนี้ 4253 4262 4270 4383 4394 4476 4635 ... แต่ละหมายเลขสอดคล้องกับจำนวนการโพสต์ที่ผู้ใช้บางรายมีส่วนร่วมในเว็บไซต์ ฉันกำลังสังเกตุการตรวจสอบ "การมีส่วนร่วมความไม่เท่าเทียมกัน" ปรากฏการณ์ตามที่กำหนดไว้ที่นี่ เพื่อให้ง่ายต่อการเข้าใจฉันต้องการสร้างพล็อตที่ช่วยให้ผู้อ่านสรุปได้อย่างรวดเร็วเช่น "10% ของผู้ใช้มีส่วนร่วม 50% ของข้อมูล" มันควรจะมีลักษณะคล้ายกับภาพร่างสีสวยหมัดนี้เป็นที่ยอมรับ: ฉันไม่รู้เลยว่าจะเรียกสิ่งนี้ได้อย่างไรฉันไม่รู้ว่าจะหาที่ไหน นอกจากนี้หากใครบางคนมีการนำไปใช้Rสิ่งนั้นจะยอดเยี่ยม

2
ทำไมความหนาแน่นหลังเป็นสัดส่วนกับความหนาแน่นก่อนหน้าที่ฟังก์ชันโอกาส?
ตามทฤษฎีบท Bayes' ) แต่ตามข้อความทางเศรษฐมิติของฉันมันบอกว่าP ( θ | Y ) α P ( Y | θ ) P ( θ ) ทำไมถึงเป็นเช่นนี้ ฉันไม่เข้าใจว่าทำไมP ( y ) ถึงถูกเพิกเฉยP( y| θ)P( θ ) = P( θ | y) P( y)P(y|θ)P(θ)=P(θ|y)P(y)P(y|\theta)P(\theta) = P(\theta|y)P(y)P( θ | y) ∝ P( y| θ)P( θ )P(θ|y)∝P(y|θ)P(θ)P(\theta|y) \propto P(y|\theta)P(\theta)P( …

1
วิธีการทำนายข้อมูลใหม่ด้วยการถดถอยอิสระ
ใครสามารถช่วยอธิบายแนวคิดเกี่ยวกับวิธีการคาดการณ์สำหรับข้อมูลใหม่เมื่อใช้แบบเรียบ / เส้นโค้งสำหรับแบบจำลองการทำนายได้หรือไม่ ตัวอย่างเช่นเมื่อสร้างแบบจำลองที่ใช้gamboostในmboostแพ็คเกจใน R ด้วย p-splines การคาดการณ์สำหรับข้อมูลใหม่ทำอย่างไร ข้อมูลอะไรที่ใช้ในการฝึกอบรม? สมมติว่ามีค่าใหม่ของตัวแปรอิสระ x และเราต้องการทำนาย y สูตรสำหรับการสร้างอิสระถูกนำไปใช้กับค่าข้อมูลใหม่นี้โดยใช้ knots หรือ df ที่ใช้เมื่อทำการฝึกอบรมรูปแบบแล้วค่าสัมประสิทธิ์จากแบบจำลองที่ผ่านการฝึกอบรมจะถูกนำไปใช้ในการทำนายผลลัพธ์หรือไม่? นี่คือตัวอย่างของ R สิ่งที่คาดการณ์ว่าจะทำให้เกิดแนวคิดในการแสดงผล 899.4139 สำหรับข้อมูลใหม่ mean_radius = 15.99 #take the data wpbc as example library(mboost) data(wpbc) modNew<-gamboost(mean_area~mean_radius, data = wpbc, baselearner = "bbs", dfbase = 4, family=Gaussian(),control = boost_control(mstop = 5)) test<-data.frame(mean_radius=15.99) …

3
คำถามเกี่ยวกับการพิสูจน์สมการปกติ
คุณจะพิสูจน์ได้อย่างไรว่าสมการปกติ: (XTX)β=XTY(XTX)β=XTY(X^TX)\beta = X^TYมีวิธีแก้ปัญหาหนึ่งวิธีหรือมากกว่าโดยไม่มีสมมติฐานว่า X กลับด้านได้? สิ่งเดียวที่ฉันคาดเดาก็คือมันมีบางอย่างที่เกี่ยวข้องกับการผกผันทั่วไป แต่ฉันก็หลงทางไปหมด
11 regression  proof 

2
ฟิชเชอร์สำหรับหุ่น?
ฉบับย่อ: มีการแนะนำให้รู้จักกับงานเขียนของโรนัลด์ฟิชเชอร์(เอกสารและหนังสือ) เกี่ยวกับสถิติที่มุ่งเป้าไปที่ผู้ที่ไม่มีพื้นฐานด้านประวัติหรือไม่? ฉันกำลังคิดถึงบางสิ่งเช่น "ผู้อ่านฟิชเชอร์ที่มีคำอธิบายประกอบ" ซึ่งมีเป้าหมายที่ไม่ใช่นักสถิติ ฉันสะกดแรงจูงใจสำหรับคำถามนี้ที่ด้านล่าง แต่ได้รับการเตือนว่ามันยืดยาว (ฉันไม่รู้วิธีอธิบายให้กระชับมากขึ้น) และยิ่งกว่านั้นมันยังเป็นที่ถกเถียงกันมาก ดังนั้นโปรดข้ามส่วนที่เหลือของโพสต์นี้ถ้าคุณไม่คิดว่าคำถาม (ตามที่ระบุข้างต้น) สั้นเกินไปที่จะตอบโดยไม่ต้องชี้แจงเพิ่มเติม ฉันได้สอนตัวเองเกี่ยวกับพื้นฐานของหลาย ๆ พื้นที่ที่ผู้คนจำนวนมากจะพิจารณาเรื่องยาก (เช่นพีชคณิตเชิงเส้นพีชคณิตนามธรรมการวิเคราะห์ที่แท้จริงและซับซ้อนทอพอโลยีทั่วไปทฤษฎีการวัด ฯลฯ ) แต่ความพยายามทั้งหมดของฉันในการสอนสถิติตัวเองล้มเหลว . เหตุผลของเรื่องนี้ไม่ใช่ว่าฉันพบสถิติที่ยากในทางเทคนิค (หรือมากกว่านั้นนอกเหนือจากส่วนอื่น ๆ ที่ฉันพยายามหาทางผ่าน) แต่ฉันพบว่าสถิติของคนต่างด้าวอยู่เสมอถ้าไม่ใช่คนแปลกๆ พื้นที่อื่นที่ฉันเคยสอนตัวเอง ช้าฉันเริ่มสงสัยว่ารากของความแปลกประหลาดนี้ส่วนใหญ่เป็นเรื่องทางประวัติศาสตร์และในฐานะที่เป็นคนที่เรียนสาขานี้จากหนังสือและไม่ได้มาจากชุมชนของผู้ปฏิบัติงาน (เช่นกรณีถ้าฉันได้รับการฝึกฝนอย่างเป็นทางการในสถิติ ) ฉันจะไม่มีวันผ่านความรู้สึกแปลกแยกนี้จนกว่าฉันจะได้เรียนรู้เพิ่มเติมเกี่ยวกับประวัติของสถิติ ดังนั้นฉันได้อ่านหนังสือหลายเล่มเกี่ยวกับประวัติของสถิติและการทำเช่นนี้ในความเป็นจริงแล้วไปทาง looong ในการอธิบายสิ่งที่ฉันเห็นว่าเป็นความแปลกประหลาดของสนาม แต่ฉันมีวิธีที่จะไปในทิศทางนี้ยังคง หนึ่งในสิ่งที่ฉันได้เรียนรู้จากการอ่านของฉันในประวัติศาสตร์ของสถิติคือแหล่งที่มาของสิ่งที่ฉันเห็นว่าแปลกประหลาดในสถิติคือผู้ชายคนหนึ่งโรนัลด์ฟิชเชอร์ อันที่จริงคำพูดต่อไปนี้1 (ซึ่งฉันเพิ่งค้นพบเมื่อเร็ว ๆ นี้) เป็นพยัญชนะทั้งสองด้วยความตระหนักของฉันว่าโดยการเจาะลึกลงไปในประวัติศาสตร์บางอย่างฉันจะเริ่มทำความเข้าใจกับสาขานี้ จุดอ้างอิง: แนวคิดและทฤษฎีทางสถิติส่วนใหญ่สามารถอธิบายแยกต่างหากจากที่มาทางประวัติศาสตร์ของพวกเขา สิ่งนี้ไม่สามารถทำได้โดยไม่มีความลึกลับที่ไม่จำเป็นสำหรับกรณีของ "ความน่าจะเป็นแบบ fiducial" อันที่จริงฉันคิดว่าลางสังหรณ์ของฉันที่นี่แม้ว่าแน่นอน (แน่นอน) ไม่ได้ไม่มีมูลความจริงทั้งหมด ฟิชเชอร์ไม่เพียง …

1
LASSO เลือกกลุ่มพยากรณ์ได้อย่างไร
ฉันกำลังมองหาคำตอบที่เข้าใจง่ายว่าทำไมรุ่น GLM LASSO เลือกตัวทำนายที่เฉพาะเจาะจงออกจากกลุ่มของกลุ่มที่มีความสัมพันธ์สูงและทำไมมันถึงแตกต่างจากการเลือกคุณสมบัติชุดย่อยที่ดีที่สุด จากรูปทรงเรขาคณิตของ LASSO ที่แสดงในรูปที่ 2 ในTibshirani 1996ฉันเชื่อว่า LASSO เลือกตัวทำนายที่มีความแปรปรวนมากขึ้น ตอนนี้สมมติว่าฉันใช้การเลือกชุดย่อยที่ดีที่สุดกับ CV 10 เท่าเพื่อรับตัวทำนาย 2 ตัวสำหรับโมเดลการถดถอยโลจิสติกและฉันมีความรู้ก่อนที่เหมาะสมว่าตัวทำนาย 2 ตัวเหล่านี้เหมาะสมที่สุด (ในแง่สูญเสีย 0-1) วิธีการแก้ปัญหา LASSO สนับสนุนวิธีการแก้ปัญหาที่ไม่พึงประสงค์ (5 ตัวทำนาย) ที่น้อยกว่าพร้อมกับข้อผิดพลาดในการทำนายที่มากขึ้น โดยสัญชาตญาณอะไรทำให้เกิดความแตกต่างเกิดขึ้น เป็นเพราะวิธีที่ LASSO เลือกระหว่างตัวทำนายที่สัมพันธ์กันหรือไม่?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.