สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
นักสถิติจะถามคำถามอะไรเกี่ยวกับการวิเคราะห์การระบาดของเชื้ออีโคไล
คุณอาจเคยได้ยินเกี่ยวกับ enterohaemorrhagic ล่าสุดE. coli ( EHEC ) ระบาดในประเทศเยอรมนี นักสถิติจะถามคำถามอะไรเกี่ยวกับการวิเคราะห์ EHEC ฉันกำลังคิดถึง Q + ระหว่างนักข่าว / เจ้าหน้าที่ของรัฐ↔ที่ไม่ใช่ผู้เชี่ยวชาญพูดว่าอาจารย์และวิศวกรที่มีระดับอนุปริญญา / ปริญญาโท แต่อย่างน้อยที่สุดก็เป็นสถิติ (เป็นรูปแผนที่ของที่ดิน EHEC แสดงสายพันธุ์ต่าง ๆ ของ EHEC และครอบคลุมการทดสอบต่าง ๆ เป็นไปได้หรือไม่) วันจันทร์ที่ 20 มิถุนายน: ฉันคิดว่าการระบาดของ EHEC จะเป็นพื้นที่ที่มีสถิติสำคัญในโลกโดยรวม: หลักฐานอะไรที่เป็นสาเหตุต่าง ๆ สิ่งเหล่านี้จะสื่อสารกับสาธารณะได้อย่างไร ดังนั้นเริ่มต้นเงินรางวัล

2
จัดระเบียบแผนภูมิการจัดหมวดหมู่ (ใน rpart) เป็นชุดของกฎหรือไม่
มีวิธีที่เมื่อต้นไม้การจำแนกที่ซับซ้อนถูกสร้างขึ้นโดยใช้ rpart (ใน R) เพื่อจัดระเบียบกฎการตัดสินใจสำหรับแต่ละชั้นหรือไม่? ดังนั้นแทนที่จะได้รับต้นไม้ใหญ่หนึ่งต้นเราจะได้ชุดของกฎสำหรับแต่ละชั้นเรียน (ถ้าเป็นเช่นนั้นได้อย่างไร) นี่คือตัวอย่างรหัสง่ายๆที่จะแสดงตัวอย่างใน: fit <- rpart(Kyphosis ~ Age + Number + Start, data=kyphosis) ขอบคุณ
11 r  classification  cart  rpart 

3
วิธีการเปรียบเทียบสองชุดข้อมูลกับพล็อต QQ โดยใช้ ggplot2?
ในฐานะที่เป็นทั้งสถิติและสามเณร R ฉันมีช่วงเวลาที่ยากลำบากมากที่พยายามสร้าง qqplots ด้วยอัตราส่วนกว้างยาว 1: 1 ggplot2 ดูเหมือนว่าจะให้การควบคุมการวางแผนมากกว่าแพ็คเกจการวางแผน R เริ่มต้น แต่ฉันไม่เห็นวิธีทำ qqplot ใน ggplot2 เพื่อเปรียบเทียบชุดข้อมูลสองชุด ดังนั้นคำถามของฉัน ggplot2 เทียบเท่ากับอะไรเช่น: qqplot(datset1,dataset2)

7
เทคนิคการลดข้อมูลเพื่อระบุประเภทของประเทศ
ฉันสอนวิชาภูมิศาสตร์เศรษฐศาสตร์เบื้องต้น เพื่อช่วยให้นักเรียนของฉันพัฒนาความเข้าใจที่ดีขึ้นเกี่ยวกับประเภทของประเทศที่พบในเศรษฐกิจโลกร่วมสมัยและการชื่นชมเทคนิคการลดข้อมูลฉันต้องการสร้างงานที่ทำให้เกิดความแตกต่างของประเทศต่างๆ (เช่นรายได้สูง - มูลค่าเพิ่ม mfg อายุการใช้งานยาวนานรายได้สูงผู้ส่งออกทรัพยากรธรรมชาติอายุขัยกลางถึงสูงโดยเยอรมนีเป็นองค์ประกอบของประเภทแรกและเยเมนเป็นตัวอย่างของประเภทที่สอง) สิ่งนี้จะใช้ข้อมูล UNDP ที่เปิดเผยต่อสาธารณชน (ซึ่งหากฉันจำได้อย่างถูกต้องว่ามีข้อมูลทางสังคมและเศรษฐกิจในน้อยกว่า 200 ประเทศขออภัยด้วยไม่มีข้อมูลภูมิภาค) ก่อนที่จะมีการมอบหมายนี้จะเป็นอีกสิ่งหนึ่งที่ขอให้พวกเขา (ใช้ --- ส่วนใหญ่ช่วงเวลาหรือระดับอัตราส่วน --- ข้อมูล) เพื่อตรวจสอบความสัมพันธ์ระหว่างตัวแปรเดียวกันเหล่านี้ ความหวังของฉันคือพวกเขาจะพัฒนาสัญชาตญาณสำหรับชนิดของความสัมพันธ์ระหว่างตัวแปรต่าง ๆ (เช่นความสัมพันธ์เชิงบวกระหว่างอายุขัยและ [ตัวบ่งชี้ต่าง ๆ ของความมั่งคั่ง] ความสัมพันธ์เชิงบวกระหว่างความมั่งคั่งและความหลากหลายในการส่งออก) จากนั้นเมื่อใช้เทคนิคการลดข้อมูลส่วนประกอบหรือปัจจัยจะทำให้เกิดความรู้สึกหยั่งรู้ (เช่นปัจจัย / องค์ประกอบที่ 1 ให้ความสำคัญกับความมั่งคั่ง; ปัจจัย / องค์ประกอบที่ 2 ให้ความสำคัญกับการศึกษา) ระบุว่าสิ่งเหล่านี้เป็นนักเรียนปีที่สองถึงสี่ซึ่งบ่อยครั้งที่มีการเปิดรับความคิดในการวิเคราะห์มากกว่าปกติคุณจะแนะนำเทคนิคการลดข้อมูลใดที่เหมาะสมที่สุดสำหรับการมอบหมายครั้งที่สอง นี่คือข้อมูลประชากรสถิติเชิงอนุมาน (p-vlaues ฯลฯ ) จึงไม่จำเป็นจริงๆ

3
มีห้องสมุดใดบ้างสำหรับวิธีการแบบ CART ที่ใช้ตัวทำนายและการตอบสนองแบบกระจัดกระจาย?
ฉันกำลังทำงานกับชุดข้อมูลขนาดใหญ่บางอย่างโดยใช้แพ็คเกจ gbm ในอาร์ทั้งเมทริกซ์ตัวทำนายของฉันและเวกเตอร์การตอบสนองของฉันค่อนข้างเบาบาง (เช่นรายการส่วนใหญ่เป็นศูนย์) ฉันหวังว่าจะสร้างแผนภูมิการตัดสินใจโดยใช้อัลกอริทึมที่ใช้ประโยชน์จากความกระจัดกระจายตามที่ทำไว้ที่นี่ ) ในบทความดังกล่าวในสถานการณ์ของฉันรายการส่วนใหญ่มีคุณลักษณะที่เป็นไปได้เพียงไม่กี่รายการเท่านั้นดังนั้นพวกเขาจึงสามารถหลีกเลี่ยงการคำนวณจำนวนมากที่สูญเสียไปโดยสมมติว่ารายการของพวกเขาขาดคุณสมบัติที่กำหนดเว้นแต่ข้อมูลจะระบุอย่างชัดเจน ความหวังของฉันคือฉันสามารถเร่งความเร็วที่คล้ายกันโดยใช้อัลกอริทึมแบบนี้ (จากนั้นจึงใส่อัลกอริทึมการเร่งรอบ ๆ มันเพื่อปรับปรุงความแม่นยำในการทำนายของฉัน) เนื่องจากพวกเขาดูเหมือนจะไม่เผยแพร่รหัสของพวกเขาฉันสงสัยว่ามีแพ็คเกจโอเพนซอร์ซหรือไลบรารี (ในภาษาใด ๆ ) ที่ได้รับการปรับให้เหมาะกับกรณีนี้หรือไม่ เป็นการดีที่ฉันต้องการบางอย่างที่Matrixสามารถดึงเมทริกซ์แบบเบาบางได้โดยตรงจากแพ็คเกจของ R แต่ฉันจะทำตามที่ฉันจะได้ ฉันได้ดูไปรอบ ๆ และดูเหมือนว่าสิ่งนี้ควรจะอยู่ที่นั่น: นักเคมีดูเหมือนจะพบปัญหานี้มาก (กระดาษที่ฉันเชื่อมโยงข้างต้นเกี่ยวกับการเรียนรู้ที่จะหาสารประกอบยาใหม่) แต่การใช้งานที่ฉันพบได้นั้นเป็นกรรมสิทธิ์หรือมีความเชี่ยวชาญสูงสำหรับการวิเคราะห์ทางเคมี เป็นไปได้ว่าหนึ่งในนั้นอาจถูกนำมาใช้ซ้ำได้ การจัดหมวดหมู่เอกสารดูเหมือนจะเป็นพื้นที่ที่การเรียนรู้จากการเว้นช่องว่างคุณลักษณะมีประโยชน์ (เอกสารส่วนใหญ่ไม่มีคำมากที่สุด) ตัวอย่างเช่นมีการอ้างอิงแบบเอียงในการใช้งาน C4.5 (อัลกอริทึมคล้าย CART) ในเอกสารนี้แต่ไม่มีรหัส จากรายการส่งจดหมาย WEKA สามารถรับข้อมูลที่กระจัดกระจายได้ แต่ไม่เหมือนกับวิธีการในเอกสารที่ฉันลิงก์ด้านบน WEKA ไม่ได้รับการปรับให้เหมาะสมเพื่อใช้ประโยชน์จากมันจริง ๆ ในแง่ของการหลีกเลี่ยงวงจร CPU ที่สิ้นเปลือง ขอบคุณล่วงหน้า!

1
การปรับเปลี่ยนการจำลองแบบ linear ballistic accumulator (LBA) ใน R
โมเดล "Linear Ballistic Accumulator" (LBA) เป็นแบบจำลองที่ค่อนข้างประสบความสำเร็จสำหรับพฤติกรรมมนุษย์ในการตัดสินใจงานง่าย ๆ Donkin, et al (2009, PDF ) ให้รหัสที่ใบอนุญาตประมาณค่าพารามิเตอร์ของรูปแบบการให้ข้อมูลพฤติกรรมของมนุษย์และผมได้คัดลอกโค้ดนี้ (กับเล็กน้อยบางรูปแบบการเปลี่ยนแปลง) เพื่อสรุปสาระสำคัญที่นี่ อย่างไรก็ตามฉันต้องการทำการดัดแปลงเล็กน้อยกับโมเดล แต่ฉันไม่แน่ใจว่าจะได้รับการปรับเปลี่ยนนี้อย่างไรในโค้ด ในการเริ่มต้นด้วยรูปแบบที่เป็นที่ยอมรับ LBA หมายถึงทางเลือกในการตอบสนองแต่ละข้อในฐานะคู่แข่งในการแข่งขันที่ค่อนข้างแปลกประหลาดซึ่งคู่แข่งสามารถแตกต่างกันในลักษณะดังต่อไปนี้: ตำแหน่งเริ่มต้น: สิ่งนี้แตกต่างจากการแข่งขันไปยังการแข่งขันตามการกระจายเครื่องแบบที่ล้อมรอบด้วย U (0, X1) ความเร็ว: สิ่งนี้จะถูกเก็บไว้อย่างคงที่ภายในการแข่งขันที่กำหนด (ไม่เร่งความเร็ว) แต่จะแตกต่างกันไปตามการแข่งขันตามการแจกแจงแบบเกาส์ที่กำหนดโดย N (X2, X3) ตำแหน่งเส้นชัย (X4) ดังนั้นผู้แข่งขันแต่ละคนจึงมีค่าเป็นของตนเองสำหรับ X1, X2, X3 และ X4 การแข่งขันซ้ำหลายครั้งโดยผู้ชนะและเวลาที่บันทึกไว้หลังจากการแข่งขันแต่ละครั้ง ค่าคงที่ของ X5 จะถูกเพิ่มเข้าไปในทุกครั้งที่ชนะ ตอนนี้การดัดแปลงที่ฉันต้องการจะทำคือการสลับความแปรปรวนในจุดเริ่มต้นไปยังเส้นชัย นั่นคือฉันต้องการจุดเริ่มต้นที่จะเป็นศูนย์สำหรับคู่แข่งและการแข่งขันทั้งหมดดังนั้นจึงกำจัด X1 แต่ฉันต้องการเพิ่มพารามิเตอร์ X6 …

2
ความสำคัญของความน่าจะเป็นเริ่มต้นการเปลี่ยนแปลงในโมเดลมาร์คอฟที่ซ่อนอยู่
ประโยชน์ของการให้ค่าเริ่มต้นกับการเปลี่ยนแปลงความน่าจะเป็นใน Hidden Markov Model มีอะไรบ้าง ในที่สุดระบบจะเรียนรู้พวกเขาดังนั้นอะไรคือจุดที่ให้คุณค่าอื่น ๆ นอกเหนือจากการสุ่ม? อัลกอริทึมพื้นฐานสร้างความแตกต่างเช่น Baum – Welch หรือไม่? ถ้าฉันรู้ว่าความน่าจะเป็นในการเปลี่ยนแปลงในตอนเริ่มต้นนั้นถูกต้องมากและจุดประสงค์หลักของฉันคือการทำนายความน่าจะเป็นของผลลัพธ์จากสถานะที่ซ่อนอยู่ไปจนถึงการสังเกตคุณจะแนะนำฉันอย่างไร

2
การแสดงข้อมูลหลายมิติ (LSI) ใน 2D
ฉันใช้การจัดทำดัชนีความหมายแฝงเพื่อค้นหาความคล้ายคลึงกันระหว่างเอกสาร ( ขอบคุณ JMS! ) หลังจากการลดขนาดฉันได้ลอง k-หมายถึงการจัดกลุ่มเพื่อจัดกลุ่มเอกสารเป็นกลุ่มซึ่งทำงานได้ดีมาก แต่ฉันอยากจะไปอีกหน่อยและมองภาพเอกสารเป็นชุดของโหนดโดยที่ระยะห่างระหว่างสองโหนดนั้นแปรผกผันกับความคล้ายคลึงกัน (โหนดที่มีความคล้ายคลึงกันมากอยู่ใกล้กัน) มันทำให้ฉันไม่สามารถลดเมทริกซ์ความคล้ายคลึงกันให้เป็นกราฟ 2 มิติได้อย่างแม่นยำเนื่องจากข้อมูลของฉันคือ> 2 มิติ ดังนั้นคำถามแรกของฉัน: มีวิธีมาตรฐานในการทำเช่นนี้? ฉันสามารถลดข้อมูลของฉันให้เหลือสองมิติจากนั้นจึงแปลงเป็นแกน X และ Y และนั่นจะเพียงพอสำหรับกลุ่มของเอกสาร ~ 100-200 หรือไม่ หากนี่เป็นวิธีแก้ปัญหาจะดีกว่าหรือไม่ที่จะลดข้อมูลของฉันลงเป็น 2 มิติจากจุดเริ่มต้นหรือมีวิธีการเลือกสองมิติที่ "ดีที่สุด" จากข้อมูลหลายมิติของฉันหรือไม่ ฉันใช้ Python และไลบรารี gensim หากนั่นสร้างความแตกต่าง

1
การลดจำนวนระดับของตัวแปรทำนายการจัดหมวดหมู่แบบไม่เรียงลำดับ
ฉันต้องการฝึกอบรมลักษณนามพูด SVM หรือฟอเรสต์แบบสุ่มหรือลักษณนามอื่น ๆ หนึ่งในคุณสมบัติในชุดข้อมูลเป็นตัวแปรเด็ดขาดที่มี 1,000 ระดับ เป็นวิธีที่ดีที่สุดในการลดจำนวนระดับในตัวแปรนี้คืออะไร ใน R มีฟังก์ชั่นที่เรียกว่าcombine.levels()ในแพ็คเกจHmiscซึ่งรวมระดับที่ไม่บ่อยนัก แต่ฉันกำลังมองหาคำแนะนำอื่น ๆ

1
เกิดข้อผิดพลาดในการรายงานด้วยค่ามัธยฐานและการแทนด้วยกราฟิก
ฉันใช้การทดสอบที่หลากหลายสำหรับข้อมูลวิทยานิพนธ์ของฉันตั้งแต่พารามิเตอร์ ANOVAs และการทดสอบ t ไปจนถึงการทดสอบที่ไม่ใช่พารามิเตอร์ Kruskal-Wallis และ Mann-Whitneys รวมถึง ANOVAs 2-way อันดับและ GzLMs ที่มีไบนารี ข้อมูลปัวซองและข้อมูลตามสัดส่วน ตอนนี้ฉันต้องรายงานทุกอย่างในขณะที่เขียนทั้งหมดนี้ในผลลัพธ์ของฉัน ผมเคยถามแล้วที่นี่วิธีการรายงานช่วงความเชื่อมั่นไม่สมดุลข้อมูลสัดส่วน ฉันรู้ว่าค่าเบี่ยงเบนมาตรฐานความคลาดเคลื่อนมาตรฐานหรือช่วงความมั่นใจนั้นเหมาะสมสำหรับวิธีการซึ่งเป็นสิ่งที่ฉันรายงานหากการทดสอบทั้งหมดของฉันเป็นพารามิเตอร์ที่ดี อย่างไรก็ตามสำหรับการทดสอบที่ไม่ใช่พารามิเตอร์ของฉันฉันควรจะรายงานค่ามัธยฐานและไม่ได้หมายความว่าอย่างไร ถ้าเป็นเช่นนั้นฉันจะรายงานข้อผิดพลาดอะไร การเชื่อมโยงกับสิ่งนี้เป็นวิธีที่ดีที่สุดในการนำเสนอผลการทดสอบแบบไม่มีพารามิเตอร์ เนื่องจากส่วนใหญ่ฉันมีข้อมูลต่อเนื่องหรือช่วงเวลาภายในหมวดหมู่ฉันมักจะใช้กราฟแท่งกับด้านบนของแถบที่เป็นแถบค่าเฉลี่ยและแถบข้อผิดพลาดแสดง 95% CI สำหรับการทดสอบ NP ฉันสามารถใช้กราฟแท่งได้หรือไม่ แต่มีแถบด้านบนแทนค่ามัธยฐานหรือไม่? ขอบคุณสำหรับคำแนะนำของคุณ!

2
พลังของการทดสอบการถดถอย F คืออะไร?
การทดสอบ F แบบคลาสสิกสำหรับชุดย่อยของตัวแปรในการถดถอยหลายชั้นมีรูปแบบ ที่SSE(R)คือผลรวมของความคลาดเคลื่อนกำลังสองภายใต้โมเดล 'ลดลง' ซึ่งทำรังอยู่ภายใน 'ใหญ่' รุ่นBและdfคือองศาอิสระของทั้งสองโมเดล ภายใต้สมมติฐานว่างว่าตัวแปรพิเศษในโมเดล 'ใหญ่' ไม่มีกำลังอธิบายเชิงเส้นสถิติจะถูกกระจายเป็น F กับdfR-dfBและdfBองศาอิสระF=(SSE(R)−SSE(B))/(dfR−dfB)SSE(B)/dfB,F=(SSE(R)−SSE(B))/(dfR−dfB)SSE(B)/dfB, F = \frac{(\mbox{SSE}(R) - \mbox{SSE}(B))/(df_R - df_B)}{\mbox{SSE}(B)/df_B}, SSE(R)SSE(R)\mbox{SSE}(R)BBBdfdfdfdfR−dfBdfR−dfBdf_R - df_BdfBdfBdf_B การกระจายตัวคืออะไรภายใต้ทางเลือก ฉันคิดว่ามันไม่ใช่แบบกึ่งกลาง F (ฉันหวังว่าจะไม่ใช่แบบไม่เป็นศูนย์กลางเป็นสองเท่า) แต่ฉันไม่สามารถค้นหาการอ้างอิงใด ๆ ว่าพารามิเตอร์ที่ไม่ใช่ศูนย์กลางคืออะไร ฉันจะคิดว่ามันขึ้นอยู่กับการถดถอยจริงค่าสัมประสิทธิ์และอาจจะเกี่ยวกับการออกแบบเมทริกซ์Xแต่นอกเหนือจากนั้นผมไม่แน่ใจว่าββ\betaXXX

1
การพิจารณาว่าการเปลี่ยนแปลงในอนุกรมเวลามีนัยสำคัญทางสถิติหรือไม่
ฉันมีจำนวนการโทรทั้งหมดที่ได้รับในแต่ละสัปดาห์และได้วางแผนไว้ในแผนภูมิย้อนกลับไปเกือบ 3 ปี ดูเหมือนว่าในวันคริสต์มาสจะมีการลดลงครั้งใหญ่ซึ่งดูเหมือนว่าจะไม่สามารถฟื้นตัวได้ดูเหมือนว่ามีการเปลี่ยนแปลงขั้นตอนในการร้องขอ มีการทดสอบที่ฉันสามารถทำได้ที่สามารถวัดความแตกต่างนี้ได้หรือไม่? ไชโย เบน

1
“ สัมประสิทธิ์สหสัมพันธ์สูงสุด” นี้คืออะไร?
สถิติการประมวลผลรูปภาพทั่วไปคือการใช้คุณสมบัติพื้นผิวของHaralickซึ่งก็คือ 14 ฉันสงสัยเกี่ยวกับคุณลักษณะที่ 14 ของเหล่านี้: เนื่องจากแผนที่ adjacency (ซึ่งเราสามารถดูการกระจายเชิงประจักษ์ของจำนวนเต็มสองจำนวนi , j &lt; 256 ), มันถูกนิยามเป็น: สแควร์รูทของ eigenvalue ที่สองของ , โดยที่คือ:PPPฉัน, j &lt; 256i,j&lt;256i,j < 256QQQQQQ Qฉันเจ= ∑kP( ฉัน, k ) P( j , k )[ ∑xP( x , i ) ] [ ∑YP( k , y) ]Qij=∑kP(i,k)P(j,k)[∑xP(x,i)][∑yP(k,y)]Q_{ij} = \sum_k \frac{ P(i,k) …

2
คุ้มค่าหรือไม่ที่จะเผยแพร่ที่ Statiki ที่อ้างอิงจาก wiki? [ปิด]
ปิด คำถามนี้เป็นคำถามความคิดเห็นตาม ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้สามารถตอบข้อเท็จจริงและการอ้างอิงได้โดยแก้ไขโพสต์นี้ ปิดให้บริการใน7 เดือนที่ผ่านมา พื้นหลัง ฉันอ่านเกี่ยวกับStatProb.comจากความคิดเห็นในบล็อกแอนดรู Gelman ของ ตามเว็บไซต์ StatProb คือ: StatProb: สารานุกรมที่สนับสนุนโดยสถิติและความน่าจะเป็นสังคมรวมข้อดีของ wikis แบบดั้งเดิม (สิ่งพิมพ์ที่รวดเร็วและทันสมัย, การพัฒนาที่ผู้ใช้สร้างขึ้น, การเชื่อมโยงหลายมิติและประวัติที่บันทึกไว้) กับการเผยแพร่แบบดั้งเดิม (การประกันคุณภาพการตรวจสอบ และการแสดงข้อมูลที่มีโครงสร้าง) ผลงานทั้งหมดได้รับการอนุมัติจากคณะกรรมการบรรณาธิการที่กำหนดโดยสมาคมสถิติชั้นนำ สมาชิกคณะบรรณาธิการจะอยู่ในหน้าเกี่ยวกับ ฉันไม่ใช่นักสถิติ แต่ฉันใช้สถิติและเว็บไซต์นี้เสนอโอกาสให้ฉันเผยแพร่เนื้อหาที่ในขณะที่อาจเป็นประโยชน์ต่อผู้อื่นอาจมีการเผยแพร่ไม่ได้จนกว่าฉันจะรวมไว้เป็นภาคผนวกหรือโพสต์ไว้บนเว็บไซต์ ตัวเลือกน่าสนใจเพราะกระบวนการตรวจสอบจะช่วยเพิ่มความมั่นใจในวิธีการที่ฉันใช้และให้ความน่าเชื่อถือในพื้นที่สาธารณะ แม้จะมีการสนับสนุนจากสถิติที่สำคัญและสังคมน่าจะเป็น แต่เว็บไซต์ก็ยังไม่ได้รับการแก้ไข อันที่จริงหนึ่งบล็อกเกอร์ถาม 'RIP StatProb?' และความถี่ของการบริจาคลดลงตามกาลเวลา คำถาม: คุ้มค่ากับความพยายามในการเผยแพร่ผ่าน StatProb.com หรือไม่ ปรับปรุง: ณ วันนี้ (2012-02-01) ผลงานล่าสุดคือ2011-05-04 ; การแก้ไขล่าสุด 2011-06 ดังนั้นวันนี้จึงดูน่าดึงดูดน้อยกว่าเมื่อก่อนถามคำถาม

2
มีวิธีใดที่จะอธิบายการทำนายจากแบบจำลองฟอเรสต์แบบสุ่มหรือไม่?
สมมติว่าฉันมีรูปแบบการจำแนกการคาดการณ์ตามป่าสุ่ม (ใช้แพ็คเกจสุ่มป่าไม้ใน R) ฉันต้องการตั้งค่าเพื่อให้ผู้ใช้ปลายทางสามารถระบุรายการที่จะสร้างการทำนายสำหรับและมันจะส่งออกโอกาสในการจัดหมวดหมู่ จนถึงตอนนี้ก็ไม่มีปัญหา แต่มันจะมีประโยชน์ / เจ๋งมากที่จะสามารถแสดงผลออกมาเช่นกราฟความสำคัญของตัวแปร แต่สำหรับรายการเฉพาะที่ถูกทำนายไม่ใช่สำหรับชุดฝึก สิ่งที่ต้องการ: รายการ X ถูกคาดการณ์ว่าจะเป็นสุนัข (มีโอกาส 73%) เนื่องจาก: ขา = 4 ลมหายใจ = ขนที่ไม่ดี= อาหารสั้น= น่ารังเกียจ คุณได้รับจุด มีวิธีมาตรฐานหรืออย่างน้อยก็สมควรในการดึงข้อมูลนี้จากป่าสุ่มที่ได้รับการฝึกอบรมแล้ว? ถ้ามีใครมีรหัสที่จะใช้สำหรับแพ็คเกจสุ่มป่าไม้หรือไม่?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.