สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
SVM, การโต้ตอบที่ผันแปรและข้อมูลการฝึกอบรมเหมาะสม
ฉันมีคำถามทั่วไป 2 ข้อขึ้นไป 1) ฉันอยากรู้ว่า SVM จัดการการโต้ตอบของตัวแปรอย่างไรเมื่อสร้างแบบจำลองการทำนาย เช่นถ้าฉันมีคุณสมบัติสองอย่างคือ f1 และ f2 และเป้าหมายนั้นขึ้นอยู่กับ f1, f2 และพูดว่า f1 * f2 (หรือฟังก์ชั่น h (f1, f2)), SVM จะพอดี (ไม่ใช่แค่ OOS แต่ยังอยู่ในข้อมูลการฝึกอบรม) ปรับปรุงเมื่อรวม f1, f2 และ h (f1, f2) ในคุณสมบัติมากกว่าเพียงแค่รวมถึง f1 และ f2? อัลกอริทึม SVM จัดการกับการโต้ตอบกับคุณลักษณะหรือไม่ ดูเหมือนว่าจะเป็นไปตามที่ SVM พยายามสร้างไฮเปอร์เพลนในพื้นที่มิติที่สูงขึ้น แต่ไม่แน่ใจว่าต้องการถามเช่นไร 2) เมื่อทำการติดตั้ง SVM บนข้อมูลการฝึกอบรมให้มีคุณสมบัติเพียงพอและค้นหาพารามิเตอร์ที่เหมาะสม (ผ่านการค้นหาแบบ …

1
ชื่อของอะนาล็อกข้อผิดพลาดแบบสัมบูรณ์ถึงคะแนน Brier หรือไม่?
คำถามเมื่อวานนี้กำหนดความแม่นยำของแบบจำลองซึ่งประมาณความน่าจะเป็นของเหตุการณ์ทำให้ฉันสงสัยเกี่ยวกับการให้คะแนนความน่าจะเป็น หนามคะแนน เป็นตัวชี้วัดข้อผิดพลาดเฉลี่ยกำลังสอง การวัดประสิทธิภาพข้อผิดพลาดแบบอะนาล็อกหมายความว่าแบบอะนา มีชื่อด้วยใช่ไหม11ยังไม่มีข้อความΣi = 1ยังไม่มีข้อความ( p r e dฉันคทีฉันo nผม- r e fe r e n c eผม)21N∑i=1N(predictioni−referencei)2\frac{1}{N}\sum\limits _{i=1}^{N}(prediction_i - reference_i)^2 1ยังไม่มีข้อความΣi = 1ยังไม่มีข้อความ| predฉันคทีฉันo nผม- r e fe r e n c eผม|1N∑i=1N|predictioni−referencei|\frac{1}{N}\sum\limits _{i=1}^{N}|prediction_i - reference_i|

1
กำหนดความแม่นยำของแบบจำลองซึ่งประมาณความน่าจะเป็นของเหตุการณ์
ฉันกำลังสร้างโมเดลเหตุการณ์ที่มีสองผลลัพธ์คือ a และ b ฉันได้สร้างแบบจำลองซึ่งประมาณความน่าจะเป็นที่จะเกิดขึ้นหรือ a (เช่นแบบจำลองจะคำนวณว่าจะเกิดขึ้นโดยมีโอกาส 40% และ b จะเกิดขึ้นกับโอกาส 60%) ฉันมีบันทึกผลการทดลองเป็นจำนวนมากพร้อมการประมาณการจากแบบจำลอง ฉันต้องการวัดความแม่นยำของแบบจำลองที่ใช้ข้อมูลนี้ - เป็นไปได้และถ้าเป็นเช่นนั้น

2
RFM และการสร้างแบบจำลองมูลค่าตลอดชีวิตของลูกค้าใน R
ใครช่วยบอกวิธีการสร้างแบบจำลองความใหม่ความถี่และค่าเงิน (RFM) และการสร้างแบบจำลองมูลค่าลูกค้าใน R นอกจากนี้มีใครบางคนสามารถอ้างอิงวรรณกรรมบางอย่างกับฉันได้หรือไม่

3
การคำนวณโหมดของข้อมูลที่สุ่มตัวอย่างจากการแจกแจงแบบต่อเนื่อง
อะไรคือวิธีที่ดีที่สุดในการปรับ 'โหมด' ของข้อมูลตัวอย่างจากการกระจายอย่างต่อเนื่อง? เนื่องจากโหมดนี้ไม่ได้กำหนดทางเทคนิค (ใช่ไหม) สำหรับการแจกแจงแบบต่อเนื่องฉันจึงถามว่า 'คุณจะพบคุณค่าที่พบได้บ่อยที่สุด' ได้อย่างไร? หากคุณถือว่าการกระจายตัวของผู้ปกครองนั้นเป็น gaussian คุณสามารถ bin ข้อมูลและหาว่าโหมดนั้นเป็นที่ตั้งของ bin ที่มีจำนวนมากที่สุด อย่างไรก็ตามคุณจะกำหนดขนาดถังขยะได้อย่างไร มีการใช้งานที่แข็งแกร่งหรือไม่? (เช่นแข็งแกร่งถึงค่าผิดปกติ) ฉันใช้python/ scipy/ numpyแต่ฉันสามารถแปลได้Rโดยไม่ยากเกินไป

3
ชุดข้อมูลที่เป็นภาพประกอบและการวิเคราะห์สำหรับการสร้างแบบจำลองหลายระดับ
ฉันเพิ่งเข้าเรียนหลักสูตรเบื้องต้นเกี่ยวกับการสร้างแบบจำลองหลายระดับ ชุดข้อมูลและตัวอย่างส่วนใหญ่ที่เราใช้นั้นมาจากสังคมศาสตร์ ฉันเพิ่งฝึกงาน 2 สัปดาห์ในแผนกชีวสถิติที่พวกเขาต้องการให้ฉันเริ่มโครงการที่เกี่ยวข้องกับการเปลี่ยนแปลงในระดับที่โรงพยาบาลของผู้ป่วยสำหรับภาวะฉุกเฉินที่มีอัตราการตายสูงทั้งระหว่างโรงพยาบาลและ 5 ปีขึ้นไป ช่วงเวลา. ฉันเริ่มฝึกงานในสัปดาห์หน้าและฉันหวังว่าจะหาหนังสือหรือแหล่งข้อมูลออนไลน์ที่มีการวิเคราะห์ที่คล้ายกัน (ควรใช้กับ R, Stata หรือ MLwiN) โดยเฉพาะอย่างยิ่งที่พวกเขามีชุดข้อมูลสำหรับผู้อ่าน ลิงค์ใด ๆ ที่จะได้รับการต้อนรับมากที่สุด แก้ไข: ฉันจะทำงานกับชุดข้อมูลที่มีรายละเอียดทุกแง่มุมที่บันทึกไว้ของการดูแลในโรงพยาบาลของผู้ป่วย ผลลัพธ์หลักที่น่าสนใจคือการเสียชีวิตภายใน 30 วันนับจากวันรับเข้าเรียน

1
ฟังก์ชันค่าใช้จ่ายใดที่ดีกว่าสำหรับต้นไม้แบบสุ่ม: ดัชนี Gini หรือเอนโทรปี
ฟังก์ชันค่าใช้จ่ายใดที่ดีกว่าสำหรับต้นไม้แบบสุ่ม: ดัชนี Gini หรือเอนโทรปี ฉันกำลังพยายามใช้ฟอเรสต์แบบสุ่มใน Clojure

2
ข้อสมมติฐานเชิงบรรทัดฐานอะไรบ้างที่จำเป็นสำหรับการทดสอบแบบไม่มีคู่ แล้วพวกเขาจะพบกันเมื่อไหร่?
หากเราต้องการทำการทดสอบแบบจับคู่ความต้องการคือ (ถ้าฉันเข้าใจอย่างถูกต้อง) ว่าความแตกต่างเฉลี่ยระหว่างหน่วยการวัดที่ตรงกันจะถูกกระจายตามปกติ ในการทดสอบ t-test แบบคู่ซึ่งเป็นข้อต่อ (AFAIK) ในความต้องการว่าความแตกต่างระหว่างหน่วยการวัดที่ตรงกันจะถูกกระจายตามปกติ (แม้ว่าการกระจายตัวของกลุ่มเปรียบเทียบทั้งสองกลุ่มจะไม่ปกติ) อย่างไรก็ตามในการทดสอบแบบไม่จับคู่เราไม่สามารถพูดคุยเกี่ยวกับความแตกต่างระหว่างหน่วยที่ตรงกันดังนั้นเราต้องการให้การสังเกตจากทั้งสองกลุ่มเป็นเรื่องปกติเพื่อให้ความแตกต่างของค่าเฉลี่ยของพวกเขาเป็นเรื่องปกติ ซึ่งทำให้ฉันคำถามของฉัน: เป็นไปได้หรือไม่สำหรับการแจกแจงแบบไม่ปกติสองแบบเพื่อให้ความแตกต่างของค่าเฉลี่ยถูกกระจายตามปกติ (และตอบสนองความต้องการที่จำเป็นของเราในการดำเนินการทดสอบ t ที่ไม่มีคู่กับพวกเขา - อีกครั้ง - เท่าที่ฉันเข้าใจ) อัปเดต: (ขอบคุณทุกคำตอบ) ฉันเห็นว่ากฎทั่วไปที่เรากำลังมองหาคือความแตกต่างของค่าเฉลี่ยจะเป็นเรื่องปกติซึ่งน่าจะเป็นข้อสันนิษฐานที่ดี (ต่ำกว่าพอ n) เนื่องจาก CLT นี่เป็นสิ่งที่น่าอัศจรรย์สำหรับฉัน (ไม่น่าแปลกใจเพียงแค่น่าอัศจรรย์) สำหรับวิธีการนี้สำหรับการทดสอบแบบไม่ใช้คู่ แต่ไม่ได้ผลสำหรับการทดสอบตัวอย่างแบบเดี่ยว นี่คือรหัส R เพื่อแสดง: n1 <- 10 n2 <- 10 mean1 <- 50 mean2 <- 50 R <- 10000 # diffs …

2
จะทำอย่างไรเมื่อบางเวลามีการตอบสนองที่เบ้อย่างหนักและบางคนไม่ได้ทำการศึกษาซ้ำหลายครั้ง?
โดยทั่วไปเมื่อมีการวัดผลอย่างต่อเนื่อง แต่เบ้ในการออกแบบระยะยาว (พูดด้วยผลระหว่างวิชาหนึ่ง) วิธีการทั่วไปคือการเปลี่ยนผลลัพธ์ให้เป็นปกติ หากสถานการณ์นั้นรุนแรงเช่นด้วยการสังเกตที่ถูกตัดทอนอย่างใดอย่างหนึ่งอาจจะมีจินตนาการและใช้โมเดลการเติบโตของ Tobit หรือบางอย่าง แต่ฉันกำลังสูญเสียเมื่อฉันเห็นผลลัพธ์ที่กระจายตามปกติในบางช่วงเวลาและจากนั้นก็เบ้อย่างหนักที่คนอื่น ๆ ; การแปลงอาจเสียบการรั่วไหลหนึ่ง แต่ฤดูใบไม้ผลิอื่น คุณจะแนะนำอะไรในกรณีเช่นนี้? มีโมเดลมิกซ์เอฟเฟ็กต์รุ่นที่ไม่ใช่พารามิเตอร์ที่ฉันไม่ทราบหรือไม่ หมายเหตุ: ตัวอย่างที่ใช้จะเป็นคะแนนการทดสอบความรู้ก่อน / โพสต์ชุดของการแทรกแซงการศึกษา คะแนนเริ่มต้นตามปกติ แต่จากนั้นจัดกลุ่มที่ระดับสูงสุดของระดับต่อไป

1
อสมการ Chebyshev ด้านเดียวสำหรับช่วงเวลาที่สูงขึ้น
มีอะนาล็อกในช่วงเวลาที่อสมการของ Chebyshev ที่สูงกว่าในกรณีด้านเดียวหรือไม่? ความไม่เท่าเทียมกันของ Chebyshev-Cantelli นั้นดูเหมือนจะทำงานเพื่อความแปรปรวนได้เท่านั้นในขณะที่ความไม่เท่าเทียมของ Chebyshevs นั้นสามารถสร้างขึ้นได้อย่างง่ายดายสำหรับเลขชี้กำลังทั้งหมด ไม่มีใครรู้ถึงความไม่เท่าเทียมด้านเดียวโดยใช้ช่วงเวลาที่สูงขึ้นหรือไม่?

1
Hosmer-Lemeshow กับ AIC สำหรับการถดถอยโลจิสติก
หาก Hosmer-Lemeshow บ่งบอกถึงการขาดความพอดี แต่ AIC นั้นต่ำที่สุดในบรรดานางแบบทั้งหมด .... คุณควรจะใช้แบบจำลองนี้หรือไม่? ถ้าฉันลบตัวแปรสถิติของ Hosmer-Lemeshow นั้นไม่มีนัยสำคัญ (ซึ่งหมายความว่าไม่มีการขาดความพอดีทั้งหมด) แต่ AIC เพิ่มขึ้น แก้ไข : ฉันคิดว่าโดยทั่วไปถ้า AIC ของโมเดลที่แตกต่างกันอยู่ใกล้กัน (เช่น ) กันแล้วก็เหมือนกัน แต่ AIC นั้นแตกต่างกันมาก นี่ดูเหมือนจะบ่งบอกว่าสิ่งที่มีค่า AIC ต่ำสุดเป็นสิ่งที่ฉันควรใช้ถึงแม้ว่าการทดสอบ Hosmer-Lemeshow จะระบุเป็นอย่างอื่น&lt;2&lt;2<2 บางทีการทดสอบ HL ใช้กับตัวอย่างจำนวนมากเท่านั้นหรือ มันมีพลังงานต่ำสำหรับตัวอย่างขนาดเล็ก (ขนาดตัวอย่างของฉันคือ ~ 300) แต่ถ้าฉันได้รับผลลัพธ์ที่สำคัญ ... ซึ่งหมายความว่าแม้จะใช้พลังงานต่ำฉันก็จะถูกปฏิเสธ มันจะสร้างความแตกต่างถ้าฉันใช้ AICc กับ AIC หรือไม่? คุณจะได้รับ AICc ใน SAS …

2
การดัดแปลง Lasso สำหรับ LARS
ฉันพยายามเข้าใจว่า Lars สามารถปรับเปลี่ยนอัลกอริทึมเพื่อสร้าง Lasso ได้อย่างไร ในขณะที่ฉันเข้าใจ LARS ฉันไม่สามารถเห็นการดัดแปลง Lasso จากบทความโดย Tibshirani และคณะ โดยเฉพาะฉันไม่เห็นสาเหตุที่สภาพของสัญญาณว่าเครื่องหมายของพิกัดไม่เป็นศูนย์จะต้องเห็นด้วยกับสัญลักษณ์ของสหสัมพันธ์ปัจจุบัน ใครสามารถช่วยฉันด้วยเรื่องนี้ ฉันเดาว่าฉันกำลังมองหาหลักฐานทางคณิตศาสตร์โดยใช้เงื่อนไข KKT กับปัญหาบรรทัดฐาน L-1 ดั้งเดิมเช่น Lasso ขอบคุณมาก!
12 lasso 

1
ความแตกต่างในการใช้งานของการแยกไบนารีในต้นไม้การตัดสินใจ
ผมอยากรู้เกี่ยวกับการดำเนินการในทางปฏิบัติของการแยกไบนารีในต้นไม้ตัดสินใจ - เป็นที่เกี่ยวกับระดับของเด็ดขาดทำนาย{J}XjXjX{j} โดยเฉพาะฉันมักจะใช้รูปแบบการสุ่มตัวอย่างบางอย่าง (เช่นการบรรจุถุงการใส่ตัวอย่างมากเกินไป) เมื่อสร้างแบบจำลองการทำนายโดยใช้ต้นไม้การตัดสินใจ - เพื่อปรับปรุงความแม่นยำและความมั่นคงของการทำนาย ในระหว่างขั้นตอนการสุ่มตัวอย่างเหล่านี้เป็นไปได้ที่ตัวแปรหมวดหมู่จะถูกนำเสนอไปยังอัลกอริทึมการปรับแต่งแบบต้นไม้ที่น้อยกว่าชุดระดับที่สมบูรณ์ พูดตัวแปร X {A,B,C,D,E}จะใช้เวลาในระดับ ในตัวอย่างอาจจะเพียงระดับ{A,B,C,D}ที่มีอยู่ จากนั้นเมื่อมีการใช้ต้นไม้ผลลัพธ์สำหรับการทำนายอาจจะมีชุดเต็ม ต่อจากตัวอย่างนี้พูดต้นไม้แยกบน X และส่ง{A,B}ไปทางซ้ายและ{C,D}ไปทางขวา ฉันคาดว่าตรรกะของการแบ่งไบนารีจะพูดเมื่อต้องเผชิญกับข้อมูลใหม่: "ถ้า X มีค่า A หรือ B ให้ส่งไปทางซ้ายมิฉะนั้นส่งกรณีนี้ไปทางขวา" สิ่งที่ดูเหมือนจะเกิดขึ้นในการนำไปใช้งานบางอย่างคือ "ถ้า X มีค่า A หรือ B ส่งไปทางซ้ายถ้า X มีค่า C หรือ D ส่งไปทางขวา" เมื่อกรณีนี้ใช้กับค่า E อัลกอริธึมจะพังลง วิธี "ถูกต้อง" สำหรับการแยกแบบไบนารีที่จะจัดการคืออะไร? ดูเหมือนว่าจะมีการใช้วิธีที่มีประสิทธิภาพมากกว่านี้ แต่ไม่เสมอไป (ดู Rpart ด้านล่าง) …

9
ฉันจะสร้างกราฟที่ดีโดยอัตโนมัติได้อย่างไร
เช่น. เช่นที่อยู่ในหน้านี้http://store.steampowered.com/hwsurvey มีซอฟต์แวร์สำเร็จรูปที่สามารถทำสิ่งนี้ได้หรือไม่? อีกทางเลือกหนึ่งคำแนะนำสำหรับซอฟต์แวร์อื่นที่มีลักษณะคล้ายกัน ฉันรู้ว่านี่ไม่ใช่คำถามเชิงสถิติ แต่ฉันรู้สึกอย่างแรงกล้าว่าข้อมูลควรถูกนำเสนอในลักษณะที่เรียบร้อยและน่าดึงดูดใจเพื่อให้มีประสิทธิภาพดังนั้นฉันคิดว่าคำถามนี้น่าจะเป็นปัญหาสำหรับบางคน อัปเดต (29/12/11) : ขอบคุณสำหรับการตอบคำถามทั้งหมดนี้ฉันขอขอบคุณข้อเสนอแนะของคุณทั้งหมด โดยอัตโนมัติฉันหมายความว่าฉันป้อนข้อมูล &amp; กราฟจะได้รับการอัปเดตโดยอัตโนมัติ วัตถุประสงค์ของโครงการของฉันคือการรวบรวมข้อมูล 6-10 ชุดต่อวัน (หรืออาจ 2x ทุกวัน) ในช่วงระยะเวลาที่ไม่ จำกัด และฉันต้องการค้นหาวิธีในการแสดงข้อมูลในเว็บไซต์ (คล้ายกับลิงก์ Steam ที่ฉัน ที่ระบุไว้ด้านบน) ในขณะที่แบ็กเอนด์ผู้ใช้นั้นง่ายพอสำหรับผู้ใช้ที่ไม่ใช่ด้านเทคนิค หากคุณมีข้อเสนอแนะเพิ่มเติมโปรดเพิ่มคำตอบ! ขอบคุณอีกครั้ง!

3
ตัวเลือกการโฮสต์สำหรับข้อมูลที่เปิดเผยต่อสาธารณะ
ดังนั้นคุณตัดสินใจที่จะสนับสนุนแนวคิดของการวิจัยที่ทำซ้ำได้และต้องการทำให้ข้อมูลของคุณพร้อมใช้งานออนไลน์เพื่อให้ผู้คนเห็นและใช้งาน คำถามคือคุณโฮสต์ที่ไหน ความชอบครั้งแรกของฉันคือแน่นอนพื้นที่เว็บส่วนตัวที่ฉันมีบนเซิร์ฟเวอร์มหาวิทยาลัย แต่สิ่งเหล่านี้ไม่ได้มีอยู่จริง - ถ้าฉันออกไปไดเรกทอรีจะยังคงเปิดอยู่ในช่วงเวลาสั้น ๆ ก่อนที่มันจะหายไป แทบจะไม่มีการตั้งค่าที่เหมาะสมสำหรับการทำให้ข้อมูลพร้อมใช้งานสำหรับผู้ใช้และทำงานในอนาคต คุณใช้สิ่งที่ชอบ GitHub หรือ SourceForge? หรือบริการอื่น ๆ ? ข้อมูลที่เป็นปัญหาคือผลลัพธ์ของการจำลองที่น่าสนใจแคบมาก - ดังนั้นฉันไม่คิดว่าจะมีบางอย่างเช่น InfoChimps หรือที่เก็บข้อมูลสาธารณะอีกแห่งหนึ่งที่เหมาะสำหรับมัน นี่คือน้อย "คุณสามารถเรียนรู้สิ่งต่าง ๆ ด้วยรหัสนี้!" และอื่น ๆ "คุณสามารถทำซ้ำรูปที่ 3 ในเอกสารนี้"

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.