สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
วิธีการเลือกตัวแปรทางพันธุกรรมขั้นตอนวิธีใน R สำหรับตัวแปรอินพุต SVM?
ฉันใช้แพคเกจkernlabใน R เพื่อสร้าง SVM สำหรับการจำแนกข้อมูล SVM ทำงานได้อย่างดีในการให้ 'คาดการณ์' ของความแม่นยำที่เหมาะสมอย่างไรก็ตามรายการตัวแปรอินพุตของฉันมีขนาดใหญ่กว่าที่ฉันต้องการและฉันไม่แน่ใจว่ามีความสำคัญสัมพัทธ์ของตัวแปรที่แตกต่างกันอย่างไร ฉันต้องการใช้อัลกอริธึมทางพันธุกรรมเพื่อเลือกชุดย่อยของตัวแปรอินพุตที่สร้าง SVM ที่ได้รับการฝึกอบรม / เหมาะสมที่สุด ฉันต้องการความช่วยเหลือในการเลือกแพ็กเกจ R ที่จะใช้เมื่อพยายามใช้งาน GA นี้ (และอาจเป็นตัวอย่างสั้น ๆ ของ psuedo) ฉันดูแพ็คเกจ R GA / P ส่วนใหญ่อยู่ที่นั่น ( RGP , genalg , subselect , GALGO ) แต่ฉันกำลังดิ้นรนในเชิงแนวคิดเพื่อดูว่าฉันจะส่งผ่านฟังก์ชัน ksvm ของฉันเป็นส่วนหนึ่งของฟังก์ชั่นการออกกำลังกายและใส่ข้อมูลของฉันได้อย่างไร อาเรย์ตัวแปรเป็นกลุ่มประชากร ... ความช่วยเหลือความคิดหรือการผลักไปในทิศทางที่ถูกต้องได้รับสุดซึ้ง ขอบคุณ รหัสที่แก้ปัญหานี้เพิ่มด้านล่างในการแก้ไขในภายหลัง # Prediction function to …

4
ค่าที่คาดหวังเกี่ยวข้องกับค่าเฉลี่ยมัธยฐาน ฯลฯ อย่างไรในการแจกแจงแบบไม่ปกติ
ค่าที่คาดหวังของตัวแปรสุ่มต่อเนื่องเกี่ยวข้องกับค่าเฉลี่ยเลขคณิตค่ามัธยฐาน ฯลฯ อย่างไรในการแจกแจงแบบไม่ปกติ (เช่น. เอียงปกติ) ฉันสนใจในการแจกแจงทั่วไป / ที่น่าสนใจใด ๆ (เช่นบันทึกปกติ, การแจกแจงแบบทวิภาค / แบบง่าย, อะไรก็ได้ที่แปลกและมหัศจรรย์) ฉันกำลังมองหาคำตอบเชิงคุณภาพเป็นส่วนใหญ่ แต่คำตอบเชิงปริมาณหรือเชิงสูตรก็ยินดีต้อนรับเช่นกัน ฉันต้องการเห็นภาพที่ทำให้ชัดเจนยิ่งขึ้น

4
อัลกอริธึมมาตรฐานสำหรับการทำการถดถอยเชิงเส้นแบบลำดับชั้น?
มีอัลกอริธึมมาตรฐาน (ตรงข้ามกับโปรแกรม) สำหรับการถดถอยเชิงเส้นแบบลำดับชั้นหรือไม่? คนมักจะทำเพียงแค่ MCMC หรือมีความเชี่ยวชาญมากขึ้นบางทีอาจจะเป็นรูปแบบปิดอัลกอริทึมบางส่วน?

2
ความสัมพันธ์ข้ามกับข้อมูลร่วมกัน
อะไรคือความแตกต่างระหว่างสหสัมพันธ์ข้ามและข้อมูลซึ่งกันและกัน ปัญหาประเภทใดที่สามารถแก้ไขได้โดยใช้มาตรการเหล่านี้และเมื่อใดควรใช้อีกข้อหนึ่ง ขอบคุณสำหรับความคิดเห็น เพื่อชี้แจงคำถามที่ได้รับแจ้งจากความสนใจในการวิเคราะห์ iomage มากกว่าการวิเคราะห์อนุกรมเวลาแม้ว่าการตรัสรู้ใด ๆ ในพื้นที่นั้นจะได้รับการชื่นชม

1
ปรับการเติบโตตามฤดูกาลในแต่ละเดือนโดยอิงตามฤดูกาลรายสัปดาห์
เป็นงานอดิเรกด้านฉันได้รับการสำรวจชุดเวลาการพยากรณ์ (โดยเฉพาะอย่างยิ่งการใช้ R) สำหรับข้อมูลของฉันฉันมีจำนวนการเข้าชมต่อวันสำหรับทุกวันย้อนกลับไปเกือบ 4 ปี ในข้อมูลนี้มีรูปแบบที่แตกต่างกัน: วันจันทร์ถึงวันศุกร์มีการเข้าชมจำนวนมาก (สูงสุดในวันจันทร์ / อังคาร) แต่มีน้อยกว่าในวันเสาร์ - อาทิตย์ บางครั้งของปีลดลง (เช่นการเข้าชมน้อยกว่ามากในช่วงวันหยุดของสหรัฐอเมริกาในช่วงฤดูร้อนแสดงการเติบโตน้อยลง) การเติบโตที่สำคัญปีต่อปี มันเป็นเรื่องดีที่จะสามารถคาดการณ์ปีที่จะมาถึงของข้อมูลนี้และใช้เพื่อปรับปรุงการเติบโตแบบเดือนต่อเดือน สิ่งสำคัญที่ทำให้ฉันมีมุมมองรายเดือนคือ: บางเดือนจะมีจันทร์ / อังคารมากกว่าเดือนอื่น ๆ (ซึ่งไม่สอดคล้องกันในช่วงหลายปีที่ผ่านมา) ดังนั้นเดือนที่เกิดขึ้นกับวันธรรมดาจะต้องมีการปรับตาม การสำรวจสัปดาห์ก็ดูเหมือนยากเนื่องจากระบบการกำหนดหมายเลขสัปดาห์เปลี่ยนจาก 52-53 ขึ้นอยู่กับปีและดูเหมือนว่าtsจะไม่จัดการเรื่องนั้น ฉันไตร่ตรองโดยเฉลี่ยในวันธรรมดาของเดือน แต่หน่วยผลลัพธ์นั้นค่อนข้างแปลก (การเติบโตในอัตราเฉลี่ยการเข้าชมวันทำงาน) และนั่นจะเป็นการทิ้งข้อมูลที่ถูกต้อง ฉันรู้สึกว่าข้อมูลประเภทนี้จะเป็นเรื่องธรรมดาในอนุกรมเวลา (เช่นการใช้ไฟฟ้าในอาคารสำนักงานอาจเป็นแบบนี้) ทุกคนมีคำแนะนำเกี่ยวกับวิธีการสร้างแบบจำลองโดยเฉพาะใน R? ข้อมูลที่ฉันทำงานด้วยนั้นค่อนข้างตรงไปตรงมามันเริ่มต้นจาก: [,1] 2008-10-05 17607 2008-10-06 36368 2008-10-07 40250 2008-10-08 39631 2008-10-09 40870 2008-10-10 35706 …

2
จะทำการทดสอบ Wilcoxon ได้รับการจัดอันดับสำหรับข้อมูลการอยู่รอดใน R ได้อย่างไร?
สมมติว่าคุณมีข้อมูลการอยู่รอดเช่นนี้: obs <- data.frame( time = c(floor(runif(100) * 30), floor((runif(100)^2) * 30)), status = c(rbinom(100, 1, 0.2), rbinom(100, 1, 0.7)), group = gl(2,100) ) ในการทำการทดสอบการจัดอันดับบันทึกมาตรฐานหนึ่งสามารถใช้ survdiff(Surv(time, status) ~ group, data = obs, rho = 0) ขวา? แต่แล้วการทดสอบอื่น ๆ ล่ะ? คุณจะทำการทดสอบระดับเซ็นชื่อของวิลคอกซัน, การทดสอบเปโตหรือการทดสอบเฟลมิง - แฮร์ริงตันได้อย่างไร R มีความเป็นไปได้ที่จะทำการทดสอบ Wilcoxonแต่ฉันไม่พบวิธีที่จะให้การตรวจสอบมีการพิจารณา นอกจากนี้หมอระบุว่าการตั้งค่าrho = 1จะทำให้การทดสอบ "การเปลี่ยนแปลง …

2
ลบรายการซ้ำออกจากชุดการฝึกอบรมเพื่อจัดหมวดหมู่
ให้เราบอกว่าฉันมีหลายแถวสำหรับปัญหาการจำแนก: X1, . . .Xยังไม่มีข้อความ, วายX1,...Xยังไม่มีข้อความ,YX_1, ... X_N, Y ที่ไหน X1, . . . ,Xยังไม่มีข้อความX1,...,Xยังไม่มีข้อความX_1, ..., X_N คือคุณสมบัติ / ตัวพยากรณ์และ YYY เป็นคลาสที่การรวมคุณสมบัติของแถวเป็นของ การรวมคุณสมบัติหลายอย่างและคลาสของพวกเขาถูกทำซ้ำในชุดข้อมูลซึ่งฉันใช้เพื่อให้พอดีกับตัวจําแนก ฉันแค่สงสัยว่ามันเป็นที่ยอมรับในการลบรายการที่ซ้ำกัน (โดยทั่วไปฉันทำgroup by X1 ... XN Yใน SQL)? ขอบคุณ PS: นี่เป็นเพียงชุดข้อมูลไบนารีที่มีคลาสของนักบวชค่อนข้างเบ้

4
ทดสอบความแตกต่างอย่างมีนัยสำคัญในอัตราส่วนของตัวแปรสุ่มแบบกระจาย
เกี่ยวข้องกับการวิเคราะห์อัตราส่วนของตัวแปรและวิธีการกำหนดอัตราส่วนของตัวแปรที่มีการแจกแจงแบบปกติสองแบบหรือค่าผกผันของค่าใดค่าหนึ่ง . สมมติว่าฉันมีตัวอย่างจำนวนหนึ่งจากการแจกแจงแบบสุ่มอย่างต่อเนื่องที่แตกต่างกันสี่แบบซึ่งเราสามารถถือว่าเป็นเรื่องปกติได้ ในกรณีของฉันสิ่งเหล่านี้สอดคล้องกับตัวชี้วัดประสิทธิภาพของระบบไฟล์สองระบบที่แตกต่างกัน (เช่น ext4 และ XFS) ทั้งที่มีและไม่มีการเข้ารหัส ตัวอย่างเช่นเมตริกอาจเป็นจำนวนไฟล์ที่สร้างขึ้นต่อวินาทีหรือเวลาแฝงเฉลี่ยสำหรับการดำเนินการกับไฟล์บางอย่าง เราสามารถสรุปได้ว่าตัวอย่างทั้งหมดที่ได้จากการแจกแจงเหล่านี้จะเป็นผลบวกอย่างแน่นอน ขอเรียกกระจายเหล่านี้ที่และ\}Perffstype,encryptionPerffstype,encryption\textrm{Perf}_{fstype,encryption}fstype∈{xfs,ext4}fstype∈{xfs,ext4}fstype \in \{xfs,ext4\}encryption∈{crypto,nocrypto}encryption∈{crypto,nocrypto}encryption \in \{crypto,nocrypto\} ตอนนี้สมมติฐานของฉันคือการเข้ารหัสทำให้ระบบไฟล์ช้าลงโดยปัจจัยที่ใหญ่กว่าระบบอื่น มีการทดสอบอย่างง่าย ๆ สำหรับสมมติฐานE[Perfxfs,crypto]E[Perfxfs,nocrypto]&lt;E[Perfext4,crypto]E[Perfext4,nocrypto]E[Perfxfs,crypto]E[Perfxfs,nocrypto]&lt;E[Perfext4,crypto]E[Perfext4,nocrypto]\frac{E[\textrm{Perf}_{xfs,crypto}]}{E[\textrm{Perf}_{xfs,nocrypto}]} < \frac{E[\textrm{Perf}_{ext4,crypto}]}{E[\textrm{Perf}_{ext4,nocrypto}]} ?

2
แบบจำลองความเป็นอันตรายของสัดส่วนค็อกซ์และตัวอย่างที่ไม่ได้เลือกแบบสุ่ม
มีวิธีใดบ้างที่จะแก้ไขอคติในโมเดลอันตรายตามสัดส่วนของ Cox ที่เกิดจากตัวอย่างที่ไม่ได้เลือกแบบสุ่ม (เช่นการแก้ไขของ Heckman) ความเป็นมา : ให้บอกว่าสถานการณ์มีลักษณะดังนี้: - ในช่วงสองปีแรกลูกค้าทั้งหมดได้รับการยอมรับ - หลังจากสองปีที่ผ่านมา Cox PH model ได้ถูกสร้างขึ้น แบบจำลองทำนายระยะเวลาที่ลูกค้าจะใช้บริการของเรา - เนื่องจากนโยบายของ บริษัท ต่อจากนี้เฉพาะลูกค้าที่มีโอกาสรอดชีวิต 3 เดือนที่มากกว่า 0.5 ได้รับการยอมรับคนอื่น ๆ จึงถูกปฏิเสธ - หลังจากนั้นอีกสองปีจะต้องมีการสร้างโมเดลใหม่ ปัญหาคือเรามีเป้าหมายเฉพาะสำหรับลูกค้าที่ได้รับการยอมรับและการใช้เฉพาะลูกค้าเหล่านี้อาจทำให้เกิดอคติที่ร้ายแรง
9 bias  cox-model 

4
วิธีจัดการกับ gaps / NaNs ในข้อมูลอนุกรมเวลาเมื่อใช้ Matlab สำหรับ autocorrelation และ neural Networks
ฉันมีอนุกรมเวลาของการวัด (ซีรีย์ความสูงหนึ่งมิติ) ในช่วงเวลาการสังเกตกระบวนการวัดลงไปบางจุด ดังนั้นข้อมูลที่ได้คือเวกเตอร์ที่มี NaNs ซึ่งมีช่องว่างในข้อมูล การใช้ MATLAB ทำให้ฉันมีปัญหาเมื่อคำนวณค่าความสัมพันธ์อัตโนมัติ ( autocorr) และการใช้เครือข่ายประสาท ( nnstart) Gaps / NaN เหล่านี้ควรถูกจัดการอย่างไร? ฉันควรนำสิ่งเหล่านี้ออกจากเวกเตอร์หรือไม่ หรือแทนที่รายการของพวกเขาด้วยค่าที่แก้ไขแล้ว? (ถ้าเป็นเช่นนั้นใน MATLAB)

7
กำลังมองหาข้อมูลประดิษฐ์ 2D เพื่อแสดงคุณสมบัติของอัลกอริทึมการจัดกลุ่ม
ฉันกำลังมองหาชุดข้อมูลของ 2 มิติดาต้าพอยน์ (แต่ละดาต้าพอยน์เป็นเวกเตอร์ของสองค่า (x, y)) ตามการแจกแจงและรูปแบบที่แตกต่างกัน รหัสเพื่อสร้างข้อมูลดังกล่าวก็จะเป็นประโยชน์ ฉันต้องการใช้พวกเขาเพื่อพล็อต / เห็นภาพว่าอัลกอริทึมการจัดกลุ่มทำงานอย่างไร นี่คือตัวอย่างบางส่วน: ดาวเหมือนข้อมูลคลาวด์ สี่กลุ่มแยกง่ายหนึ่ง เกลียว (ไม่มีคลัสเตอร์) แหวน เมฆสองก้อนที่แยกจากกันแทบจะไม่ สองกลุ่มขนานสร้างเกลียว ... ฯลฯ

3
การมีความสัมพันธ์ก่อนหรือหลังการเปลี่ยนแปลงของตัวแปร
มีหลักการทั่วไปหรือไม่ว่าควรจะคำนวณความสัมพันธ์ของเพียร์สันสำหรับตัวแปรสุ่มสองตัว X และ Y ก่อนที่จะทำการแปลงท่อนหรือไม่? มีขั้นตอนการทดสอบที่เหมาะสมกว่าหรือไม่ พวกมันให้ผลเหมือนกัน แต่มีค่าต่างกันเนื่องจากการแปลงไฟล์เป็นแบบไม่เป็นเชิงเส้น มันขึ้นอยู่กับว่า X หรือ Y ใกล้เคียงกับมาตรฐานหลังจากบันทึกหรือไม่? ถ้าเป็นเช่นนั้นทำไมมันถึงสำคัญ? และนั่นหมายความว่าเราควรทำการทดสอบ normality บน X และ Y กับ log (X) และ log (Y) และขึ้นอยู่กับการตัดสินใจว่า pearson (x, y) เหมาะสมกว่า pearson (log (x), log (หรือไม่) y))?

4
คำสั่งที่มีประสิทธิภาพที่สุดในการเรียนรู้ LaTeX, Sweave, Beamer? [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามดังนั้นจึงเป็นหัวข้อสำหรับการตรวจสอบข้าม ปิดให้บริการใน3 ปีที่ผ่านมา ฉันสนใจที่จะเรียนรู้วิธีสร้างรายงานซ้ำจากรหัส R ของฉันและการสร้างภาพข้อมูล ggplot2 ฉันเข้าใจว่า LaTeX ดูเหมือนจะเป็นคำตอบที่เป็นไปได้และใช้กับ R ส่วนใหญ่ใช้ Sweave และสำหรับการนำเสนอจากผู้ใช้ R ถึง LaTeX ก็ใช้ Beamer คำถามของฉันคือสิ่งที่ฉันควรเรียนรู้ก่อนหรือสิ่งที่ฉันควรเรียนรู้พร้อมกัน? ฉันไม่รู้จัก Sweave หรือ LaTeX ฉันควรเรียนรู้ LaTeX (อย่างน้อยสักครู่) แล้วเรียนรู้ Sweave หรือคุณจะแนะนำให้เรียนรู้พวกเขาในเวลาเดียวกัน? ลิงก์ไปยังบทเรียนที่สนับสนุนคำตอบของคุณชื่นชมอย่างมาก
9 r 

1
การสร้างโมเดลเอนโทรปีสูงสุดจากตัวแยกประเภทเอนโทรปีสูงสุดแบบหลายอินพุตที่มีอยู่
ฉันรู้สึกทึ่งกับแนวคิดของรูปแบบสูงสุดของเอนโทรปีมาร์คอฟ (MEMM) และฉันกำลังคิดที่จะใช้มันสำหรับแท็กเกอร์ Speech (POS) ส่วนหนึ่ง ในขณะนี้ฉันใช้ลักษณนาม Maximum Entropy (ME) ทั่วไปเพื่อติดแท็กแต่ละคำ สิ่งนี้ใช้คุณสมบัติหลายอย่างรวมถึงสองแท็กก่อนหน้านี้ MEMM ใช้อัลกอริทึม Viterbi เพื่อค้นหาเส้นทางที่เหมาะสมผ่านห่วงโซ่มาร์คอฟ (เช่นเพื่อค้นหาแท็กชุดที่สมบูรณ์แบบที่สุดสำหรับประโยคแทนที่จะเป็นคำแต่ละคำที่เหมาะสมที่สุด อ่านเกี่ยวกับเรื่องนี้ดูเหมือนจะมีความสง่างามและความเรียบง่ายที่ยอดเยี่ยม อย่างไรก็ตามแต่ละสเตจจะอาศัย "ผลลัพธ์" ของสเตจก่อนหน้าเท่านั้น (เช่นตามเครือมาร์คอฟ) อย่างไรก็ตามโมเดล ME ของฉันใช้สองขั้นตอนก่อนหน้า (เช่นแท็กสำหรับสองคำก่อนหน้านี้) ดูเหมือนว่าฉันมีวิธีที่เป็นไปได้สองวิธี: เช่นเดียวกับการใช้ Viterbi แบบเดิมให้ใช้ชุดของเส้นทางที่จัดเก็บตามขั้นตอนเดียว (ก่อนหน้านี้) ตัวแยกประเภท ME ของฉันจะใช้ขั้นตอนนี้และ 'แช่แข็ง' ก่อนหน้านี้ (ถูกแช่แข็งในเส้นทางภายใต้การพิจารณา) เพื่อสร้างฟังก์ชันถ่ายโอน หรือฉันเขียนอัลกอริทึมเพื่อติดตามสองขั้นตอน สิ่งนี้มีความซับซ้อนมากขึ้นและจะไม่เป็นโมเดลของมาร์คอฟที่แท้จริงอีกต่อไปเพราะฟังก์ชั่นถ่ายโอนแต่ละตัว (เช่นจาก ME Model) จะขึ้นอยู่กับสองขั้นตอนก่อนหน้านี้และไม่ใช่หนึ่งขั้นตอน มันทำให้ฉันรู้ว่าสิ่งที่สองจะแม่นยำยิ่งขึ้นแม้ว่ามันจะซับซ้อนกว่าก็ตาม ฉันยังไม่พบตัวอย่างใด ๆ ของสิ่งนี้ในระหว่างการค้นหาวรรณกรรม มันถูกลองแล้วหรือยัง? วิธีการสองขั้นตอนนี้ช่วยปรับปรุงความแม่นยำโดยรวมหรือไม่?

1
ตัวกรองอนุภาคในตัวอย่างโค้ดเล็ก ๆ น้อย ๆ
ฉันกำลังมองหาตัวอย่างรหัสง่ายๆของวิธีการเรียกใช้ตัวกรองอนุภาคในอาร์แพคเกจ pomp ปรากฏขึ้นเพื่อสนับสนุนบิตสเปซทางคณิตศาสตร์ของรัฐ แต่ตัวอย่างนั้นค่อนข้างยุ่งยากที่จะติดตามโดยทางโปรแกรม วิธีการโหลดข้อมูลที่สังเกตลงในวัตถุเอิกเกริก ตัวอย่างที่นี่: http://cran.r-project.org/web/packages/pomp/vignettes/intro_to_pomp.pdf ให้บอกว่าฉันมีไฟล์ csv ที่มี 1 คอลัมน์ของข้อมูลที่มีเสียงดังเป็นอินพุตและฉันต้องการเรียกใช้ผ่านตัวกรองอนุภาคเพื่อหวังว่าจะทำความสะอาดมันด้วยผลลัพธ์ที่ถูกประเมินไปยังไฟล์ csv อื่น y &lt;- read.csv("C:/Dev/VeryCleverStatArb/inputData.csv", header=FALSE) #CSV to Pomp object ??? #Run Particle Filter #Write estimates to csv. ปัญหาหลักของตัวอย่างคือการโหลดข้อมูล csv ลงในวัตถุเอิกเกริก แบบจำลองอวกาศของรัฐที่ง่ายมากน่าจะเพียงพอสำหรับตอนนี้ ความคิดใด ๆ สำหรับ R- อยากรู้อยากเห็น?
9 r 

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.