สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
ความเสถียรของโมเดลในการตรวจสอบความถูกต้องของโมเดลการถดถอย
เมื่อพิจารณาถึงการข้ามการตรวจสอบหลายครั้งของการถดถอยโลจิสติกส์และการประมาณค่าหลาย ๆ ค่าของสัมประสิทธิ์การถดถอยแต่ละวิธีควรวัดว่าตัวทำนาย (หรือชุดของผู้ทำนาย) มีเสถียรภาพและมีความหมายหรือไม่ขึ้นอยู่กับสัมประสิทธิ์การถดถอย ? สิ่งนี้แตกต่างสำหรับการถดถอยเชิงเส้นหรือไม่?

1
ทดสอบสัดส่วนและตัวจําแนกไบนารี
ฉันมีเครื่องผลิตชิ้นส่วนต้นแบบ ในการทดสอบครั้งแรกเครื่องผลิตชิ้นส่วนและลักษณนามไบนารีบอกฉันว่าd 1ส่วนมีข้อบกพร่อง ( d 1 &lt; N 1มักจะวันที่1 / N 1 &lt; 0.01และN 1 ≈ 10 4 ) และN 1 - d 1ชิ้นส่วนเป็นสิ่งที่ดียังไม่มีข้อความ1N1N_1d1d1d_1d1&lt; N1d1&lt;N1d_1 < N_1d1/ N1&lt; 0.01d1/N1&lt;0.01d_1/N_1<0.01ยังไม่มีข้อความ1≈ 104N1≈104N_1\approx10^4ยังไม่มีข้อความ1- d1N1−d1N_1-d_1 จากนั้นช่างเทคนิคจะทำการเปลี่ยนแปลงบางอย่างในเครื่องเพื่อลดจำนวนชิ้นส่วนที่บกพร่อง ในการทดสอบที่สองและต่อไปนี้การปรับเปลี่ยนเครื่องผลิตชิ้นส่วนและลักษณนามไบนารีเดียวกัน (แตะต้อง) บอกผมว่าd 2ส่วนมีข้อบกพร่องอยู่แล้ววันที่2 / N 2ค่อนข้างคล้ายกับd 1 / N 1ยังไม่มีข้อความ2N2N_2d2d2d_2d2/ N2d2/N2d_2/N_2d1/ N1d1/N1d_1/N_1 ช่างต้องการทราบว่าการเปลี่ยนแปลงของเขามีประสิทธิภาพหรือไม่ สมมติว่าตัวแยกประเภทสมบูรณ์แบบ (ความไวของมันคือ 100% และความเฉพาะเจาะจงของมันคือ …

3
เนื้อหาออนไลน์เพื่อเรียนรู้การวิเคราะห์อนุกรมเวลา
คำถามของฉันคือถ้ามีสื่อออนไลน์ที่ดีสำหรับการเรียนรู้นี้ สิ่งที่แนะนำสิ่งต่าง ๆ ได้ดีโดยเฉพาะอย่างยิ่งแบบจำลอง ARMA และคณิตศาสตร์ที่เกี่ยวข้อง แก้ไข:ฉันกำลังมองหาบางอย่างในระดับปริญญาตรีระดับสูง บางสิ่งที่เหมือนในบทนำของอนุกรมเวลาและการพยากรณ์ของ Brockwell และ Davis

2
ฉันจะจัดกลุ่มสตริงตามธีมทั่วไปได้อย่างไร
ฉันกำลังพยายามจัดกลุ่มเช่นสตริงเกี่ยวกับการเขียนโปรแกรมกับสตริงอื่น ๆ เกี่ยวกับการเขียนโปรแกรมสตริงเกี่ยวกับฟิสิกส์กับสตริงอื่น ๆ เกี่ยวกับฟิสิกส์ ฯลฯ สำหรับหัวข้อที่หลากหลาย แม้จะมีแง่มุมทางภาษาที่ชัดเจนทางทฤษฎีของปัญหา แต่ฉันกำลังมองหาที่จะทำสิ่งนี้โดยใช้การเขียนโปรแกรม / ซอฟต์แวร์ บทสรุป:ด้วยสตริงจำนวนมากฉันจะจัดกลุ่มตามธีมความหมายได้อย่างไร แอปพลิเคชันเฉพาะ:ฉันมีคำถามแบบไม่สำคัญประมาณ 200,000 คำถามที่ฉันต้องการจัดหมวดหมู่เป็นกลุ่มร่วมกัน (รถยนต์คอมพิวเตอร์การเมืองแคนาดาอาหารบารักโอบา ฯลฯ ) สิ่งที่ฉันได้ดู: Wikipedia มีรายการชุดเครื่องมือประมวลผลภาษาธรรมชาติ (สมมติว่าสิ่งที่ฉันพยายามทำจริง ๆ แล้วเรียกว่า NLP) ดังนั้นฉันจึงดูบ้าง แต่ดูเหมือนไม่มีใครทำอะไรที่คล้ายกับความต้องการของฉัน หมายเหตุ:มีการชี้ให้เห็นว่าการทำเช่นนี้ต้องใช้ความรู้เพิ่มเติม (เช่น Porsche เป็นรถยนต์ส่วน C ++ เป็นภาษาโปรแกรม) ฉันคิดว่าจำเป็นต้องใช้ข้อมูลการฝึกอบรม แต่ถ้าฉันมีเพียงรายการคำถามและคำตอบฉันจะสร้างข้อมูลการฝึกอบรมได้อย่างไร จากนั้นฉันจะใช้ข้อมูลการฝึกอบรมอย่างไร หมายเหตุเพิ่มเติม:หากการจัดรูปแบบปัจจุบันของความช่วยเหลือ Q &amp; As ของฉัน (แม้ว่าจะดูเหมือนว่า JSON มันเป็นไฟล์ข้อความดิบ): // row 1: is metadata …

2
วิธีการเลือกการแปลงที่ดีที่สุดเพื่อให้เป็นเส้นตรง?
ฉันต้องการทำการถดถอยเชิงเส้นหลายครั้งและจากนั้นเพื่อทำนายค่าใหม่ด้วยการประมาณค่าเล็กน้อย ฉันมีตัวแปรตอบสนองของฉันอยู่ในช่วงตั้งแต่ -2 ถึง +7 และตัวทำนายสามตัว (ช่วงประมาณ +10 - +200) การกระจายเกือบปกติ แต่ความสัมพันธ์ระหว่างการตอบสนองและตัวทำนายนั้นไม่ใช่เชิงเส้นฉันเห็นเส้นโค้งบนแปลง ตัวอย่างเช่นนี้: http://cs10418.userapi.com/u17020874/153949434/x_9898cf38.jpg ฉันต้องการใช้การแปลงเพื่อให้เป็นเชิงเส้น ฉันพยายามเปลี่ยนตัวแปรการตอบสนองโดยการตรวจสอบฟังก์ชั่นต่าง ๆ และดูที่แปลงผลลัพธ์เพื่อดูความสัมพันธ์เชิงเส้นระหว่างการตอบสนองและตัวทำนาย และฉันพบว่ามีฟังก์ชั่นมากมายที่สามารถให้ความสัมพันธ์เชิงเส้นที่มองเห็นได้กับฉัน ตัวอย่างเช่นฟังก์ชั่น t1=log(y+2.5)t1=log⁡(y+2.5)t_1=\log(y+2.5) t2=1log(y+5)t2=1log⁡(y+5)t_2=\frac{1}{\log(y+5)} t3=1y+5t3=1y+5t_3=\frac{1}{y+5} t4=1(y+10)3t4=1(y+10)3t_4=\frac{1}{(y+10)^3} t5=1(y+3)13t5=1(y+3)13t_5=\frac{1}{(y+3)^\frac{1}{3}}ฯลฯ ให้ผลลัพธ์ที่คล้ายกัน: http://cs10418.userapi.com/u17020874/153949434/x_06f13dbf.jpg หลังจากที่ฉันจะแปลงกลับค่าที่ทำนายไว้ (สำหรับเป็นเป็นต้น) การแจกแจงจะคล้ายกันมากหรือน้อยกว่าปกติt=1(y+10)3t=1(y+10)3t=\frac{1}{(y+10)^3}y′=1t13−10y′=1t13−10y’=\frac{1}{t^\frac{1}{3}}-10 ฉันจะเลือกการแปลงที่ดีที่สุดสำหรับข้อมูลของฉันได้อย่างไร มีวิธีเชิงปริมาณ (และไม่ซับซ้อนมาก) ในการประเมินความเป็นเชิงเส้นหรือไม่? เพื่อพิสูจน์ว่าการแปลงที่เลือกนั้นดีที่สุดหรือค้นหาโดยอัตโนมัติหากเป็นไปได้ หรือวิธีเดียวที่จะทำได้คือการถดถอยแบบหลายเส้นที่ไม่เป็นเชิงเส้น?

3
ความน่าจะเป็นของคน n คนจากรายชื่อคน m ที่อยู่ในการสุ่มเลือก x คนจากรายชื่อคน y
ถ้าฉันเลือก 232 คนจากกลุ่ม 363 คนโดยไม่เปลี่ยนความน่าจะเป็นที่ 2 จากรายชื่อ 12 คนที่อยู่ในการเลือกนั้นคืออะไร นี่คือการสุ่มจับฉลากสำหรับการแข่งขันแบบพิเศษที่มีผู้เข้าชม 363 คนจาก 232 จุด มีข้อโต้แย้งว่าการเลือกนั้นมีอคติต่อกลุ่มคน 12 คนหรือไม่ ความพยายามครั้งแรกของฉันในการคำนวณว่ามี 232 ตัวเลือกที่เป็นไปได้ 363 ตัวเลือก จำนวนชุดค่าผสมของบุคคลหนึ่งคนจากรายการสิบสองคือ 1 เลือก 12 + 2 เลือก 12 + ... + 11 เลือก 12 + 12 เลือก 12 ดังนั้น 1 เลือก 12 + 2 เลือก 12 .... / …

1
ข้ามเอฟเฟกต์แบบสุ่มและข้อมูลที่ไม่สมดุล
ฉันกำลังสร้างแบบจำลองข้อมูลบางอย่างที่ฉันคิดว่าฉันมีผลกระทบแบบสุ่มข้ามสอง แต่ชุดข้อมูลไม่สมดุลและฉันไม่แน่ใจว่าต้องทำอะไรเพื่อบัญชี ข้อมูลของฉันคือชุดของเหตุการณ์ เหตุการณ์เกิดขึ้นเมื่อลูกค้าพบกับผู้ให้บริการเพื่อดำเนินงานซึ่งประสบความสำเร็จหรือไม่ มีลูกค้าและผู้ให้บริการหลายพันรายและลูกค้าและผู้ให้บริการแต่ละรายมีส่วนร่วมในกิจกรรมที่แตกต่างกันจำนวน (ประมาณ 5 ถึง 500) ลูกค้าและผู้ให้บริการแต่ละรายมีระดับทักษะและโอกาสที่งานจะประสบความสำเร็จคือหน้าที่ของทักษะของผู้เข้าร่วมทั้งสอง ไม่มีการทับซ้อนระหว่างไคลเอนต์และผู้ให้บริการ ฉันสนใจความแปรปรวนของประชากรของลูกค้าและผู้ให้บริการที่เกี่ยวข้องดังนั้นเราจึงสามารถทราบได้ว่าแหล่งข้อมูลใดมีผลต่ออัตราความสำเร็จมากขึ้น ฉันต้องการทราบค่าเฉพาะของทักษะระหว่างลูกค้าและผู้ให้บริการที่เรามีข้อมูลเพื่อระบุลูกค้าหรือผู้ให้บริการที่ดีที่สุด / แย่ที่สุด ตอนแรกฉันต้องการสมมติว่าความน่าจะเป็นของความสำเร็จนั้นเกิดจากระดับทักษะรวมของลูกค้าและผู้ให้บริการโดยไม่มีผลกระทบคงที่อื่น ๆ ดังนั้นสมมติว่า x เป็นปัจจัยสำหรับลูกค้าและ y เป็นปัจจัยสำหรับผู้ให้บริการจากนั้นใน R (โดยใช้แพ็คเกจ lme4) ฉันมีรูปแบบที่ระบุเป็น: glmer( success ~ (1 | x) + (1 | y), family=binomial(), data=events) ปัญหาหนึ่งคือลูกค้าไม่ได้กระจายอย่างเท่าเทียมกันทั่วทั้งผู้ให้บริการ ลูกค้าที่มีทักษะสูงจะมีโอกาสที่จะจับคู่กับผู้ให้บริการที่มีทักษะสูงกว่า ความเข้าใจของฉันคือผลกระทบแบบสุ่มจะต้องไม่เกี่ยวข้องกับตัวทำนายอื่น ๆ ในโมเดล แต่ฉันไม่แน่ใจว่าจะอธิบายได้อย่างไร นอกจากนี้ลูกค้าและผู้ให้บริการบางรายมีกิจกรรมน้อยมาก (น้อยกว่า 10) ในขณะที่ลูกค้าอื่นมีจำนวนมาก (มากถึง 500) …

3
การแสดงผลขนาดทวินาม (BESD) เป็นการนำเสนอขนาดที่ทำให้เข้าใจผิดหรือไม่?
มันยากสำหรับฉันที่จะยอมรับว่าโดนัลด์รูบินจะมาพร้อมกับเทคนิคมะนาวที่แท้จริง แต่นั่นคือการรับรู้ของฉันเกี่ยวกับ BESD [ 1 , 2 , 3 ] กระดาษต้นฉบับโดย Rosenthal และ Rubin (1982)อ้างว่ามีค่าในการแสดง "วิธีการสร้างความสัมพันธ์กับช่วงเวลาของผลิตภัณฑ์ใด ๆ ในการแสดง [2x2] ไม่ว่าจะเป็นข้อมูลต้นฉบับที่ต่อเนื่องหรือเป็นหมวดหมู่" ตารางด้านล่างมาจากหน้า 451 ของลิงค์ที่ 2 ด้านบน: R2R2R^2φϕ\phi ฉันขาดสิ่งที่มีค่าอย่างแท้จริงที่นี่ นอกจากนี้ฉันมีความประทับใจว่าในช่วง 10 ปีที่ผ่านมาชุมชนสถิติได้ปฏิเสธโดยวิธีนี้อย่างมากและถูกต้องตามกฎหมาย - ฉันผิดหรือเปล่า? EEEคCCs Rsrsr Es R= .50 + r / 2Esr=.50+r/2E_{sr} = .50 + r/2 และ คs R= .50 - …

3
โมเดลเชิงเส้น Heteroscedasticity
ฉันมีโมเดลเชิงเส้นต่อไปนี้: เพื่อแก้ไขปัญหาความแตกต่างแบบตกค้างฉันพยายามใช้การแปลงบันทึกกับตัวแปรตามเป็นแต่ฉันยังคงเห็นแฟน ๆ มีผลต่อส่วนที่เหลือ ค่า DV มีขนาดค่อนข้างเล็กดังนั้นการเพิ่มค่าคงที่ +1 ก่อนที่จะบันทึกอาจไม่เหมาะสมในกรณีนี้log(Y+1)log⁡(Y+1)\log(Y + 1) &gt; summary(Y) Min. :-0.0005647 1st Qu.: 0.0001066 Median : 0.0003060 Mean : 0.0004617 3rd Qu.: 0.0006333 Max. : 0.0105730 NA's :30.0000000 ฉันจะแปลงตัวแปรเพื่อปรับปรุงข้อผิดพลาดการทำนายและความแปรปรวนได้อย่างไรโดยเฉพาะอย่างยิ่งสำหรับค่าที่เหมาะสมที่สุด

2
วิธีการดำเนินการถดถอยแบบเกาส์กระบวนการเมื่อฟังก์ชั่นการเปลี่ยนแปลงประมาณเมื่อเวลาผ่านไป?
อะไรคือกลยุทธ์ที่ดีสำหรับการดำเนินการถดถอยแบบเกาส์เมื่อฟังก์ชั่นที่ฉันพยายามประมาณการเปลี่ยนแปลงอยู่ตลอดเวลา? วิธีการไร้เดียงสาที่เกิดขึ้นในใจของฉันคือใช้เฉพาะจุดข้อมูลล่าสุด N เพื่อทำการถดถอย กลยุทธ์ที่ดีกว่าคืออะไร

3
วิธีการคาดการณ์ขึ้นอยู่กับข้อมูลรวมในช่วงเวลาที่ผิดปกติ?
ฉันพยายามที่จะคาดการณ์ยอดขายของผลิตภัณฑ์ในเครื่องขายแสตมป์อัตโนมัติ ปัญหาคือเครื่องถูกเติมเต็มในช่วงเวลาที่ผิดปกติและในทุกการเติมเราสามารถบันทึกยอดขายรวมตั้งแต่การเติมครั้งสุดท้ายของเครื่อง (เช่นเราไม่มีข้อมูลการขายรายวัน) ดังนั้นโดยทั่วไปเรามีข้อมูลสำหรับยอดขายรวมในช่วงเวลาที่ไม่สม่ำเสมอ ช่วงเวลาปกติอยู่ระหว่าง 2 วันถึง 3 สัปดาห์ นี่คือข้อมูลตัวอย่างสำหรับเครื่องขายแสตมป์อัตโนมัติหนึ่งเครื่องและผลิตภัณฑ์หนึ่งรายการ: 27/02/2012 48 17/02/2012 24 09/02/2012 16 02/02/2012 7 25/01/2012 12 16/01/2012 16 05/01/2012 16 23/12/2011 4 16/12/2011 14 09/12/2011 4 02/12/2011 2 อัลกอริทึมไร้เดียงสาปัจจุบันของเราคือการคำนวณยอดขายเฉลี่ยต่อวันโดยการหารปริมาณทั้งหมดที่ขายในช่วง 90 วันที่ผ่านมา 90 คุณมีความคิดวิธีปรับปรุงการคาดการณ์ยอดขายต่อวันหรือไม่? ฉันต้องคาดการณ์สิ่งที่จะขายในการเยี่ยมชมครั้งต่อไปของเครื่อง เป็นไปได้ไหมที่จะใช้อัลกอริธึมการทำให้เรียบแบบเอกซ์โพเนนเชียลของธรรมชาติของข้อมูลของเรา? ขอบคุณล่วงหน้า! อัปเดต: ขอบคุณมากสำหรับคำตอบและความคิดเห็นทั้งหมด ให้ฉันลองเพิ่มบริบทหน่อย (กรณีธุรกิจที่อยู่เบื้องหลังคำถาม - ง่ายมากแน่นอน) เรามีตู้จำหน่ายสินค้าอัตโนมัติหลายร้อยเครื่อง ทุกวันเราต้องตัดสินใจว่าพวกเขา 20 คนไปเยี่ยมชมเพื่อเติมเงิน …

1
ความช่วยเหลือเกี่ยวกับการสร้างแบบจำลอง SEM (OpenMx, polycor)
ฉันมีปัญหามากมายกับชุดข้อมูลเดียวที่ฉันพยายามใช้ SEM เราสมมติว่ามีปัจจัยแฝง 5 ตัวคือ A, B, C, D, E พร้อมด้วยตัวชี้วัด A1 ถึง A5 (ปัจจัยที่สั่ง), B1 ถึง B3 (เชิงปริมาณ), C1, D1, E1 (ทั้งหมดสามปัจจัยสุดท้ายที่สั่งโดยมีเพียง 2 ระดับสำหรับ E1 เรามีความสนใจในความแปรปรวนร่วมระหว่างปัจจัยทั้งหมด ฉันพยายามที่จะใช้OpenMxเพื่อทำเช่นนั้น นี่คือความพยายามของฉัน: ฉันก่อนพยายามใช้การฝึกอบรมขีด จำกัด สำหรับปัจจัยที่สั่งทั้งหมด แต่การบรรจบล้มเหลว ฉันตัดสินใจที่จะใช้ความสัมพันธ์แบบ polychoric / polyserial แทนข้อมูลดิบด้วยฟังก์ชั่นhetcorจากห้องสมุดpolycor(ฉันวางแผนที่จะบูตตัวอย่างเพื่อรับช่วงความมั่นใจ) มันก็ล้มเหลวที่จะมาบรรจบกัน! ฉันพยายาม จำกัด เฉพาะบุคคลที่มีข้อมูลครบถ้วน แต่ก็ล้มเหลวด้วย! คำถามแรกของฉันคือ: มีวิธีธรรมชาติในการตีความความล้มเหลวเหล่านี้? คำถามที่สองของฉันคือฉันควรทำอย่างไร ??? แก้ไข: สำหรับผู้อ่านในอนาคตที่อาจพบปัญหาเดียวกันหลังจากที่ไปถึงรหัสของฟังก์ชั่นในการpolycor... การแก้ปัญหาเป็นเพียงการใช้งานที่มีตัวเลือกhetcor() …

1
นอกเหนือจากเมล็ดฟิชเชอร์
ชั่วครู่หนึ่งดูเหมือนว่าFisher Kernelsอาจจะได้รับความนิยมเนื่องจากพวกมันดูเหมือนจะเป็นวิธีในการสร้างเมล็ดจากแบบจำลองความน่าจะเป็น อย่างไรก็ตามฉันไม่ค่อยเห็นพวกเขาใช้ในทางปฏิบัติและฉันมีสิทธิ์ที่ดีที่พวกเขามักจะไม่ทำงานได้ดี พวกเขาพึ่งพาการคำนวณข้อมูลฟิชเชอร์ - การอ้างอิง Wikipedia: ข้อมูลฟิชเชอร์เป็นข้อมูลเชิงลบของความคาดหวังของอนุพันธ์อันดับสองเกี่ยวกับ ar ของลอการิทึมธรรมชาติของ f ข้อมูลอาจถูกมองว่าเป็นมาตรวัดของ "ความโค้ง" ของเส้นโค้งการสนับสนุนใกล้กับค่าประมาณความน่าจะเป็นสูงสุด (MLE) ของθ เท่าที่ฉันสามารถบอกได้ว่านี่หมายความว่าฟังก์ชั่นเคอร์เนลระหว่างสองจุดคือระยะทางตามพื้นผิวโค้งนี้ - ใช่ไหม? อย่างไรก็ตามนี่อาจเป็นปัญหาสำหรับใช้ในวิธีเคอร์เนลเช่น MLE อาจเป็นการประเมินที่แย่มากสำหรับรุ่นที่กำหนด ความโค้งของเส้นโค้งการสนับสนุนรอบ ๆ MLE อาจไม่มีประโยชน์ใด ๆ สำหรับการแยกแยะระหว่างอินสแตนซ์ตัวอย่างเช่นถ้าพื้นผิวที่มีโอกาสสูงแหลมมาก ดูเหมือนว่าจะทิ้งข้อมูลจำนวนมากเกี่ยวกับโมเดล หากเป็นกรณีนี้มีวิธีการสร้างเมล็ดที่ทันสมัยกว่าจากวิธีการที่น่าจะเป็นหรือไม่? ตัวอย่างเช่นเราสามารถใช้ชุดการระงับเพื่อใช้การประมาณค่า MAP ด้วยวิธีเดียวกันได้หรือไม่ แนวคิดอื่น ๆ ของระยะทางหรือความคล้ายคลึงกันจากวิธีความน่าจะเป็นสามารถทำงานเพื่อสร้างฟังก์ชั่นเคอร์เนล (ที่ถูกต้อง)?

1
การจัดการกับชุดข้อมูลอนุกรมเวลาที่มีขนาดใหญ่มาก
ฉันสามารถเข้าถึงชุดข้อมูลที่มีขนาดใหญ่มาก ข้อมูลมาจากการบันทึกMEGของผู้คนที่ฟังเพลงที่ตัดตอนมาจากหนึ่งในสี่ประเภท ข้อมูลมีดังนี้: 6 วิชา 3 การทดลองซ้ำ (ตอน) 120 การทดลองต่อยุค 8 วินาทีของข้อมูลต่อการทดลองที่ 500Hz (= 4000 ตัวอย่าง) จาก 275 MEG channel ดังนั้น "ตัวอย่าง" นี่คือเมทริกซ์ขนาด [4000x275] และมีตัวอย่าง 2160 ตัวอย่างและนั่นคือก่อนการแยกคุณลักษณะใด ๆ เป้าหมายคือการทำนายประเภทตามสัญญาณสมอง (การจำแนก 4 ระดับ) เห็นได้ชัดว่ามีบางประเด็นที่ท้าทายที่นี่คือ: ชุดข้อมูลไม่พอดีกับหน่วยความจำ ข้อมูลจะมีความสัมพันธ์ทางโลกที่แข็งแกร่งและความแปรผันระหว่างหัวข้อจะมีขนาดใหญ่มาก ดังนั้นจึงไม่ชัดเจนว่าจะแบ่งข้อมูลอย่างไร อัตราส่วนสัญญาณต่อเสียงรบกวนต่ำมาก ไม่ชัดเจนว่าคุณสมบัติที่ถูกต้องสำหรับตัวจําแนกจะเป็นอย่างไร สิ่งเหล่านี้ในทางกลับกัน: มีหลายสิ่งที่เราทำได้ ประการแรกเราสามารถลดตัวอย่างได้อย่างปลอดภัยจาก 500Hz ถึง ~ 200Hz แม้ว่าการ จำกัด Nyquist เข้าบัญชีกิจกรรมสมองไม่ได้เกิดขึ้นจริงที่ 100Hz …

3
วิธีการเมื่อเรียนรู้จากชุดข้อมูลขนาดใหญ่?
โดยทั่วไปมีสองวิธีทั่วไปในการเรียนรู้กับชุดข้อมูลขนาดใหญ่ (เมื่อคุณเผชิญกับข้อ จำกัด ด้านเวลา / พื้นที่): การโกง :) - ใช้ชุดย่อยที่ "จัดการได้" เพื่อการฝึกอบรม การสูญเสียความถูกต้องอาจเล็กน้อยเนื่องจากกฎของผลตอบแทนลดลง - ประสิทธิภาพการทำนายของตัวแบบมักจะแบนนานก่อนที่ข้อมูลการฝึกอบรมทั้งหมดจะถูกรวมเข้าไป การคำนวณแบบขนาน - แบ่งปัญหาออกเป็นส่วนเล็ก ๆ และแก้ปัญหาแต่ละเรื่องด้วยเครื่อง / โปรเซสเซอร์ที่แยกต่างหาก คุณต้องใช้อัลกอริทึมรุ่นขนาน แต่ข่าวดีก็คือว่าอัลกอริทึมทั่วไปจำนวนมากนั้นขนานกันตามธรรมชาติ: เพื่อนบ้านที่ใกล้ที่สุดต้นไม้ตัดสินใจ ฯลฯ มีวิธีอื่นไหม มีกฎของหัวแม่มือเมื่อใช้แต่ละ? ข้อเสียของแต่ละวิธีคืออะไร?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.