สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
เทคนิคการเรียนรู้ของเครื่องสำหรับการเรียนรู้รูปแบบสตริง
ฉันมีรายการคำที่เป็นของหมวดหมู่ที่กำหนดเองที่แตกต่างกัน แต่ละหมวดหมู่มีรูปแบบของตัวเอง (ตัวอย่างเช่นหมวดหนึ่งมีความยาวคงที่พร้อมด้วยอักขระพิเศษอีกประเภทหนึ่งมีตัวอักษรอยู่ซึ่งเกิดขึ้นเฉพาะในหมวดหมู่ "คำ", ... ) ตัวอย่างเช่น: "ABC" -> type1 "ACC" -> type1 "a8 219" -> type2 "c 827" -> type2 "ASDF 123" -> type2 "123123" -> type3 ... ฉันกำลังค้นหาเทคนิคการเรียนรู้ของเครื่องเพื่อเรียนรู้รูปแบบเหล่านี้ด้วยตนเองตามข้อมูลการฝึกอบรม ฉันได้พยายามกำหนดตัวแปรตัวทำนายบางตัว (เช่นความยาวจำนวนตัวอักษรพิเศษ ... ) ด้วยตัวเองแล้วใช้โครงข่ายประสาทเทียมเพื่อเรียนรู้และทำนายหมวดหมู่ แต่นั่นไม่ใช่สิ่งที่ฉันต้องการ ฉันต้องการเทคนิคเพื่อเรียนรู้รูปแบบสำหรับแต่ละหมวดหมู่ด้วยตัวเอง - แม้กระทั่งเรียนรู้รูปแบบที่ฉันไม่เคยคิด ดังนั้นฉันจึงให้ข้อมูลการเรียนรู้อัลกอริทึม (ประกอบด้วยตัวอย่างหมวดคำ) และต้องการให้เรียนรู้รูปแบบสำหรับแต่ละหมวดหมู่เพื่อทำนายหมวดหมู่ในภายหลังจากคำที่คล้ายกันหรือเท่ากัน มีวิธีการที่ทันสมัยในการทำมันได้หรือไม่ ขอบคุณสำหรับความช่วยเหลือของคุณ

3
ค่าเฉลี่ยของการแจกแจงเลขชี้กำลังผกผัน
ให้ตัวแปรสุ่มค่าเฉลี่ยและความแปรปรวนของG = 1 คืออะไรY= Ex p ( λ )Y=Exp(λ)Y = Exp(\lambda)ไหมG = 1YG=1YG=\dfrac{1}{Y} ฉันดูการแจกแจงผกผันแกมม่า แต่ค่าเฉลี่ยและความแปรปรวนถูกกำหนดเฉพาะสำหรับและα > 2ตามลำดับ ...α > 1α>1\alpha>1α > 2α>2\alpha>2

2
ความสัมพันธ์ระหว่างไซน์และโคไซน์
สมมติว่ากระจายอย่างสม่ำเสมอบน[ 0 , 2 π ] Let Y = บาปXและZ = cos X แสดงให้เห็นว่าความสัมพันธ์ระหว่างYและZเป็นศูนย์XXX[ 0 , 2 π][0,2π][0, 2\pi]Y= บาปXY=sin⁡XY = \sin XZ= cosXZ=cos⁡XZ = \cos XYYYZZZ ดูเหมือนว่าฉันจะต้องรู้ค่าเบี่ยงเบนมาตรฐานของไซน์และโคไซน์และความแปรปรวนร่วมของพวกมัน ฉันจะคำนวณสิ่งเหล่านี้ได้อย่างไร ฉันคิดว่าฉันต้องถือว่ามีการกระจายชุดและดูที่ตัวแปรเปลี่ยนY = บาป( X )และZ = cos ( X ) จากนั้นกฎของนักสถิติที่ไม่รู้สึกตัวจะให้คุณค่าที่คาดหวังXXXY= บาป( X)Y=sin⁡(X)Y=\sin(X)Z= cos( X)Z=cos⁡(X)Z=\cos(X) และE[Z]=1E[ Y] = 1ข-∫∞- ∞บาป( x …

2
วิธีการกำหนดพารามิเตอร์สำหรับ t-SNE สำหรับการลดขนาด?
ฉันใหม่มากที่จะแต่งงานคำ ฉันต้องการเห็นภาพว่าเอกสารกำลังเรียนรู้อย่างไร ฉันอ่านว่า t-SNE เป็นวิธีการที่จะทำ ฉันมีเอกสาร 100K ขนาด 250 เท่าของการฝัง มีหลายแพ็คเกจเช่นกัน อย่างไรก็ตามสำหรับ t-SNE ฉันไม่ทราบว่าการวนซ้ำหรือค่าของ alpha หรือค่า perpexility ที่ฉันควรเรียนรู้มากขึ้นเท่าไร พารามิเตอร์ไฮเปอร์เหล่านี้หรืออาจถูกกำหนดโดยคุณลักษณะบางอย่าง?

2
การถดถอยเชิงเส้นการคาดการณ์ตามเงื่อนไขและค่าที่คาดหวัง
ตกลงดังนั้นนิดหน่อยในบางสิ่งบางอย่างความช่วยเหลือใด ๆ ที่จะได้รับการชื่นชมมาก ฉันเข้าใจว่าแบบจำลองการถดถอยเชิงเส้นถูกคาดการณ์ผ่านการคาดการณ์ตามเงื่อนไข E( Y| X) = b + Xb + eE(Y|X)=ข+Xข+อีE(Y|X)=b+Xb+e เราคิดว่าทั้งและเป็นตัวแปรสุ่มที่มีการแจกแจงความน่าจะเป็นที่ไม่รู้จักบ้างไหม? มันเป็นความเข้าใจของฉันว่าเฉพาะค่าตกค้างและค่าสัมประสิทธิ์เบต้าโดยประมาณคือตัวแปรสุ่ม ถ้าเป็นเช่นนั้นถ้าความอ้วนและอายุถ้าเราใช้ความคาดหวังตามเงื่อนไขความหมายอะไรคือค่าที่คาดหวังของการเป็นโรคอ้วนถ้าบุคคลนั้นมีตัวอย่าง เพียงแค่ใช้ค่าเฉลี่ย (ค่าเฉลี่ย) ของปีสำหรับข้อสังเกตเหล่านั้นที่ ? ยังไม่ได้คาดหวังค่าที่นำมาซึ่งเราจะต้องคูณด้วยความน่าจะเป็นที่เกิดขึ้น? แต่ในแง่นี้เราพบว่าความน่าจะเป็นของXXXYYYY=Y=Y =X=X=X =E( Y| X= 35 )E(Y|X=35)E(Y|X=35)353535X= 35X=35X=35XXX- ค่าแปรปรวนที่เกิดขึ้นถ้ามันแสดงถึงสิ่งที่ชอบอายุ? ถ้าแทนค่าอัตราแลกเปลี่ยนนี่จะจัดเป็นแบบสุ่มหรือไม่? คุณจะพบคุณค่าที่คาดหวังของสิ่งนี้บนโลกได้อย่างไรโดยไม่ทราบว่าความน่าจะเป็น หรือค่าที่คาดหวังจะเท่ากับค่าเฉลี่ยในขีด จำกัดXXX ถ้าเราไม่คิดว่าตัวแปรตามเป็นตัวสุ่มตัวแปรเนื่องจากเราไม่ได้แยกแยะความน่าจะเป็นเราจะถือว่ามันคืออะไร เพียงแค่ค่าคงที่หรืออะไร แต่ถ้าเป็นกรณีนี้เราจะกำหนดเงื่อนไขให้กับตัวแปรที่ไม่ใช่แบบสุ่มเริ่มต้นได้อย่างไร เราคิดอย่างไรเกี่ยวกับการกระจายตัวแปรอิสระ ขออภัยหากมีสิ่งใดที่ไม่สมเหตุสมผลหรือชัดเจนสำหรับทุกคน
11 regression 

1
โดยสังเขปเหตุใดไขว้เอนโทรปีจึงวัดระยะทางของการแจกแจงความน่าจะเป็นสองอัน?
สำหรับการแจกแจงแบบแยกสองและข้ามเอนโทรปีจะถูกกำหนดเป็นqพีppQqq H( p , q) = - ∑xp ( x ) บันทึกQ( x )H(p,q)=−∑xp(x)log⁡q(x).H(p,q)=-\sum_x p(x)\log q(x). ฉันสงสัยว่าทำไมนี่เป็นการวัดระยะทางแบบง่าย ๆ ระหว่างการแจกแจงความน่าจะเป็นสองแบบ? ผมเห็นว่าเป็นเอนโทรปีของซึ่งมาตรการ "แปลกใจ" ของพีเป็นตัวชี้วัดที่ส่วนหนึ่งแทนที่โดยQฉันยังไม่เข้าใจความหมายที่เข้าใจง่ายที่อยู่เบื้องหลังคำจำกัดความp p H ( p , q ) p qH( p , p )H(พี,พี)H(p,p)พีพีpพีพีpH( p , q)H(พี,Q)H(p,q)พีพีpQQq

2
ความแปรปรวนของฟังก์ชั่น * * ใน * หมายถึงการเรียนรู้เชิงสถิติ * หมายถึงอะไร
บนหน้า 34 ของการเรียนรู้สถิติเบื้องต้น : \newcommand{\Var}{{\rm Var}} แม้ว่าหลักฐานทางคณิตศาสตร์จะอยู่นอกเหนือขอบเขตของหนังสือเล่มนี้ก็เป็นไปได้ที่จะแสดงให้เห็นว่าการทดสอบที่คาดหวัง MSE สำหรับค่าที่กำหนดx0x0x_0สามารถแบ่งย่อยเป็นผลรวมของสามปริมาณพื้นฐาน: ความแปรปรวนของf^(x0)f^(x0)\hat{f}(x_0)ที่ยกกำลังสองอคติของf^(x0)f^(x0)\hat{f}(x_0)และความแปรปรวนของข้อตกลงข้อผิดพลาด\εε\varepsilonนั่นคือ, E(y0−f^(x0))2=Var(f^(x0))+[Bias(f^(x0))]2+Var(ε)E(y0−f^(x0))2=Var(f^(x0))+[Bias(f^(x0))]2+Var(ε) E\left(y_0 - \hat{f}(x_0)\right)^2 = \Var\big(\hat{f}(x_0)\big) + \Big[{\rm Bias}\big(\hat{f}(x_0)\big)\Big]^2 + \Var(\varepsilon) [... ] ความแปรปรวนหมายถึงจำนวนที่f^f^\hat{f}จะเปลี่ยนแปลงหากเราประเมินโดยใช้ชุดข้อมูลการฝึกอบรมอื่น คำถาม:เนื่องจากVar(f^(x0))Var(f^(x0))\Var\big(\hat{f}(x_0)\big)ดูเหมือนจะแสดงถึงความแปรปรวนของฟังก์ชั่นสิ่งนี้หมายความว่าอย่างเป็นทางการ? นั่นคือฉันคุ้นเคยกับแนวคิดของความแปรปรวนของตัวแปรสุ่มXXXแต่สิ่งที่เกี่ยวกับความแปรปรวนของชุดฟังก์ชัน นี่อาจเป็นความแปรปรวนของตัวแปรสุ่มอีกค่าที่มีรูปแบบของฟังก์ชันหรือไม่

2
การอ้างอิงออนไลน์ให้ความรู้เบื้องต้นแก่ OLS
ฉันเริ่มศึกษาตัวประมาณกำลังสองน้อยที่สุด (OLS) ธรรมดาและฉันยังอยู่ที่จุดเริ่มต้น ฉันซื้อหนังสือเกี่ยวกับเศรษฐมิติแล้ว แต่ฉันไม่พบสิ่งใดทางออนไลน์ ดังนั้นฉันจึงสงสัยว่ามีเว็บไซต์โฮมเพจหรือแหล่งข้อมูลออนไลน์อื่น ๆ ที่อธิบายตัวประมาณกำลังสองน้อยที่สุดในทางที่หลบหนี ฉันกำลังมองหาวัสดุที่ให้คำแนะนำทั่วไปหรือภาพรวม จนถึงตอนนี้ฉันไม่พบอะไรที่น่าเหลือเชื่อบนอินเทอร์เน็ต ใครบ้างมีการอ้างอิงที่เป็นประโยชน์บ้าง การอ้างอิงออนไลน์ในอุดมคติอธิบาย OLS ด้วยวิธีง่าย ๆ เพื่อวัตถุประสงค์ที่นำไปใช้ เป็นการดีเลิศมันยังให้ตัวอย่างและข้อมูลเพิ่มเติมเกี่ยวกับหัวข้อเฉพาะเช่นการคำนวณทางคณิตศาสตร์ของการประมาณสมมติฐานของ OLS หรือ poofs ทางคณิตศาสตร์ที่ตัวประมาณไม่มีอคติ ฉันไม่ได้มองหาไฟล์ PDF ของหนังสือเศรษฐมิติ

2
สัญชาตญาณที่อยู่เบื้องหลังเครือข่ายประสาทแบบ Long Long Term Memory (LSTM) กำเริบคืออะไร?
แนวคิดที่อยู่เบื้องหลัง Recurrent Neural Network (RNN) ชัดเจนสำหรับฉัน ฉันเข้าใจในวิธีต่อไปนี้: เรามีลำดับของการสังเกต ( ) (หรือกล่าวอีกนัยหนึ่งคืออนุกรมเวลาหลายตัวแปร) การสังเกตแต่ละครั้งเป็นเวกเตอร์ตัวเลข -dimensional ภายในโมเดล RNN เราถือว่าการสังเกตต่อไปเป็นหน้าที่ของการสังเกตการณ์ก่อนหน้านี้เช่นเดียวกับ "สถานะที่ซ่อน" ก่อนหน้านี้ซึ่งสถานะที่ซ่อนอยู่จะถูกแสดงด้วยตัวเลข เวกเตอร์ (ขนาดของสถานะที่ถูกตรวจสอบและสถานะที่ซ่อนอยู่อาจแตกต่างกัน) รัฐที่ซ่อนตัวเองก็สันนิษฐานว่าขึ้นอยู่กับการสังเกตก่อนหน้านี้และสถานะที่ซ่อนอยู่:โอ⃗ 1, o⃗ 2, … , o⃗ no→1,o→2,…,o→n\vec o_1, \vec o_2, \dots, \vec o_nโอ⃗ ผมo→i\vec o_iยังไม่มีข้อความNNโอ⃗ ฉัน+ 1o→i+1\vec o_{i+1}โอ⃗ ผมo→i\vec o_{i}ชั่วโมง⃗ ผมh→i\vec h_i โอ⃗ ผม, ชั่วโมง⃗ ผม= F( o⃗ ฉัน- …

1
การปรับการคาดการณ์ (การถดถอยเชิงเส้น)
การเปิดเผยอย่างเต็มรูปแบบ: ฉันไม่ใช่นักสถิติและฉันไม่ได้อ้างว่าเป็น ฉันเป็นผู้ดูแลระบบไอทีต่ำต้อย กรุณาเล่นอ่อนโยนกับฉัน :) ฉันมีหน้าที่รับผิดชอบในการรวบรวมและพยากรณ์การใช้ที่เก็บข้อมูลดิสก์สำหรับองค์กรของเรา เรารวบรวมที่เก็บข้อมูลของเราใช้เป็นรายเดือนและใช้การถดถอยเชิงเส้นแบบง่าย ๆ สิบสองเดือนสำหรับการคาดการณ์ เราใช้ข้อมูลนี้สำหรับการจัดสรรและการวางแผนค่าใช้จ่ายทุนเช่น "ตามโมเดลนี้เราจะต้องซื้อจำนวน x หากพื้นที่เก็บข้อมูลในเดือน y เพื่อตอบสนองความต้องการของเรา" ทั้งหมดนี้ทำงานได้ดีพอที่จะตอบสนองความต้องการของเรา เรามีการเคลื่อนไหวครั้งเดียวจำนวนมากในตัวเลขของเราซึ่งทำให้การคาดการณ์ไม่เป็นไปตามปกติ ตัวอย่างเช่นมีคนพบการสำรองข้อมูลเก่า 500GB ซึ่งไม่จำเป็นอีกต่อไปและลบทิ้ง ดีสำหรับพวกเขาในการเรียกคืนพื้นที่! อย่างไรก็ตามการคาดการณ์ของเราในขณะนี้ลดลงอย่างมากจากการลดลงครั้งใหญ่ในหนึ่งเดือน เรายอมรับเสมอว่าการลดลงเช่นนี้ใช้เวลา 9-10 เดือนในการสร้างแบบจำลอง แต่อาจใช้เวลานานมากหากเราเข้าสู่ฤดูการวางแผนค่าใช้จ่ายทุน ฉันสงสัยว่ามีวิธีจัดการความแปรปรวนแบบครั้งเดียวเหล่านี้หรือไม่ว่าค่าที่คาดการณ์จะไม่ได้รับผลกระทบมากนัก (เช่นความชันของเส้นไม่เปลี่ยนแปลงอย่างมาก) แต่จะนำมาพิจารณาด้วย (เช่น การเปลี่ยนแปลงครั้งเดียวในค่า y ที่เกี่ยวข้องกับจุดเฉพาะในเวลา) ความพยายามครั้งแรกของเราในการแก้ปัญหานี้ทำให้ได้ผลลัพธ์ที่น่าเกลียด (เช่นเส้นโค้งการเติบโตแบบเลขชี้กำลัง) เราทำการประมวลผลทั้งหมดของเราใน SQL Server หากมีความสำคัญ

1
การเรียนรู้ทั้งมวล: ทำไม Model Stacking จึงมีประสิทธิภาพ
เมื่อเร็ว ๆ นี้ฉันเริ่มสนใจการวางโมเดลเป็นรูปแบบของการเรียนรู้ทั้งมวล โดยเฉพาะอย่างยิ่งฉันได้ทดลองกับชุดของเล่นบางอย่างสำหรับปัญหาการถดถอย ฉันได้ใช้งานตัวแยกระดับ "ระดับ 0" เป็นรายบุคคลโดยเก็บการคาดการณ์ผลลัพธ์ของ regressor แต่ละอันไว้เป็นคุณสมบัติใหม่สำหรับ "meta-regressor" เพื่อใช้เป็นอินพุตและพอดีกับ meta-regressor นี้กับคุณสมบัติใหม่เหล่านี้ (การคาดคะเนจากระดับ 0 regressors) ฉันรู้สึกประหลาดใจอย่างยิ่งที่ได้เห็นการปรับปรุงที่เหนือกว่าของ regressors ส่วนบุคคลเมื่อทำการทดสอบ meta-regressor กับชุดการตรวจสอบความถูกต้อง ดังนั้นนี่คือคำถามของฉัน: ทำไมการวางแบบจำลองจึงมีประสิทธิภาพ โดยสังเขปฉันคาดหวังว่ารูปแบบที่ทำการวางซ้อนจะทำงานได้ไม่ดีเนื่องจากดูเหมือนว่าจะมีการแสดงคุณสมบัติที่ไม่ดีเมื่อเทียบกับรุ่นระดับ 0 แต่ละตัว นั่นคือถ้าฉันฝึก 3 ระดับ 0 regressors บนชุดข้อมูลที่มีคุณสมบัติ 20 รายการและใช้การคาดคะเนระดับ 0 regressors เหล่านี้เพื่อป้อนข้อมูลให้กับ meta-regressor ของฉันนี่หมายความว่า meta-regressor ของฉันมีเพียง 3 คุณสมบัติในการเรียนรู้จาก ดูเหมือนว่ามีการเข้ารหัสข้อมูลเพิ่มเติมในคุณลักษณะดั้งเดิม 20 ประการที่รีจีสเตอร์ระดับ 0 มีไว้สำหรับการฝึกอบรมมากกว่าฟีเจอร์เอาต์พุต 3 …

1
จะเลือกระหว่างการทดสอบการลงชื่อกับการทดสอบการจัดอันดับของวิลคอกซันได้อย่างไร
ฉันพยายามเลือกหนึ่งจากการทดสอบทั้งสองนี้เพื่อวิเคราะห์ข้อมูลที่จับคู่ ไม่มีใครรู้กฎของหัวแม่มือเกี่ยวกับที่จะเลือกโดยทั่วไป?

1
ทำไม 95% CI สำหรับค่ามัธยฐานควรจะเป็น ?
ในแหล่งต่าง ๆ (ดูเช่นที่นี่ ) สูตรต่อไปนี้จะได้รับสำหรับช่วงความเชื่อมั่นสำหรับค่ามัธยฐาน (โดยเฉพาะอย่างยิ่งสำหรับจุดประสงค์ของการวาดรอยหยักบนแปลงกล่องและมัสสุ): 95 % C. ผมm e d i a n= M e d i a n ± 1.57 × Iคิวอาร์ยังไม่มีข้อความ--√95% CImedian=Median±1.57×IQRN 95\%\ CI_{\rm median} = {\rm Median} \pm \frac{1.57\times IQR}{\sqrt{N}} ค่าคงที่เวทย์มนตร์ทำให้ฉันเป็นบ้าฉันไม่สามารถหาวิธีได้ การประมาณค่าต่าง ๆ (เช่นสมมติว่าการกระจายตัวของเราคือเกาส์เซียนและมีขนาดใหญ่) ไม่ได้ให้เบาะแส - ฉันได้รับค่าต่างกันสำหรับค่าคงที่1.571.571.57ยังไม่มีข้อความNN

5
การตีความทฤษฎีบท Bayes นำไปใช้กับผลลัพธ์การตรวจเต้านมในเชิงบวก
ฉันพยายามที่จะคลุมศีรษะของฉันรอบ ๆ ผลลัพธ์ของทฤษฎีบทของเบย์ที่ใช้กับตัวอย่างแมมโมแกรมแบบคลาสสิกโดยการบิดของแมมโมแกรมนั้นสมบูรณ์แบบ นั่นคือ, อุบัติการณ์ของมะเร็ง: .01.01.01 ความน่าจะเป็นของการตรวจด้วยคลื่นบวกด้วยการให้ผู้ป่วยเป็นมะเร็ง: 111 ความน่าจะเป็นของการตรวจคัดกรองด้วยวิธีทางบวกเนื่องจากผู้ป่วยไม่มีมะเร็ง: .01.01.01 โดย Bayes: P (มะเร็ง | mammogram +) = 1⋅.01(1⋅.01)+(.091⋅.99)1⋅.01(1⋅.01)+(0.091⋅.99)\dfrac {1 \cdot .01}{(1 \cdot .01) + (.091 \cdot .99)} =.5025=0.5025 = .5025 ดังนั้นถ้าคนที่สุ่มจากประชากรใช้แมมโมแกรมและรับผลบวกมีโอกาส 50% ที่พวกเขาเป็นมะเร็งหรือไม่? ฉันไม่สามารถเข้าใจได้โดยสัญชาตญาณว่าโอกาส 1% เล็กน้อยของการบวกที่ผิดพลาดใน 1% ของประชากรสามารถกระตุ้นผลลัพธ์ 50% ได้อย่างไร อย่างมีเหตุผลฉันคิดว่าการคัดกรองเชิงบวกอย่างแท้จริงที่มีอัตราบวกผิดพลาดเล็กน้อยจะแม่นยำยิ่งขึ้น

2
autocorrelation สำหรับการเดินแบบสุ่มคืออะไร?
ดูเหมือนว่ามันจะสูงจริงๆ แต่มันก็ไม่ง่ายสำหรับฉัน ใครช่วยอธิบายหน่อยได้ไหม? ฉันสับสนมากในเรื่องนี้และขอขอบคุณคำอธิบายที่ละเอียดและลึกซึ้ง ขอบคุณมากในล่วงหน้า!

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.