สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
การถดถอยเชิงเส้น: การแจกแจงแบบไม่ปกติใด ๆ ที่แสดงเอกลักษณ์ของ OLS และ MLE?
คำถามนี้ได้รับแรงบันดาลใจจากการอภิปรายที่ยาวนานในความคิดเห็นที่นี่: การถดถอยเชิงเส้นใช้การกระจายแบบปกติอย่างไร ในรูปแบบการถดถอยเชิงเส้นตามปกติเพื่อความง่ายในการเขียนนี่มีเพียงตัวทำนายเดียว: โดยที่เป็นค่าคงที่ที่รู้จักกันและเป็นข้อผิดพลาดอิสระที่ไม่มีค่าเฉลี่ยศูนย์ หากเรายังถือว่าการแจกแจงปกติสำหรับข้อผิดพลาดตัวประมาณกำลังสองน้อยที่สุดและตัวประมาณความน่าจะเป็นสูงสุดของจะเหมือนกันx ฉันϵ ฉันβ 0 , β 1Yi=β0+β1xi+ϵiYi=β0+β1xi+ϵi Y_i = \beta_0 + \beta_1 x_i + \epsilon_i xixix_iϵiϵi\epsilon_iβ0,β1β0,β1\beta_0, \beta_1 ดังนั้นคำถามง่าย ๆ ของฉัน: มีการแจกแจงอื่น ๆ สำหรับข้อผิดพลาดเช่นนั้น mle เหมือนกันกับตัวประมาณค่า squaeres น้อยที่สุดหรือไม่? ความหมายหนึ่งแสดงให้เห็นได้ง่ายส่วนอีกเรื่องหนึ่งไม่เป็นเช่นนั้น

1
แผนภูมิชนิดนี้คืออะไร?
ขออภัยสำหรับคำถามที่คลุมเครือ แต่แผนภูมินี้ปรากฏในBiddle et al ปี 2009และฉันไม่เคยเจออะไรแบบนี้มาก่อน มันเป็นแผนภูมิแท่งที่มีขอบมุมซึ่งบางครั้งก็มีเขา สิ่งเหล่านี้หมายความว่าอย่างไร แผนภูมิประเภทนี้มีชื่อหรือไม่? ต่อ/meta/244083/site-for-asking-about-chartsฉันคิดว่า Academia เป็นสถานที่ที่ดีที่สุดที่จะถาม

7
การอ้างถึงผลลัพธ์ว่า "เกือบ" หรือ "ค่อนข้าง" สำคัญหรือไม่
ฉันทามติทั่วไปเกี่ยวกับคำถามที่คล้ายกันมันผิดหรือไม่ที่อ้างถึงผลลัพธ์ว่า "สำคัญมาก" หรือไม่? คือ "มีความสำคัญสูง" เป็นวิธีที่ถูกต้องแม้ว่าจะไม่ใช่วิธีที่เฉพาะเจาะจงในการอธิบายความแข็งแกร่งของการเชื่อมโยงที่มีค่า p ต่ำกว่าขีด จำกัด นัยสำคัญที่คุณตั้งไว้ อย่างไรก็ตามสิ่งที่เกี่ยวกับการอธิบายค่า p ที่สูงกว่าเกณฑ์ของคุณเล็กน้อย? ฉันได้เห็นเอกสารบางฉบับใช้คำเช่น "ค่อนข้างมีนัยสำคัญ", "มีนัยสำคัญเกือบ", "ใกล้จะถึงความสำคัญ" และอื่น ๆ ฉันพบว่าคำศัพท์เหล่านี้มีความปรารถนาเล็กน้อยที่สกปรกในบางกรณีวิธีที่ไม่เหมาะสมในการดึงเส้นเขตแดนเพื่อดึงผลลัพธ์ที่มีความหมายออกมาจากการศึกษาที่มีผลลัพธ์เชิงลบ ข้อกำหนดเหล่านี้ยอมรับได้หรือไม่ที่จะอธิบายผลลัพธ์ที่ "เพิ่งพลาด" การตัดค่า p ของคุณหรือไม่

3
การจัดกึ่งกลางและการปรับขนาดตัวแปรจำลอง
ฉันมีชุดข้อมูลที่มีทั้งตัวแปรเด็ดขาดและตัวแปรต่อเนื่อง ฉันแนะนำให้เปลี่ยนตัวแปรเด็ดขาดเป็นตัวแปรไบนารีสำหรับแต่ละระดับ (เช่น A_level1: {0,1}, A_level2: {0,1}) - ฉันคิดว่าบางคนเรียกว่า "ตัวแปรจำลอง" นี้ ด้วยที่กล่าวว่ามันจะทำให้เข้าใจผิดแล้วศูนย์และปรับขนาดข้อมูลทั้งหมดที่มีตัวแปรใหม่หรือไม่ ดูเหมือนว่าฉันจะสูญเสียความหมาย "เปิด / ปิด" ของตัวแปร หากเป็นการทำให้เข้าใจผิดหมายความว่าฉันควรจัดกึ่งกลางและปรับขนาดตัวแปรต่อเนื่องแยกจากนั้นเพิ่มอีกครั้งลงในชุดข้อมูลของฉันหรือไม่ TIA

1
การลดขนาดแบบมีผู้สอน
ฉันมีชุดข้อมูลซึ่งประกอบด้วยตัวอย่างที่มีป้ายกำกับ 15K (จาก 10 กลุ่ม) ฉันต้องการนำการลดขนาดมาใช้เป็น 2 มิติโดยคำนึงถึงความรู้เกี่ยวกับฉลาก เมื่อฉันใช้เทคนิคการลดขนาดที่ไม่ได้รับอนุญาต "มาตรฐาน" เช่น PCA พล็อตกระจายดูเหมือนจะไม่มีส่วนเกี่ยวข้องกับฉลากที่รู้จัก สิ่งที่ฉันกำลังมองหามีชื่อหรือไม่? ฉันต้องการอ่านการอ้างอิงของการแก้ปัญหา

1
วิธีฝึกเลเยอร์ LSTM ของเครือข่ายลึก
ฉันใช้เครือข่าย lstm และ feed-forward เพื่อจำแนกข้อความ ฉันแปลงข้อความเป็นเวกเตอร์ที่ร้อนแรงหนึ่งรายการและป้อนให้แต่ละรายการเป็น lstm เพื่อที่ฉันจะสามารถสรุปได้ว่าเป็นการแทนเพียงครั้งเดียว จากนั้นฉันก็ป้อนไปยังเครือข่ายอื่น แต่ฉันจะฝึก lstm ได้อย่างไร ฉันต้องการจัดลำดับข้อความ - ฉันควรป้อนโดยไม่ต้องฝึกอบรมหรือไม่? ฉันแค่ต้องการแสดงข้อความเป็นรายการเดียวที่ฉันสามารถป้อนลงในเลเยอร์อินพุตของตัวแยกประเภท ฉันขอขอบคุณคำแนะนำใด ๆ อย่างมาก! ปรับปรุง: ดังนั้นฉันมี lstm และลักษณนาม ฉันเอาเอาท์พุตทั้งหมดของ lstm และ mean-pool พวกมันจากนั้นฉันป้อนค่าเฉลี่ยนั้นลงในลักษณ ปัญหาของฉันคือฉันไม่รู้วิธีฝึก lstm หรือตัวจําแนก ฉันรู้ว่าอินพุตควรเป็นอะไรสำหรับ lstm และเอาต์พุตของตัวแยกประเภทที่ควรใช้สำหรับอินพุตนั้น เนื่องจากเป็นเครือข่ายสองเครือข่ายที่เพิ่งเปิดใช้งานตามลำดับฉันจำเป็นต้องทราบและไม่ทราบว่าอุดมคติของเอาต์พุตควรเป็น lstm ซึ่งจะเป็นอินพุตสำหรับตัวแยกประเภท มีวิธีทำเช่นนี้หรือไม่?

1
อะไรคือองค์ประกอบหลัก“ ที่หมุน” และ“ ไม่ได้รับการป้องกัน” เนื่องจาก PCA จะหมุนแกนพิกัดเสมอ
เท่าที่ฉันเข้าใจส่วนประกอบหลักจะได้รับโดยการหมุนแกนพิกัดเพื่อจัดเรียงพวกเขากับทิศทางของความแปรปรวนสูงสุด อย่างไรก็ตามฉันยังคงอ่านเกี่ยวกับ "ส่วนประกอบหลักที่ไม่ได้ทำการหมุน" และซอฟต์แวร์สถิติของฉัน (SAS) ให้ส่วนประกอบหลักที่หมุนรอบตัวได้แบบแปรปรวนตลอดจนส่วนประกอบที่ไม่ได้หมุน ที่นี่ฉันสับสน: เมื่อเราคำนวณส่วนประกอบหลักแกนจะหมุนไปแล้ว เหตุใดจึงต้องมีการหมุนอีกครั้ง และ "องค์ประกอบหลักที่ยังไม่ได้ประมวลผล" หมายความว่าอย่างไร

3
โครงข่ายประสาทเทียมแบบ Convolutional ใช้วิธีการแบบ Convolitis แทนการคูณเมทริกซ์อย่างไร?
ฉันกำลังอ่านหนังสือของ Yoshua Bengio เกี่ยวกับการเรียนรู้ที่ลึกซึ้งและมันบอกไว้ในหน้า 224: เครือข่าย Convolutional เป็นเพียงเครือข่ายประสาทที่ใช้ convolution แทนการคูณเมทริกซ์ทั่วไปอย่างน้อยหนึ่งชั้น อย่างไรก็ตามฉันไม่แน่ใจ 100% ของวิธีการ "แทนที่การคูณเมทริกซ์ด้วยการโน้มน้าว" ในแง่ที่แม่นยำทางคณิตศาสตร์ สิ่งที่ฉันสนใจจริงๆคือการกำหนดสิ่งนี้สำหรับเวกเตอร์อินพุตใน 1D (เช่นใน ) ดังนั้นฉันจะไม่ป้อนข้อมูลเป็นภาพและพยายามหลีกเลี่ยงการบิดในแบบ 2Dx ∈ Rdx∈Rdx \in \mathbb{R}^d ตัวอย่างเช่นในเครือข่ายประสาท "ปกติ" การดำเนินการและรูปแบบของผู้ให้บริการอาหารสามารถแสดงให้เห็นได้อย่างชัดเจนดังที่บันทึกไว้ในบันทึกของ Andrew Ng: W( l )a( l )= z( l + 1 )W(l)a(l)=z(l+1) W^{(l)} a^{(l)} = z^{(l+1)} ฉ( z( l + 1 )) …

5
ฉันจะแปลงระยะทาง (ยูคลิดแดน) เป็นคะแนนความคล้ายคลึงกันได้อย่างไร
ฉันใช้หมายถึงการรวมกลุ่มเป็นเสียงของกลุ่มลำโพง เมื่อฉันเปรียบเทียบคำพูดกับข้อมูลลำโพงแบบคลัสเตอร์ฉันจะได้รับความผิดเพี้ยนเฉลี่ย (อิงตามปริภูมิแบบยุคลิด) ระยะนี้อาจจะอยู่ในช่วงinfty] ฉันต้องการแปลงระยะทางนี้เป็นคะแนนความเหมือนโปรดแนะนำฉันเกี่ยวกับวิธีที่ฉันสามารถบรรลุสิ่งนี้[ 0 , ∞ ] [ 0 , 1 ]kkk[0,∞][0,∞][0,\infty][0,1][0,1][0,1]

1
สถิติ F บางส่วนคืออะไร
สถิติ F บางส่วนคืออะไร นั่นเหมือนกับการทดสอบ F บางส่วนหรือไม่ คุณจะคำนวณสถิติ F บางส่วนเมื่อใด ฉันสมมติว่าสิ่งนี้เกี่ยวข้องกับการเปรียบเทียบแบบจำลองการถดถอย แต่ฉันไม่ได้ติดตามอะไรบางอย่าง (?)

1
การติดตั้ง Cox-model กับ strata และ strata-covariate
ในกลยุทธ์การสร้างแบบจำลองการถดถอยโดย Harrell (รุ่นที่สอง) มีส่วน (S. 20.1.7) ที่กล่าวถึงโมเดล Cox รวมถึงการทำงานร่วมกันระหว่าง covariate ที่มีผลกระทบหลักต่อการอยู่รอดเราต้องการประเมินเช่นกัน (อายุในตัวอย่างด้านล่าง) และ covariate ที่มีเอฟเฟกต์หลักที่เราไม่ต้องการประเมิน (เพศในตัวอย่างด้านล่าง) เป็นรูปธรรม: สมมติว่าในความเป็นอันตราย (ไม่ทราบจริง)ตามแบบจำลองh(t)h(t)h(t) h(t)={hf(t)exp(β1age),hm(t)exp((β1+β2)age),for female patiensfor male patiensh(t)={hf(t)exp⁡(β1age),for female patienshm(t)exp⁡((β1+β2)age),for male patiensh(t) = \begin{cases} h_f(t) \exp(\beta_1 \textrm{age}), & \textrm{for female patiens} \\ h_m(t) \exp((\beta_1 + \beta_2) \textrm{age}), & \textrm{for male patiens} \end{cases} โดยที่ ,ไม่เป็นความจริงจริงไม่ควรประเมินฟังก์ชั่นอันตรายพื้นฐานและ …

1
ความแปรปรวนในระยะยาวคืออะไร?
ความแปรปรวนในระยะยาวในขอบเขตของการวิเคราะห์อนุกรมเวลาได้กำหนดไว้อย่างไร ฉันเข้าใจว่ามันถูกใช้ในกรณีที่มีโครงสร้างความสัมพันธ์ในข้อมูล ดังนั้นกระบวนการสโตแคสติกของเราจะไม่เป็นตระกูลX1,X2…X1,X2…X_1, X_2 \dots iid ตัวแปรสุ่ม แต่เป็นการกระจายตัวเท่านั้น ฉันขออ้างอิงมาตรฐานเพื่อแนะนำแนวคิดและปัญหาที่เกี่ยวข้องกับการประมาณค่าได้ไหม

3
ป่าสุ่มและการส่งเสริมพารามิเตอร์หรือไม่ใช่พารามิเตอร์หรือไม่
จากการอ่านการสร้างแบบจำลองทางสถิติที่ยอดเยี่ยม: ทั้งสองวัฒนธรรม (Breiman 2001)เราสามารถยึดความแตกต่างทั้งหมดระหว่างแบบจำลองทางสถิติแบบดั้งเดิม (เช่นการถดถอยเชิงเส้น) และอัลกอริทึมการเรียนรู้ของเครื่องจักร (เช่นการห่อป่าแบบสุ่ม Breiman วิพากษ์วิจารณ์แบบจำลองข้อมูล (พารามิเตอร์) เพราะพวกเขาอยู่บนพื้นฐานของข้อสันนิษฐานว่าการสังเกตนั้นถูกสร้างขึ้นโดยแบบจำลองที่เป็นทางการซึ่งเป็นที่รู้จักซึ่งกำหนดโดยนักสถิติซึ่งอาจเลียนแบบธรรมชาติได้ไม่ดี ในทางตรงกันข้าม ML algos จะไม่ถือว่าแบบจำลองที่เป็นทางการใด ๆ และเรียนรู้การเชื่อมโยงโดยตรงระหว่างตัวแปรอินพุตและเอาต์พุตจากข้อมูล ฉันตระหนักว่าบรรจุถุง / RF และการส่งเสริมการนอกจากนี้ยังมีการจัดเรียงของพารา: ยกตัวอย่างเช่นntree , mtryใน RF, อัตราการเรียนรู้ , ส่วนถุง , ซับซ้อนต้นไม้ใน Stochastic ไล่โทนสีต้นไม้เพิ่มขึ้นมีการปรับจูนทุกพารามิเตอร์ นอกจากนี้เรายังประมาณค่าพารามิเตอร์เหล่านี้จากข้อมูลเนื่องจากเราใช้ข้อมูลเพื่อค้นหาค่าที่ดีที่สุดของพารามิเตอร์เหล่านี้ ดังนั้นความแตกต่างคืออะไร? RF และ Boosted Trees เป็นโมเดลพาราเมตริกหรือไม่?

1
คำถามที่เกี่ยวข้องกับ Borel-Cantelli Lemma
บันทึก: Borel-Cantelli Lemma กล่าวว่า ∑n=1∞P(An)<∞⇒P(limsupAn)=0∑n=1∞P(An)<∞⇒P(limsupAn)=0\sum_{n=1}^\infty P(A_n) \lt \infty \Rightarrow P(\lim\sup A_n)=0 ∑n=1∞P(An)=∞ and An's are independent⇒P(limsupAn)=1∑n=1∞P(An)=∞ and An's are independent⇒P(limsupAn)=1\sum_{n=1}^\infty P(A_n) =\infty \textrm{ and } A_n\textrm{'s are independent} \Rightarrow P(\lim\sup A_n)=1 จากนั้น ถ้า∑n=1∞P(AnAcn+1)<∞∑n=1∞P(AnAn+1c)<∞\sum_{n=1}^\infty P(A_nA_{n+1}^c )\lt \infty โดยใช้ Borel-Cantelli Lemma ฉันต้องการที่จะแสดงให้เห็นว่า ประการแรก limn→∞P(An)limn→∞P(An)\lim_{n\to \infty}P(A_n)ที่มีอยู่ และประการที่สอง limn→∞P(An)=P(limsupAn)limn→∞P(An)=P(limsupAn)\lim_{n\to \infty}P(A_n) =P(\lim\sup A_n) โปรดช่วยฉันแสดงสองส่วนนี้ ขอขอบคุณ.

1
ตัวประมาณแบบเอนเอียงสำหรับการถดถอยบรรลุผลลัพธ์ที่ดีกว่าแบบไม่เอนเอียงในแบบจำลองข้อผิดพลาดในตัวแปร
ฉันกำลังทำงานกับข้อมูล syntatic สำหรับข้อผิดพลาดในตัวแปรแบบจำลองสำหรับการวิจัยบางอย่าง ขณะนี้ฉันมีตัวแปรอิสระเดี่ยวและฉันคาดว่าฉันรู้ถึงความแปรปรวนสำหรับมูลค่าที่แท้จริงของตัวแปรตาม ดังนั้นด้วยข้อมูลนี้ฉันสามารถบรรลุตัวประมาณค่าแบบไม่เอนเอียงสำหรับค่าสัมประสิทธิ์ของตัวแปรตาม นางแบบ: โดยที่: สำหรับบางx~= x + e1x~=x+e1\tilde{x} = x + e_1 e 1 ~ N ( 0 , σ 2 ) σ e 2 ~ N ( 0 , 1 )Y= 0.5 x - 10 + e2y=0.5x−10+e2y = 0.5x -10 + e_2 อี1~ N( 0 , …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.