สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
ฉันจะเน้นเสียงแก้ไขที่มีเสียงดังในอนุกรมเวลาได้อย่างไร
ฉันมีข้อมูลอนุกรมเวลาจำนวนมาก - ระดับน้ำและความเร็วเทียบกับเวลา มันเป็นผลลัพธ์จากการจำลองแบบไฮดรอลิก เป็นส่วนหนึ่งของกระบวนการตรวจสอบเพื่อยืนยันว่าแบบจำลองทำงานได้ตามที่คาดหวังฉันต้องวางแผนในแต่ละช่วงเวลาเพื่อให้แน่ใจว่าไม่มี "การโยกเยก" ในข้อมูล (ดูตัวอย่างการโยกเยกเล็กน้อยด้านล่าง) การใช้ UI ของซอฟต์แวร์การสร้างแบบจำลองเป็นวิธีที่ค่อนข้างช้าและลำบากในการตรวจสอบข้อมูลนี้ ฉันจึงเขียนแมโคร VBA สั้น ๆ เพื่อนำเข้าบิตข้อมูลต่าง ๆ จากแบบจำลองรวมถึงผลลัพธ์ลงใน Excel และพล็อตพวกมันทั้งหมดในครั้งเดียว ฉันหวังว่าจะเขียนแมโคร VBA สั้น ๆ อีกชุดเพื่อวิเคราะห์ข้อมูลอนุกรมเวลาและเน้นส่วนที่สงสัย สิ่งเดียวที่ฉันคิดก็คือฉันสามารถวิเคราะห์ความชันของข้อมูลได้บ้าง ทุกที่ที่ความชันเปลี่ยนแปลงอย่างรวดเร็วจากการเป็นค่าบวกเป็นค่าลบหลายครั้งภายในหน้าต่างการค้นหาที่ระบุอาจถูกจัดประเภทว่าไม่เสถียร ฉันพลาดเทคนิคที่ง่ายกว่านี้ไหม? โดยพื้นฐานแล้วการจำลอง "เสถียร" ควรให้เส้นโค้งที่ราบรื่นมาก การเปลี่ยนแปลงอย่างฉับพลันใด ๆ มีแนวโน้มที่จะเป็นผลมาจากความไม่แน่นอนในการคำนวณ

4
การฝึกอบรมเครือข่ายประสาทเพื่อการถดถอยจะทำนายค่าเฉลี่ยเสมอ
ฉันกำลังฝึกอบรมเครือข่ายประสาทเทียมแบบง่ายสำหรับการถดถอยซึ่งงานนี้จะทำนายตำแหน่ง (x, y) ของกล่องในภาพเช่น: เอาต์พุตของเครือข่ายมีสองโหนดหนึ่งรายการสำหรับ x และอีกหนึ่งสำหรับ y ส่วนที่เหลือของเครือข่ายเป็นเครือข่ายประสาทเทียมมาตรฐาน การสูญเสียเป็นค่าเฉลี่ยความคลาดเคลื่อนกำลังสองระหว่างตำแหน่งที่ทำนายของกล่องและตำแหน่งจริงของพื้นดิน ฉันกำลังฝึกอบรมเกี่ยวกับ 10,000 ภาพเหล่านี้และการตรวจสอบในปี 2000 ปัญหาที่ฉันมีคือแม้ว่าหลังจากการฝึกอบรมที่สำคัญแล้วการสูญเสียไม่ลดลงจริงๆ หลังจากสังเกตเอาท์พุทของเครือข่ายฉันสังเกตว่าเครือข่ายมีแนวโน้มที่จะส่งออกค่าใกล้ศูนย์สำหรับทั้งสองเอาท์พุทโหนด ดังนั้นการทำนายตำแหน่งของกล่องจึงเป็นจุดศูนย์กลางของภาพเสมอ มีการเบี่ยงเบนบางอย่างในการคาดการณ์ แต่มักจะอยู่ที่ประมาณศูนย์ ด้านล่างแสดงให้เห็นถึงการสูญเสีย: ฉันใช้งานสิ่งนี้ได้หลายครั้งมากกว่าที่แสดงในกราฟนี้และการสูญเสียยังไม่ลดลง น่าสนใจที่นี่การสูญเสียเพิ่มขึ้น ณ จุดหนึ่ง ดังนั้นดูเหมือนว่าเครือข่ายจะทำนายค่าเฉลี่ยของข้อมูลการฝึกอบรมมากกว่าการเรียนรู้ที่เหมาะสม ความคิดเห็นใด ๆ เกี่ยวกับสาเหตุที่อาจเป็นเช่นนี้ ฉันใช้อดัมเป็นเครื่องมือเพิ่มประสิทธิภาพด้วยอัตราการเรียนรู้เริ่มต้นที่ 0.01 และการเปิดใช้งานใหม่ หากคุณมีความสนใจในบางรหัสของฉัน (Keras) มันเป็นด้านล่าง: # Create the model model = Sequential() model.add(Convolution2D(32, 5, 5, border_mode='same', subsample=(2, 2), activation='relu', input_shape=(3, image_width, …

1
เหตุใดจึงมีการรายงานในเอกสารที่ใช้ผลบวกของรูปสี่เหลี่ยมในผลลัพธ์ Anova บ่อยครั้ง
จากประสบการณ์สั้น ๆ ของฉันในสถิติดูเหมือนว่าชนิดของผลรวมของสแควร์ส (ประเภท I, II, III, IV ... ) ที่ใช้ในการรับผลลัพธ์ ANOVA สามารถสร้างความแตกต่างอย่างมากในผลการทดสอบ (โดยเฉพาะรุ่นที่มีปฏิสัมพันธ์ ข้อมูล). อย่างไรก็ตามฉันยังไม่เห็นกระดาษรายงานเลย เหตุผลที่เป็นเช่นนั้น? ฉันจะขอบคุณจริง ๆ หากมีตัวอย่างกระดาษรายงาน (ไม่ใช่สถิติเอง) ไม่ทางใดก็ทางหนึ่งหรือเหตุผลที่ไม่ธรรมดา

2
เมื่อใดที่จะใช้รูปแบบการผสมแบบเกาส์?
ฉันยังใหม่กับการใช้ GMM ฉันไม่สามารถค้นหาความช่วยเหลือที่เหมาะสมออนไลน์ได้ ใครช่วยกรุณาให้ทรัพยากรที่ถูกต้องกับ "วิธีการตัดสินใจว่าการใช้ GMM เหมาะกับปัญหาของฉันหรือไม่" หรือในกรณีที่มีปัญหาการจัดหมวดหมู่ "จะตัดสินใจได้อย่างไรว่าฉันต้องใช้การจำแนกประเภท SVM หรือการจำแนกประเภท GMM"

1
ความครอบคลุมต่ำกว่าที่คาดสำหรับการสุ่มตัวอย่างที่สำคัญด้วยการจำลอง
ผมพยายามที่จะตอบคำถามที่ประเมินหนึ่งด้วยวิธีการสุ่มตัวอย่างความสำคัญในการวิจัย โดยทั่วไปผู้ใช้จำเป็นต้องคำนวณ ∫π0ฉ( x ) dx =∫π01cos( x)2+x2dx∫0πf(x)dx=∫0π1cos⁡(x)2+x2dx\int_{0}^{\pi}f(x)dx=\int_{0}^{\pi}\frac{1}{\cos(x)^2+x^2}dx ใช้การแจกแจงเอ็กซ์โพเนนเชียลเป็นการกระจายความสำคัญ Q( x ) = λ ประสบการณ์- λ xq(x)=λ exp−λxq(x)=\lambda\ \exp^{-\lambda x} และค้นหาค่าของซึ่งให้ค่าประมาณที่ดีขึ้นกับอินทิกรัล (ของมัน) ผมแต่งปัญหาการประเมินผลของค่าเฉลี่ยของในช่วง : หนึ่งคือแล้วเพียงแค่\ λλ\lambdaself-studyμμ\muฉ( x )f(x)f(x)[ 0 , π][0,π][0,\pi]πμπμ\pi\mu ดังนั้นให้เป็น pdf ของและให้ : เป้าหมายตอนนี้คือการประมาณp ( x )p(x)p(x)X∼ คุณ( 0 , π)X∼U(0,π)X\sim\mathcal{U}(0,\pi)Y∼ f( X)Y∼f(X)Y\sim f(X) μ = E [ …

2
วิธีที่ดีที่สุดในการประเมินผลการรักษาโดยเฉลี่ยในการศึกษาระยะยาวคืออะไร?
ในการศึกษาระยะยาวผลลัพธ์ของหน่วยที่ถูกวัดซ้ำ ๆ ณ จุดเวลาโดยมีโอกาสในการวัดคงที่ทั้งหมด (คงที่ = วัดที่หน่วยในเวลาเดียวกัน)YฉันทีYผมเสื้อY_{it}ผมผมiเสื้อเสื้อtม.ม.m หน่วยที่ได้รับมอบหมายสุ่มทั้งการรักษา,หรือกลุ่มควบคุม, 0 ฉันต้องการประเมินและทดสอบผลการรักษาโดยเฉลี่ยเช่นที่ความคาดหวังนั้นเกิดขึ้นข้ามเวลาและส่วนบุคคล ฉันพิจารณาใช้แบบจำลองหลายระดับ (เอฟเฟกต์ผสม) ในโอกาสคงที่เพื่อวัตถุประสงค์นี้G = 1G=1G=1G = 0G=0G=0TE= E( Y| G=1)-E( Y| G=0),ATE=E(Y|G=1)-E(Y|G=0),ATE=E(Y | G=1) - E(Y | G=0), Yฉันที= α + βGผม+ยู0 ฉัน+อีฉันทีYผมเสื้อ=α+βGผม+ยู0ผม+อีผมเสื้อY_{it} = \alpha + \beta G_i + u_{0i} + e_{it} ด้วย the intercept the ,จะถูกสกัดกั้นแบบสุ่มทั่วทั้งหน่วยและส่วนที่เหลือαα\alphaββ\betaTEATEATEยูยูuอีอีe ตอนนี้ฉันกำลังพิจารณารูปแบบทางเลือก Yฉันที=β~Gผม+Σj = …

1
ทำความเข้าใจกับโทโพโลยีของ LSTM
อย่างที่หลายคนมีฉันพบแหล่งข้อมูลที่นี่และที่นี่เพื่อเป็นประโยชน์อย่างมากสำหรับการทำความเข้าใจเซลล์ LSTM ฉันมั่นใจว่าฉันเข้าใจว่าการไหลของค่าและการปรับปรุงและฉันมั่นใจมากพอที่จะเพิ่ม "การเชื่อมต่อช่องมอง" ฯลฯ ในตัวอย่างของฉันฉันมีที่ในแต่ละครั้งขั้นตอนการป้อนข้อมูลเวกเตอร์ของความยาวiและเวกเตอร์การส่งออกของระยะเวลาที่oo < i สิ่งที่ไม่ได้กล่าวถึงในหน้านี้คือวิธีการจัดเรียงและฝึกอบรม ฉันมีคำถาม 2 ข้อ: ในข้อมูลการฝึกอบรมของฉันฉันมีเวกเตอร์อินพุต / เอาต์พุตจำนวนมากที่สอดคล้องกับหน่วยเวลาจำนวนมาก สมมติว่าฉันฝึก LSTM ด้วยข้อมูลทั้งหมด จากนั้นฉันจะเรียกใช้อินพุตที่กำหนดเองแบบยาว ๆ สิ่งที่ฉันหมายถึงคือถ้าฉันมีข้อมูลการฝึกอบรมสำหรับพูดทั้งหมดของปี 2558 และ 2559 ฉันจะสามารถเรียกใช้ข้อมูลผ่านเครือข่ายในปี 2560 ได้หรือไม่? หรืออาจ 2017 ถึง 2020 ตามที่ฉันได้อ่านมันรู้สึกเหมือนฉันมีเซลล์ LSTM หนึ่งเซลล์ต่อหน่วยเวลาดังนั้นถ้าฉันมีหน่วยเวลาหลายครั้งฉันก็มีเซลล์ LSTM ที่ถูกล่ามโซ่ไว้มากมาย เนื่องจากความยาวของสายโซ่นั้นขึ้นอยู่กับความยาวของข้อมูลที่ฉันต้องการเรียกใช้ผ่านเครือข่ายและนั่นเป็นเรื่องที่คาดเดาได้ยากฉันไม่สามารถเห็นได้ว่าฉันจะฝึกอบรมเรื่องนี้อย่างไรเว้นแต่ฉันจะฝึกเซลล์ LSTM เพียงเซลล์เดียว ครั้ง ดังนั้นดูเหมือนว่าฉันจะฝึกเซลล์ LSTM หนึ่งเซลล์จากนั้นnโยงมันเข้าด้วยกันเพื่อหารายการเวกเตอร์ความยาวที่กำหนดn? แม้ว่าเซลล์ LSTM หนึ่งเซลล์จะมีองค์ประกอบและฟังก์ชั่นจำนวนหนึ่ง แต่รู้สึกว่ามันไม่เพียงพอที่จะรวบรวมข้อมูลมากมายในบางสิ่งที่เล็กมาก? ขอบคุณ มีทรัพยากรอื่น ๆ …

2
เหตุใดฉันจึงไม่สามารถรับ SVD ที่ถูกต้องของ X ผ่านการสลายตัว eigenvalue ของ XX 'และ X'X
ฉันพยายามทำ SVD ด้วยมือ: m<-matrix(c(1,0,1,2,1,1,1,0,0),byrow=TRUE,nrow=3) U=eigen(m%*%t(m))$vector V=eigen(t(m)%*%m)$vector D=sqrt(diag(eigen(m%*%t(m))$values)) U1=svd(m)$u V1=svd(m)$v D1=diag(svd(m)$d) U1%*%D1%*%t(V1) U%*%D%*%t(V) แต่บรรทัดสุดท้ายไม่กลับmมา ทำไม? ดูเหมือนว่าจะมีบางอย่างที่เกี่ยวข้องกับสัญญาณของ eigenvector ...
9 r  svd  eigenvalues 

1
โอกาสที่ตัวอย่าง bootstrap นั้นเหมือนกับตัวอย่างดั้งเดิม
แค่ต้องการตรวจสอบเหตุผลบางอย่าง หากตัวอย่างดั้งเดิมของฉันมีขนาดและฉันบูตมันแล้วกระบวนการคิดของฉันเป็นดังนี้:nnn 1n1n\frac{1}{n}เป็นโอกาสของการสังเกตใด ๆ ที่ดึงมาจากตัวอย่างดั้งเดิม เพื่อให้แน่ใจว่าการวาดต่อไปคือไม่ได้สังเกตตัวอย่างก่อนหน้านี้เรา จำกัด ขนาดของกลุ่มตัวอย่างที่จะn-1ดังนั้นเราจึงได้รูปแบบนี้:n - 1n-1n-1 1n⋅1n - 1⋅1n - 2⋯1n - ( n - 1 )=1n !.1n⋅1n-1⋅1n-2⋯1n-(n-1)=1n!. \frac{1}{n} \cdot \frac{1}{n-1} \cdot \frac{1}{n-2} \cdots \frac{1}{n-(n-1)} = \frac{1}{n!}. ถูกต้องหรือไม่ ฉันสะดุดที่สาเหตุที่ไม่สามารถแทน(1n)n(1n)n(\frac{1}{n})^n

2
การถดถอยเชิงเส้น: * ทำไม * คุณสามารถแบ่งผลรวมของช่องสี่เหลี่ยมได้?
โพสต์นี้หมายถึงรูปแบบการถดถอย bivariate เชิงเส้น\ ฉันมักจะแบ่งพาร์ติชันของผลรวมของกำลังสอง (SSTO) เป็นผลรวมของกำลังสองสำหรับข้อผิดพลาด (SSE) และผลรวมของกำลังสองสำหรับโมเดล (SSR) โดยความเชื่อ แต่เมื่อฉันเริ่มคิดจริงๆฉันไม่เข้าใจทำไมมันถึงทำงาน ...Yi=β0+β1xiYi=β0+β1xiY_i = \beta_0 + \beta_1x_i ส่วนที่ผมไม่เข้าใจ yiyiy_i : ค่าที่สังเกตได้ของ y y¯y¯\bar{y} : ค่าเฉลี่ยของyiyiy_i s ที่สังเกตได้ทั้งหมด y^iy^i\hat{y}_i : ค่าติดตั้ง / ทำนายของ y สำหรับการสังเกตของ x yi−y^iyi−y^iy_i - \hat{y}_i : ส่วนที่เหลือ / ข้อผิดพลาด (ถ้ายกกำลังสองและบวกกันสำหรับการสังเกตทั้งหมดนี่คือ SSE) y^i−y¯y^i−y¯\hat{y}_i - \bar{y} : ค่าติดตั้งโมเดลแตกต่างจากค่าเฉลี่ย (ถ้ายกกำลังสองและบวกสำหรับการสังเกตทั้งหมดนี่คือ SSR) …

1
สร้างตัวเลขสุ่มจาก“ การกระจายตัวแบบลาด” จากทฤษฎีทางคณิตศาสตร์
เพื่อจุดประสงค์บางอย่างฉันต้องสร้างตัวเลขสุ่ม (ข้อมูล) จากการกระจาย "ชุดลาด" "ความชัน" ของการกระจายนี้อาจแตกต่างกันไปในช่วงเวลาที่สมเหตุสมผลแล้วการกระจายของฉันควรเปลี่ยนจากเครื่องแบบเป็นสามเหลี่ยมตามความชัน นี่คือที่มาของฉัน: มาทำให้มันง่ายและสร้างฟอร์มข้อมูล 000 ถึง BBB(สีน้ำเงิน, สีแดงคือการกระจายแบบสม่ำเสมอ) เพื่อให้ได้ฟังก์ชันความหนาแน่นของความน่าจะเป็นของเส้นสีฟ้าฉันต้องการเพียงสมการของเส้นนั้น ดังนั้น: ฉ(x ) = t g( φ ) x + Y(0 )ฉ(x)=เสื้อก.(φ)x+Y(0)f(x) = tg(\varphi)x + Y(0) และตั้งแต่ (ภาพ): เสื้อg( φ )Y( 0 )=1 / B - Y( 0 )B / 2=1B- tกรัม( φ )B2เสื้อก.(φ)=1/B-Y(0)B/2Y(0)=1B-เสื้อก.(φ)B2\begin{align} tg(\varphi) &= \frac{1/B …

1
ความไม่สอดคล้องกันเล็กน้อยระหว่างฟังก์ชัน R ในตัว Kruskal-Wallis และการคำนวณด้วยตนเอง
ฉันสับสนในเรื่องต่อไปนี้และฉันไม่สามารถหาคำตอบที่อื่นได้ ฉันพยายามเรียนรู้ R ในขณะที่ทำสถิติและในการออกกำลังกายฉันพยายามตรวจสอบผลลัพธ์ของฟังก์ชั่น R ในตัวอีกครั้งโดยทำสิ่งเหล่านี้ 'ด้วยมือ' ตามที่เป็นอยู่ในอาร์อย่างไรก็ตาม สำหรับการทดสอบ Kruskal-Wallis ฉันได้รับผลลัพธ์ที่แตกต่างกันไปและฉันไม่สามารถหาสาเหตุได้ ตัวอย่างเช่นฉันกำลังดูข้อมูลต่อไปนี้ที่แจกในแบบฝึกหัด activity <- c(2, 4, 3, 2, 3, 3, 4, 0, 4, 3, 4, 0, 0, 1, 3, 1, 2, 0, 3, 1, 0, 3, 4, 0, 1, 2, 2, 2, 3, 2) group <- c(rep("A", 11), rep("B", 10), …

1
ความสัมพันธ์ระหว่าง MLE และกำลังสองน้อยที่สุดในกรณีของการถดถอยเชิงเส้น
Hastie และ Tibshirani พูดถึงในหัวข้อ 4.3.2 ของหนังสือของพวกเขาว่าในการตั้งค่าการถดถอยเชิงเส้นแนวทางสแควร์สน้อยที่สุดในความเป็นจริงเป็นกรณีพิเศษของความน่าจะเป็นสูงสุด เราจะพิสูจน์ผลลัพธ์นี้ได้อย่างไร? PS: อะไหล่ไม่มีรายละเอียดทางคณิตศาสตร์

2
จำลองการถดถอยเชิงเส้นด้วย heteroscedasticity
ฉันพยายามจำลองชุดข้อมูลที่ตรงกับข้อมูลเชิงประจักษ์ที่ฉันมี แต่ไม่แน่ใจว่าจะประเมินข้อผิดพลาดในข้อมูลต้นฉบับได้อย่างไร ข้อมูลเชิงประจักษ์รวมถึง heteroscedasticity แต่ฉันไม่สนใจที่จะเปลี่ยนมันออกไป แต่ใช้โมเดลเชิงเส้นที่มีคำผิดพลาดเพื่อจำลองแบบจำลองของข้อมูลเชิงประจักษ์ ตัวอย่างเช่นสมมติว่าฉันมีชุดข้อมูลเชิงประจักษ์และโมเดล: n=rep(1:100,2) a=0 b = 1 sigma2 = n^1.3 eps = rnorm(n,mean=0,sd=sqrt(sigma2)) y=a+b*n + eps mod <- lm(y ~ n) ใช้plot(n,y)เราได้รับดังต่อไปนี้ อย่างไรก็ตามถ้าฉันพยายามจำลองข้อมูล, simulate(mod)heteroscedasticity จะถูกลบออกและไม่ถูกจับโดยแบบจำลอง ฉันสามารถใช้โมเดลกำลังสองน้อยที่สุด VMat <- varFixed(~n) mod2 = gls(y ~ n, weights = VMat) ที่ให้แบบจำลองที่ดีขึ้นตาม AIC แต่ฉันไม่รู้วิธีจำลองข้อมูลโดยใช้เอาต์พุต คำถามของฉันคือฉันจะสร้างแบบจำลองที่จะช่วยให้ฉันสามารถจำลองข้อมูลให้ตรงกับข้อมูลเชิงประจักษ์ (n และ y ด้านบน) …

3
การเลือกคุณสมบัติโดยใช้การเรียนรู้ลึก?
ฉันต้องการคำนวณความสำคัญของคุณลักษณะอินพุตแต่ละรายการโดยใช้ตัวแบบลึก แต่ผมพบว่าเพียงหนึ่งกระดาษเกี่ยวกับการเลือกใช้คุณลักษณะการเรียนรู้ลึก - เลือกคุณลักษณะลึก พวกเขาแทรกเลเยอร์ของโหนดที่เชื่อมต่อกับแต่ละคุณสมบัติโดยตรงก่อนเลเยอร์ที่ซ่อนอยู่เป็นครั้งแรก ฉันได้ยินมาว่าเครือข่ายความเชื่อลึก (DBN) สามารถใช้กับงานประเภทนี้ได้เช่นกัน แต่ฉันคิดว่า DBN นำเสนอคุณลักษณะที่เป็นนามธรรม (กลุ่ม) เช่น PCA เท่านั้นแม้ว่าจะสามารถลดขนาดได้อย่างมีประสิทธิภาพฉันสงสัยว่าถ้าเป็นไปได้ในการคำนวณความสำคัญ (น้ำหนัก) ของแต่ละคุณลักษณะ เป็นไปได้หรือไม่ที่จะคำนึงถึงความสำคัญของคุณลักษณะด้วย DBN และมีวิธีการอื่นที่รู้จักกันในการเลือกคุณสมบัติโดยใช้การเรียนรู้อย่างลึกซึ้งหรือไม่?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.