สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
การเชื่อมต่อระหว่างฟังก์ชั่น softmax ใน ML และการกระจาย Boltzmann ในอุณหพลศาสตร์มีความลึกเพียงใด
ฟังก์ชั่น softmax ที่ใช้กันทั่วไปในเครือข่ายประสาทเทียมเพื่อแปลงจำนวนจริงเป็นความน่าจะเป็นเป็นฟังก์ชันเดียวกับการแจกแจง Boltzmann การกระจายความน่าจะเป็นเหนือพลังงานสำหรับทั้งมวลของอนุภาคในสมดุลความร้อนที่อุณหภูมิ T ในอุณหพลศาสตร์ ฉันเห็นเหตุผลบางประการที่ชัดเจนว่าทำไมถึงเป็นจริง: ไม่ว่าหากค่าอินพุตเป็นลบ softmax จะส่งออกค่าบวกที่รวมเป็นหนึ่ง มันแตกต่างกันเสมอซึ่งเป็นประโยชน์สำหรับการ backpropagation มันมีพารามิเตอร์ 'อุณหภูมิ' ที่ควบคุมว่าเครือข่ายควรผ่อนปรนค่าขนาดเล็กได้อย่างไร (เมื่อ T มีขนาดใหญ่มากผลลัพธ์ทั้งหมดมีแนวโน้มเท่ากันเมื่อมีขนาดเล็กมากเฉพาะค่าที่เลือกอินพุตมากที่สุดเท่านั้น) ฟังก์ชั่น Boltzmann ใช้เป็น softmax เพียงอย่างเดียวสำหรับเหตุผลในทางปฏิบัติหรือมีการเชื่อมต่อกับอุณหพลศาสตร์ / ฟิสิกส์เชิงสถิติที่ลึกซึ้งขึ้นหรือไม่?

3
แบ่งข้อมูลอนุกรมเวลาออกเป็นชุดการฝึกอบรม / ทดสอบ / การตรวจสอบความถูกต้อง
อะไรคือวิธีที่ดีที่สุดในการแบ่งข้อมูลอนุกรมเวลาออกเป็นชุดรถไฟ / ทดสอบ / การตรวจสอบความถูกต้องซึ่งจะใช้ชุดการตรวจสอบความถูกต้องสำหรับการปรับพารามิเตอร์ไฮเปอร์พารามิเตอร์ เรามีข้อมูลการขายรายวัน 3 ปีและแผนของเราคือใช้ข้อมูลการฝึกอบรม 2015-2016 จากนั้นสุ่มตัวอย่าง 10 สัปดาห์จากข้อมูล 2017 เพื่อใช้เป็นชุดการตรวจสอบและอีก 10 สัปดาห์จากข้อมูล 2017 สำหรับ ชุดทดสอบ จากนั้นเราจะเดินหน้าในแต่ละวันในชุดทดสอบและการตรวจสอบความถูกต้อง

2
ทำไมเราไม่ใช้ค่าเฉลี่ยถ่วงน้ำหนักแทนค่าเฉลี่ยฮาร์มอนิก
ฉันสงสัยว่าอะไรคือคุณค่าที่แท้จริงของการใช้ค่าเฉลี่ยฮาร์มอนิก (ตัวอย่างเช่นการคำนวณค่า F- มาตรการ) ซึ่งต่างจากค่าเฉลี่ยเลขคณิตถ่วงน้ำหนักในการรวมความแม่นยำและการเรียกคืน? ฉันคิดว่าค่าเฉลี่ยเลขคณิตถ่วงน้ำหนักสามารถเล่นบทบาทของค่าเฉลี่ยฮาร์มอนิกได้หรือฉันขาดอะไรไป?

2
การเลือกขนาดตัวกรองความก้าวหน้า ฯลฯ ใน CNN
ฉันกำลังดูการบรรยาย CS231N จาก Stanford และฉันพยายามที่จะสรุปประเด็นสำคัญในสถาปัตยกรรมของ CNN สิ่งที่ฉันพยายามจะเข้าใจก็คือหากมีแนวทางทั่วไปในการเลือกขนาดตัวกรอง convolution และสิ่งต่าง ๆ เช่นความก้าวหน้าหรือสิ่งนี้เป็นศิลปะมากกว่าวิทยาศาสตร์? การรวมกันฉันเข้าใจว่ามีอยู่ส่วนใหญ่เพื่อชักนำรูปแบบของค่าคงที่ของการแปลในรูปแบบ ในทางกลับกันฉันไม่มีสัญชาตญาณที่ดีในการเลือกขนาดกางเกง มีแนวทางอื่นที่นอกเหนือไปจากการพยายามบีบอัดขนาดเลเยอร์ปัจจุบันหรือพยายามที่จะทำให้เกิดการตอบสนองที่กว้างขึ้นไปยังเซลล์ประสาทหรือไม่? ใครรู้เอกสารที่ดีหรือคล้ายกันที่กล่าวถึงนี้

4
การเชื่อมต่อระหว่าง MLE และความหมายของเอนโทรปีในการเรียนรู้ลึกเป็นอย่างไร
ผมเข้าใจว่าได้รับชุดของอิสระสังเกต ตัวประมาณความน่าจะเป็นสูงสุด (หรือที่เท่ากันคือ MAP ที่มี flat / uniform มาก่อน) ซึ่งระบุพารามิเตอร์ที่สร้างแบบจำลองการกระจาย p_ {model} \ ซ้าย (\, \ cdot \,; \ mathbf {θ} \ right) ที่ตรงกับข้อสังเกตเหล่านั้นมากที่สุดmmmO={o(1),...,o(m)}O={o(1),...,o(m)}\mathbb{O}=\{\mathbf{o}^{(1)}, . . . , \mathbf{o}^{(m)}\}θθ\mathbf{θ}pmodel(⋅;θ)pmodel(⋅;θ)p_{model}\left(\,\cdot\, ; \mathbf{θ}\right) θML(O)=pmodel(O;θ)=argmaxθ‎‎∏i=1mpmodel(o(i);θ)θML(O)=pmodel(O;θ)=arg⁡maxθ‎‎∏i=1mpmodel(o(i);θ)\mathbf{θ}_{ML}(\mathbb{O})= p_{model}\left(\mathbb{O}; \mathbf{θ}\right) = \underset{\mathbf{θ}}{\arg\max}‎‎\prod_{i=1}^{m} p_{model}\left(\mathbf{o}^{(i)}; \mathbf{θ}\right) หรือสะดวกยิ่งขึ้น θML(O)=argminθ∑i=1m−logpmodel(o(i);θ)θML(O)=arg⁡minθ∑i=1m−log⁡pmodel(o(i);θ)\mathbf{θ}_{ML}(\mathbb{O})= \underset{\mathbf{θ}}{\arg\min}\sum_{i=1}^{m} -\log p_{model}\left(\mathbf{o}^{(i)}; \mathbf{θ}\right) และดูบทบาทที่θMLθML\mathbf{θ}_{ML}สามารถเล่นในการกำหนดฟังก์ชั่นการสูญเสียสำหรับเครือข่ายนิวรัลลึกหลายระดับซึ่งθθ\mathbf{θ}สอดคล้องกับพารามิเตอร์ที่ฝึกอบรมของเครือข่าย (เช่นθ={W,b})θ={W,b})\mathbf{θ} = \{\mathbf{W}, \mathbf{b}\} )และการสังเกตเป็นคู่ของการเปิดใช้งานอินพุตxx\mathbf{x}และการแก้ไขเลเบลคลาสที่ถูกต้องy∈[1,k]y∈[1,k]y …

1
การใช้ t-SNE ดีอย่างไรนอกเหนือจากการสร้างภาพข้อมูล?
เราควรใช้ t-SNE ในสถานการณ์ใด (นอกเหนือจากการสร้างภาพข้อมูล) T-SNE ใช้สำหรับลดมิติข้อมูล คำตอบสำหรับคำถามนี้ ชี้ให้เห็นว่าควรใช้ t-SNE สำหรับการสร้างภาพข้อมูลเท่านั้นและไม่ควรใช้สำหรับการทำคลัสเตอร์ ถ้าอย่างนั้นการใช้ t-SNE ดีอย่างไร?

2
ทฤษฎีที่อยู่เบื้องหลังอาร์กิวเมนต์น้ำหนักใน R เมื่อใช้ lm ()
หลังจากปีในโรงเรียนที่จบที่ความเข้าใจของฉัน "ถ่วงน้ำหนักน้อยสแควร์" คือต่อไปนี้ให้ ,จะมีบางเมทริกซ์ออกแบบ\ boldsymbol \ beta \ in \ mathbb {R} ^ pเป็นเวกเตอร์พารามิเตอร์\ boldsymbol \ epsilon \ in \ mathbb {R} ^ nเป็นเวกเตอร์ข้อผิดพลาดที่\ boldsymbol \ epsilon \ sim \ mathcal {N} (\ mathbf {0} \ ซิก ^ 2 \ mathbf {V})ที่\ mathbf {V} = \ ข้อความ {diag} (v_1, v_2 …

1
การเปลี่ยนแปลงความหนาแน่นของความน่าจะเป็นต่างกันเนื่องจากปัจจัยจาโคเบียน
ในการจดจำรูปแบบของอธิการและการเรียนรู้ของเครื่องจักรฉันอ่านสิ่งต่อไปนี้หลังจากความหนาแน่นของความน่าจะเป็นถูกนำมาใช้:p(x∈(a,b))=∫bap(x)dxp(x∈(a,b))=∫abp(x)dxp(x\in(a,b))=\int_a^bp(x)\textrm{d}x ภายใต้การเปลี่ยนแปลงของตัวแปรแบบไม่เชิงเส้นความหนาแน่นของความน่าจะเป็นจะเปลี่ยนไปจากฟังก์ชันแบบง่ายเนื่องจากปัจจัยจาโคเบียน ตัวอย่างเช่นถ้าเราพิจารณาการเปลี่ยนแปลงของตัวแปรแล้วฟังก์ชันจะกลายเป็น (y)) ตอนนี้ให้พิจารณาความหนาแน่นของความน่าจะเป็นที่สอดคล้องกับความหนาแน่น เทียบกับตัวแปรใหม่ซึ่ง suf fi ces แสดงถึงความจริงที่ว่าและมีความหนาแน่นต่างกัน การสังเกตการณ์ที่ตกอยู่ในช่วงจะเปลี่ยนเป็นค่าเล็ก ๆ ของ เป็นช่วงx=g(y)x=g(y)x = g(y)f(x)f(x)f(x)f~(y)=f(g(y))f~(y)=f(g(y))\tilde{f}(y) = f(g(y))px(x)px(x)p_x(x)พีY( y)พีY(Y)p_y(y)YYyพีx( x )พีx(x)p_x(x)พีY( y)พีY(Y)p_y(y)( x , x + δx )(x,x+δx)(x, x + \delta x)δxδx\delta x( y, y+ δY(Y,Y+δY(y, y + \delta y ) โดยที่ พีx( x ) δx≃py(y)δypx(x)δx≃py(y)δyp_x(x)\delta x \simeq p_y(y)δyและด้วยเหตุนี้py(y)=px(x)|dxdy|=px(g(y))|g′(y)|py(y)=px(x)|dxdy|=px(g(y))|g′(y)|p_y(y) = …

1
XGBoost สามารถจัดการข้อมูลที่ขาดหายไปในขั้นตอนการพยากรณ์
เมื่อเร็ว ๆ นี้ฉันได้ตรวจสอบอัลกอริทึม XGBoost และฉันสังเกตเห็นว่าอัลกอริทึมนี้สามารถจัดการข้อมูลที่ขาดหายไป (โดยไม่ต้องใส่ข้อมูล) ในขั้นตอนการฝึกอบรม ฉันสงสัยว่า XGboost สามารถจัดการข้อมูลที่หายไป (โดยไม่ต้องใส่ข้อมูล) เมื่อใช้สำหรับการคาดการณ์การสังเกตใหม่หรือมีความจำเป็นในการใส่ข้อมูลที่ขาดหายไป ขอบคุณล่วงหน้า.

3
การถดถอยป่าแบบสุ่มไม่คาดการณ์สูงกว่าข้อมูลการฝึกอบรม
ฉันสังเกตเห็นว่าเมื่อสร้างแบบจำลองการถดถอยป่าแบบสุ่มอย่างน้อยRค่าที่ทำนายจะไม่เกินค่าสูงสุดของตัวแปรเป้าหมายที่เห็นในข้อมูลการฝึกอบรม ตัวอย่างเช่นดูรหัสด้านล่าง ฉันกำลังสร้างแบบจำลองการถดถอยเพื่อทำนายmpgตามmtcarsข้อมูล ฉันสร้าง OLS และโมเดลป่าไม้แบบสุ่มและใช้มันในการทำนายmpgสำหรับรถยนต์สมมุติที่ควรมีการประหยัดเชื้อเพลิงที่ดีมาก OLS ทำนายป่าสูงmpgตามที่คาดไว้ แต่ป่าสุ่มไม่ได้ ฉันสังเกตเห็นสิ่งนี้ในรูปแบบที่ซับซ้อนมากขึ้นเช่นกัน ทำไมนี้ > library(datasets) > library(randomForest) > > data(mtcars) > max(mtcars$mpg) [1] 33.9 > > set.seed(2) > fit1 <- lm(mpg~., data=mtcars) #OLS fit > fit2 <- randomForest(mpg~., data=mtcars) #random forest fit > > #Hypothetical car that should have very high mpg …
12 r  random-forest 

4
Bootstrap กับ Monte Carlo การประมาณข้อผิดพลาด
ฉันอ่านบทความการเผยแพร่ข้อผิดพลาดโดยวิธีมอนติคาร์โลในการคำนวณทางธรณีวิทยาแอนเดอร์สัน (1976)และมีบางสิ่งที่ฉันไม่เข้าใจ พิจารณาข้อมูลที่วัดได้และโปรแกรมที่ประมวลผลและคืนค่าที่กำหนด ในบทความโปรแกรมนี้ใช้เพื่อให้ได้ค่าที่ดีที่สุดก่อนโดยใช้วิธีการของข้อมูล (เช่น: ){ A , B , C }{ A ± σA, B ± σB, C± σค}{A±σA,B±σB,C±σC}\{A\pm\sigma_A, B\pm\sigma_B, C\pm\sigma_C\}{ A , B , C}{A,B,C}\{A, B, C\} จากนั้นผู้เขียนใช้วิธีมอนติคาร์โลเพื่อกำหนดความไม่แน่นอนให้กับค่าที่ดีที่สุดนี้โดยการเปลี่ยนแปลงพารามิเตอร์อินพุตภายในขอบเขตความไม่แน่นอน (กำหนดโดยการแจกแจงแบบเกาส์ด้วยวิธีการและค่าเบี่ยงเบนมาตรฐาน ) ก่อนป้อนเข้าโปรแกรม นี่คือตัวอย่างในรูปด้านล่าง:{ σ A , σ B , σ C }{ A , B , C}{A,B,C}\{A, B, C\}{ …

2
“ ไม่ควรมีความสัมพันธ์” ในการทดสอบ Kolmgorov-Smirnov หนึ่งตัวอย่างใน R
ฉันจะใช้การทดสอบ Kolmogorov-Smirnov เพื่อทดสอบความปกติของ MYDATA ใน R นี่เป็นตัวอย่างของสิ่งที่ฉันทำ ks.test(MYDATA,"pnorm",mean(MYDATA),sd(MYDATA)) นี่คือผลลัพธ์ R ให้ฉัน: data: MYDATA D = 0.13527, p-value = 0.1721 alternative hypothesis: two-sided Warning message: In ks.test(MYDATA, "pnorm", mean(MYDATA), sd(MYDATA)) : ties should not be present for the Kolmogorov-Smirnov test ฉันคิดว่ามีปัญหา "ความสัมพันธ์" หมายถึงอะไรในคำเตือนนี้

3
Lasso กับ Lasso ที่ปรับตัวได้
LASSO และการปรับตัว LASSO เป็นสองสิ่งที่แตกต่างใช่มั้ย (สำหรับฉันบทลงโทษนั้นดูแตกต่างออกไป แต่ฉันแค่ตรวจสอบว่าฉันพลาดอะไรไปหรือเปล่า) เมื่อคุณพูดถึงมุ้งยืด LASSO หรือ LASSO ที่ปรับตัวได้นั้นเป็นกรณีพิเศษหรือไม่? แพคเกจ glmnet ใดที่คุณเลือกถ้าคุณเลือก alpha = 1 Adaptive LASSO ทำงานบนสภาพที่รุนแรงขึ้นใช่ไหม? ทั้งคู่มีคุณสมบัติพยากรณ์ในข้อมูลที่เหมาะสมใช่ไหม

2
รุ่นอนุกรมเวลาของความแตกต่างของบันทึกดีกว่าอัตราการเติบโตหรือไม่
บ่อยครั้งที่ฉันเห็นผู้เขียนประเมินโมเดล "ความแตกต่างของบันทึก" เช่น log(yt)−log(yt−1)=log(yt/yt−1)=α+βxtlog⁡(yt)−log⁡(yt−1)=log⁡(yt/yt−1)=α+βxt\log (y_t)-\log(y_{t-1}) = \log(y_t/y_{t-1}) = \alpha + \beta x_t ฉันเห็นนี้มีความเหมาะสมที่จะเกี่ยวข้องกับไปสู่การเปลี่ยนแปลงในอัตราร้อยละขณะที่คือ(1)y t log ( y t ) I ( 1 )xtxtx_tytyty_tlog(yt)log⁡(yt)\log (y_t)I(1)I(1)I(1) แต่ความแตกต่างของบันทึกคือการประมาณและดูเหมือนว่าเราสามารถประมาณโมเดลได้โดยไม่ต้องมีการแปลงบันทึกเช่น yt/yt−1−1=(yt−yt−1)/yt−1=α+βxtyt/yt−1−1=(yt−yt−1)/yt−1=α+βxty_t/y_{t-1} -1 = (y_t - y_{t-1}) / y_{t-1}=\alpha+\beta x_t ยิ่งไปกว่านั้นอัตราการเติบโตจะอธิบายการเปลี่ยนแปลงเปอร์เซ็นต์อย่างแม่นยำในขณะที่ความแตกต่างของบันทึกจะประมาณการเปลี่ยนแปลงเปอร์เซ็นต์เท่านั้น อย่างไรก็ตามฉันพบว่าวิธีการบันทึกความแตกต่างถูกใช้บ่อยกว่ามาก ในความเป็นจริงแล้วการใช้อัตราการเติบโตดูเหมือนว่าเหมาะสมที่จะจัดการกับความคงที่ของความแตกต่างแรก ในความเป็นจริงฉันได้พบว่าการคาดการณ์กลายเป็นแบบเอนเอียง (บางครั้งเรียกว่าปัญหาการส่งข้อมูลย้อนกลับในวรรณกรรม) เมื่อเปลี่ยนตัวแปรบันทึกกลับไปเป็นข้อมูลระดับyt/yt−1yt/yt−1y_t/y_{t-1} ประโยชน์ของการใช้ความแตกต่างของบันทึกเปรียบเทียบกับอัตราการเติบโตคืออะไร มีปัญหาใด ๆ กับการเปลี่ยนแปลงอัตราการเติบโตหรือไม่? ฉันเดาว่าฉันขาดอะไรไปไม่งั้นก็ดูเหมือนว่าจะใช้วิธีนี้บ่อยขึ้น

1
การสุ่มตัวอย่างจากการแจกแจงร่อแร่โดยใช้การแจกแจงแบบมีเงื่อนไข?
ฉันต้องการตัวอย่างจากความหนาแน่นของ univariate ฉXฉXf_Xแต่ฉันรู้เพียงความสัมพันธ์: ฉX( x ) = ∫ฉX| Y(x | y)fY( y) dY.ฉX(x)=∫ฉX|Y(x|Y)ฉY(Y)dY.f_X(x) = \int f_{X\vert Y}(x\vert y)f_Y(y) dy. ฉันต้องการหลีกเลี่ยงการใช้ MCMC (โดยตรงกับการแทนค่าอินทิกรัล) และเนื่องจากและเป็นตัวอย่างที่ง่ายฉันจึงคิดที่จะใช้ตัวอย่างต่อไปนี้ :f Y ( y )ฉX| Y( x | y)ฉX|Y(x|Y)f_{X\vert Y}(x\vert y)ฉY( y)ฉY(Y)f_Y(y) สำหรับNj = 1 , … , NJ=1,...,ยังไม่มีข้อความj=1,\dots, N ตัวอย่างf_YYJ∼ fYYJ~ฉYy_j \sim f_Y ตัวอย่างy_j)xJ∼ fX| Y( …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.