สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

4
ตัวอย่าง / หนังสือ / แหล่งข้อมูลที่ดีเพื่อเรียนรู้เกี่ยวกับการเรียนรู้ด้วยเครื่องประยุกต์ (ไม่ใช่แค่ ML เท่านั้น)
ก่อนหน้านี้ฉันเคยเรียนหลักสูตร ML แต่ตอนนี้ฉันทำงานกับโครงการที่เกี่ยวข้องกับ ML ในงานของฉัน ฉันแน่ใจว่าสิ่งที่ฉันทำได้รับการวิจัย / จัดการกับก่อนหน้านี้ แต่ฉันไม่สามารถหาหัวข้อที่เฉพาะเจาะจง ตัวอย่างการเรียนรู้ของเครื่องทั้งหมดที่ฉันพบออนไลน์นั้นง่ายมาก (เช่นวิธีใช้โมเดล KMeans ใน Python และดูการคาดคะเน) ฉันกำลังมองหาแหล่งข้อมูลที่ดีเกี่ยวกับวิธีการใช้งานจริงเหล่านี้และอาจเป็นตัวอย่างรหัสของการใช้งานเครื่องเรียนรู้ขนาดใหญ่และการฝึกอบรมแบบจำลอง ฉันต้องการเรียนรู้เกี่ยวกับวิธีการดำเนินการอย่างมีประสิทธิภาพและสร้างข้อมูลใหม่ที่สามารถทำให้อัลกอริทึม ML มีประสิทธิภาพมากขึ้น

1
อะไรคือคำอธิบายของตัวอย่างว่าทำไมการทำแบทช์ให้เป็นมาตรฐานต้องทำด้วยความระมัดระวัง
ฉันกำลังอ่านเอกสารการทำให้เป็นมาตรฐานของแบทช์ [1] และมันมีส่วนหนึ่งที่ต้องผ่านตัวอย่างพยายามที่จะแสดงว่าทำไมการทำให้เป็นมาตรฐานต้องทำอย่างระมัดระวัง ฉันอย่างจริงใจไม่เข้าใจวิธีการทำงานของตัวอย่างและฉันอยากรู้อยากเห็นจริง ๆ เข้าใจพวกเขากระดาษมากที่สุดเท่าที่จะทำได้ ก่อนอื่นให้ฉันพูดที่นี่: ตัวอย่างเช่นพิจารณาชั้นด้วยการป้อนข้อมูลที่ยูที่เพิ่มเรียนรู้อคติ B และ normalizes ที่ x = U + B , x = { x 1 . . N }คือชุดของค่าของxในชุดฝึกอบรมและE [ x ] = ∑ N i = 1 x ix^= x - E[ x ]x^=x-E[x]\hat{x} = x − E[x]x = u + …

2
การตรวจสอบความถูกต้องไขว้หลังจาก LASSO ในข้อมูลการสำรวจที่ซับซ้อน
ฉันกำลังพยายามเลือกรูปแบบตัวทำนายผลผู้สมัครบางคนที่ใช้ LASSO ด้วยผลลัพธ์ที่ต่อเนื่อง เป้าหมายคือการเลือกแบบจำลองที่ดีที่สุดด้วยประสิทธิภาพการทำนายที่ดีที่สุดซึ่งโดยทั่วไปสามารถทำได้โดยการตรวจสอบความถูกต้องของ K-fold cross หลังจากได้รับเส้นทางการแก้ปัญหาของพารามิเตอร์การปรับแต่งจาก LASSO ปัญหาที่นี่คือข้อมูลมาจากการออกแบบการสำรวจหลายขั้นตอนที่ซับซ้อน (NHANES) ด้วยการสุ่มตัวอย่างแบบคลัสเตอร์และการแบ่งชั้น ส่วนการประเมินไม่ยากเนื่องจากglmnetใน R สามารถรับน้ำหนักตัวอย่างได้ แต่ส่วนการตรวจสอบความถูกต้องไขว้นั้นมีความชัดเจนน้อยกว่าสำหรับฉันเนื่องจากการสังเกตการณ์ตอนนี้ไม่ได้เป็นอีกต่อไปแล้วและขั้นตอนการบัญชีสำหรับการสุ่มตัวอย่างน้ำหนักแทนประชากรที่ จำกัด ได้อย่างไร? ดังนั้นคำถามของฉันคือ: 1) วิธีการดำเนินการตรวจสอบความถูกต้องด้วย K-fold ด้วยข้อมูลการสำรวจที่ซับซ้อนเพื่อเลือกพารามิเตอร์การปรับแต่งที่ดีที่สุดได้อย่างไร? โดยเฉพาะอย่างยิ่งวิธีแบ่งพาร์ติชันข้อมูลตัวอย่างในชุดการฝึกอบรมและการตรวจสอบความถูกต้องอย่างเหมาะสม และวิธีการกำหนดประมาณการของข้อผิดพลาดการทำนาย? 2) มีวิธีอื่นในการเลือกพารามิเตอร์การปรับที่ดีที่สุดหรือไม่?

2
เครือข่ายที่เหลือเกี่ยวข้องกับการไล่ระดับสีอย่างรวดเร็วหรือไม่?
เมื่อเร็ว ๆ นี้เราเห็นการเกิดขึ้นของ Residual Neural Net นั้นแต่ละชั้นประกอบด้วยโมดูลการคำนวณและการเชื่อมต่อทางลัดที่เก็บรักษาอินพุตไว้กับเลเยอร์เช่นเอาท์พุทของการจัดแสดงชั้น ith: เครือข่ายอนุญาตให้แยกคุณลักษณะที่เหลือและช่วยให้ความลึกที่ลึกขึ้นในขณะที่มีประสิทธิภาพมากขึ้นสำหรับปัญหาการไล่ระดับสีที่หายไปเพื่อให้ได้ประสิทธิภาพการทำงานที่ทันสมัยy i + 1 = c i + y icicic_iyi+1=ci+yiyi+1=ci+yi y_{i+1} = c_i + y_i การขุดลึกลงไปในการเพิ่มระดับความลาดชันซึ่งเป็นเทคนิคการตระการตาที่ทรงพลังในโลกแห่งการเรียนรู้ของเครื่องซึ่งดูเหมือนว่าจะทำการเพิ่มประสิทธิภาพการไล่ระดับสีบนส่วนที่เหลือของการสูญเสียมันยากที่จะไม่เห็นความคล้ายคลึงกัน ฉันรู้ว่าพวกมันเหมือนกัน แต่ไม่เหมือนกัน - ข้อแตกต่างที่สำคัญอย่างหนึ่งที่ฉันสังเกตเห็นก็คือการเพิ่มความลาดชันนั้นจะทำการปรับให้เหมาะสมที่สุดกับคำศัพท์เสริมในขณะที่ส่วนที่เหลืออยู่จะทำให้เครือข่ายทั้งหมดดีที่สุด ผมไม่ได้เห็นเขา et al, ทราบว่านี่เป็นส่วนหนึ่งของแรงจูงใจของพวกเขาในของพวกเขากระดาษเดิม ดังนั้นฉันจึงสงสัยว่าความเข้าใจของคุณในหัวข้อนี้คืออะไรและขอให้คุณแบ่งปันแหล่งข้อมูลที่น่าสนใจที่คุณมี ขอบคุณ.

4
โครงข่ายประสาทเทียม - ความหมายของน้ำหนัก
ฉันใช้ฟีดไปข้างหน้า NN ฉันเข้าใจแนวคิด แต่คำถามของฉันเกี่ยวกับน้ำหนัก คุณจะตีความพวกเขาได้อย่างไรเช่นพวกเขาเป็นตัวแทนของอะไรหรือพวกเขาจะยกเลิกการรูทรูดได้อย่างไร ฉันพบสิ่งที่เรียกว่า "น้ำหนักของพื้นที่" แต่ฉันไม่แน่ใจว่ามันหมายถึงอะไร

2
การตีความแบบจำลองค่าเฉลี่ยผลลัพธ์ใน R
ฉันพยายามที่จะเข้าใจและรู้ว่าจะรายงานอะไรจากการวิเคราะห์ข้อมูลบางอย่างของฉันโดยใช้แบบจำลองค่าเฉลี่ยใน R ฉันใช้สคริปต์ต่อไปนี้เพื่อวิเคราะห์ผลกระทบของวิธีการวัดค่าตัวแปรที่กำหนด: นี่คือชุดข้อมูล: https://www.dropbox.com/s/u9un273gzw9o30u/VMT4.csv?dl=0 รูปแบบที่จะติดตั้ง: LM.1 <- gls(VMTf ~ turn+sex+method, na.action="na.fail", method = "ML",VMT4) ขุดแบบเต็ม require(MuMIn) d=dredge(LM.1) print(d) coefficients(d) รับข้อมูลสรุปของทุกรุ่นเพื่อรับค่าประมาณพารามิเตอร์ summary(model.avg(d)) ฉันรู้ว่าแบบจำลองทั้งหมดสามารถเฉลี่ย (ค่าเฉลี่ยเต็มรูปแบบแบบจำลอง) หรือเพียงแค่ส่วนย่อยของพวกเขา (ค่าเฉลี่ยแบบมีเงื่อนไข) ตอนนี้ฉันต้องการทราบว่า: เมื่อใดควรใช้การหาค่าเฉลี่ยแบบเต็มหรือแบบเงื่อนไขเพื่อทำการอนุมาน ฉันควรรายงานเรื่องทั้งหมดนี้สำหรับบทความทางวิทยาศาสตร์อย่างไร หมายความว่าค่า Z และ p ที่เกี่ยวข้องสำหรับสถานการณ์เฉลี่ยแบบจำลองคืออะไร? เพื่อให้ง่ายต่อการมองเห็นคำถามของฉัน นี่คือตารางผลลัพธ์ > summary(model.avg(d))# now, there are effects Call: model.avg(object = d) Component model call: gls(model …

1
ความแตกต่างระหว่าง ElasticNet ใน Scikit-Learn Python และ Glmnet ใน R
มีใครพยายามที่จะตรวจสอบว่าเหมาะสมกับโมเดล Elastic Net ด้วยElasticNetใน scikit-Learn ใน Python และglmnetใน R บนชุดข้อมูลเดียวกันสร้างผลลัพธ์ทางคณิตศาสตร์ที่เหมือนกันหรือไม่ ฉันได้ทดลองกับการรวมกันของพารามิเตอร์หลายชุด (เนื่องจากทั้งสองฟังก์ชั่นแตกต่างกันในค่าเริ่มต้นที่พวกเขาส่งผ่านไปยังข้อโต้แย้ง) และปรับขนาดข้อมูล แต่ดูเหมือนไม่มีอะไรที่จะสร้างแบบจำลองเดียวกันระหว่างสองภาษา มีใครประสบปัญหาเดียวกันหรือไม่

3
ข้อได้เปรียบหลักของแบบจำลองกระบวนการเกาส์เซียน
กระบวนการแบบเกาส์ใช้กันอย่างแพร่หลายโดยเฉพาะอย่างยิ่งในการแข่งขัน เป็นที่ทราบกันดีว่าความต้องการการคำนวณสูง ( )0(n3)0(n3)0(n^3) อะไรทำให้พวกเขาโด่งดัง อะไรคือข้อได้เปรียบหลักและซ่อนเร้นของพวกเขา? เหตุใดพวกเขาจึงใช้โมเดลพาราเมตริก (โดยโมเดลพาราเมทริกฉันหมายถึงการถดถอยเชิงเส้นแบบทั่วไปซึ่งรูปแบบพาราเมทริกที่แตกต่างกันสามารถใช้อธิบายแนวโน้มอินพุทและเอาท์พุท; เช่น qaudratic) ฉันขอขอบคุณคำตอบทางเทคนิคที่อธิบายคุณสมบัติโดยธรรมชาติที่ทำให้กระบวนการแบบเกาส์แตกต่างและมีประโยชน์

1
การวัด“ ความเบี่ยงเบน” สำหรับปัวซอง zero-inflated หรือทวินามลบพองศูนย์?
การเบี่ยงเบนสเกลที่กำหนดไว้เป็น D = 2 * (บันทึกความน่าจะเป็นของโมเดลอิ่มตัวลบบันทึกความน่าจะเป็นของโมเดลที่ติดตั้ง) มักใช้เป็นเครื่องวัดความดีพอดีในโมเดล GLM เปอร์เซ็นต์การเบี่ยงเบนที่อธิบายถูกกำหนดเป็น [D (โมเดลว่าง) - D (โมเดลที่พอดี)] / D (โมเดลว่าง) บางครั้งก็ใช้เป็น GLM อนาล็อกเพื่อการถดถอยเชิงเส้นของ R-squared นอกเหนือจากข้อเท็จจริงที่ว่าการแจกแจง ZIP และ ZINB ไม่ได้เป็นส่วนหนึ่งของตระกูลการแจกแจงแบบเลขชี้กำลังฉันกำลังมีปัญหาในการทำความเข้าใจว่าเหตุใดส่วนเบี่ยงเบนส่วนเบี่ยงเบนขนาดและเปอร์เซ็นต์เบี่ยงเบนที่อธิบายไม่ถูกนำมาใช้ ทุกคนสามารถแสดงความเห็นในเรื่องนี้หรือให้การอ้างอิงที่เป็นประโยชน์ ขอบคุณล่วงหน้า!

3
หนังสือที่ดีสำหรับการเรียนรู้ความน่าจะเป็นประยุกต์หรือไม่
ฉันกำลังมองหาหนังสือที่ให้การครอบคลุมอย่างลึกซึ้งเกี่ยวกับทฤษฎีความน่าจะเป็น แต่เน้นเนื้อหาที่ส่วนใหญ่มีประโยชน์นอกแผนกคณิตศาสตร์ ฉันเคยได้ยินว่า "ทฤษฎีความน่าจะเป็น: การสำรวจและแอปพลิเคชัน" ค่อนข้างดี แต่ฉันต้องการคำแนะนำอื่น ๆ ตัวอย่างเช่นหนังสือของ Achim Klenke นั้นมากเกินไปสำหรับฉัน ... มันถูกจัดทำขึ้นเพื่อพิสูจน์ทฤษฎีบทไม่ใช่แอพพลิเคชั่นเท่าที่ฉันจะบอกได้ ยังไม่ได้เป็นแฟนตัวยงของหนังสือของ Durrett จากสิ่งที่ฉันได้อ่านหรือ Billingsley หรือ Feller ... อีกครั้งเน้นการวิจัยคณิตศาสตร์มากเกินไป

1
นโยบายการเปิดตัวในกระดาษของ AlphaGo คืออะไร?
กระดาษเป็นที่นี่ นโยบายการเปิดตัว ... เป็นนโยบาย softmax เชิงเส้นที่ขึ้นอยู่กับคุณลักษณะของรูปแบบโลคัลที่คำนวณเพิ่มขึ้นอย่างรวดเร็ว ... ฉันไม่เข้าใจว่านโยบายการเปิดตัวคืออะไรและเกี่ยวข้องกับเครือข่ายนโยบายในการเลือกย้ายอย่างไร มีคำอธิบายที่ง่ายกว่านี้ไหม?

3
อีกคำถามหนึ่งในทฤษฎีบทขีด จำกัด กลาง
ปล่อยเป็นลำดับของตัวแปรสุ่มแบบอิสระของ Bernoulli ด้วย ตั้ง แสดงให้เห็นว่าลู่เข้าสู่การกระจายไปยังตัวแปรปกติมาตรฐานเมื่อมีแนวโน้มที่จะไม่มีที่สิ้นสุดP { X k = 1 } = 1 - P { X k = 0 } = 1{Xn:n≥1}{Xn:n≥1}\{X_n:n\ge1\}Sn= n ∑ k=1(Xk-1P{Xk=1}=1−P{Xk=0}=1k.P{Xk=1}=1−P{Xk=0}=1k.P\{X_k=1\}=1-P\{X_k=0\}=\frac{1}{k}. SnSn=∑k=1n(Xk−1k), B2n=∑k=1nk−1k2Sn=∑k=1n(Xk−1k), Bn2=∑k=1nk−1k2S_n=\sum^{n}_{k=1}\left(X_k-\frac{1}{k}\right), \ B_n^2=\sum^{n}_{k=1}\frac{k-1}{k^2} ZnSnBnSnBn\frac{S_n}{B_n}ZZZnnn ความพยายามของฉันคือใช้ Lyapunov CLT ดังนั้นเราต้องแสดงให้เห็นว่ามีเช่นนั้น δ>0δ>0\delta>0limn→∞1B2+δn∑k=1nE[|Xk−1k|2+δ]=0.limn→∞1Bn2+δ∑k=1nE[|Xk−1k|2+δ]=0.\lim_{n\rightarrow \infty}\frac{1}{B_n^{2+\delta}}\sum_{k=1}^{n}E[|X_k-\frac{1}{k}|^{2+\delta}]=0. ดังนั้นตั้งค่าδ=1δ=1\delta=1∑k=1nE∣∣Xk−k−1∣∣3=∑k=1n(1k−3k2+4k3−2k4)∑k=1nE|Xk−k−1|3=∑k=1n(1k−3k2+4k3−2k4) \sum_{k=1}^{n}E\left|X_k-k^{-1}\right|^{3}=\sum_{k=1}^{n} \left(\frac{1}{k}-\frac{3}{k^2}+\frac{4}{k^3}-\frac{2}{k^4}\right) และ B3n=(∑k=1n1k−1k2)(∑k=1n1k−1k2)−−−−−−−−−−−−⎷Bn3=(∑k=1n1k−1k2)(∑k=1n1k−1k2) B_n^3=\left( \sum_{k=1}^n \frac{1}{k}-\frac{1}{k^2} \right) \sqrt{\left( \sum_{k=1}^n \frac{1}{k}-\frac{1}{k^2} …

3
การหาค่าเหมาะที่สุดของแบบจำลองสโตแคสติกคอมพิวเตอร์
นี่เป็นหัวข้อที่ยากสำหรับฉันในการใช้ google เนื่องจากการเพิ่มประสิทธิภาพของคำและสุ่มในการค้นหาเกือบจะเป็นค่าเริ่มต้นโดยอัตโนมัติในการค้นหาการเพิ่มประสิทธิภาพสุ่ม แต่สิ่งที่ฉันต้องการทราบจริงๆคือวิธีการใดที่มีอยู่สำหรับการทำให้เกิดประโยชน์สูงสุดของแบบจำลองคอมพิวเตอร์เมื่อผลลัพธ์ของแบบจำลองคอมพิวเตอร์เป็นแบบสุ่มนั่นคือไม่กำหนดขึ้น ตัวอย่างเช่นหากคุณพิจารณารูปแบบคอมพิวเตอร์ที่มีฟังก์ชั่นที่ไม่รู้จักที่แสดงถึงเอาท์พุทของรูปแบบคอมพิวเตอร์นั้นมีวิธีการทางสถิติมากมายสำหรับการแก้ปัญหาเช่นf(x)f(x)f(x) minxf(x)∈Xminf(x)x∈X\begin{align*} \min&\,\,\,\, f(x)\\ x&\in\mathcal{X} \end{align*} เมื่อf(x)f(x)f(x)ถูกกำหนดขึ้น แต่จะเกิดอะไรขึ้นเมื่อf(x)f(x)f(x)สุ่ม มีวิธีแก้ไขปัญหาหรือไม่เราสามารถแก้ไขได้ดีที่สุด minxE[f(x)]∈XminE[f(x)]x∈X\begin{align*} \min&\,\,\,\, \mathbb{E}[f(x)]\\ x&\in\mathcal{X} \end{align*} โดยที่E(⋅)E(⋅)\mathbb{E}(\cdot)เป็นผู้ดำเนินการตามปกติ

1
Q-learning ด้วย Neural Network เป็นฟังก์ชันการประมาณ
ฉันกำลังพยายามที่จะใช้เครือข่ายประสาทเพื่อให้ใกล้เคียงกับ Q-ค่าใน Q-การเรียนรู้ในขณะที่มีคำถามเกี่ยวกับ Q-การเรียนรู้โดยใช้โครงข่ายประสาทเทียม ตามที่แนะนำในคำตอบแรกฉันใช้ฟังก์ชั่นการเปิดใช้งานเชิงเส้นสำหรับเลเยอร์เอาท์พุทในขณะที่ฉันยังคงใช้ฟังก์ชั่นการเปิดใช้งาน sigmoid ในเลเยอร์ที่ซ่อนอยู่ (2 แม้ว่าฉันจะสามารถเปลี่ยนได้ในภายหลัง) ฉันยังใช้ NN เดี่ยวที่คืนค่าเอาต์พุตสำหรับแต่ละการดำเนินการQ ( a )Q(a)Q(a)ตามที่แนะนำ อย่างไรก็ตามอัลกอริทึมยังคงแยกออกสำหรับปัญหาการทรงตัวของรถเข็นเสาอย่างง่าย ดังนั้นฉันกลัวว่าการอัปเดต Q ของฉันจะผิด หลังจากการเริ่มต้นสิ่งที่ฉันทำในแต่ละขั้นตอนมีดังต่อไปนี้: คำนวณQเสื้อ( sเสื้อ)Qt(st)Q_t(s_t)โดยใช้การขยายพันธุ์ไปข้างหน้าของ NN สำหรับการดำเนินการทั้งหมด เลือกการกระทำใหม่T , ที่ดินในรัฐใหม่s Taเสื้อata_tsเสื้อsts_t คำนวณQเสื้อ( st + 1)Qt(st+1)Q_t(s_{t+1})โดยใช้การขยายพันธุ์ไปข้างหน้าของ NN สำหรับการดำเนินการทั้งหมด a t Q t + 1 ( sQt + 1( sเสื้อ,เสื้อ) = Qเสื้อ( sเสื้อ,เสื้อ) + αเสื้อ[ …

1
Support Vector Regression แตกต่างจาก SVM อย่างไร
ฉันรู้พื้นฐานเกี่ยวกับ SVM และ SVR แต่ถึงกระนั้นฉันก็ยังไม่เข้าใจว่าปัญหาของการหาไฮเปอร์เพลนที่เพิ่มระยะขอบให้พอดีกับ SVR ได้อย่างไร ประการที่สองฉันอ่านบางอย่างเกี่ยวกับใช้เป็นระยะเผื่อเผื่อใน SVR มันหมายความว่าอะไร?εε\epsilon ประการที่สามมีความแตกต่างระหว่างพารามิเตอร์ฟังก์ชันการตัดสินใจที่ใช้ใน SVM และ SVR หรือไม่?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.