สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
นิยามน้ำหนักถ่วงน้ำหนักน้อยที่สุด: ฟังก์ชัน R lm เทียบกับ
ใครช่วยบอกฉันหน่อยได้ไหมว่าทำไมฉันถึงได้ผลลัพธ์ที่แตกต่างจากRน้ำหนักอย่างน้อยกำลังสองและวิธีแก้ปัญหาด้วยตนเองโดยการทำงานของเมทริกซ์ ? โดยเฉพาะฉันกำลังพยายามแก้ไขด้วยตนเองโดยที่คือเมทริกซ์แนวทแยงมุมที่มีน้ำหนักคือเมทริกซ์ข้อมูลคือการตอบสนอง เวกเตอร์ W A x = W bWAx=Wb\mathbf W \mathbf A\mathbf x=\mathbf W \mathbf bWW\mathbf WAA\mathbf Aขb\mathbf b ฉันพยายามเปรียบเทียบผลลัพธ์กับR lmฟังก์ชันโดยใช้weightsอาร์กิวเมนต์

2
วิธีตัวอย่างการแจกแจงแบบหลายส่วนที่ถูกตัดทอน?
ฉันต้องการอัลกอริทึมในการสุ่มตัวอย่างการกระจายหลายส่วนแบบตัดปลาย นั่นคือ, x⃗ ~1Zพีx11...พีxkkx1! ...xk!x→∼1Zp1x1…pkxkx1!…xk!\vec x \sim \frac{1}{Z} \frac{p_1^{x_1} \dots p_k^{x_k}}{x_1!\dots x_k!} ที่เป็นค่าคงที่ฟื้นฟู\ vec xมีkส่วนประกอบบวกและ\ รวม x_i n ฉันเพียงพิจารณาค่าของ\ vec {x}ในช่วง\ vec เป็น \ le \ vec x \ le \ vec ขZZZx⃗ x→\vec xkkkΣxผม= n∑xi=n\sum x_i = nx⃗ x→\vec{x}a⃗ ≤x⃗ ≤ข⃗ a→≤x→≤ข→\vec a \le \vec x \le \vec b …

1
ผลรวมของตัวแปรสุ่ม Cauchy อิสระจำนวนมากปกติหรือไม่
ตามทฤษฎีบทขีด จำกัด กลางฟังก์ชันความหนาแน่นของความน่าจะเป็นของผลรวมของตัวแปรสุ่มอิสระขนาดใหญ่มีแนวโน้มที่จะเป็นปกติ ดังนั้นเราสามารถพูดได้ว่าผลรวมของตัวแปรสุ่ม Cauchy อิสระจำนวนมากนั้นเป็นปกติหรือไม่

2
ตัวประมาณค่าแบบเป็นกลางของพารามิเตอร์ปัวซอง
จำนวนอุบัติเหตุต่อวันคือตัวแปรแบบสุ่มของปัวซองด้วยพารามิเตอร์ใน 10 วันที่เลือกแบบสุ่มจำนวนการเกิดอุบัติเหตุถูกสังเกตว่าเป็น 1,0,1,1,2,0,2,0,2,0,0,1 อะไรจะเกิดขึ้น เป็นผู้ประมาณค่าที่เป็นกลางของหรือไม่λλ\lambdaeλeλe^{\lambda} ผมพยายามที่จะพยายามในลักษณะนี้: เรารู้ว่าแต่แลมบ์ดา} ถ้าเช่นนั้นจะใช้ตัวประมาณค่าที่เป็นกลางE(x¯)=λ=0.8E(x¯)=λ=0.8E(\bar{x})=\lambda=0.8E(ex¯)≠ eλE(ex¯)≠ eλE(e^{\bar{x}})\neq\ e^{\lambda}

1
ธรรมดาในช่องสี่เหลี่ยมน้อยที่สุดคืออะไร?
เมื่อเร็ว ๆ นี้เพื่อนของฉันคนหนึ่งถามว่าอะไรที่ธรรมดามาก ๆ ดูเหมือนว่าเราจะไม่ได้อยู่ที่ใดในการสนทนา เราทั้งสองตกลงกันว่า OLS เป็นกรณีพิเศษของโมเดลเชิงเส้นมีประโยชน์หลายอย่างรู้กันดีและเป็นกรณีพิเศษของรุ่นอื่น ๆ แต่ทั้งหมดนี้จริงเหรอ? ดังนั้นฉันต้องการทราบ: ชื่อมาจากไหนจริงๆ ใครเป็นคนแรกที่ใช้ชื่อ?

1
มีการตีความอีกครั้งสำหรับการแจกแจงแกมม่าด้วยพารามิเตอร์รูปร่างที่ไม่ใช่จำนวนเต็มหรือไม่?
เป็นที่ทราบกันดีว่าตัวแปรสุ่มที่ Gamma กระจายด้วยพารามิเตอร์รูปร่างจำนวนเต็มนั้นเท่ากับผลรวมของกำลังสองของกระจายตัวแปรสุ่มแบบปกติkkkkkk แต่ฉันจะพูดอะไรเกี่ยวกับแกมม่าที่กระจายตัวแปรสุ่มด้วยค่าที่ไม่ใช่จำนวนเต็ม ? มีการตีความอื่นนอกเหนือจากการแจกแจงแกมม่าหรือไม่?kkk

2
วิธีปรับปรุงเวลาทำงานสำหรับการใส่ข้อมูล R MICE
คำถามของฉันในระยะสั้น: มีวิธีการปรับปรุงเกี่ยวกับเวลาทำงานของ R MICE (การใส่ข้อมูล) หรือไม่ ฉันกำลังทำงานกับชุดข้อมูล (30 ตัวแปร, 1.3 ล้านแถว) ซึ่งมีข้อมูลที่หายไป (ค่อนข้างสุ่ม) ประมาณ 8% ของการสังเกตในตัวแปรประมาณ 15 จาก 30 ตัวประกอบด้วย NAs เพื่อระบุข้อมูลที่หายไปฉันกำลังเรียกใช้ฟังก์ชัน MICE ซึ่งเป็นส่วนหนึ่งของแพ็คเกจMICE ฉันพบเวลาทำงานค่อนข้างช้าแม้จะอยู่บนชุดย่อย (100,000 แถว) ด้วยเมธอด = "fastpmm" และ m = 1 และทำงานประมาณ 15 นาที มีวิธีปรับปรุงเวลาทำงานโดยไม่สูญเสียประสิทธิภาพมากเกินไปหรือไม่? (mice.impute.mean ค่อนข้างเร็ว แต่มาพร้อมกับการสูญเสียข้อมูลที่สำคัญ!) รหัสที่ทำซ้ำได้: library(mice) df <- data.frame(replicate(30,sample(c(NA,1:10),1000000,rep=TRUE))) df <- data.frame(scale(df)) output …

2
เป็นองศาอิสระทำไมหาคู่จับคู่ -test จำนวนคู่ลบ 1 หรือไม่
ฉันเคยรู้จัก "องศาอิสระ" ในฐานะซึ่งคุณมีโมเดลเชิงเส้น\ mathbf {y} = \ mathbf {X} \ boldsymbol {\ beta} + \ boldsymbol {\ epsilon} พร้อม\ mathbf {y } \ in \ mathbb {R} ^ n , \ mathbf {X} \ in M_ {n \ times p} (\ mathbb {R})เมทริกซ์การออกแบบพร้อมอันดับr , \ boldsymbol {\ beta} \ in …

2
พลังของการทดลองชิมชาเลดี้
ในการทดสอบที่มีชื่อเสียงของฟิชเชอร์สิ่งที่สังเกตได้คือจำนวนถ้วยเดาที่ถูกต้องkkk มีถ้วยสองแบบ AAA และ BBB. โดยปกติแล้วมันเป็นเรื่องที่น่าสนใจในการคำนวณภูมิภาคที่สำคัญเพื่อปฏิเสธสมมติฐานว่าง (ผู้หญิงคาดเดาแบบสุ่ม) ตามขนาดของการทดสอบαα\alpha. สิ่งนี้ทำได้อย่างง่ายดายโดยใช้การแจกแจงแบบไฮเพอร์เมตริกซ์ ในทำนองเดียวกันฉันสามารถคำนวณขนาดของการทดสอบที่กำหนดในพื้นที่วิกฤติ คำถามที่แตกต่างคือ: วิธีการคำนวณพลังของการทดสอบให้ตั้งสมมติฐานทางเลือก? สมมติว่าผู้หญิงสามารถเดาได้อย่างถูกต้องด้วยความน่าจะเป็นในถ้วยเดียวp = 90 %p=90%p=90\% (P( คาดเดาA |จริงA ) = P( เดา B |จริง B ) = 0.9P(guessA|trueA)=P(guess B|true B)=0.9P(\text{guess} A|\text{true} A)=P(\text{guess } B|\text{true } B)=0.9) พลังของการทดสอบคืออะไรสมมติว่าจำนวนถ้วยเท่ากับยังไม่มีข้อความ= 8N=8N=8 และจำนวนหนึ่งถ้วยทั้งหมด n = N/ 2=4n=N/2=4n=N/2=4? (น่าเสียดาย) ผู้หญิงรู้nnn. กล่าวอีกนัยหนึ่ง: การกระจายตัวของคืออะไร k =k=k=(จำนวนถ้วยที่ถูกต้องภายใต้สมมติฐานทางเลือก) …

3
จำลองตัวแปร Bernoulli ด้วยความน่าจะโดยใช้เหรียญแบบเอนเอียง
มีคนบอกฉันได้ไหมว่าจะจำลองโดยที่โดยใช้การโยนเหรียญ (มากเท่าที่คุณต้องการ) ด้วย ?Bernoulli(ab)Bernoulli(ab)\mathrm{Bernoulli}\left({a\over b}\right)a,b∈Na,b∈Na,b\in \mathbb{N}P(H)=pP(H)=pP(H)=p ฉันกำลังคิดที่จะใช้การสุ่มตัวอย่างการปฏิเสธ แต่ไม่สามารถตอกตะปูลงได้

2
ต้นไม้ประมาณเสมอลำเอียงหรือไม่?
ฉันกำลังทำการบ้านบนต้นไม้ตัดสินใจและหนึ่งในคำถามที่ฉันต้องตอบคือ "ทำไมตัวประมาณถูกสร้างขึ้นจากต้นไม้ลำเอียงและการห่อถุงช่วยลดความแปรปรวนได้อย่างไร" ตอนนี้ฉันรู้ว่าแบบจำลองที่ติดตั้งแล้วมีแนวโน้มที่จะมีอคติต่ำมากเพราะพวกเขาพยายามจัดวางจุดข้อมูลทั้งหมด และฉันมีสคริปต์ใน Python ที่ติดตั้งทรีกับชุดข้อมูลบางส่วน (มีคุณสมบัติเดียวมันเป็นเพียงไซน์ไซด์โดยมีจุดปิดบางภาพด้านล่าง) ดังนั้นฉันสงสัยว่า "ดีถ้าฉัน reeeeally overfit ข้อมูลฉันจะได้รับอคติเป็นศูนย์หรือไม่" และมันกลับกลายเป็นว่าแม้จะมีความลึก 10,000 ยังคงมีบางจุดที่เส้นโค้งไม่ผ่าน ฉันพยายามค้นหาสาเหตุ แต่ไม่พบคำอธิบายจริงๆ ฉันเดาว่าอาจมีต้นไม้บางต้นที่สามารถผ่านทุกจุดได้อย่างสมบูรณ์แบบและต้นไม้ที่ฉันได้รับก็คือ "โชคร้าย" หรือนั่นอาจเป็นชุดข้อมูลที่แตกต่างกันอาจให้ผลลัพธ์ที่ไม่เอนเอียง (อาจเป็นไซนัสที่สมบูรณ์แบบ?) หรือแม้แต่นั้นการตัดที่เกิดขึ้นในตอนต้นทำให้เป็นไปไม่ได้ที่การตัดเพิ่มเติมจะแยกจุดทั้งหมดอย่างสมบูรณ์ ดังนั้นเมื่อคำนึงถึงชุดข้อมูลนี้ (เนื่องจากอาจแตกต่างกับชุดอื่น ๆ ) คำถามของฉันคือ: เป็นไปได้หรือไม่ที่จะปรับต้นไม้จนจุดที่อคตินั้นมีค่าเป็นศูนย์หรือว่าจะมีอคติอยู่บ้าง ขนาดเล็ก? และถ้าอย่างน้อยก็มีอคติเสมอทำไมมันถึงเกิดขึ้น? PS ฉันไม่รู้ว่ามันอาจเกี่ยวข้องหรือไม่ แต่ฉันใช้DecisionTreeRegressorจากsklearnเพื่อให้พอดีกับโมเดลกับข้อมูล
9 cart  bias 

2
โคไซน์มีความคล้ายคลึงกันอย่างไรหลังจากการแปลงเชิงเส้น?
มีความสัมพันธ์ทางคณิตศาสตร์ระหว่าง: ความคล้ายคลึงกันของโคไซน์ ของเวกเตอร์สองตัวและBและsim(A,B)sim⁡(A,B)\operatorname{sim}(A, B)AAABBB ความคล้ายคลึงกันของโคไซน์sim(MA,MB)sim⁡(MA,MB)\operatorname{sim}(MA, MB)ของAAAและBBB , การปรับขนาดที่ไม่สม่ำเสมอผ่านเมทริกซ์M ที่กำหนดMMM? นี่MMMคือเมทริกซ์ทแยงมุมที่กำหนดที่มีองค์ประกอบไม่เท่ากันบนเส้นทแยงมุม ฉันพยายามคำนวณมากกว่า แต่ไม่สามารถไปถึงลิงก์ที่น่าสนใจ / ง่าย (แสดงออก) ฉันสงสัยว่ามีหรือไม่ เช่นมุมที่ไม่ได้รับการเก็บรักษาไว้ในสเกลที่ไม่สม่ำเสมอ แต่ความสัมพันธ์ระหว่างมุมดั้งเดิมกับมุมมองหลังการปรับสเกลไม่เท่ากันคืออะไร อะไรที่สามารถพูดได้เกี่ยวกับการเชื่อมโยงระหว่างชุดของเวกเตอร์ S1 และชุดของเวกเตอร์ S2 อีกชุดหนึ่ง - ที่ซึ่ง S2 จะได้รับจากการปรับขนาด S1 ที่ไม่สม่ำเสมอ?

1
การผสานการวัดแบบสุ่มหมายความว่าอย่างไร
ฉันกำลังดูกระดาษแบบจำลองเอฟเฟกต์แบบสุ่มของ Dirichlet และสเปคของโมเดลมีดังนี้: YผมψผมG=Xผมβ+ψผม+εผม∼ กรัม~ D P( α ,G0)Yผม=Xผมβ+ψผม+εผมψผม~GG~DP(α,G0) \begin{align*}y_{i} &= X_{i}\beta + \psi_{i} + \epsilon_{i}\\ \psi_{i} &\sim G \\ G &\sim \mathcal{DP}\left(\alpha, G_{0}\right) \end{align*} ที่ไหน αα\alpha เป็นพารามิเตอร์ขนาดและ G0G0G_{0}เป็นตัวชี้วัดพื้นฐาน ต่อมาในบทความแนะนำว่าเรารวมฟังก์ชั่นเข้ากับการวัดพื้นฐานG0G0G_{0} เช่น ∫ฉ(YJ| θ,ψJ)dG0(ψJ) .∫ฉ(YJ|θ,ψJ)dG0(ψJ). \int f\left(y_{j}|\theta, \psi_{j}\right)\, dG_{0}\left(\psi_{j}\right).การวัดพื้นฐานใน Dirichlet ประมวลผลเป็น cdf หรือว่าเป็น pdf หรือไม่? จะเกิดอะไรขึ้นหากการวัดพื้นฐานคือ Gaussian

1
รูปร่างคล้ายลิ่มของพล็อต PCA ระบุว่าอะไร?
ในของพวกเขาบนกระดาษ autoencoders สำหรับการจำแนกข้อความฮินตันและ Salakhutdinov แสดงให้เห็นถึงพล็อตที่ผลิตโดย 2 มิติ LSA (ซึ่งเป็นเรื่องที่เกี่ยวข้องอย่างใกล้ชิดกับ PCA): การใช้ PCA กับข้อมูลมิติสูงแตกต่างกันเล็กน้อยฉันได้รับพล็อตที่คล้ายกัน: (ยกเว้นในกรณีนี้ฉันอยากรู้ว่ามีโครงสร้างภายในหรือไม่) หากเราป้อนข้อมูลแบบสุ่มลงใน PCA เราจะได้รับดิสก์รูปหยดดังนั้นรูปทรงลิ่มนี้ไม่ได้สุ่ม มันหมายถึงอะไรด้วยตัวเอง?

1
หนังสือ / แหล่งข้อมูลเกี่ยวกับการทดลองขั้นสูงคืออะไรดี?
ฉันกำลังมองหาแหล่งข้อมูล (ไม่จำเป็นต้องเป็นหนังสือเล่มเดียว) ที่จะครอบคลุมกรณีที่ท้าทายมากขึ้นของการออกแบบการทดลองและการวิเคราะห์เชิงสถิติ บางกรณีที่ฉันต้องการได้รับความคุ้มครอง: 1. กรณีที่หน่วยของการสุ่มแตกต่างจากหน่วยการวิเคราะห์ ตัวอย่าง: ฉันเรียกใช้แพลตฟอร์มอีคอมเมิร์ซกับผู้ขาย M และผู้ซื้อ N ฉันต้องการแนะนำการรักษาในระดับผู้ขาย แต่สนใจในความน่าจะเป็นของผู้ซื้อที่ทำการซื้อ ผู้ซื้อทั่วไปจะไปที่ร้านค้าหลายแห่งในเซสชัน 2. ตัวแปรผลลัพธ์มีความเบ้สูง ตัวอย่าง: ฉันเรียกใช้ศูนย์บริการและฉันต้องการลองแจ้งให้ลูกค้าป้อนรหัสลูกค้าก่อนถึงตัวแทน ฉันหวังว่าจะลดระยะเวลาเฉลี่ยของการโทรศัพท์ การกระจายสายโทรศัพท์เบ้อย่างมาก 3. กลุ่มการรักษามีการกระจายรูปร่างแตกต่างกัน ตัวอย่าง: ศูนย์บริการเดียวกัน แต่ตอนนี้การรักษาของฉันทำงานได้ดีขึ้นมากสำหรับการโทรสั้นและแย่กว่าเล็กน้อยสำหรับการโทรนาน วิธีที่ถูกต้องในการวิเคราะห์นี้คืออะไร? 4. การรักษาทำให้กลุ่มของฉันไม่สมดุล ตัวอย่าง: แพลตฟอร์มอีคอมเมิร์ซเดียวกับใน1แต่ตอนนี้ฉันต้องการทดสอบด้วยกลไกการจัดอันดับที่แตกต่างกัน โดยได้รับมอบหมายให้อยู่ในอันดับที่น่าพอใจมากขึ้นผู้ขายอาจต้องการขึ้นราคาเพิ่มสินค้าคงคลังเปลี่ยนกลยุทธ์ทางการตลาด ฯลฯ ในลักษณะที่จะทำให้ตัวแปรเหล่านั้นแตกต่างกันอย่างเป็นระบบสำหรับการรักษาที่แตกต่างกัน

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.