สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
เราจะทำนายเหตุการณ์ที่หายากได้อย่างไร
ฉันกำลังพัฒนารูปแบบการทำนายความเสี่ยงด้านการประกันภัย โมเดลเหล่านี้เป็น "เหตุการณ์ที่หายาก" เช่นการคาดคะเนการไม่แสดงตัวตนของสายการบินการตรวจจับข้อผิดพลาดของฮาร์ดแวร์ ฯลฯ ขณะที่ฉันเตรียมชุดข้อมูลของฉันฉันพยายามใช้การจำแนกประเภท แต่ฉันไม่สามารถรับตัวแยกประเภทที่มีประโยชน์ได้ . ฉันไม่มีประสบการณ์ด้านสถิติและการสร้างแบบจำลองมากไปกว่าหลักสูตรสถิติของโรงเรียนมัธยมดังนั้นฉันจึงสับสน อย่างที่ฉันคิดไว้ฉันคิดว่าจะใช้แบบจำลองกระบวนการปัวซองซึ่งมีความเป็นเนื้อเดียวกัน ฉันจัดประเภทตามข้อมูลเหตุการณ์ (date, lat, lon) เพื่อให้ได้ค่าประมาณความเสี่ยงที่ดี ณ เวลาใดเวลาหนึ่งของแต่ละวัน ฉันอยากรู้ว่าอะไรคือวิธีการ / ขั้นตอนวิธีในการทำนายเหตุการณ์ที่เกิดขึ้นได้ยาก คุณแนะนำอะไรเป็นวิธีแก้ไขปัญหานี้

3
ความแตกต่างระหว่าง ep-SVR และ nu-SVR (และอย่างน้อยกำลังสอง SVR)
ฉันพยายามค้นหา SVR ที่เหมาะสมกับข้อมูลประเภทนั้น ฉันรู้ SVR 4 ประเภท: พยัญชนะตัวที่ 5 ของกรีก nu กำลังสองน้อยที่สุดและ เชิงเส้น ฉันเข้าใจว่า SVR แบบเส้นตรงมากขึ้นหรือน้อยลงเช่น Lasso กับ L1 Reg แต่ความแตกต่างระหว่าง 3 เทคนิคที่เหลือคืออะไร?
11 regression  svm 

1
วิธีการเลือกความน่าจะเป็นทางลัดสำหรับ Logistic Regression ที่หายาก
ฉันมีการสังเกต 100,000 ครั้ง (ตัวแปรตัวบ่งชี้จำลอง 9 ตัว) พร้อม 1,000 ผลบวก การถดถอยโลจิสติกควรทำงานได้ดีในกรณีนี้ แต่ความเป็นไปได้ที่จะตัดตัวฉัน ในวรรณกรรมทั่วไปเราเลือกตัด 50% เพื่อทำนาย 1s และ 0s ฉันทำสิ่งนี้ไม่ได้เพราะแบบจำลองของฉันให้ค่าสูงสุด ~ 1% ดังนั้นเกณฑ์อาจอยู่ที่ 0.007 หรือที่ใดที่หนึ่งโดยรอบ ฉันเข้าใจROCเส้นโค้งและพื้นที่ใต้เส้นโค้งสามารถช่วยฉันเลือกระหว่างรุ่น LR สองชุดสำหรับชุดข้อมูลเดียวกันได้อย่างไร อย่างไรก็ตาม ROC ไม่ได้ช่วยฉันเลือกความน่าจะเป็นทางลัดที่เหมาะสมที่สามารถใช้ในการทดสอบแบบจำลองกับข้อมูลที่ไม่อยู่ในกลุ่มตัวอย่าง ฉันควรใช้ค่า cutoff ที่ลดmisclassification rateหรือไม่ ( http://www2.sas.com/proceedings/sugi31/210-31.pdf ) เพิ่ม -> สำหรับอัตราเหตุการณ์ที่ต่ำเช่นนี้อัตราการผิดพลาดของฉันได้รับผลกระทบจากผลบวกปลอมจำนวนมาก ในขณะที่อัตราโดยรวมนั้นดูดีเนื่องจากขนาดของจักรวาลทั้งหมดยังใหญ่ แต่แบบจำลองของฉันไม่ควรมีผลบวกผิด ๆ มากมาย (เพราะเป็นแบบจำลองการคืนทุน) 5/10 coeff มีความสำคัญ

4
ความรู้เบื้องต้นเกี่ยวกับสถิติที่ไม่ใช่พารามิเตอร์
ฉันเรียนสถิติมาสองปีที่ผ่านมา เกือบทุกอย่างที่ฉันได้เรียนรู้เกี่ยวกับสถิติเชิงพารามิเตอร์ ตอนนี้ฉันต้องการเรียนรู้เพิ่มเติมเกี่ยวกับสถิติที่ไม่ใช่พารามิเตอร์ ใครช่วยแนะนำสั้น ๆ (อาจจะอ่านได้ดี) แนะนำในพื้นที่นี้

3
อัลกอริทึมใดที่ฉันควรใช้เพื่อจัดกลุ่มชุดข้อมูลไบนารีขนาดใหญ่เป็นไม่กี่หมวดหมู่
ฉันมีเมทริกซ์ขนาดใหญ่ (650K แถว * 62 คอลัมน์) ของข้อมูลไบนารี (รายการ 0-1 เท่านั้น) เมทริกซ์ส่วนใหญ่จะกระจัดกระจาย: เติมประมาณ 8% ฉันต้องการจัดกลุ่มเป็น 5 กลุ่ม - พูดชื่อตั้งแต่ 1 ถึง 5 ฉันได้ลองจัดกลุ่มแบบลำดับชั้นและไม่สามารถจัดการขนาดได้ ฉันยังใช้อัลกอริทึมการจัดกลุ่ม k - หมายถึงการคำนวณระยะทางด้วยการคำนึงถึงเวกเตอร์บิต 650K ที่มีความยาว 62 ฉันไม่ได้ผลลัพธ์ที่เหมาะสมกับสิ่งเหล่านี้ กรุณาช่วย.

1
สูตรการประมาณค่าถดถอยแบบ Quantile
ฉันได้เห็นการเป็นตัวแทนที่แตกต่างกันสองแบบของตัวประมาณการถดถอยแบบควอไทล์ซึ่ง ได้แก่ Q(βq)=∑i:yi≥x′iβnq∣yi−x′iβq∣+∑i:yi&lt;x′iβn(1−q)∣yi−x′iβq∣Q(βq)=∑i:yi≥xi′βnq∣yi−xi′βq∣+∑i:yi&lt;xi′βn(1−q)∣yi−xi′βq∣Q(\beta_{q}) = \sum^{n}_{i:y_{i}\geq x'_{i}\beta} q\mid y_i - x'_i \beta_q \mid + \sum^{n}_{i:y_{i}< x'_{i}\beta} (1-q)\mid y_i - x'_i \beta_q \mid และ Q(βq)=∑i=1nρq(yi−x′iβq),ρq(u)=ui(q−1(ui&lt;0))Q(βq)=∑i=1nρq(yi−xi′βq),ρq(u)=ui(q−1(ui&lt;0))Q(\beta_q) = \sum^{n}_{i=1} \rho_q (y_i - x'_i \beta_q), \hspace{1cm} \rho_q(u) = u_i(q - 1(u_i < 0 )) ที่\ ใครช่วยบอกวิธีการแสดงความเท่าเทียมกันของการแสดงออกทั้งสองนี้? นี่คือสิ่งที่ฉันพยายามจนถึงตอนนี้โดยเริ่มจากนิพจน์ที่สองui=yi−x′iβqui=yi−xi′βqu_i = y_i - x'_i \beta_q คำถาม( βQ)= ∑i …

2
วิธีทั่วไปสำหรับการรับข้อผิดพลาดมาตรฐาน
ฉันไม่สามารถหาวิธีทั่วไปในการรับข้อผิดพลาดมาตรฐานได้ทุกที่ ฉันดูใน google เว็บไซต์นี้และแม้แต่ในตำราเรียน แต่สิ่งที่ฉันสามารถค้นหาได้คือสูตรข้อผิดพลาดมาตรฐานสำหรับค่าเฉลี่ยความแปรปรวนสัดส่วนสัดส่วนความเสี่ยง ฯลฯ ... และไม่ใช่ว่าสูตรเหล่านี้มาถึงอย่างไร หากร่างกายใด ๆ สามารถอธิบายได้ด้วยคำง่ายๆหรือแม้กระทั่งเชื่อมโยงฉันไปยังแหล่งข้อมูลที่ดีซึ่งอธิบายว่าฉันจะขอบคุณ

1
ช่วงความมั่นใจเปลี่ยนกลับ
เมื่อพบการสนทนานี้ฉันกำลังตั้งคำถามเกี่ยวกับการประชุมช่วงเปลี่ยนความมั่นใจ ตามบทความนี้ความครอบคลุมเล็กน้อยเปลี่ยนกลับ CI สำหรับความหมายของตัวแปรสุ่มเข้าสู่ระบบปกติคือ: UCL(X)=exp(Y+var(Y)2+zvar(Y)n+var(Y)22(n−1)−−−−−−−−−−−−√) UCL(X)=exp⁡(Y+var(Y)2+zvar(Y)n+var(Y)22(n−1))\ UCL(X)= \exp\left(Y+\frac{\text{var}(Y)}{2}+z\sqrt{\frac{\text{var}(Y)}{n}+\frac{\text{var}(Y)^2}{2(n-1)}}\right) LCL(X)=exp(Y+var(Y)2−zvar(Y)n+var(Y)22(n−1)−−−−−−−−−−−−√) LCL(X)=exp⁡(Y+var(Y)2−zvar(Y)n+var(Y)22(n−1))\ LCL(X)= \exp\left(Y+\frac{\text{var}(Y)}{2}-z\sqrt{\frac{\text{var}(Y)}{n}+\frac{\text{var}(Y)^2}{2(n-1)}}\right) / และไม่ใช่ naive /exp((Y)+zvar(Y)−−−−−−√)exp⁡((Y)+zvar(Y))\exp((Y)+z\sqrt{\text{var}(Y)}) ตอนนี้อะไรคือ CIs สำหรับการเปลี่ยนแปลงดังต่อไปนี้: x−−√x\sqrt{x}และx1/3x1/3x^{1/3} arcsin(x−−√)arcsin(x)\text{arcsin}(\sqrt{x}) log(x1−x)log⁡(x1−x)\log(\frac{x}{1-x}) 1/x1/x1/x วิธีการเกี่ยวกับช่วงเวลาความอดทนสำหรับตัวแปรสุ่มตัวเอง (ฉันหมายถึงค่าตัวอย่างเดียวที่สุ่มมาจากประชากร) มีปัญหาเดียวกันกับช่วงเปลี่ยนกลับหรือพวกเขาจะมีความคุ้มครองเล็กน้อย?

1
การประมาณพารามิเตอร์สำหรับการแจกแจงแบบเบ้ปกติ
พารามิเตอร์ formulaic มีการประมาณการสำหรับ skew-normal หรือไม่ ถ้าคุณทำได้มาจาก MLE หรือ Mom ก็ยอดเยี่ยมเช่นกัน ขอบคุณ แก้ไข ฉันมีชุดข้อมูลที่ฉันสามารถบอกได้ด้วยตาเปล่าโดยการแปลงจะเอียงไปทางซ้ายเล็กน้อย ฉันต้องการประเมินค่าเฉลี่ยและความแปรปรวนจากนั้นทำการทดสอบความเหมาะสม (ซึ่งเป็นสาเหตุที่ฉันต้องการค่าประมาณพารามิเตอร์) ฉันคิดถูกหรือไม่ว่าฉันแค่ต้องเดาความเบ้ (อัลฟา) (อาจจะทำแบบทดสอบหลายอย่างและแบบทดสอบที่ดีที่สุด?) ฉันต้องการ MLE ที่ได้มาเพื่อความเข้าใจของฉันเอง - ต้องการ MLE มากกว่า MoM เนื่องจากฉันคุ้นเคยกับมันมากกว่า ฉันไม่แน่ใจว่ามีการเอียงทั่วไปมากกว่าหนึ่งแบบปกติ - ฉันแค่หมายถึงค่าเฉลี่ยที่เอียงเล็กน้อย! หากเป็นไปได้การประมาณค่าพารามิเตอร์พลังงานแบบเลขชี้กำลังของเบ้จะเป็นประโยชน์เช่นกัน!

2
ความสำคัญของสัมประสิทธิ์สหสัมพันธ์เฉลี่ย
ข้อจำกัดความรับผิดชอบ: หากคุณพบว่าคำถามนี้คล้ายกับคำถามอื่นมากเกินไปฉันยินดีที่จะรวมเข้าด้วยกัน อย่างไรก็ตามฉันไม่พบคำตอบที่น่าพอใจที่อื่น (และยังไม่มี "ชื่อเสียง" ที่จะแสดงความคิดเห็นหรือ upvote) ดังนั้นฉันคิดว่ามันเป็นการดีที่สุดที่จะถามคำถามใหม่ด้วยตัวเอง คำถามของฉันคือสิ่งนี้ สำหรับวิชามนุษย์ 12 คนฉันได้คำนวณค่าสัมประสิทธิ์สหสัมพันธ์ (Spearman's rho) ระหว่าง 6 ระดับของตัวแปรอิสระ X และการสังเกตที่สอดคล้องกันของตัวแปรตาม Y (หมายเหตุ: ระดับของ X ไม่เท่ากันในทุกวิชา) สมมุติฐานว่างคือในประชากรทั่วไปความสัมพันธ์นี้เท่ากับศูนย์ ฉันได้ทดสอบสมมติฐานนี้สองวิธี: ใช้การทดสอบทีหนึ่งตัวอย่างในสัมประสิทธิ์สหสัมพันธ์ที่ได้รับจาก 12 วิชาของฉัน โดยการจัดศูนย์กลางของระดับ X และการสังเกตของ Y เช่นนั้นสำหรับผู้เข้าร่วมแต่ละคนค่าเฉลี่ย (X) = 0 และค่าเฉลี่ย (Y) = 0 จากนั้นคำนวณความสัมพันธ์กับข้อมูลรวม (72 ระดับของ X และ 72 การสังเกตของ Y) . …

3
เมื่อใดที่สี่เหลี่ยมจัตุรัสน้อยสุดเป็นความคิดที่ไม่ดี
ถ้าฉันมีรูปแบบการถดถอย: Y=Xβ+εY=Xβ+ε Y = X\beta + \varepsilon โดยที่ V[ε]=Id∈Rn×nV[ε]=Id∈Rn×n\mathbb{V}[\varepsilon] = Id \in \mathcal{R} ^{n \times n} และE[ε]=(0,…,0)E[ε]=(0,…,0)\mathbb{E}[\varepsilon]=(0, \ldots , 0) , เมื่อจะใช้βOLSβOLS\beta_{\text{OLS}} , สามัญสี่เหลี่ยมน้อยประมาณการของββ\betaเป็นทางเลือกที่ดีสำหรับการประมาณการ? ฉันกำลังพยายามหาตัวอย่างว่ากำลังสองน้อยที่สุดทำงานได้ไม่ดี ดังนั้นฉันกำลังมองหาการกระจายของข้อผิดพลาดที่เป็นไปตามสมมติฐานก่อนหน้า แต่ให้ผลลัพธ์ที่ไม่ดี หากครอบครัวของการกระจายจะถูกกำหนดโดยค่าเฉลี่ยและความแปรปรวนที่จะดี ถ้าไม่มันก็โอเค ฉันรู้ว่า "ผลลัพธ์ที่ไม่ดี" นั้นค่อนข้างคลุมเครือ แต่ฉันคิดว่าแนวคิดนี้เป็นที่เข้าใจได้ เพียงเพื่อหลีกเลี่ยงความสับสนฉันรู้ว่ากำลังสองน้อยที่สุดไม่เหมาะสมและมีตัวประมาณที่ดีกว่าเช่นการถดถอยสัน แต่นั่นไม่ใช่สิ่งที่ฉันตั้งใจ ฉันต้องการตัวอย่างว่ากำลังสองน้อยที่สุดจะผิดธรรมชาติ ฉันสามารถจินตนาการถึงสิ่งต่าง ๆ เช่นข้อผิดพลาดเวกเตอร์ϵϵ\epsilonอาศัยอยู่ในภูมิภาคที่ไม่มีการนูนของRnRn\mathbb{R}^nแต่ฉันไม่แน่ใจเกี่ยวกับสิ่งนั้น แก้ไข 1: เป็นแนวคิดที่จะช่วยให้คำตอบ (ซึ่งฉันไม่สามารถคิดวิธีการเพิ่มเติม) βOLSβOLS\beta_{\text{OLS}}เป็นสีน้ำเงิน ดังนั้นมันอาจช่วยให้คิดได้ว่าเมื่อตัวประมาณค่าที่ไม่เอนเอียงเชิงเส้นจะไม่เป็นความคิดที่ดี แก้ไข 2: ตามที่ไบรอันชี้ให้เห็นหากXX′XX′XX'นั้นมีเงื่อนไขที่ไม่ดีดังนั้นβOLSβOLS\beta_{\text{OLS}}เป็นความคิดที่ไม่ดีเพราะความแปรปรวนมีขนาดใหญ่เกินไปและควรใช้การถดถอยแบบริดจ์แทน ฉันสนใจมากขึ้นในการรู้ว่าการกระจายใดควรεε\varepsilonเพื่อให้สี่เหลี่ยมน้อยทำงานได้ไม่ดี βOLS∼β+(X′X)−1X′εβOLS∼β+(X′X)−1X′ε\beta_{\text{OLS}} …

1
SurveyMonkey เพิกเฉยต่อข้อเท็จจริงที่ว่าคุณได้รับตัวอย่างที่ไม่ใช่แบบสุ่มหรือไม่?
SurveyMonkey มีขั้นตอนและแผนภูมิสำหรับคุณในการหาขนาดตัวอย่างที่คุณต้องการสำหรับระยะขอบข้อผิดพลาดหรือช่วงความเชื่อมั่นที่กำหนดตามขนาดประชากรของคุณ ขนาดตัวอย่าง SurveyMonkey แผนภูมินี้ไม่สนใจความจริงที่ว่าคุณจะไม่ได้รับตัวอย่างแบบสุ่มเนื่องจากคุณจะได้รับเฉพาะผู้ที่สนใจตอบแบบสอบถามเท่านั้น ฉันได้รับคำเตือนเมื่อฉันพิมพ์สิ่งนี้ว่าคำถามดูเหมือนเป็นอัตวิสัยดังนั้นฉันอาจไม่ได้ถามอย่างถูกต้อง มันไม่ได้เกี่ยวกับ SurveyMonkey แต่เป็นคำถามทั่วไป - คุณสามารถคำนวณช่วงความมั่นใจจากข้อมูลการตอบกลับโดยสมัครใจโดยใช้เทคนิคขั้นสูงที่ฉันไม่รู้หรือไม่? ในการสำรวจความคิดเห็นหรือการสำรวจระดับชาติเห็นได้ชัดว่าพวกเขาจะต้องจัดการกับปัญหานี้ การศึกษาของฉันไม่ได้ครอบคลุมเทคนิคการสุ่มตัวอย่างแบบสำรวจในเชิงลึก แต่ฉันคิดว่ามันเกี่ยวข้องกับการรวบรวมข้อมูลประชากรและการใช้เพื่อทราบว่าตัวแทนตัวอย่างของคุณมีวิธีอย่างไร แต่นอกเหนือจากนั้นสำหรับการสำรวจออนไลน์อย่างง่ายพวกเขาเพียงแค่สมมติว่าคนที่ใส่ใจที่จะตอบสนองนั้นเป็นกลุ่มตัวอย่างแบบสุ่มของประชากรหรือไม่

3
องค์ประกอบหลักแรกไม่ได้แยกคลาส แต่พีซีเครื่องอื่นทำ เป็นไปได้อย่างไร?
ฉันใช้ PCA ใน 17 ตัวแปรเชิงปริมาณเพื่อให้ได้ชุดของตัวแปรที่มีขนาดเล็กลงซึ่งเป็นองค์ประกอบหลักที่จะใช้ในการเรียนรู้ของเครื่องภายใต้การดูแลเพื่อแบ่งอินสแตนซ์ออกเป็นสองชั้น หลังจาก PCA บัญชี PC1 คิดเป็น 31% ของความแปรปรวนของข้อมูล PC2 คิดเป็น 17%, PC3 คิดเป็น 10%, PC4 คิดเป็น 8%, PC5 คิดเป็น 7% และ PC6 คิดเป็น 6% อย่างไรก็ตามเมื่อฉันดูความแตกต่างของพีซีระหว่างสองคลาสน่าประหลาดใจที่ PC1 ไม่ได้แยกแยะระหว่างสองคลาสได้ดี พีซีที่เหลืออยู่เป็นตัวเลือกที่ดี นอกจากนี้ PC1 จะไม่เกี่ยวข้องเมื่อใช้ในต้นไม้ตัดสินใจซึ่งหมายความว่าหลังจากตัดแต่งกิ่งต้นไม้มันจะไม่ปรากฏแม้แต่ในต้นไม้ แผนผังประกอบด้วย PC2-PC6 มีคำอธิบายใด ๆ สำหรับปรากฏการณ์นี้หรือไม่? มันเป็นสิ่งที่ผิดปกติกับตัวแปรที่ได้รับหรือไม่?

1
การทดสอบอัตราส่วนความน่าจะเป็นและการทดสอบ Wald ให้ข้อสรุปที่แตกต่างกันสำหรับ glm ใน R
ฉันทำซ้ำเช่นจากทั่วไปเชิงเส้นและรูปแบบผสม MWE ของฉันอยู่ด้านล่าง: Dilution &lt;- c(1/128, 1/64, 1/32, 1/16, 1/8, 1/4, 1/2, 1, 2, 4) NoofPlates &lt;- rep(x=5, times=10) NoPositive &lt;- c(0, 0, 2, 2, 3, 4, 5, 5, 5, 5) Data &lt;- data.frame(Dilution, NoofPlates, NoPositive) fm1 &lt;- glm(formula=NoPositive/NoofPlates~log(Dilution), family=binomial("logit"), data=Data) summary(object=fm1) เอาท์พุต Call: glm(formula = NoPositive/NoofPlates ~ log(Dilution), family …

3
ระยะทางที่จะใช้? เช่น manhattan, euclidean, Bray-Curtis เป็นต้น
ฉันไม่ใช่นักนิเวศวิทยาชุมชน แต่วันนี้ฉันกำลังทำงานกับข้อมูลนิเวศวิทยาชุมชน สิ่งที่ฉันไม่เข้าใจนอกเหนือจากคณิตศาสตร์ของระยะทางเหล่านี้คือเกณฑ์สำหรับแต่ละระยะทางที่จะใช้และในสถานการณ์ที่สามารถนำไปใช้ได้ ตัวอย่างเช่นจะใช้กับข้อมูลการนับอย่างไร จะแปลงมุมความชันระหว่างสองตำแหน่งเป็นระยะทางได้อย่างไร หรืออุณหภูมิหรือปริมาณน้ำฝนที่สองสถานที่? สมมติฐานสำหรับแต่ละระยะทางคืออะไรและเมื่อใดที่เหมาะสม

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.