สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
ฉันจะจัดการกับข้อมูลที่ไม่มีอยู่หรือหายไปได้อย่างไร
ฉันลองวิธีการพยากรณ์และต้องการตรวจสอบว่าวิธีการของฉันถูกต้องหรือไม่ การศึกษาของฉันเปรียบเทียบกองทุนรวมประเภทต่าง ๆ ฉันต้องการใช้ดัชนี GCC เป็นเกณฑ์มาตรฐานสำหรับหนึ่งในนั้น แต่ปัญหาคือดัชนี GCC หยุดในเดือนกันยายน 2011 และการศึกษาของฉันอยู่ระหว่างมกราคม 2546 ถึงกรกฎาคม 2557 ดังนั้นฉันจึงพยายามใช้ดัชนีอื่นดัชนี MSCI เพื่อสร้างการถดถอยเชิงเส้น แต่ปัญหาคือว่าดัชนี MSCI ขาดข้อมูลตั้งแต่เดือนกันยายน 2010 เพื่อหลีกเลี่ยงสิ่งนี้ฉันได้ทำสิ่งต่อไปนี้ ขั้นตอนเหล่านี้ใช้ได้หรือไม่ ดัชนี MSCI ไม่มีข้อมูลสำหรับเดือนกันยายน 2010 ถึงกรกฎาคม 2012 ฉัน "ให้" โดยการใช้ค่าเฉลี่ยเคลื่อนที่สำหรับการสังเกตห้าครั้ง วิธีนี้ใช้ได้หรือไม่ ถ้าเป็นเช่นนั้นฉันควรใช้การสังเกตกี่ครั้ง หลังจากประเมินข้อมูลที่ขาดหายไปฉันทำการถดถอยของดัชนี GCC (เป็นตัวแปรตาม) กับดัชนี MSCI (เป็นตัวแปรอิสระ) สำหรับช่วงเวลาที่ใช้ร่วมกันได้ (ตั้งแต่มกราคม 2550 ถึงกันยายน 2554) จากนั้นแก้ไขโมเดลจากปัญหาทั้งหมด ในแต่ละเดือนฉันจะแทนที่ x ด้วยข้อมูลจากดัชนี MSCI …

2
คำจำกัดความที่แน่นอนของการวัด Deviance ในแพ็คเกจ glmnet พร้อม crossvalidation?
สำหรับการวิจัยปัจจุบันของฉันฉันใช้วิธี Lasso ผ่านแพ็คเกจ glmnet ใน R บนตัวแปรที่ขึ้นกับทวินาม ใน glmnet แลมบ์ดาที่ดีที่สุดจะพบได้ผ่านการตรวจสอบข้ามและแบบจำลองผลลัพธ์สามารถนำมาเปรียบเทียบกับมาตรการต่าง ๆ เช่นข้อผิดพลาดการแบ่งประเภทหรือการเบี่ยงเบน คำถามของฉัน: กำหนด deviance ใน glmnet อย่างไร มันคำนวณอย่างไร (ในกระดาษที่สอดคล้องกัน "เส้นทางการทำให้เป็นมาตรฐานสำหรับโมเดลเชิงเส้นทั่วไปผ่านพิกัดโคตร" โดย Friedman et al. ฉันพบเฉพาะความคิดเห็นนี้เกี่ยวกับการเบี่ยงเบนที่ใช้ใน cv.glmnet: "หมายถึงการเบี่ยงเบน (ลบสองเท่า ข้อมูล) "(หน้า 17))

3
การรับฟังก์ชั่นต้นทุนการถดถอยเชิงเส้นแบบปกติต่อหลักสูตรการเรียนรู้ของเครื่อง Coursera
ฉันใช้หลักสูตร "การเรียนรู้ของเครื่องจักร" ของ Andrew Ng ผ่านทาง Coursera เมื่อไม่กี่เดือนก่อนโดยไม่สนใจวิชาคณิตศาสตร์ / ภาควิชาส่วนใหญ่และมุ่งเน้นไปที่การนำไปใช้และการปฏิบัติจริง ตั้งแต่นั้นมาฉันเริ่มกลับไปศึกษาทฤษฎีพื้นฐานบางอย่างและกลับมาเยี่ยมการบรรยายของศ. อึ้งอีกครั้ง ฉันกำลังอ่านผ่านการบรรยายของเขาใน "Normalized Linear Regression" และเห็นว่าเขาให้ฟังก์ชั่นค่าใช้จ่ายต่อไปนี้: J(θ)=12m[∑i=1m(hθ(x(i))−y(i))2+λ∑j=1nθ2j]J(θ)=12m[∑i=1m(hθ(x(i))−y(i))2+λ∑j=1nθj2]J(\theta) = \frac{1}{2m}[\sum_{i=1}^m(h_\theta (x^{(i)}) - y^{(i)})^2 + \lambda\sum_{j=1}^n\theta^2_j] จากนั้นเขาให้การไล่ระดับสีต่อไปนี้สำหรับฟังก์ชันต้นทุนนี้: ∂∂θjJ(θ)=1m[∑i=1m(hθ(x(i))−y(i))x(i)j−λθj]∂∂θjJ(θ)=1m[∑i=1m(hθ(x(i))−y(i))xj(i)−λθj]\frac{\partial}{\partial \theta_j}J(\theta) = \frac{1}{m}[\sum_{i=1}^m(h_\theta (x^{(i)}) - y^{(i)})x^{(i)}_j - \lambda\theta_j] ฉันสับสนเล็กน้อยเกี่ยวกับวิธีการที่เขาได้รับจากที่หนึ่งไปยังอีกที่ เมื่อฉันพยายามทำรากศัพท์ของตัวเองฉันได้ผลลัพธ์ดังนี้: ∂∂θjJ(θ)=1m[∑i=1m(hθ(x(i))+y(i))x(i)j+λθj]∂∂θjJ(θ)=1m[∑i=1m(hθ(x(i))+y(i))xj(i)+λθj]\frac{\partial}{\partial \theta_j}J(\theta) = \frac{1}{m}[\sum_{i=1}^m(h_\theta (x^{(i)}) + y^{(i)})x^{(i)}_j + \lambda\theta_j] ความแตกต่างคือเครื่องหมาย 'บวก' ระหว่างฟังก์ชันต้นทุนดั้งเดิมและพารามิเตอร์การทำให้เป็นมาตรฐานในสูตรของ Prof. …

1
การทดสอบความสำคัญขึ้นอยู่กับความแม่นยำ / การเรียกคืน / F1
เป็นไปได้หรือไม่ที่จะทำการทดสอบอย่างมีนัยสำคัญโดยพิจารณาจากคะแนนความแม่นยำ / การเรียกคืน / F1 เท่านั้น ตัวอย่างเช่นหากคุณเจอ 2 ระบบในกระดาษซึ่งมีรายงาน P / R / F1 เท่านั้น (ในชุดข้อมูลเดียวกัน ฯลฯ ) คุณสามารถทำการทดสอบนัยสำคัญทางสถิติได้หรือไม่? ถ้าใช่มันเป็นเช่นไร?

1
กำหนดน้ำหนักให้กับตัวแปรในการวิเคราะห์คลัสเตอร์
ฉันต้องการกำหนดน้ำหนักที่แตกต่างให้กับตัวแปรในการวิเคราะห์คลัสเตอร์ของฉัน แต่โปรแกรมของฉัน (Stata) ดูเหมือนจะไม่มีตัวเลือกสำหรับสิ่งนี้ดังนั้นฉันต้องทำด้วยตนเอง ลองนึกภาพ 4 ตัวแปร A, B, C, D น้ำหนักสำหรับตัวแปรเหล่านั้นควรจะเป็น w(A)=50% w(B)=25% w(C)=10% w(D)=15% ฉันสงสัยว่าหนึ่งในสองวิธีต่อไปนี้จะทำเคล็ดลับได้หรือไม่: ก่อนอื่นฉันสร้างมาตรฐานให้กับตัวแปรทั้งหมด (เช่นตามช่วงของพวกเขา) จากนั้นฉันก็คูณตัวแปรมาตรฐานแต่ละตัวด้วยน้ำหนักของมัน จากนั้นทำการวิเคราะห์คลัสเตอร์ ฉันคูณตัวแปรทั้งหมดด้วยน้ำหนักของพวกเขาและทำให้เป็นมาตรฐานในภายหลัง จากนั้นทำการวิเคราะห์คลัสเตอร์ หรือความคิดทั้งสองเป็นเรื่องไร้สาระสมบูรณ์? [แก้ไข] อัลกอริทึมการจัดกลุ่ม (ฉันลอง 3 วิธีที่แตกต่างกัน) ที่ฉันต้องการใช้คือ k-mean, การเชื่อมโยงค่าเฉลี่ยถ่วงน้ำหนักและการเชื่อมโยงเฉลี่ย ฉันวางแผนที่จะใช้การเชื่อมโยงถัวเฉลี่ยถ่วงน้ำหนักเพื่อกำหนดจำนวนคลัสเตอร์ที่ดีซึ่งฉันเสียบเข้ากับ k-mean หลังจากนั้น
12 clustering  stata 

3
การตรวจจับค่าผิดปกติในชุดเล็กมาก
ฉันต้องได้ค่าที่ถูกต้องที่สุดเท่าที่จะเป็นไปได้สำหรับความสว่างของแหล่งกำเนิดแสงที่เสถียรเป็นหลักซึ่งให้ค่าความส่องสว่างตัวอย่างสิบสองค่า เซ็นเซอร์ไม่สมบูรณ์และแสงบางครั้งอาจ "กะพริบ" สว่างขึ้นหรือมืดลงซึ่งสามารถเพิกเฉยได้ดังนั้นฉันจึงจำเป็นต้องมีการตรวจจับในระยะไกล (ฉันคิดว่า?) ฉันได้อ่านวิธีการต่าง ๆ ที่นี่และไม่สามารถตัดสินใจได้ว่าจะใช้วิธีใด จำนวนของค่าผิดปกติไม่เคยทราบล่วงหน้าและมักจะเป็นศูนย์ โดยทั่วไปการสั่นไหวนั้นเป็นค่าเบี่ยงเบนขนาดใหญ่มากจากความสว่างที่คงที่ (เพียงพอที่จะยุ่งกับค่าเฉลี่ยที่ถ่ายด้วยของที่มีขนาดใหญ่) แต่ไม่จำเป็นต้องเป็นเช่นนั้น ต่อไปนี้เป็นตัวอย่างชุดการวัด 12 รายการสำหรับความสมบูรณ์ของคำถาม: 295.5214, 277.7749, 274.6538, 272.5897, 271.0733, 292.5856, 282.0986, 275.0419, 273.084, 273.1783, 274.0317, 290.1837 ความรู้สึกของฉันไม่น่าจะมีค่าผิดปกติในชุดนั้นแม้ว่า 292 และ 295 ดูสูงเล็กน้อย ดังนั้นคำถามของฉันคืออะไรวิธีที่ดีที่สุดที่นี่? ฉันควรพูดถึงว่าค่ามาจากการใช้ระยะทางแบบยุคลิดของส่วนประกอบ RG และ B ของแสงจากจุดศูนย์ (สีดำ) มันจะเจ็บปวดโดยทางโปรแกรม แต่เป็นไปได้ที่จะกลับไปใช้ค่าเหล่านี้หากจำเป็น ระยะทางแบบยุคลิดนั้นใช้เป็นตัวชี้วัดของ "ความแข็งแรงโดยรวม" เนื่องจากฉันไม่ได้สนใจสีแค่ความแรงของเอาท์พุท อย่างไรก็ตามมีโอกาสที่เหมาะสมที่กะพริบที่ฉันกล่าวถึงมีองค์ประกอบ RGB ที่แตกต่างกันไปยังเอาต์พุตปกติ ในขณะนี้ฉันกำลังเล่นกับฟังก์ชั่นบางอย่างที่จะทำซ้ำจนกว่าจะถึงการเป็นสมาชิกที่มั่นคงของมาตรการที่ได้รับอนุญาต: การหาค่าเบี่ยงเบนมาตรฐาน วางทุกอย่างไว้นอกพูด …

2
ค่าสัมประสิทธิ์สหสัมพันธ์ระหว่างตัวแปรที่กำหนด (ที่ไม่เป็นคู่) และเป็นตัวเลข (ช่วงเวลา) หรือตัวแปรลำดับ
ฉันได้อ่านทุกหน้าในเว็บไซต์นี้แล้วพยายามหาคำตอบสำหรับปัญหาของฉันแล้ว แต่ดูเหมือนว่าไม่มีใครที่เหมาะสมกับฉัน ... ก่อนอื่นฉันจะอธิบายให้คุณทราบถึงข้อมูลที่ฉันใช้กับ ... สมมติว่าฉันมีเวกเตอร์อาร์เรย์ที่มีชื่อเมืองหลายแห่งหนึ่งแห่งสำหรับผู้ใช้ 300 คน ฉันยังมีเวกเตอร์อาร์เรย์อีกชุดหนึ่งที่มีคะแนนตอบสนองต่อการสำรวจของผู้ใช้แต่ละคนหรือค่าต่อเนื่องสำหรับผู้ใช้แต่ละคน ฉันต้องการที่จะทราบว่ามีค่าสัมประสิทธิ์สหสัมพันธ์ที่คำนวณความสัมพันธ์ระหว่างตัวแปรทั้งสองนี้ดังนั้นระหว่างตัวแปรที่ระบุและตัวแปรที่เป็นตัวเลข / ต่อเนื่องหรือลำดับ ฉันค้นหาบนอินเทอร์เน็ตและในบางหน้าพวกเขาแนะนำให้ใช้ค่าสัมประสิทธิ์ฉุกเฉินหรือ Cramer's V หรือ Lambda สัมประสิทธิ์หรือ Eta สำหรับแต่ละวัดนี้เพียงแค่บอกว่าพวกเขาสามารถนำไปใช้กับข้อมูลดังกล่าวซึ่งเรามีตัวแปรที่ระบุและช่วงเวลาหรือตัวแปรที่เป็นตัวเลข สิ่งคือการค้นหาและการค้นหาพยายามที่จะทำความเข้าใจกับทุกคนบางครั้งมีการเขียนหรือดูตัวอย่างที่พวกเขามีเหตุผลที่จะใช้พวกเขาหากคุณมีตัวแปรที่ระบุไว้แยกออกเป็นสองส่วนยกเว้น Cramer's V เวลาอื่นไม่ได้เขียนข้อกำหนดใด ๆ ประเภทของข้อมูล มีอีกหลายหน้าที่บอกว่าถูกต้องที่จะใช้การถดถอยแทนนั่นคือถูกต้อง แต่ฉันแค่อยากจะรู้ว่ามีสัมประสิทธิ์เช่น pearson / spearman สำหรับข้อมูลประเภทนี้หรือไม่ ฉันยังคิดว่ามันไม่ถูกต้องที่จะใช้ Spearman Correlation coeff เนื่องจากเมืองต่างๆไม่สามารถจัดเรียงได้ ฉันได้สร้างฟังก์ชันของ Cramer'sV และ Eta ด้วยตัวเอง (ฉันทำงานกับ Matlab) แต่สำหรับ Eta พวกเขาไม่ได้พูดถึง p-value ใด ๆ …

2
เมื่อไร (ถ้าเคย) มันเป็นความคิดที่ดีที่จะทำการวิเคราะห์พลังงานหลังฉาก?
ความเข้าใจของฉันคือว่าการวิเคราะห์พลังงานจะโพสต์เฉพาะกิจถ้าหากใช้ขนาดผลกระทบที่สังเกตได้เป็นขนาดผลกระทบประชากรเป้าหมาย

2
ตัวอย่างง่ายๆที่แสดงให้เห็นถึงข้อดีของรูปแบบเฉลี่ยของ Bayesian (BMA)
ฉันกำลังผสมผสานวิธีการแบบเบอเซียนโมเดลเฉลี่ย (BMA) ในการวิจัยของฉันและอีกไม่นานจะมีการนำเสนอเกี่ยวกับงานของฉันกับเพื่อนร่วมงานของฉัน อย่างไรก็ตาม BMA ไม่ได้เป็นที่รู้จักกันดีในสาขาของฉันดังนั้นหลังจากนำเสนอพวกเขาด้วยทฤษฎีทั้งหมดและก่อนที่จะนำไปใช้กับปัญหาของฉันจริง ๆ ฉันต้องการนำเสนอตัวอย่างที่เรียบง่ายและให้คำแนะนำเกี่ยวกับสาเหตุที่ BMA ทำงาน ฉันกำลังคิดเกี่ยวกับตัวอย่างง่าย ๆ ที่มีสองแบบให้เลือก แต่แบบจำลองการสร้างข้อมูลที่แท้จริง (DGM) นั้นอยู่ที่ไหนสักแห่งในระหว่างนั้นและหลักฐานไม่ได้ให้ประโยชน์อย่างใดอย่างหนึ่งกับพวกเขา ดังนั้นหากคุณเลือกหนึ่งและดำเนินการต่อจากพวกเขาคุณจะไม่สนใจความไม่แน่นอนของแบบจำลองและทำผิดพลาด แต่ BMA ถึงแม้ว่าตัวแบบที่แท้จริงไม่ได้เป็นส่วนหนึ่งของชุดแบบจำลองอย่างน้อยก็ให้ความหนาแน่นหลังพารามิเตอร์ที่น่าสนใจ ตัวอย่างเช่นมีการพยากรณ์อากาศสองครั้งในแต่ละวัน (A และ B) และต้องการพยากรณ์อากาศที่ดีที่สุดดังนั้นในสถิติแบบดั้งเดิมคุณจะต้องพยายามค้นหาพยากรณ์ที่ดีที่สุดระหว่างสองคนนี้ แต่จะเป็นอย่างไรหากความจริงอยู่ที่ไหนสักแห่งระหว่าง (นั่นคือบางครั้ง A ถูกต้องบางครั้ง B) แต่ฉันทำมันไม่เป็นทางการ บางอย่างเช่นนั้น แต่ฉันเปิดกว้างต่อความคิด ฉันหวังว่าคำถามนี้เฉพาะเจาะจงมาก! ในวรรณคดีฉันไม่พบตัวอย่างที่ดีจากสิ่งที่ฉันได้อ่าน: Kruschke (2011)ในขณะที่การแนะนำที่ดีเกี่ยวกับสถิติ Bayesian ไม่ได้มุ่งเน้นไปที่ BMA อย่างแท้จริงและตัวอย่างการโยนเหรียญที่เขามีในบทที่ 4 นั้นยอดเยี่ยมสำหรับการแนะนำสถิติ Bayesian แต่ไม่ได้โน้มน้าวให้นักวิจัยคนอื่นใช้ BMA ("ทำไมฉันถึงมีสามรุ่นอีกครั้งหนึ่งพูดว่าเหรียญยุติธรรมและสองคนบอกว่ามันลำเอียงในทิศทางใดทิศทางหนึ่ง?") สิ่งอื่น ๆ ทั้งหมดที่ฉันอ่าน …


1
ตัวประมาณความน่าจะเป็นสูงสุด - ช่วงความมั่นใจ
ฉันจะสร้างช่วงความมั่นใจแบบซีมโทติคสำหรับพารามิเตอร์จริงโดยเริ่มจาก MLE สำหรับพารามิเตอร์นั้นได้อย่างไร

2
การตีความโมเดลการถดถอยโลจิสติกด้วยตัวทำนายหลายตัว
ฉันทำการถดถอยโลจิสติกหลายตัวแปรโดยมีตัวแปรตามYเป็นตายที่บ้านพักคนชราภายในระยะเวลาหนึ่งของรายการและได้รับผลลัพธ์ดังต่อไปนี้ (โปรดทราบว่าตัวแปรเริ่มในAมันเป็นค่าอย่างต่อเนื่องในขณะที่เริ่มต้นBเป็นหมวดหมู่): Call: glm(Y ~ A1 + B2 + B3 + B4 + B5 + A6 + A7 + A8 + A9, data=mydata, family=binomial) Deviance Residuals: Min 1Q Median 3Q Max -1.0728 -0.2167 -0.1588 -0.1193 3.7788 Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 20.048631 6.036637 3.321 0.000896 *** A1 …
12 r  regression  logistic 

1
MLE สำหรับการกระจายสามเหลี่ยม?
เป็นไปได้หรือไม่ที่จะใช้ขั้นตอน MLE ปกติกับการแจกแจงสามเหลี่ยม? - ฉันกำลังพยายาม แต่ฉันดูเหมือนจะถูกบล็อกในขั้นตอนเดียวหรืออย่างอื่นในวิชาคณิตศาสตร์ตามวิธีการแจกแจงที่กำหนดไว้ ฉันพยายามใช้ความจริงที่ว่าฉันรู้จำนวนตัวอย่างด้านบนและด้านล่าง c (โดยไม่รู้ตัว c): ตัวเลขทั้งสองนี้คือ cn และ (1-c) n หาก n คือจำนวนตัวอย่างทั้งหมด อย่างไรก็ตามดูเหมือนว่าจะไม่ได้ช่วยในการสืบมา ช่วงเวลาของช่วงเวลาให้ตัวประมาณค่าสำหรับ c โดยไม่มีปัญหามาก อะไรคือลักษณะที่แน่นอนของการอุดตันของ MLE ที่นี่ (ถ้ามี) รายละเอียดเพิ่มเติม: ลองพิจารณาในและการแจกแจงที่นิยามไว้ในโดย: [ 0 , 1 ] [ 0 , 1 ]คคc[ 0 , 1 ][0,1][0,1][ 0 , 1 ][0,1][0,1] ฉ( x ; c …

1
ฟังก์ชัน "ค่าเริ่มต้น" ในฟังก์ชัน glm () คืออะไร
สิ่งที่เป็นพารามิเตอร์start, etastart, mustartในGLM () ฟังก์ชั่น ? ฉันได้ดูเอกสารและอินเทอร์เน็ต แต่ฉันไม่พบคำอธิบายที่ชัดเจนว่ามันหมายถึงอะไร มันคล้ายกับ Bayesian "ค่าเริ่มต้น" สำหรับกลุ่ม แต่ฉันสงสัยว่ามันเกี่ยวข้องกับเนื่องจากฟังก์ชัน glm () ใน R เป็นสถิติที่ใช้บ่อย ...

3
ความแปรปรวนร่วม - เมทริกซ์ความแปรปรวนร่วมของข้อผิดพลาดในการถดถอยเชิงเส้น
เมทริกซ์ข้อผิดพลาด var / cov คำนวณโดยใช้ชุดการวิเคราะห์ทางสถิติในทางปฏิบัติอย่างไร แนวคิดนี้ชัดเจนสำหรับฉันในทางทฤษฎี แต่ไม่ใช่ในทางปฏิบัติ ฉันหมายถึงถ้าฉันมีเวกเตอร์ของตัวแปรสุ่มฉันเข้าใจว่าความแปรปรวน / ความแปรปรวนร่วมเมทริกซ์Σจะได้รับผลิตภัณฑ์ภายนอกของความเบี่ยงเบนจาก --- เวกเตอร์เฉลี่ย: Σ = E [ ( X - E ( X ) ) ( X - E ( X ) ) ⊤ ]X =( X1, X2, … , Xn)⊤X=(X1,X2,…,Xn)⊤\textbf{X}=(X_{1}, X_{2}, \ldots, X_{n})^\topΣΣ\SigmaΣ = E [ ( X - E …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.