สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
การแปลง r เป็นฟิชเชอร์ซีมีประโยชน์ต่อการวิเคราะห์อภิมานหรือไม่?
โดยปกติจะถูกแปลงเป็น Fisher zเพื่อทดสอบความแตกต่างระหว่างค่าrสองค่า แต่เมื่อต้องทำการวิเคราะห์เมตาดาต้าทำไมเราควรทำตามขั้นตอนดังกล่าว มันถูกต้องสำหรับข้อผิดพลาดในการวัดหรือข้อผิดพลาดที่ไม่ใช่การสุ่มตัวอย่างและทำไมเราควรสันนิษฐานว่าrเป็นการประมาณค่าที่ไม่สมบูรณ์ของสหสัมพันธ์ของประชากรrrrzzzrrrrrr

1
ติดตั้ง Poisson GLM ใน R - ปัญหาเกี่ยวกับอัตราเทียบกับจำนวน
ขณะนี้ฉันกำลังทำงานในโครงการที่เกี่ยวข้องกับ GLM (และในที่สุดเกม) ของการนับจำนวนข้อมูลเมื่อเวลาผ่านไป โดยปกติฉันจะทำสิ่งนี้ใน SAS แต่ฉันพยายามย้ายไปที่ R และมีปัญหา ... เมื่อฉันพอดีกับ GLM เพื่อนับข้อมูลโดยใช้สิ่งต่อไปนี้: cdi_model <- glm(counts ~ exposure + covariate + month, data=test, family = poisson) ฉันเข้าใจ: Deviance Residuals: Min 1Q Median 3Q Max -1.9825 -0.7903 -0.1187 0.5717 1.7649 Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 1.97563 0.20117 9.821 …

2
"ข้อมูลหน่วยก่อน" คืออะไร
ฉันได้อ่าน Wagenmakers (2007) วิธีการแก้ปัญหาการปฏิบัติเพื่อให้ปัญหาที่แพร่หลายของค่าพี ฉันรู้สึกทึ่งกับการแปลงค่า BIC ให้เป็นปัจจัยและความน่าจะเป็นของเบย์ อย่างไรก็ตามจนถึงตอนนี้ฉันยังไม่เข้าใจว่าข้อมูลหน่วยก่อนหน้าเป็นอย่างไร ฉันจะขอบคุณสำหรับคำอธิบายเกี่ยวกับรูปภาพหรือรหัส R เพื่อสร้างรูปภาพของสิ่งนี้ก่อนหน้านี้

4
ผู้คนในลอตเตอรี่เลือกตัวเลขใดน่าจะเป็นอย่างน้อย
ล้านล้านมากกว่า $ 500 ล้านวันนี้ ฉันจำการอ่านกระดาษ JSTOR เกี่ยวกับตัวเลขบางตัวที่ไม่น่าจะเลือกได้มากที่สุด ตัวอย่างเช่นผู้คนจำนวนมากเลือก 7 เพราะเป็นเลขนำโชคของพวกเขาและฉันต้องการตรงกันข้าม อย่างไรก็ตามการเป็นสมาชิก JSTOR ของฉันหมดลงแล้ว ตัวเลขใดที่ผู้คนเลือกลอตเตอรี่เป็นอย่างน้อยในการเลือกลอตเตอรี่จากตัวเลขระหว่าง 1 ถึง 80 หมายเหตุ:แต่ละหมายเลขมีโอกาสเท่ากันในการเลือก ฉันต้องการเลือกหมายเลขที่ไม่มีใครทำดังนั้นฉันไม่ต้องแบ่งปันรางวัลกับใครถ้าฉันชนะ

1
เปรียบเทียบความพอดีของโมเดลกับการตอบสนองที่เปลี่ยนแปลงและไม่แปลงรูปแบบ
ฉันต้องการเปรียบเทียบข้อมูลที่มีสัดส่วนระหว่างกลุ่มต่าง ๆ สามกลุ่มเช่น: ID Group Prop.Nitrogen 1 A 0.89 2 A 0.85 3 B 0.92 4 B 0.97 ติดตาม Wharton และ Hui (ดอย: 10.1890 / 10-0340.1 1 ) ฉันว่าฉันจะดูว่าข้อมูลเหล่านี้จะจัดการกับการใช้ logit ที่ดีขึ้นหรือไม่ เมื่อฉันดูพล็อตการวินิจฉัยสำหรับตัวแบบเชิงเส้นบนข้อมูลที่ถูกแปลงและไม่ถูกแปลงพวกมันดูคล้ายกันมากโดยไม่มีปัญหาที่ชัดเจนและมีความแตกต่างเพียงเล็กน้อยในพารามิเตอร์ที่ประมาณไว้ อย่างไรก็ตามฉันยังต้องการที่จะพูดอะไรบางอย่างเกี่ยวกับรูปแบบที่เหมาะกับข้อมูลที่ถูกแปลงและไม่มีการแปลงรูปแบบได้อย่างไร - ฉันรู้ว่าฉันไม่สามารถเปรียบเทียบค่า AIC ได้โดยตรง มีการแก้ไขและฉันสามารถตรวจสอบสิ่งนี้ได้หรือไม่? หรือฉันควรจะใช้วิธีการที่แตกต่างกันอย่างไร

1
ฉันจะพิสูจน์ได้อย่างไรว่าฟังก์ชั่นการแจกแจงสะสมนั้นต่อเนื่องใช่ไหม?
ฉันได้เรียนรู้ในหลักสูตรความน่าจะเป็นที่ฟังก์ชันการแจกแจงสะสมของตัวแปรสุ่มนั้นต่อเนื่องกัน เป็นไปได้ที่จะพิสูจน์ว่า?XFFFXXX

2
จะคำนวณอัตราอันตรายที่คาดการณ์จากแบบจำลอง Cox PH ได้อย่างไร
ฉันมีโมเดล Cox PH ต่อไปนี้: (เวลา, กิจกรรม) ~ X + Y + Z ฉันต้องการที่จะได้รับอันตรายจากการคาดการณ์อัตรา (ฉันพูดคุยเกี่ยวกับอัตราการเกิดอันตรายไม่อัตราส่วนอันตราย) ได้รับค่าเฉพาะของX, ,Y Zฉันรู้ว่าแพ็คเกจ muhaz Rสามารถคำนวณอัตราอันตรายที่สังเกตได้ แต่ฉันสนใจในแบบจำลองที่ทำนายไว้ มีวิธีทำเช่นนี้ใน R หรือไม่?
11 r  survival  hazard  cox-model 

3
PCA แบบฝึกหัดช่วยสอนพร้อมข้อมูล
การค้นหาอินเทอร์เน็ตสำหรับการสอนแบบ PCA ให้ผลลัพธ์นับพันรายการ (แม้แต่วิดีโอ) บทเรียนจำนวนมากดีมาก แต่ฉันไม่สามารถหาตัวอย่างที่ใช้งานได้จริงใด ๆ ที่มีการอธิบาย PCA โดยใช้ชุดข้อมูลบางอย่างที่ฉันสามารถใช้สำหรับการสาธิต ฉันต้องการการสอนที่มีชุดข้อมูลขนาดเล็กซึ่งง่ายต่อการพล็อต (ไม่ใช่ 10,000 บรรทัดของข้อมูลที่มีมิติ 100s) ก่อนและหลังการวิเคราะห์ PCA และสามารถแสดงความแตกต่าง / ผลลัพธ์ได้อย่างชัดเจน (ฉันคิดว่าตัวอย่างการใช้งานจริงแบบทีละขั้นตอนโดยมีข้อมูลที่มีประมาณ 100 บรรทัดและ 3 มิตินั้นยอดเยี่ยม) คุณมีข้อเสนอแนะหรือไม่?

1
การเลือกคุณสมบัติอัตโนมัติสำหรับการตรวจจับความผิดปกติ
วิธีที่ดีที่สุดในการเลือกคุณสมบัติโดยอัตโนมัติสำหรับการตรวจจับความผิดปกติคืออะไร? ผมปกติการรักษาความผิดปกติของการตรวจสอบเป็นขั้นตอนวิธีการที่คุณสมบัติที่ได้รับการคัดเลือกโดยผู้เชี่ยวชาญของมนุษย์: สิ่งที่สำคัญคือการส่งออกช่วง (ในขณะที่ "การป้อนข้อมูลที่ผิดปกติ - ส่งออกผิดปกติ") ดังนั้นแม้จะมีคุณสมบัติหลายอย่างที่คุณสามารถมากับชุดย่อยขนาดเล็กมากโดยการรวม คุณสมบัติ. อย่างไรก็ตามสมมติว่าในกรณีทั่วไปรายการคุณลักษณะอาจมีขนาดใหญ่บางทีการเรียนรู้แบบอัตโนมัติบางครั้งก็เป็นที่นิยมกว่า เท่าที่ฉันเห็นมีความพยายามบางอย่าง: "การเลือกคุณสมบัติอัตโนมัติสำหรับการตรวจจับความผิดปกติ" ( pdf ) ซึ่งสรุปคำอธิบายข้อมูลเวกเตอร์สนับสนุน "ระบบตรวจจับการบุกรุกบนโฮสต์ที่รวดเร็วโดยใช้ทฤษฎีการตั้งค่าแบบคร่าวๆ" (ไม่มีไฟล์ PDF ให้ใช้?) ซึ่งฉันเดาว่าใช้ทฤษฎีการตั้งค่าแบบหยาบ "กฎการเรียนรู้สำหรับการตรวจจับความผิดปกติของการรับส่งข้อมูลเครือข่ายที่ไม่เป็นมิตร" ( pdf , วิดีโอ ) ซึ่งใช้วิธีการทางสถิติ ดังนั้นตอนนี้ฉันสงสัยว่าใครสามารถบอกได้ - สมมติว่ามีการตรวจจับความผิดปกติและชุดคุณลักษณะที่มีขนาดใหญ่มาก (หลายร้อย?): ฟีเจอร์ที่ยิ่งใหญ่เหล่านี้เหมาะสมหรือไม่? เราไม่ควรลดคุณสมบัติที่ตั้งไว้พูดสองสามสิบแล้วใช่มั้ย หากชุดคุณลักษณะขนาดใหญ่เข้ากันได้อย่างใดอย่างหนึ่งในวิธีการด้านบนจะให้การคาดการณ์ที่ดีขึ้นและทำไม? มีอะไรที่ไม่ได้ระบุไว้ซึ่งดีกว่ามาก? ทำไมพวกเขาควรให้ผลลัพธ์ที่ดีกว่าเมื่อเปรียบเทียบกับพูดลดขนาดหรือสร้างโครงสร้างผ่านการจัดกลุ่ม / อันดับ / ฯลฯ

2
Drosophila ของ AI คืออะไรตอนนี้
ในช่วงกลางทศวรรษที่ 1960 นักวิจัยได้อ้างถึงหมากรุกว่า " Drosophila of AI" ที่มีชื่อเสียง: เหมือนแมลงวันผลไม้เกมหมากรุกสามารถเข้าถึงได้และเป็นปัญหาที่ค่อนข้างง่ายที่จะทำการทดลอง ตอนนี้ผู้คนดูเหมือนจะพูดว่า "หมากรุกเป็นเพียงปัญหาการค้นหา" และ "วิธีหมากรุกจะให้ความสนใจต่อชุมชน AI เพียงเล็กน้อย" ดังนั้นสิ่งที่เป็นแมลงหวี่ของ AI ตอนนี้หรือไม่

4
น้ำหนักเบต้าแบบมาตรฐานสำหรับการถดถอยหลายระดับ
เราจะได้น้ำหนักที่ถดถอยแบบมาตรฐาน (เอฟเฟกต์คงที่) จากการถดถอยหลายระดับได้อย่างไร และในฐานะ "Add-on": วิธีที่ง่ายที่สุดในการรับน้ำหนักมาตรฐานเหล่านี้จากmer-object คืออะไร (จากlmerฟังก์ชั่นของlme4แพ็คเกจในR)

4
เป็นไปได้ที่จะได้รับ ANN ที่ดีขึ้นโดยการลบการเชื่อมต่อบางอย่าง?
ฉันสงสัยว่าในบางสถานการณ์มีความเป็นไปได้ที่ ANN จะทำงานได้ดีขึ้นหรือไม่ถ้าคุณตัดการเชื่อมต่อบางอย่างกับพวกเขาเป็นตัวอย่าง: สร้าง ANN หนึ่งอันโดยใช้ A และ B หลายชั้นของ ANN แบบสองชั้นในแบบคู่ขนาน (โหนดอินพุตและเอาต์พุตเดียวกัน) เพิ่มการเชื่อมต่อ "การสื่อสาร" สองสามอย่างระหว่างเลเยอร์ A และ B ที่ซ่อนอยู่? เราจะได้ผลลัพธ์ที่ดีกว่า นี่ใช้ในทางปฏิบัติหรือไม่ใช้แค่เครือข่ายที่เชื่อมต่อแบบหลายชั้นเสมอ

1
ผ้าห่มมาร์คอฟเทียบกับการพึ่งพาปกติในเครือข่ายแบบเบย์
ในขณะที่ฉันกำลังอ่านเกี่ยวกับเครือข่ายแบบเบย์ฉันพบคำว่า " ผ้าห่มมาร์คอฟ " และสับสนอย่างมากกับความเป็นอิสระในกราฟเครือข่ายแบบเบย์ ผ้าห่มมาร์คอฟกล่าวสั้น ๆ ว่าทุกโหนดขึ้นอยู่กับพ่อแม่เด็กและพ่อแม่ของเด็กเท่านั้น [เป็นพื้นที่สีเทาสำหรับโหนด A ในภาพ] ความน่าจะเป็นร่วมของ BN,คืออะไร?P( M, S, G , I, B , R )P(M,S,G,I,B,R)P(M,S,G,I,B,R) (ที่มา: aiqus.com ) ถ้าฉันทำตามขั้นตอนผู้ปกครองเท่านั้นกฎความเป็นอิสระก็คือ P( M| S) P( S| G,I) P( ฉัน| B)P( R | B ) P( G ) P( B )P(M|S)P(S|G,I)P(I|B)P(R|B)P(G)P(B) P(M | S)P(S | G,I)P(I …

4
วิธีการแนวความคิดข้อผิดพลาดในรูปแบบการถดถอยหรือไม่?
ฉันกำลังเข้าร่วมชั้นเรียนวิเคราะห์ข้อมูลและแนวคิดที่หยั่งรากลึกของฉันบางอย่างกำลังสั่นไหว ความคิดที่ว่าข้อผิดพลาด (เอปไซลอน) รวมถึงความแปรปรวนประเภทอื่น ๆ นั้นมีผลเฉพาะกับ (ฉันคิดว่า) กับกลุ่ม (ตัวอย่างหรือประชากรทั้งหมด) ตอนนี้เรากำลังได้รับการสอนว่าหนึ่งในสมมติฐานการถดถอยคือความแปรปรวนคือ "เหมือนกันสำหรับทุกคน" นี่เป็นเรื่องที่ทำให้ฉันตกใจ ฉันคิดเสมอว่ามันเป็นความแปรปรวนใน Y ที่สอดคล้องกับค่าทั้งหมดของ X ที่คิดว่าคงที่ ฉันได้คุยกับศาสตราจารย์ผู้ซึ่งบอกฉันว่าเมื่อเราถดถอยเราคิดว่าแบบจำลองของเราเป็นจริง และฉันคิดว่านั่นเป็นส่วนที่ยุ่งยาก สำหรับฉันคำว่าข้อผิดพลาด (epsilon) หมายถึงบางสิ่งบางอย่างเช่น "องค์ประกอบใดก็ตามที่เราไม่ทราบและอาจส่งผลต่อตัวแปรผลลัพธ์ของเรารวมถึงข้อผิดพลาดในการวัด" ในวิธีการสอนในชั้นเรียนไม่มีสิ่งเช่น "สิ่งอื่น ๆ "; แบบจำลองของเราถือว่าเป็นจริงและสมบูรณ์ ซึ่งหมายความว่าการเปลี่ยนแปลงส่วนที่เหลือทั้งหมดจะต้องถูกคิดว่าเป็นผลมาจากความผิดพลาดในการวัด ฉันรู้สึกว่ามีบางอย่างผิดปกติฉันอยากจะมีความเห็นจากผู้เชี่ยวชาญเกี่ยวกับเรื่องนี้ ... มีห้องสำหรับการตีความหรือไม่ว่าคำผิดพลาดคืออะไร

2
ระยะขอบของข้อผิดพลาดเกี่ยวข้องกับช่วงความมั่นใจอย่างไร
ใครสามารถบอกความแตกต่างระหว่างระยะขอบของข้อผิดพลาดและช่วงความมั่นใจได้หรือไม่ บนอินเทอร์เน็ตฉันเห็นความหมายทั้งสองนี้ถูกใช้แทนกันได้ พูดถูกไหม "ช่วงความเชื่อมั่นจะแสดงเป็น 1.96 และแสดงบนกราฟเป็นระยะขอบข้อผิดพลาด"?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.