สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
การวัดการพึ่งพาแบบไม่เชิงเส้น
ความแปรปรวนร่วมระหว่างตัวแปรสุ่มสองตัวกำหนดการวัดว่าพวกมันเกี่ยวข้องกันอย่างไร แต่จะเกิดอะไรขึ้นถ้าการกระจายข้อต่อเป็นแบบวงกลม? แน่นอนว่ามีโครงสร้างในการกระจาย โครงสร้างนี้ถูกดึงออกมาได้อย่างไร?

2
วิธีการวาดพล็อตปฏิสัมพันธ์ที่มีช่วงความมั่นใจได้อย่างไร
ความพยายามของฉัน: ฉันไม่สามารถรับช่วงความมั่นใจได้ interaction.plot() และในทางตรงกันข้ามplotmeans()จากแพ็คเกจ 'gplot' จะไม่แสดงกราฟสองกราฟ นอกจากนี้ฉันไม่สามารถกำหนดplotmeans()กราฟสองกราฟที่ด้านบนของอีกอันหนึ่งได้เนื่องจากโดยค่าเริ่มต้นแกนจะแตกต่างกัน ฉันประสบความสำเร็จในการใช้plotCI()จากแพ็คเกจ 'gplot' และวางกราฟสองตัวไว้ แต่การจับคู่ของแกนยังไม่สมบูรณ์ คำแนะนำเกี่ยวกับวิธีการทำพล็อตการโต้ตอบกับช่วงความมั่นใจ? ทั้งโดยฟังก์ชั่นเดียวหรือคำแนะนำเกี่ยวกับวิธีการวางซ้อนplotmeans()หรือplotCI()กราฟ ตัวอย่างรหัส br=structure(list(tangle = c(140L, 50L, 40L, 140L, 90L, 70L, 110L, 150L, 150L, 110L, 110L, 50L, 90L, 140L, 110L, 50L, 60L, 40L, 40L, 130L, 120L, 140L, 70L, 50L, 140L, 120L, 130L, 50L, 40L, 80L, 140L, 100L, 60L, 70L, …

4
การศึกษามีความหมายมากเกินไปหมายความว่าอย่างไร
การศึกษามีความหมายมากเกินไปหมายความว่าอย่างไร ความประทับใจของฉันคือมันหมายความว่าขนาดตัวอย่างของคุณมีขนาดใหญ่มากจนคุณมีอำนาจในการตรวจจับขนาดเอฟเฟกต์จิ๋ว ขนาดของเอฟเฟกต์เหล่านี้อาจมีขนาดเล็กจนพวกมันมีแนวโน้มที่จะเป็นผลมาจากความเอนเอียงเล็กน้อยในกระบวนการสุ่มตัวอย่างมากกว่าการเชื่อมต่อเชิงสาเหตุ (ไม่จำเป็นโดยตรง) ระหว่างตัวแปร นี่เป็นสัญชาตญาณที่ถูกต้องหรือไม่? ถ้าเป็นเช่นนั้นฉันไม่เห็นว่าเรื่องใหญ่คืออะไรตราบใดที่ผลลัพธ์ถูกตีความในแสงนั้นและคุณตรวจสอบด้วยตนเองและดูว่าขนาดของเอฟเฟกต์โดยประมาณนั้นใหญ่พอที่จะ "มีความหมาย" หรือไม่ ฉันพลาดอะไรไปรึเปล่า? มีข้อเสนอแนะที่ดีกว่าว่าจะทำอย่างไรในสถานการณ์นี้?

4
วิธีการสร้างเมทริกซ์สหสัมพันธ์แบบสุ่มที่มีการแจกแจงแบบเส้นทแยงมุมประมาณปกติโดยมีค่าเบี่ยงเบนมาตรฐานที่กำหนด
ฉันต้องการสร้างเมทริกซ์สหสัมพันธ์แบบสุ่มเพื่อให้การกระจายตัวขององค์ประกอบนอกแนวทแยงดูเหมือนประมาณปกติ ฉันจะทำมันได้อย่างไร แรงจูงใจคือสิ่งนี้ สำหรับชุดข้อมูลอนุกรมเวลาการแจกแจงความสัมพันธ์มักจะใกล้เคียงกับปกติ ฉันต้องการสร้างเมทริกซ์สหสัมพันธ์ "ปกติ" จำนวนมากเพื่อเป็นตัวแทนของสถานการณ์ทั่วไปและใช้เพื่อคำนวณจำนวนความเสี่ยงnnn ฉันรู้วิธีการหนึ่ง แต่ส่วนเบี่ยงเบนมาตรฐานที่เกิดขึ้น (จากการกระจายตัวขององค์ประกอบนอกแนวทแยงมุม) มีขนาดเล็กเกินไปสำหรับจุดประสงค์ของฉัน: สร้างแถวสม่ำเสมอหรือแบบสุ่มปกติของเมทริกซ์มาตรฐานแถว (ลบค่าเฉลี่ย หารด้วยค่าเบี่ยงเบนมาตรฐาน) จากนั้นเมทริกซ์สหสัมพันธ์ตัวอย่างมีการแจกแจงรายการแบบทแยงมุมตามปกติ [ อัปเดตหลังจากความคิดเห็น: ส่วนเบี่ยงเบนมาตรฐานจะเป็น ]X 1nnnXX\mathbf X1n - 1X X⊤1n−1XX⊤\frac{1}{n-1}\mathbf X \mathbf X^\top∼ n- 1 / 2∼n−1/2\sim n^{-1/2} ทุกคนสามารถแนะนำวิธีที่ดีกว่าที่ฉันสามารถควบคุมค่าเบี่ยงเบนมาตรฐานได้หรือไม่?

2
ฉันจะเลือกจำนวนส่วนประกอบสำหรับการวิเคราะห์ส่วนประกอบอิสระได้อย่างไร
ในกรณีที่ไม่มีการคาดเดาที่ดีเกี่ยวกับจำนวนขององค์ประกอบที่จะร้องขอในการวิเคราะห์ส่วนประกอบอิสระฉันกำลังมองหากระบวนการคัดเลือกโดยอัตโนมัติ ฉันคิดว่าเกณฑ์ที่สมเหตุสมผลอาจเป็นจำนวนที่ลดหลักฐานระดับโลกสำหรับความสัมพันธ์ระหว่างองค์ประกอบที่คำนวณได้ นี่คือรหัสเทียมของวิธีการนี้: for each candidate number of components, n: run ICA specifying n as requested number of components for each pair (c1,c2) of resulting components: compute a model, m1: lm(c1 ~ 1) compute a model, m2: lm(c1 ~ c2) compute log likelihood ratio ( AIC(m2)-AIC(m1) ) representing the relative …
11 ica 

1
ความน่าจะเป็นที่ครอบคลุมของช่วงความมั่นใจบูตพื้นฐาน
ฉันมีคำถามต่อไปนี้สำหรับหลักสูตรที่ฉันกำลังทำอยู่: ดำเนินการศึกษา Monte Carlo เพื่อประเมินความน่าจะเป็นที่ครอบคลุมของช่วงความมั่นใจบูตมาตรฐานและช่วงความเชื่อมั่นเริ่มต้นพื้นฐาน ตัวอย่างจากประชากรปกติและตรวจสอบอัตราความครอบคลุมเชิงประจักษ์สำหรับค่าเฉลี่ยตัวอย่าง ความน่าจะเป็นของการครอบคลุมสำหรับ bootstrap CI มาตรฐานทั่วไปนั้นง่าย: n = 1000; alpha = c(0.025, 0.975); x = rnorm(n, 0, 1); mu = mean(x); sqrt.n = sqrt(n); LNorm = numeric(B); UNorm = numeric(B); for(j in 1:B) { smpl = x[sample(1:n, size = n, replace = TRUE)]; xbar = mean(smpl); …

4
เส้นตรงหมายถึงอะไรในการถดถอยเชิงเส้น
ใน R ถ้าฉันเขียน lm(a ~ b + c + b*c) นี่จะเป็นการถดถอยเชิงเส้นหรือไม่? วิธีการถดถอยแบบอื่น ๆ ใน R? ฉันจะขอบคุณคำแนะนำสำหรับหนังสือหรือแบบฝึกหัดใดบ้าง?
11 r  regression 

4
ตัวอย่างของการศึกษาโดยใช้ p <0.001, p <0.0001 หรือแม้แต่ค่า p ต่ำกว่า?
ฉันมาจากสังคมศาสตร์โดยที่ p &lt;0.05 เป็นบรรทัดฐานค่อนข้างมากโดยที่ p &lt;0.1 และ p &lt;0.01 ก็ปรากฏขึ้นด้วย แต่ฉันสงสัยว่า: สาขาวิชาใดถ้ามีให้ใช้ค่า p ต่ำกว่าเป็นเรื่องธรรมดา มาตรฐาน?

4
การเปรียบเทียบค่าสัมประสิทธิ์การถดถอยโลจิสติกในแบบจำลอง?
ฉันได้พัฒนาโมเดล logit เพื่อนำไปใช้กับชุดข้อมูลข้ามภาคหกชุด สิ่งที่ฉันพยายามเปิดเผยคือการเปลี่ยนแปลงผลกระทบที่สำคัญของตัวแปรอิสระ (IV) ที่กำหนดต่อการควบคุมตัวแปรตาม (DV) สำหรับคำอธิบายอื่น ๆ ในช่วงเวลาและเวลาที่ต่างกัน คำถามของฉันคือ: ฉันจะประเมินขนาดที่เพิ่มขึ้น / ลดลงในความสัมพันธ์ระหว่าง IV และ DV ได้อย่างไร ฉันสามารถดูขนาด (สัมประสิทธิ์) ที่แตกต่างกันของค่าสัมประสิทธิ์ของแบบจำลองหรือฉันจำเป็นต้องทำตามกระบวนการอื่นหรือไม่? ถ้าฉันต้องการทำอย่างอื่นมันคืออะไรและสามารถทำได้ / ฉันจะทำใน SPSS ได้อย่างไร? นอกจากนี้ภายในรุ่นเดียว ฉันสามารถเปรียบเทียบขนาดสัมพัทธ์ของตัวแปรอิสระตามคะแนนที่ไม่ได้มาตรฐานได้หรือไม่หากทั้งหมดถูกเข้ารหัส 0-1 หรือฉันจำเป็นต้องแปลงให้เป็นคะแนนมาตรฐานหรือไม่ มีปัญหาเกี่ยวข้องกับคะแนนมาตรฐานหรือไม่
11 logistic  spss 

2
วิธีการคำนวณพารามิเตอร์การทำให้เป็นมาตรฐานในการถดถอยริดจ์ที่กำหนดองศาอิสระและเมทริกซ์อินพุต?
ให้ A เป็น matrix ของตัวแปรอิสระและ B เป็น matrix ที่สอดคล้องกันของค่าที่ขึ้นต่อกัน ในการถดถอยสันเขาเรากำหนดพารามิเตอร์เพื่อให้: B ตอนนี้ให้ [usv] = svd (A) และรายการแนวทแยงมุมของ 's' เรากำหนดองศาอิสระ (DF) =แลมบ์ดา} การถดถอยของริดจ์ลดขนาดของค่าสัมประสิทธิ์ของส่วนประกอบความแปรปรวนต่ำดังนั้นพารามิเตอร์จะควบคุมองศาอิสระดังนั้นสำหรับn×pn×pn \times pλ บีตา= ( T + λ ฉัน) - 1 T B วันที่ฉัน = ฉันทีเอช Σ n ฉัน= 1 ( d ฉัน ) 2n×1n×1n \times 1λλ\lambdaβ=(ATA+λI)−1ATBβ=(ATA+λI)−1ATB\beta=(A^\mathrm{T}A+\lambda I)^{-1}A^\mathrm{T}Bdi=ithdi=ithd_{i}=i^{th} λλ=0∑ni=1(di)2(di)2+λ∑i=1n(di)2(di)2+λ\sum_{i=1}^{n} …

1
ขนาดตัวอย่างที่ต้องการเพื่อพิจารณาว่าชุดโฆษณาใดที่มีอัตราการคลิกผ่านสูงสุด
ฉันเป็นนักออกแบบซอฟต์แวร์โดยการแลกเปลี่ยนและฉันกำลังทำงานในโครงการสำหรับลูกค้าและฉันต้องการตรวจสอบให้แน่ใจว่าการวิเคราะห์ของฉันมีสถิติที่ดี พิจารณาสิ่งต่อไปนี้: เรามีโฆษณาn รายการ (n &lt;10) และเราต้องการทราบว่าโฆษณาใดมีประสิทธิภาพดีที่สุด เซิร์ฟเวอร์โฆษณาของเราจะแสดงโฆษณาเหล่านี้แบบสุ่ม ความสำเร็จคือถ้าผู้ใช้คลิกที่โฆษณา - เซิร์ฟเวอร์ของเราคอยติดตามสิ่งนั้น ให้ไว้: ช่วงความเชื่อมั่น: 95% คำถาม: ขนาดตัวอย่างโดยประมาณคืออะไร? (เราต้องแสดงโฆษณาทั้งหมดกี่รายการ) ทำไม (จำได้ว่าฉันเป็นคนบ้า ๆ บอ ๆ ) ขอบคุณ

3
ความแตกต่างระหว่างคะแนน Z และค่า p คืออะไร?
ในอัลกอริธึม motif ของเครือข่ายดูเหมือนว่าเป็นเรื่องธรรมดาที่จะส่งคืนทั้งค่าpและค่าคะแนน Zสำหรับสถิติ: "เครือข่ายอินพุตมีสำเนา X ของกราฟย่อย G" กราฟย่อยจะถือว่าเป็นบรรทัดฐานถ้ามันเป็นที่พอใจ p-value &lt;A, คะแนน Z&gt; B และ X&gt; C สำหรับผู้ใช้ที่กำหนด (หรือชุมชนที่กำหนด) A, B และ C สิ่งนี้กระตุ้นให้เกิดคำถาม: คำถาม : p-value และ Z-score ต่างกันอย่างไร และคำถามย่อย: คำถาม : มีสถานการณ์ที่ p-value และ Z-score ของสถิติเดียวกันอาจแนะนำสมมุติฐานตรงกันข้ามหรือไม่? เงื่อนไขที่หนึ่งและสองที่ระบุไว้ข้างต้นเป็นเงื่อนไขเดียวกันหรือไม่?

4
การติดฉลาก boxplots ใน R
ล็อคแล้ว คำถามและคำตอบของคำถามนี้ถูกล็อคเนื่องจากคำถามอยู่นอกหัวข้อ แต่มีความสำคัญทางประวัติศาสตร์ ขณะนี้ไม่ยอมรับคำตอบหรือการโต้ตอบใหม่ ฉันต้องการสร้าง boxplot โดยไม่มีแกนและเพิ่มลงในพล็อตปัจจุบัน (ROC curve) แต่ฉันต้องการเพิ่มข้อมูลข้อความเพิ่มเติมลงใน boxplot: เลเบลสำหรับ min และ max บรรทัดปัจจุบันของรหัสอยู่ด้านล่าง (กราฟปัจจุบันด้วย) ขอบคุณมากสำหรับความช่วยเหลือ boxplot(data, horizontal = TRUE, range = 0, axes=FALSE, col = "grey", add = TRUE) อีกวิธีคือเพิ่มบรรทัดจาก 0 ถึง 1 (แทนแกน x) แต่ฉันต้องการให้ผ่านเส้นกลาง ... ตัวอย่างเช่นกราฟิกนี้
11 r  boxplot 

2
วิธีจัดการกับข้อมูลที่ไม่มีอยู่ (ไม่หายไป)?
ฉันไม่เคยพบข้อความหรือตัวอย่างที่ดีเกี่ยวกับวิธีจัดการข้อมูล 'ไม่มีอยู่จริง' สำหรับอินพุตไปยังตัวจําแนกประเภทใด ๆ ฉันได้อ่านข้อมูลที่ขาดหายไปมากมาย แต่สิ่งที่สามารถทำได้เกี่ยวกับข้อมูลที่ไม่สามารถหรือไม่มีอยู่ที่เกี่ยวข้องกับอินพุตหลายตัวแปร ฉันเข้าใจว่านี่เป็นคำถามที่ซับซ้อนมากและจะแตกต่างกันไปขึ้นอยู่กับวิธีการฝึกอบรมที่ใช้ ... เช่นถ้าพยายามทำนายเวลาวิ่งสำหรับนักวิ่งหลายคนด้วยข้อมูลที่แม่นยำดี ตัวแปรที่เป็นไปได้ในหลาย ๆ ปัจจัย ได้แก่ : ตัวแปรอินพุต - นักวิ่งครั้งแรก (Y / N) ตัวแปรอินพุต - รอบเวลาก่อนหน้า (0 - 500 วินาที) ตัวแปรอินพุต - อายุ ตัวแปรอินพุต - ความสูง . . ตัวแปรอินพุตอื่น ๆ อีกมากมาย &amp; เอาท์พุททำนาย - เวลาที่คาดการณ์ไว้ Laptime (0 - 500 วินาที) 'ตัวแปรที่ขาดหายไป' สำหรับ '2. …

3
วิธีการเลือกจุดการทำงานที่ดีจากเส้นโค้งการเรียกคืนที่แม่นยำ?
มีวิธีมาตรฐานใด ๆ ในการพิจารณาจุดการทำงาน "ที่เหมาะสมที่สุด" บนกราฟการเรียกคืนที่แม่นยำหรือไม่? (เช่นการกำหนดจุดบนเส้นโค้งที่ให้การแลกเปลี่ยนที่ดีระหว่างความแม่นยำและการเรียกคืน) ขอบคุณ

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.