สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
จำลองการดึงจากการกระจายแบบสม่ำเสมอโดยใช้การดึงจากการแจกแจงแบบปกติ
ฉันเพิ่งซื้อแหล่งข้อมูลการสัมภาษณ์ด้านวิทยาศาสตร์ข้อมูลซึ่งมีหนึ่งในคำถามที่น่าจะเป็นดังนี้: ที่ได้รับมาจากการแจกแจงปกติพร้อมพารามิเตอร์ที่รู้จักกันคุณจะจำลองการดึงจากการแจกแจงแบบสม่ำเสมอได้อย่างไร? กระบวนการคิดดั้งเดิมของฉันคือว่าสำหรับตัวแปรสุ่มแบบแยกเราสามารถแบ่งการแจกแจงแบบปกติออกเป็นส่วนย่อยที่ไม่ซ้ำกัน K โดยแต่ละส่วนย่อยมีพื้นที่เท่ากันภายใต้เส้นโค้งปกติ จากนั้นเราสามารถกำหนดได้ว่าค่า K ใดที่ตัวแปรใช้โดยการจดจำพื้นที่ของส่วนโค้งปกติที่ตัวแปรนั้นสิ้นสุดลง แต่สิ่งนี้จะใช้ได้เฉพาะกับตัวแปรสุ่มแบบแยกเท่านั้น ฉันได้ทำการวิจัยเกี่ยวกับวิธีที่เราอาจทำแบบเดียวกันกับตัวแปรสุ่มต่อเนื่อง แต่น่าเสียดายที่ฉันสามารถค้นหาเทคนิคเช่นการสุ่มตัวอย่างการแปลงผกผันที่จะใช้เป็นอินพุตตัวแปรสุ่มแบบสม่ำเสมอและสามารถส่งออกตัวแปรสุ่มจากการกระจายอื่น ๆ ฉันคิดว่าบางทีเราสามารถทำกระบวนการนี้ในทางกลับกันเพื่อให้ได้ตัวแปรสุ่มที่เหมือนกัน? ฉันยังคิดว่าอาจใช้ตัวแปรสุ่มแบบปกติเป็นอินพุตในเครื่องกำเนิดไฟฟ้าเชิงเส้นเชิงเส้น แต่ฉันไม่แน่ใจว่าสิ่งนี้จะได้ผลหรือไม่ มีความคิดเกี่ยวกับวิธีที่ฉันอาจเข้าหาคำถามนี้หรือไม่?

4
จะพัฒนาสัญชาตญาณความน่าจะเป็นแบบมีเงื่อนไขได้อย่างไร
ในวิดีโอบรรยายจากสถิติของ Harvard 110: ความน่าจะเป็นที่พบได้ใน iTunes และ YouTube ฉันพบปัญหานี้ ฉันพยายามสรุปที่นี่: สมมติว่าเราได้ไพ่สองใบสุ่มจากเด็คมาตรฐาน ความน่าจะเป็นที่ไพ่ทั้งคู่เป็นเอซเนื่องจากเรามีอย่างน้อยหนึ่งเอซคืออะไร P(both aces|have ace)=P(both aces,have ace)P(have ace)P(both aces|have ace)=P(both aces,have ace)P(have ace) P(both\ aces | have\ ace) = \frac{P(both\ aces, have\ ace)}{P(have\ ace)} เนื่องจากมีอย่างน้อยหนึ่งเอซจะถูกบอกเป็นนัย ๆ ถ้าคุณมีเอซทั้งคู่การตัดกันสามารถลดลงเหลือเพียงแค่P(both aces)P(both aces)P(both\ aces) P(both aces|have ace)=P(both aces)P(have ace)P(both aces|have ace)=P(both aces)P(have ace) P(both\ aces …

2
วิธีปรับรูปแบบการผสมสำหรับการจัดกลุ่ม
ฉันมีสองตัวแปร - X และ Y และฉันต้องทำให้คลัสเตอร์สูงสุด (และเหมาะสมที่สุด) = 5 ขอพล็อตที่เหมาะของตัวแปรเป็นดังนี้: ฉันต้องการสร้าง 5 กลุ่มจากสิ่งนี้ บางสิ่งเช่นนี้ ดังนั้นฉันคิดว่านี่คือรูปแบบผสมที่มี 5 กลุ่ม แต่ละกลุ่มมีจุดกึ่งกลางและวงกลมความเชื่อมั่นรอบ ๆ กระจุกนั้นไม่ได้สวยแบบนี้เสมอไปมันมีลักษณะดังต่อไปนี้ซึ่งบางครั้งก็มีสองกลุ่มอยู่ใกล้กันหรือหนึ่งหรือสองกลุ่มหายไปโดยสิ้นเชิง จะเหมาะสมกับรูปแบบผสมและดำเนินการจำแนก (การจัดกลุ่ม) ในสถานการณ์นี้ได้อย่างมีประสิทธิภาพ? ตัวอย่าง: set.seed(1234) X <- c(rnorm(200, 10, 3), rnorm(200, 25,3), rnorm(200,35,3), rnorm(200,65, 3), rnorm(200,80,5)) Y <- c(rnorm(1000, 30, 2)) plot(X,Y, ylim = c(10, 60), pch = 19, col …

1
ฉันควรใช้ t-test กับข้อมูลที่มีการบิดเบือนสูงหรือไม่ ขอหลักฐานทางวิทยาศาสตร์
ฉันมีตัวอย่างจากชุดข้อมูลที่มีการบิดเบือนสูง (ดูคล้ายการแจกแจงแบบเอ็กซ์โปเนนเชียล) เกี่ยวกับการมีส่วนร่วมของผู้ใช้ (เช่น: จำนวนโพสต์) ที่มีขนาดต่างกัน (แต่ไม่น้อยกว่า 200) และฉันต้องการเปรียบเทียบค่าเฉลี่ย สำหรับสิ่งนั้นฉันใช้การทดสอบ t สองแบบที่ไม่มีการจับคู่ (และการทดสอบ t กับปัจจัยของ Welch เมื่อตัวอย่างมีความแปรปรวนต่างกัน) อย่างที่ฉันได้ยินมาว่าสำหรับกลุ่มตัวอย่างที่มีขนาดใหญ่จริง ๆ มันไม่สำคัญว่ากลุ่มตัวอย่างจะไม่แจกแจงแบบปกติ มีคนกำลังตรวจสอบสิ่งที่ฉันทำบอกว่าการทดสอบที่ฉันใช้ไม่เหมาะกับข้อมูลของฉัน พวกเขาแนะนำให้บันทึกการแปลงตัวอย่างของฉันก่อนใช้การทดสอบ t ฉันเป็นผู้เริ่มต้นดังนั้นฉันจึงสับสนในการตอบคำถามการวิจัยของฉันด้วย "บันทึกการเข้าร่วมการวัด" พวกเขาผิดหรือเปล่า? ฉันผิดหรือเปล่า? หากพวกเขาคิดผิดมีหนังสือหรือเอกสารทางวิทยาศาสตร์ที่ฉันสามารถอ้างอิง / แสดงได้หรือไม่? หากฉันผิดฉันควรใช้การทดสอบแบบใด

2
ความเป็นมาของการแปลงสภาพให้เป็นมาตรฐานสำหรับ GLM
\newcommand{\E}{\mathbb{E}}วิธีการคือ normalizing เปลี่ยนสำหรับครอบครัวชี้แจง มา? A ( ⋅ ) = ∫ d uV 1 / 3 ( μ )A(⋅)=∫duV1/3(μ)A(\cdot) = \displaystyle\int\frac{du}{V^{1/3}(\mu)} โดยเฉพาะอย่างยิ่ง : ฉันพยายามติดตามภาพร่างการขยายตัวของเทย์เลอร์ในหน้า 3 เลื่อน 1 ที่นี่แต่มีคำถามหลายข้อ ด้วยXXXจากตระกูลชี้แจงการแปลงh ( X )h(X)h(X)และκ ฉันκi\kappa _iแสดงถึงฉันทีเอชithi^{th} cumulant สไลด์ยืนยันว่า: κ 3 ( h ( ˉ X ) ) ≈ h ′ ( μ ) …

2
ค่า P เท่ากับ 0 ในการทดสอบการเรียงสับเปลี่ยน
ฉันมีสองชุดข้อมูลและฉันต้องการที่จะทราบว่าพวกเขาแตกต่างกันอย่างมีนัยสำคัญหรือไม่ (นี้มาจาก " สองกลุ่มมีความแตกต่างอย่างมีนัยสำคัญ? ทดสอบที่จะใช้ ") ฉันตัดสินใจใช้การทดสอบการเปลี่ยนรูปโดยทำสิ่งต่อไปนี้ใน R: permutation.test <- function(coding, lncrna) { coding <- coding[,1] # dataset1 lncrna <- lncrna[,1] # dataset2 ### Under null hyphotesis, both datasets would be the same. So: d <- c(coding, lncrna) # Observed difference diff.observed = mean(coding) - mean(lncrna) number_of_permutations = 5000 diff.random …

4
อุบัติเหตุเครื่องบินชนกันเป็นจำนวนเท่าใด?
คำถามเดิม (7/25/14): การเสนอราคานี้จากสื่อข่าวทำให้รู้สึกหรือมีวิธีการทางสถิติที่ดีขึ้นในการดูน้ำท่วมของอุบัติเหตุเครื่องบินเมื่อเร็ว ๆ นี้? อย่างไรก็ตามบาร์เน็ตต์ยังให้ความสนใจกับทฤษฎีของการแจกแจงปัวซงซึ่งก็หมายความว่าช่วงเวลาสั้น ๆ ระหว่างการเกิดปัญหานั้นมีแนวโน้มที่จะเป็นไปได้มากกว่าระยะยาว "สมมติว่ามีอุบัติเหตุร้ายแรงถึงหนึ่งครั้งต่อปีโดยเฉลี่ยหมายความว่าโอกาสที่จะเกิดอุบัติเหตุในวันใดวันหนึ่งเป็นหนึ่งใน 365" บาร์เน็ตต์กล่าว "หากเกิดความผิดพลาดในวันที่ 1 สิงหาคมโอกาสที่ความผิดพลาดครั้งต่อไปจะเกิดขึ้นหนึ่งวันต่อมาในวันที่ 2 สิงหาคมคือ 1/365 แต่โอกาสที่ความผิดพลาดครั้งต่อไปจะเกิดขึ้นในวันที่ 3 สิงหาคมคือ (364/365) x (1/365) เนื่องจากข้อผิดพลาดครั้งถัดไปเกิดขึ้นในวันที่ 3 สิงหาคมเฉพาะในกรณีที่ไม่มีข้อผิดพลาดในวันที่ 2 สิงหาคมเท่านั้น " “ ดูเหมือนว่าจะใช้งานง่าย แต่ข้อสรุปดังต่อไปนี้อย่างไม่ลดละจากกฎความน่าจะเป็น” บาร์เน็ตต์กล่าว ที่มา: http://www.bbc.com/news/magazine-28481060 ความชัดเจน (7/27/14): สิ่งที่เคาน์เตอร์หยั่งรู้ (สำหรับฉัน) กำลังบอกว่าเหตุการณ์ที่หายากมักจะเกิดขึ้นในเวลาใกล้เคียง ฉันคิดว่าเหตุการณ์ที่เกิดขึ้นได้ยากจะไม่เกิดขึ้นในเวลาอันใกล้ ทุกคนสามารถชี้ให้ฉันเห็นการแจกแจงเชิงทฤษฎีหรือเชิงประจักษ์ของเวลาระหว่างเหตุการณ์ภายใต้สมมติฐานของการแจกแจงปัวซอง? (นั่นคือฮิสโตแกรมที่แกน y เป็นความถี่หรือความน่าจะเป็นและแกน x เป็นเวลาระหว่างเหตุการณ์ที่เกิดขึ้น 2 ครั้งติดต่อกันซึ่งแบ่งออกเป็นวันสัปดาห์เดือนหรือปีหรือสิ่งที่คล้ายกัน) ขอบคุณ …

1
มันสมเหตุสมผลหรือไม่ที่จะทำการทดสอบ Kolmogorov-Smirnov แบบ one-tailed?
มันมีความหมายและเป็นไปได้หรือไม่ที่จะทำการทดสอบ KS แบบทางเดียว? สมมติฐานว่างของการทดสอบดังกล่าวจะเป็นอย่างไร หรือการทดสอบ KS นั้นเป็นการทดสอบแบบสองทางโดยเนื้อแท้ ฉันจะได้รับประโยชน์จากคำตอบที่ช่วยให้ฉันเข้าใจการกระจายของD (ฉันกำลังทำงานผ่านกระดาษของ Massey ในปี 1951 และค้นหาคำอธิบายที่ท้าทายตัวอย่างเช่นและD - supremum และ infinite ของความแตกต่างของค่าไม่แน่นอน ของความแตกต่างใน CDF เชิงประจักษ์?)D+D+D^{+}D−D-D^{-} คำถามติดตามผล: value เป็นอย่างไรสำหรับD +และD -ได้มาอย่างไร จำนวนมากดังนั้นของสิ่งพิมพ์ฉันกำลังเผชิญหน้ากับกำลังนำเสนอค่าขึ้นบัญชีดำมากกว่า CDF ของD n , D +และD -pพีpD+D+D^{+}D−D-D^{-}DnDnD_{n}D+D+D^{+}D−D−D^{-} อัปเดต:ฉันเพิ่งค้นพบคำถามที่เกี่ยวข้องอะไรคือสมมติฐานว่างในการทดสอบ Kolmogorov-Smirnov ด้านเดียว? ซึ่งฉันพลาดการสแกนครั้งแรกก่อนที่จะเขียนอันนี้

1
การถดถอยในการตั้งค่า
ฉันพยายามดูว่าจะไปถดถอยสัน , เชือก , หลักถดถอยส่วนประกอบ (PCR) หรือสแควน้อยบางส่วน (PLS) ในสถานการณ์ที่มีจำนวนมากของตัวแปร / คุณสมบัติ ( ) และขนาดเล็กจำนวนตัวอย่าง ( n < p ) และเป้าหมายของฉันคือการทำนายpppn<pn<pn np>10np>10np>10n ตัวแปร ( และY ) มีความสัมพันธ์ซึ่งกันและกันด้วยองศาที่ต่างกันXXXYYY คำถามของฉันคือกลยุทธ์ใดที่ดีที่สุดสำหรับสถานการณ์นี้ ทำไม?

3
การแจกจ่ายของฉันเป็นเรื่องปกติ การทดสอบ Kolmogorov-Smirnov ไม่เห็นด้วย
ฉันมีปัญหากับค่าปกติของข้อมูลบางอย่างที่ฉันมี: ฉันได้ทำการทดสอบ Kolmogorov ซึ่งบอกว่ามันไม่ปกติกับ p = .0000 ฉันไม่เข้าใจ: ความเบ้ของการกระจายของฉัน = -. 497 และ kurtosis = -0,024 นี่คือพล็อตเรื่องการกระจายตัวของฉันซึ่งดูธรรมดามาก ... (ฉันมีสามคะแนนและแต่ละคะแนนนี้ไม่ปกติกับค่า p ที่สำคัญสำหรับการทดสอบ Kolmogorov ... ฉันไม่เข้าใจจริงๆ)

3
การทำนายความแปรปรวนของข้อมูล heteroscedastic
ฉันพยายามทำการถดถอยกับข้อมูลแบบเฮเทอโรเซสติกซึ่งฉันพยายามทำนายความแปรปรวนข้อผิดพลาดรวมถึงค่าเฉลี่ยในแง่ของตัวแบบเชิงเส้น บางสิ่งเช่นนี้ y(x,t)ξ(x,t)y¯(x,t)σ(x,t)=y¯(x,t)+ξ(x,t),∼N(0,σ(x,t)),=y0+ax+bt,=σ0+cx+dt.y(x,t)=y¯(x,t)+ξ(x,t),ξ(x,t)∼N(0,σ(x,t)),y¯(x,t)=y0+ax+bt,σ(x,t)=σ0+cx+dt.\begin{align}\\ y\left(x,t\right) &= \bar{y}\left(x,t\right)+\xi\left(x,t\right),\\ \xi\left(x,t\right) &\sim N\left(0,\sigma\left(x,t\right)\right),\\ \bar{y}\left(x,t\right) &= y_{0}+ax+bt,\\ \sigma\left(x,t\right) &= \sigma_{0}+cx+dt. \end{align} ในคำพูดของข้อมูลที่ประกอบด้วยวัดซ้ำของที่ค่าต่างๆของxและเสื้อ ฉันถือว่าการวัดเหล่านี้ประกอบด้วยค่า "จริง" หมายถึงค่าˉ y ( x , t )ซึ่งเป็นฟังก์ชันเชิงเส้นของxและtพร้อมกับเสียงเกาส์แบบเติมadd ( x , t )ซึ่งค่าเบี่ยงเบนมาตรฐาน (หรือความแปรปรวนฉันไม่ได้ ตัดสินใจ) นอกจากนี้ยังขึ้นอยู่กับเส้นตรงกับx ,เสื้อ (ฉันอาจอนุญาตการพึ่งพาที่ซับซ้อนมากขึ้นในxและy(x,t)y(x,t)y(x,t)xxxttty¯(x,t)y¯(x,t)\bar{y}(x,t)xxxtttξ(x,t)ξ(x,t)\xi(x,t)x,tx,เสื้อx,txxx - ไม่มีแรงกระตุ้นเชิงทฤษฎีที่แข็งแกร่งสำหรับรูปแบบเชิงเส้น - แต่ฉันไม่อยากจะเข้าใจสิ่งต่าง ๆ ในตอนนี้)ttt ฉันรู้ว่าคำค้นหาที่นี่คือ "heteroscedasticity" แต่ทั้งหมดที่ฉันสามารถค้นหาได้คือการอภิปรายเกี่ยวกับวิธีการลด / ลบคำศัพท์เพื่อทำนายดีขึ้นแต่ไม่มีอะไรในแง่ของการพยายามทำนายσในแง่ของ ตัวแปรอิสระ. ฉันต้องการประมาณy 0 …

1
อรรถาภิธานสำหรับสถิติและเงื่อนไขการเรียนรู้ของเครื่อง
มีอรรถาภิธานอ้างอิงใด ๆ สำหรับสถิติและเงื่อนไขการเรียนรู้ของเครื่องหรือไม่? ฉันรู้ว่าบทความ Wikipedia มักจะมีคำพ้องความหมายเหมือนกัน แต่ฉันต้องการอรรถาภิธานที่สามารถผ่านได้อย่างง่ายดาย (เทียบกับสารานุกรมฉบับเต็ม) เพื่อให้แน่ใจว่าฉันรู้ศัพท์แสงทั้งหมด

2
สันถดถอย - การตีความแบบเบย์
ฉันได้ยินมาว่าการถดถอยของสันเขานั้นสามารถได้มาจากค่าเฉลี่ยของการแจกแจงหลังถ้าหากได้รับการคัดเลือกอย่างเพียงพอ สัญชาตญาณว่าข้อ จำกัด ตามที่กำหนดไว้ในสัมประสิทธิ์การถดถอยโดยก่อนหน้านี้ (เช่นการแจกแจงแบบปกติมาตรฐานประมาณ 0) เหมือนกัน / แทนที่การลงโทษที่กำหนดไว้ในขนาดกำลังสองของสัมประสิทธิ์หรือไม่? ก่อนหน้านี้จะต้องเป็นแบบเกาส์สำหรับการเทียบเท่านี้จะถือ?

3
คำแนะนำสำหรับการเรียนรู้ที่คำนึงถึงต้นทุนในการตั้งค่าที่ไม่สมดุล
ฉันมีชุดข้อมูลที่มีไม่กี่ล้านแถวและประมาณ 100 คอลัมน์ ฉันต้องการตรวจสอบประมาณ 1% ของตัวอย่างในชุดข้อมูลซึ่งเป็นของชั้นสามัญ ฉันมีข้อ จำกัด ความแม่นยำขั้นต่ำ แต่เนื่องจากค่าใช้จ่ายไม่สมมาตรฉันไม่กระตือรือร้นในการเรียกคืนใด ๆ (ตราบใดที่ฉันไม่เหลือ 10 การแข่งขันที่เป็นบวก!) มีวิธีใดบ้างที่คุณอยากแนะนำในการตั้งค่านี้? (ยินดีต้อนรับสู่ลิงก์ไปยังเอกสารลิงค์ไปยังการนำไปปฏิบัติ)

1
Gini ลดลงและ Gini ไม่บริสุทธิ์ของโหนดลูก
ฉันกำลังทำงานกับตัววัดความสำคัญของคุณลักษณะ Gini สำหรับฟอเรสต์แบบสุ่ม ดังนั้นฉันจำเป็นต้องคำนวณการลดลงของ Gini ในโหนดที่ไม่บริสุทธิ์ นี่คือวิธีที่ฉันทำซึ่งนำไปสู่ความขัดแย้งกับคำนิยามแนะนำว่าฉันต้องผิดที่ไหนสักแห่ง ... :) สำหรับต้นไม้ไบนารีและได้รับความน่าจะเป็นของลูกซ้ายและขวาฉันสามารถคำนวณความไม่บริสุทธิ์ของ Gini ของโหนด :nnn i(n)=1−p2l−p2ri(n)=1−pl2−pr2 i(n) = 1 - p_l^2 - p_r^2 และ Gini ลดลง: Δi(n)=i(n)−pli(nl)−pri(nr)Δi(n)=i(n)−pli(nl)−pri(nr) \Delta i(n) = i(n) - p_li(n_l) - p_ri(n_r) ดังนั้นสำหรับตัวอย่างนี้มีการสังเกต 110 จุดบนโหนด: - node (110) - left (100) - left_left (60) - left_right (40) - right …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.