สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

8
สารานุกรมกราฟิก
ฉันต้องสร้างเว็บแอพที่มีผู้ใช้หลายคนซึ่งเกี่ยวกับการวัดปริมาณการเข้าชมการพยากรณ์โรค ฯลฯ ณ จุดนี้ฉันรู้ว่าฉันจะใช้แผนภูมิแท่งและแผนภูมิวงกลม น่าเสียดายที่ประเภทแผนภูมิเหล่านั้นไม่สมบูรณ์ในการแสดงข้อมูลทั้งหมดที่ฉันรวบรวมและคำนวณ ฉันกำลังมองหาคอลเลกชันของแผนภูมิกราฟิก มันโอเคมากถ้าฉันต้องซื้อหนังสือหรืออย่างอื่น ฉันต้องการค้นหาตัวอย่างกราฟิกพร้อมคำอธิบายเพื่อสร้างแรงบันดาลใจให้ฉัน คุณรู้จักทรัพยากรเช่นนี้หรือไม่? คุณมีคำแนะนำใด ๆ สำหรับฉัน

4
ภาพรวมเกี่ยวกับการวิเคราะห์การอยู่รอดและการวิเคราะห์ข้อมูลชีวิต
ฉันเคยได้ยินการวิเคราะห์ความอยู่รอดและการวิเคราะห์ข้อมูลชีวิต แต่ไม่ได้รับภาพรวม ฉันสงสัยว่าหัวข้อใดบ้างที่ครอบคลุม มันเป็นสถิติที่บริสุทธิ์หรือเพียงแค่ประยุกต์ใช้สถิติในบางพื้นที่ การวิเคราะห์วันที่ชีวิตเป็นส่วนหนึ่งของการวิเคราะห์การอยู่รอดหรือไม่? ขอบคุณและขอแสดงความนับถือ!

1
คำแนะนำในการระบุรูปร่างโค้งโดยใช้ quantreg
ฉันใช้แพ็คเกจquantregเพื่อสร้างแบบจำลองการถดถอยโดยใช้เปอร์เซ็นไทล์ที่ 99 ของค่าของฉันในชุดข้อมูล ตามคำแนะนำจากคำถาม stackoverflow ก่อนหน้านี้ที่ฉันถามฉันใช้โครงสร้างรหัสต่อไปนี้ mod <- rq(y ~ log(x), data=df, tau=.99) pDF <- data.frame(x = seq(1,10000, length=1000) ) pDF <- within(pDF, y <- predict(mod, newdata = pDF) ) ซึ่งฉันแสดงพล็อตที่ด้านบนของข้อมูลของฉัน ฉันวางแผนเรื่องนี้โดยใช้ ggplot2 โดยมีค่าอัลฟาสำหรับจุด ฉันคิดว่าหางของการแจกแจงของฉันไม่ได้รับการพิจารณาอย่างเพียงพอในการวิเคราะห์ของฉัน บางทีนี่อาจเป็นเพราะความจริงที่ว่ามีแต่ละจุดที่ถูกละเว้นโดยการวัดประเภทเปอร์เซ็นไทล์ หนึ่งในความคิดเห็นที่แนะนำว่า บทความสั้นรวมถึงส่วนที่เกี่ยวกับการถดถอยเชิงเส้นไม่เชิงเส้นและรุ่นที่มีเส้นโค้งเรียบ จากคำถามก่อนหน้านี้ฉันถือว่าความสัมพันธ์ลอการิทึม แต่ฉันไม่แน่ใจว่าถูกต้องหรือไม่ ฉันคิดว่าฉันสามารถแยกคะแนนทั้งหมดในช่วงเวลาเปอร์เซ็นไทล์ที่ 99 แล้วตรวจสอบแยกกัน แต่ฉันไม่แน่ใจว่าจะทำอย่างไรหรือว่าเป็นวิธีที่ดี ฉันขอขอบคุณคำแนะนำเกี่ยวกับวิธีปรับปรุงการระบุความสัมพันธ์นี้

3
การทดสอบสมมติฐานเกี่ยวกับข้อมูลต่อเนื่องที่ไม่พองเกินศูนย์
ฉันขอขอบคุณคำแนะนำของคุณอย่างมากในปัญหาต่อไปนี้: ฉันมีชุดข้อมูลต่อเนื่องขนาดใหญ่ที่มีเลขศูนย์จำนวนมาก (~ 95%) และฉันต้องการค้นหาวิธีที่ดีที่สุดในการทดสอบว่าชุดย่อยบางชุดของมัน "น่าสนใจ" คือดูเหมือนจะไม่ถูกดึงออกมาจากการแจกแจงแบบเดียวกัน ส่วนที่เหลือ. ศูนย์เงินเฟ้อมาจากข้อเท็จจริงที่ว่าแต่ละจุดข้อมูลอิงการวัดจำนวนทั้งจริงและสุ่มตัวอย่างศูนย์ แต่ผลลัพธ์นั้นต่อเนื่องเนื่องจากคำนึงถึงพารามิเตอร์อื่น ๆ ที่ถ่วงน้ำหนักด้วยการนับ (และถ้านับเป็นศูนย์ผลลัพธ์ ยังเป็นศูนย์) อะไรจะเป็นวิธีที่ดีที่สุดในการทำเช่นนี้? ฉันมีความรู้สึกว่าวิลคอกซันและการทดสอบการเปลี่ยนรูปกำลังเดรัจฉานไม่เพียงพอเนื่องจากศูนย์เหล่านี้เบ้ เพ่งความสนใจไปที่การวัดที่ไม่เป็นศูนย์ยังเอาศูนย์จริงที่มีความสำคัญมาก โมเดลที่ไม่มีการขยายเกินศูนย์สำหรับข้อมูลนับนั้นได้รับการพัฒนามาอย่างดี แต่ไม่เหมาะกับกรณีของฉัน ฉันพิจารณาว่าการกระจาย Tweedie นั้นเหมาะสมกับข้อมูลและจากนั้นปรับ glm ตามการตอบสนอง = f (subset_label) ในทางทฤษฎีสิ่งนี้ดูเหมือนจะเป็นไปได้ แต่ฉันสงสัยว่า (a) นี่เกินความจริงหรือไม่และ (b) จะยังคงถือว่าโดยปริยายว่าศูนย์ทั้งหมดเป็นศูนย์ตัวอย่างคือจะมีความลำเอียงในลักษณะเดียวกัน อย่างสังหรณ์ใจดูเหมือนว่ามีการออกแบบแบบลำดับชั้นบางอย่างที่รวมสถิติทวินามตามสัดส่วนของศูนย์และพูดว่าสถิติ Wilcoxon คำนวณจากค่าที่ไม่ใช่ศูนย์ (หรือยังดีกว่าค่าที่ไม่ใช่ศูนย์เสริมด้วยเศษของ ศูนย์ขึ้นอยู่กับบางก่อน) เสียงเหมือนเครือข่ายเบย์ ... หวังว่าฉันไม่ใช่คนแรกที่มีปัญหานี้ดังนั้นจะขอบคุณมากถ้าคุณสามารถชี้ให้ฉันเห็นเทคนิคที่เหมาะสมที่มีอยู่ ... ขอบคุณมาก!

3
วิธีการแสดงเมทริกซ์ของความสัมพันธ์กับรายการที่หายไป?
ฉันต้องการได้ภาพกราฟิกของความสัมพันธ์ในบทความที่รวบรวมมาเพื่อสำรวจความสัมพันธ์ระหว่างตัวแปรได้อย่างง่ายดาย ฉันเคยวาดกราฟ (ยุ่ง) แต่ตอนนี้ฉันมีข้อมูลมากเกินไป โดยทั่วไปฉันมีตารางที่: [0]: ชื่อของตัวแปร 1 [1]: ชื่อของตัวแปร 2 [2]: ค่าสหสัมพันธ์ เมทริกซ์ "โดยรวม" ไม่สมบูรณ์ (เช่นฉันมีความสัมพันธ์ของ V1 * V2, V2 * V3 แต่ไม่ใช่ V1 * V3) มีวิธีที่จะเป็นตัวแทนกราฟิกนี้หรือไม่?

2
การขนานแพ็กเกจคาเร็ตโดยใช้ doSMP
UPDATE: คาเร็ตใช้ในตอนนี้foreachดังนั้นคำถามนี้จึงไม่มีความเกี่ยวข้องอีกต่อไป หากคุณสามารถลงทะเบียนแบ็กเอนด์แบบขนานที่foreachใช้งานได้คาเร็ตจะใช้มัน ฉันมีชุดคาเร็ตสำหรับ R และฉันสนใจที่จะใช้trainฟังก์ชั่นเพื่อตรวจสอบความถูกต้องของโมเดลของฉัน อย่างไรก็ตามฉันต้องการเพิ่มความเร็วและดูเหมือนว่าเครื่องหมายรูปหมวกจะให้การสนับสนุนการประมวลผลแบบขนาน วิธีที่ดีที่สุดในการเข้าถึงคุณลักษณะนี้ในเครื่อง Windows คืออะไร ฉันมีแพ็คเกจdoSMPแต่ฉันไม่สามารถเข้าใจวิธีการแปลforeachฟังก์ชั่นเป็นlapplyฟังก์ชั่นดังนั้นฉันสามารถส่งผ่านไปยังtrainฟังก์ชันได้ นี่คือตัวอย่างของสิ่งที่ฉันต้องการจะทำจากtrainเอกสาร: นี่คือสิ่งที่ฉันต้องการจะทำ แต่ใช้doSMPแพ็คเกจแทนที่จะเป็นdoMPIแพ็คเกจ ## A function to emulate lapply in parallel mpiCalcs <- function(X, FUN, ...) } theDots <- list(...) parLapply(theDots$cl, X, FUN) { library(snow) cl <- makeCluster(5, "MPI") ## 50 bootstrap models distributed across 5 workers mpiControl <- …

2
ฉันจะกำหนดพารามิเตอร์ weibull จากข้อมูลได้อย่างไร
ฉันมีฮิสโตแกรมของข้อมูลความเร็วลมซึ่งมักแสดงโดยใช้การแจกแจงแบบ Weibull ฉันต้องการคำนวณรูปร่างของ weibull และสเกลแฟคเตอร์ที่เหมาะสมที่สุดกับฮิสโตแกรม ฉันต้องการโซลูชันเชิงตัวเลข (ตรงข้ามกับโซลูชันกราฟิก ) เนื่องจากเป้าหมายคือการกำหนดรูปแบบ weibull โดยทางโปรแกรม แก้ไข: เก็บตัวอย่างทุก 10 นาทีความเร็วลมเฉลี่ยตลอด 10 นาที ตัวอย่างรวมถึงความเร็วลมสูงสุดและต่ำสุดที่บันทึกไว้ในแต่ละช่วงเวลาซึ่งจะถูกละเว้นในปัจจุบัน แต่ฉันต้องการรวมไว้ในภายหลัง ความกว้างของช่องเก็บคือ 0.5 m / s

1
เลือกระดับปัจจัยเป็นฐานจำลองใน lm () ใน R
ให้บอกว่าฉันกำลังถดถอย Y บน X1 และ X2 โดยที่ X1 เป็นตัวแปรตัวเลขและ X2 เป็นปัจจัยที่มีสี่ระดับ (A: D) มีวิธีการเขียนฟังก์ชั่นการถดถอยเชิงเส้นlm(Y ~ X1 + as.factor(X2))เพื่อให้ฉันสามารถเลือกระดับเฉพาะของ X2 - พูด, B - เป็นพื้นฐานหรือไม่?
10 r 

2
การเปรียบเทียบตัวแบบผสม (ตัวแบบสุ่ม) กับตัวแบบเชิงเส้นอย่างง่าย (ตัวแบบเป็นเอฟเฟกต์คงที่)
ฉันกำลังทำการวิเคราะห์บางอย่างกับชุดข้อมูลขนาดใหญ่ ฉันต้องการใช้โมเดลเชิงเส้นที่ใช้ในส่วนแรกของงานและปรับให้เหมาะสมโดยใช้โมเดลเชิงเส้นผสม (LME) LME จะคล้ายกันมากกับข้อยกเว้นว่าหนึ่งในตัวแปรที่ใช้ในแบบจำลองจะถูกใช้เป็นเอฟเฟกต์แบบสุ่ม ข้อมูลนี้มาจากการสังเกตหลายครั้ง (> 1,000) ในกลุ่มวิชาเล็ก ๆ (~ 10) และฉันรู้ว่าการสร้างแบบจำลองผลกระทบของเรื่องจะทำได้ดีกว่าเป็นเอฟเฟกต์แบบสุ่ม (นี่คือตัวแปรที่ฉันต้องการเปลี่ยน) รหัส R จะเป็นดังนี้: my_modelB <- lm(formula = A ~ B + C + D) lme_model <- lme(fixed=A ~ B + C, random=~1|D, data=my_data, method='REML') ทุกอย่างทำงานได้ดีและผลลัพธ์ก็คล้ายคลึงกันอย่างมากมาย มันจะดีถ้าฉันสามารถใช้อะไรเช่น RLRsim หรือ AIC / BIC เพื่อเปรียบเทียบทั้งสองรุ่นและตัดสินใจว่าแบบใดที่เหมาะสมที่สุด เพื่อนร่วมงานของฉันไม่ต้องการรายงาน LME เพราะไม่มีวิธีเข้าถึงได้ง่ายในการเลือกว่า "ดีกว่า" …

1
วิธีทำให้เมทริกซ์เป็นบวกแน่นอน?
ฉันกำลังพยายามใช้อัลกอริทึม EM สำหรับรูปแบบการวิเคราะห์ปัจจัยต่อไปนี้ WJ= μ + B aJ+ eJสำหรับj = 1 , … , nWj=μ+Baj+ejforj=1,…,nW_j = \mu+B a_j+e_j \quad\text{for}\quad j=1,\ldots,n ที่คือ P-มิติเวกเตอร์สุ่มเจเป็นเวกเตอร์ Q-มิติของตัวแปรแฝงและBเป็นเมทริกซ์ pxq ของพารามิเตอร์WJWjW_jaJaja_jBBB จากข้อสมมติฐานอื่น ๆ ที่ใช้สำหรับแบบจำลองฉันรู้ว่าโดยที่Dคือเมทริกซ์ความแปรปรวนร่วมแปรปรวนของข้อผิดพลาดe j , D = diag ( σ 2 1 , σ 2 2 , ... , σ 2 p )Wj∼N(μ,BB′+D)Wj∼N(μ,BB′+D)W_j\sim N(\mu, BB'+D)DDDejeje_jDDDσ21σ12\sigma_1^2σ22σ22\sigma_2^2σ2pσp2\sigma_p^2 …

3
การใช้ MCMC เพื่อประเมินค่าที่คาดหวังของฟังก์ชันมิติสูง
ฉันกำลังทำงานในโครงการวิจัยที่เกี่ยวข้องกับการปรับให้เหมาะสมและเพิ่งมีความคิดที่จะใช้ MCMC ในการตั้งค่านี้ น่าเสียดายที่ฉันค่อนข้างใหม่สำหรับวิธีการ MCMC ดังนั้นฉันจึงมีคำถามหลายข้อ ฉันจะเริ่มต้นด้วยการอธิบายปัญหาแล้วถามคำถามของฉัน ปัญหาของเราเดือดลงไปประมาณมูลค่าที่คาดหวังของฟังก์ชั่นค่าใช้จ่ายc ( ω )c(ω)c(\omega)ที่ω = ( ω1, ω2, . . . ωชั่วโมง)ω=(ω1,ω2,...ωh)\omega = (\omega_1,\omega_2,...\omega_h)เป็นชั่วโมงhhตัวแปรสุ่ม -dimentional ที่มีความหนาแน่นฉ( ω )f(ω)f(\omega) ) ในกรณีของเราเป็นรุ่นแบบปิดของc ( ω )c(ω)c(\omega)ไม่อยู่ ซึ่งหมายความว่าเราต้องใช้วิธีการ Monte Carlo เพื่อประมาณค่าที่คาดหวัง น่าเสียดายที่การประมาณการของE[ c ( ω ) ]E[c(ω)]E[c(\omega)]ที่สร้างขึ้นโดยใช้วิธี MC หรือ QMC นั้นมีความแปรปรวนมากเกินไปที่จะเป็นประโยชน์ภายในการตั้งค่าภาคปฏิบัติ หนึ่งความคิดที่ว่าเราต้องใช้การกระจายความสำคัญการสุ่มตัวอย่างในการสร้างจุดตัวอย่างที่จะผลิตประมาณการต่ำแปรปรวนของE[ c ( ω ) ]E[c(ω)]E[c(\omega)] …

2
ตรวจจับรูปแบบวงกลมในข้อมูลคลาวด์แบบจุด
สำหรับอัลกอริธึมการสร้างโวลุ่มใหม่บางตัวที่ฉันกำลังทำอยู่ฉันต้องตรวจจับจำนวนรูปแบบวงกลมตามอำเภอใจในข้อมูลจุดสามมิติ รูปแบบที่สามารถมุ่งเน้นในพื้นที่โดยพลการและสันนิษฐานว่าจะโกหก (แม้ว่าจะไม่สมบูรณ์) ในเครื่องบิน 2d บาง ๆ นี่คือตัวอย่างที่มีวงกลมสองวงในระนาบเดียวกัน (แม้ว่าจะจำได้ว่านี่คือพื้นที่ 3 มิติ): ฉันพยายามหลายวิธี .. วิธีที่ง่ายที่สุด (แต่วิธีที่ดีที่สุดจนถึงตอนนี้) คือการจัดกลุ่มตามชุดกราฟกราฟเพื่อนบ้านที่อยู่ใกล้ที่สุด วิธีนี้ใช้งานได้ดีพอสมควรเมื่อรูปแบบอยู่ห่างกัน แต่น้อยกว่าเมื่อใช้กับแวดวงอย่างในตัวอย่างให้ใกล้กันมาก ฉันลองใช้วิธี K แต่ไม่ได้ผลดี: ฉันคิดว่าการจัดจุดแบบวงกลมอาจไม่เหมาะสำหรับมัน นอกจากนี้ฉันมีปัญหาเพิ่มเติมที่ไม่ทราบล่วงหน้าถึงคุณค่าของเค ฉันลองวิธีที่ซับซ้อนมากขึ้นโดยใช้การตรวจจับรอบในกราฟเพื่อนบ้านที่ใกล้เคียงที่สุด แต่สิ่งที่ฉันได้รับคือความเปราะบางหรือมีราคาแพงมาก ฉันยังอ่านเกี่ยวกับหัวข้อที่เกี่ยวข้องจำนวนมาก (การแปลง Hough เป็นต้น) แต่ดูเหมือนว่าไม่มีสิ่งใดที่จะนำไปใช้ได้อย่างสมบูรณ์แบบในบริบทเฉพาะนี้ ความคิดหรือแรงบันดาลใจใด ๆ ที่จะได้รับการชื่นชม

1
เหตุใดการเรียกคืนจึงไม่คำนึงถึงแง่ลบที่แท้จริง
เหตุใดการเรียกคืนจึงไม่คำนึงถึงแง่ลบที่แท้จริง ในการทดลองที่เชิงลบที่แท้จริงมีความสำคัญเทียบเท่ากับการบวกที่แท้จริงการวัดเปรียบเทียบของพวกเขาที่นำมาพิจารณาหรือไม่

4
การรวมความน่าจะเป็นของอุบัติเหตุนิวเคลียร์
เหตุการณ์ล่าสุดในญี่ปุ่นทำให้ฉันคิดถึงสิ่งต่อไปนี้ โรงไฟฟ้านิวเคลียร์มักถูกออกแบบมาเพื่อจำกัดความเสี่ยงของการเกิดอุบัติเหตุร้ายแรงให้เป็น 'ความน่าจะเป็นพื้นฐานการออกแบบ' เช่น 10E-6 / ปี นี่คือเกณฑ์สำหรับโรงงานเดียว อย่างไรก็ตามเมื่อมีประชากรของเครื่องปฏิกรณ์หลายร้อยเครื่องเราจะรวมความน่าจะเป็นแต่ละครั้งของอุบัติเหตุร้ายแรงได้อย่างไร ฉันรู้ว่าฉันอาจวิจัยด้วยตัวเอง แต่เมื่อพบเว็บไซต์นี้ฉันแน่ใจว่ามีคนที่สามารถตอบคำถามนี้ได้อย่างง่ายดาย ขอบคุณ

1
การสร้างเวกเตอร์สุ่มด้วยข้อ จำกัด
ฉันจำเป็นต้องสร้างเวกเตอร์สุ่มของจำนวนจริง a_i ที่ปฏิบัติตามข้อ จำกัด ดังต่อไปนี้: abs(a_i) < c_i; sum(a_i)< A; # sum of elements smaller than A sum(b_i * a_i) < B; # weighted sum is smaller than B aT*A*a < D # quadratic multiplication with A smaller than D where c_i, b_i, A, B, D are constants. อะไรคืออัลกอริทึมทั่วไปในการสร้างเวกเตอร์ชนิดนี้อย่างมีประสิทธิภาพ

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.