สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

5
การแสดงชุดค่าผสม 2 ตัวอักษร
คำตอบสำหรับคำถามนี้เกี่ยวกับ SO ได้ส่งคืนชุดของชื่อหนึ่งถึงสองตัวประมาณ 125 ตัว: /programming/6979630/what-1-2-letter-object-names-conflict-with-existing -r วัตถุ [1] "Ad" "am" "ar" "as" "bc" "bd" "bp" "br" "BR" "bs" "by" "c" "C" [14] "cc" "cd" "ch" "ci" "CJ" "ck" "Cl" "cm" "cn" "cq" "cs" "Cs" "cv" [27] "d" "D" "dc" "dd" "de" "df" "dg" "dn" "do" "ds" "dt" "e" "E" …

2
เงื่อนไขสำหรับ M-estimator เพื่อรวมเข้ากับค่าเฉลี่ยจริง
ตัวอย่าง iid ที่ได้รับจากการแจกแจงแบบเกาส์และตัวประมาณค่า M,คุณสมบัติใดในเพียงพอที่จะรับประกันในความน่าจะเป็น? คือเป็นนูนอย่างเคร่งครัดอย่างเคร่งครัดและเพิ่มขึ้นเพียงพอ?X1,...,Xn∼N(μ,σ)X1,...,Xn∼N(μ,σ)X_1,...,X_n \sim N(\mu,\sigma) μm=argmina∑ρ(|Xi−a|)μm=argmina∑ρ(|Xi−a|)\mu_m = \underset{a}{\operatorname{argmin}} \sum\rho(|X_i-a|)ρρ\rhoμm→μμm→μ\mu_m \rightarrow \muρρ\rho
10 estimation 

1
อนุญาตให้รวมเวลาเป็นตัวทำนายในโมเดลผสมหรือไม่
ฉันเชื่อเสมอว่าเวลาไม่ควรใช้เป็นตัวทำนายในการถดถอย (รวมถึง gam's) เพราะหลังจากนั้นเราจะเพียงแค่ "อธิบาย" แนวโน้มของตัวเอง หากจุดประสงค์ของการศึกษาคือการหาพารามิเตอร์ด้านสิ่งแวดล้อมเช่นอุณหภูมิและอื่น ๆ ที่อธิบายความแปรปรวนสมมติว่ากิจกรรมของสัตว์แล้วฉันสงสัยว่าจะใช้เวลานานแค่ไหน? เป็นพร็อกซีสำหรับพารามิเตอร์ที่ไม่วัดหรือไม่? คุณสามารถดูแนวโน้มของเวลาเกี่ยวกับข้อมูลกิจกรรมของปลาโลมาที่ท่าเรือได้ที่นี่: -> จะจัดการช่องว่างในอนุกรมเวลาเมื่อใช้ GAMM ได้อย่างไร ปัญหาของฉันคือเมื่อฉันรวมเวลาในแบบจำลองของฉัน (วัดเป็นวันจูเลียน) จากนั้น 90% ของพารามิเตอร์อื่น ๆ ทั้งหมดจะไม่มีนัยสำคัญ ถ้าฉันปล่อยให้เวลาหมดแล้วบางคนก็มีความสำคัญ ... คำถามคือ: อนุญาตให้ใช้เวลาเป็นตัวพยากรณ์ (อาจจำเป็นหรือไม่) หรือทำให้การวิเคราะห์ของฉันยุ่งเหยิง? ขอบคุณมากล่วงหน้า

4
การตรวจหาค่าผิดปกติทางออนไลน์
ฉันต้องการประมวลผลภาพกล้องจุลทรรศน์แบบแบ่งส่วนโดยอัตโนมัติเพื่อตรวจจับภาพที่ผิดปกติและ / หรือการแบ่งส่วนที่ผิดพลาดซึ่งเป็นส่วนหนึ่งของขั้นตอนการถ่ายภาพความเร็วสูง มีโฮสต์ของพารามิเตอร์ที่สามารถคำนวณได้สำหรับแต่ละอิมเมจดิบและการแบ่งเซ็กเมนต์และจะกลายเป็น "สุดขีด" เมื่อรูปภาพมีข้อบกพร่อง ตัวอย่างเช่นฟองอากาศในภาพจะส่งผลให้เกิดความผิดปกติเช่นขนาดใหญ่ในหนึ่งใน "เซลล์" ที่ตรวจพบหรือจำนวนเซลล์ต่ำผิดปกติสำหรับทั้งสนาม ฉันกำลังมองหาวิธีที่มีประสิทธิภาพในการตรวจจับกรณีผิดปกติเหล่านี้ เป็นการดีที่ฉันต้องการวิธีการที่มีคุณสมบัติดังต่อไปนี้ (ตามลําดับความต้องการ): ไม่ต้องการขีด จำกัด สัมบูรณ์ที่กำหนดไว้ล่วงหน้า (แม้ว่าเปอร์เซ็นต์ที่กำหนดไว้ล่วงหน้าจะใช้ได้); ไม่จำเป็นต้องมีข้อมูลทั้งหมดในหน่วยความจำหรือแม้แต่เคยเห็นข้อมูลทั้งหมด มันจะโอเคสำหรับวิธีการปรับตัวและปรับปรุงเกณฑ์เมื่อเห็นข้อมูลเพิ่มเติม (เห็นได้ชัดว่ามีความเป็นไปได้น้อยความผิดปกติอาจเกิดขึ้นก่อนที่ระบบจะเห็นข้อมูลเพียงพอและจะพลาด ฯลฯ ) เป็นแบบขนานได้: เช่นในรอบแรกโหนดจำนวนมากทำงานในการผลิตความผิดปกติของผู้สมัครระดับกลางซึ่งจากนั้นจะได้รับการคัดเลือกรอบที่สองหนึ่งหลังจากรอบแรกเสร็จสมบูรณ์ ความผิดปกติที่ฉันกำลังมองหานั้นไม่ลึกซึ้ง มันเป็นชนิดที่ชัดเจนอย่างชัดเจนหากมองที่ฮิสโตแกรมของข้อมูล แต่ปริมาณของข้อมูลที่เป็นปัญหาและเป้าหมายสูงสุดของการตรวจจับความผิดปกติแบบเรียลไทม์เมื่อมีการสร้างภาพขึ้นตัดการแก้ปัญหาใด ๆ ขอบคุณ!
10 outliers  online 

2
มีความดีของแอนเดอร์สันที่รักการทดสอบพอดีสำหรับชุดข้อมูลสองชุดหรือไม่?
ฉันรู้ว่า ad.test () สามารถใช้สำหรับทดสอบมาตรฐานได้ เป็นไปได้ไหมที่จะรับ ad.test เพื่อเปรียบเทียบการแจกแจงจากตัวอย่างข้อมูลสองชุด? x <- rnorm(1000) y <- rgev(2000) ad.test(x,y) ฉันจะทำการทดสอบ Anderson-Darling กับ 2 ตัวอย่างได้อย่างไร

4
ทำไมประชากรศาสตร์ให้อัตราต่อ 100,000 คน?
ดูเหมือนว่าเป็นสากลที่สถิติประชากรได้รับในแง่ของประชากร 100,000 ต่อปี ตัวอย่างเช่นอัตราการฆ่าตัวตายอัตราการฆ่าตัวตายปีชีวิตที่ปรับความพิการรายการต่อไป ทำไม? ถ้าเราพูดถึงเรื่องเคมีส่วนต่อล้าน (ppm) เป็นเรื่องธรรมดา ทำไมการนับคนดูแตกต่างอย่างลึกซึ้ง จำนวน 100,000 ไม่มีพื้นฐานในระบบ SI และเท่าที่ฉันสามารถบอกได้ว่ามันไม่มีพื้นฐานเชิงประจักษ์เลยยกเว้นความสัมพันธ์ที่อ่อนแอกับเปอร์เซ็นต์ จำนวนต่อ 100,000 อาจตีความได้ว่าเป็น mili-percent, m% ฉันคิดว่ามันอาจจะคร่ำครวญบ้าง นี่เป็นสิ่งประดิษฐ์ทางประวัติศาสตร์หรือไม่? หรือมีข้อโต้แย้งใด ๆ ในการปกป้องหน่วย?
10 demography  units 

2
การเปรียบเทียบชุดอนุกรมเวลา
ฉันมีข้อมูลอนุกรมเวลาสามชุดที่ฉันต้องการเปรียบเทียบ พวกเขาถูกถ่าย 3 ช่วงเวลาแยกกันประมาณ 12 วัน เป็นค่าเฉลี่ยหัวสูงสุดและต่ำสุดของการนับหัวในห้องสมุดวิทยาลัยในช่วงสัปดาห์สุดท้าย ฉันต้องทำค่าเฉลี่ยสูงสุดและต่ำสุดเนื่องจากจำนวนหัวต่อชั่วโมงนั้นไม่ต่อเนื่อง (ดูช่องว่างข้อมูลปกติในอนุกรมเวลา ) ตอนนี้ชุดข้อมูลมีลักษณะเช่นนี้ มีจุดข้อมูลหนึ่งจุด (เฉลี่ยสูงสุดหรือต่ำสุด) ต่อเย็นเป็นเวลา 12 ค่ำ มีข้อมูล 3 ภาคการศึกษาดำเนินการเฉพาะในช่วงเวลา 12 วันของความกังวล ตัวอย่างเช่น Spring 2010, Fall 2010 และ May 2011 แต่ละชุดมี 12 คะแนน นี่คือแผนภูมิตัวอย่าง: ฉันได้เทอมเทเลเทอร์เพราะฉันต้องการที่จะดูว่ารูปแบบการเปลี่ยนแปลงจากภาคการศึกษาเพื่อภาคการศึกษา อย่างไรก็ตามตามที่ฉันได้รับแจ้งในเธรดที่เชื่อมโยงคุณไม่ควรตบท้ายเทอมหางเนื่องจากไม่มีข้อมูลในระหว่างนั้น คำถามคือแล้ว: ฉันสามารถใช้เทคนิคทางคณิตศาสตร์อะไรเพื่อเปรียบเทียบรูปแบบการเข้าเรียนสำหรับแต่ละภาคการศึกษา มีสิ่งใดเป็นพิเศษสำหรับซีรี่ส์เวลาที่ฉันต้องทำหรือฉันจะรับความแตกต่างของเปอร์เซ็นต์ได้หรือไม่? เป้าหมายของฉันคือบอกว่าการใช้ห้องสมุดในช่วงนี้กำลังจะขึ้นหรือลง ฉันไม่แน่ใจว่าฉันควรใช้เทคนิคใดในการแสดง


2
ฉันสามารถทดสอบความถูกต้องของข้อมูลที่กำหนดไว้ก่อนหน้าได้หรือไม่
ปัญหา ฉันกำลังเขียนฟังก์ชั่น R ที่ดำเนินการวิเคราะห์แบบเบย์เพื่อประเมินความหนาแน่นหลังที่ได้รับข้อมูลก่อนหน้านี้และข้อมูล ฉันต้องการให้ฟังก์ชันส่งคำเตือนหากผู้ใช้จำเป็นต้องพิจารณาใหม่ก่อน ในคำถามนี้ฉันสนใจที่จะเรียนรู้วิธีการประเมินก่อน คำถามก่อนหน้านี้ครอบคลุมกลศาสตร์ของการระบุนักบวชที่รู้แจ้ง ( ที่นี่และที่นี่ ) กรณีต่อไปนี้อาจต้องการให้ประเมินก่อนหน้า: ข้อมูลแสดงให้เห็นถึงกรณีที่รุนแรงที่ไม่ได้คิดเมื่อระบุก่อน ข้อผิดพลาดในข้อมูล (เช่นถ้าข้อมูลอยู่ในหน่วยของกรัมเมื่อก่อนอยู่ในหน่วยกิโลกรัม) ผิดก่อนถูกเลือกจากชุดของนักบวชที่มีอยู่เพราะข้อผิดพลาดในรหัส ในกรณีแรกนักบวชมักจะยังคงแพร่กระจายเพียงพอที่ข้อมูลมักจะครอบงำพวกเขาเว้นแต่ค่าข้อมูลจะอยู่ในช่วงที่ไม่ได้รับการสนับสนุน (เช่น <0 สำหรับ logN หรือ Gamma) อีกกรณีหนึ่งคือข้อบกพร่องหรือข้อผิดพลาด คำถาม มีปัญหาใด ๆ เกี่ยวกับความถูกต้องของการใช้ข้อมูลเพื่อประเมินก่อนหรือไม่? การทดสอบใดที่เหมาะสมที่สุดสำหรับปัญหานี้หรือไม่? ตัวอย่าง ต่อไปนี้เป็นชุดข้อมูลสองชุดที่จับคู่กันไม่ดีกับก่อนหน้านี้เนื่องจากมาจากกลุ่มประชากรที่มี (สีแดง) หรือN (8,0.5) (สีน้ำเงิน)logN(0,1)logN(0,1)logN(0,1)N(0,5)N(0,5)N(0,5)N(8,0.5)N(8,0.5)N(8,0.5) ข้อมูลสีน้ำเงินอาจเป็นการรวมกันของข้อมูลก่อนหน้า + ที่ถูกต้องในขณะที่ข้อมูลสีแดงจะต้องมีการแจกแจงก่อนหน้าซึ่งได้รับการสนับสนุนสำหรับค่าลบ set.seed(1) x<- seq(0.01,15,by=0.1) plot(x, dlnorm(x), type = 'l', xlim = c(-15,15),xlab='',ylab='') points(rnorm(50,0,5),jitter(rep(0,50),factor =0.2), …

1
การคำนวณอย่างรวดเร็ว / การประมาณค่าของระบบเชิงเส้นระดับต่ำ
ระบบเชิงเส้นของสมการเป็นที่แพร่หลายในสถิติการคำนวณ ระบบพิเศษหนึ่งที่ฉันได้พบ (เช่นในการวิเคราะห์ปัจจัย) คือระบบ A x = bAx=bAx=b ที่ นี่คือเมทริกซ์แนวทแยงที่มีเส้นทแยงมุมบวกอย่างเคร่งครัดคือ (กับ ) สมมาตรเมทริกซ์กึ่งแน่นอนกึ่งบวกแน่นอนและเป็นเมทริกซ์โดยพลการ เราถูกขอให้แก้ไขระบบเส้นตรงในแนวทแยง (ง่าย) ที่ได้รับการรบกวนโดยเมทริกซ์ระดับต่ำ วิธีที่ไร้เดียงสาในการแก้ปัญหาดังกล่าวข้างต้นคือการกลับโดยใช้สูตรของฟอร์ด อย่างไรก็ตามนั่นไม่ถูกต้องเนื่องจาก Cholesky และ QR factorizations สามารถเร่งแก้ปัญหาของระบบเชิงเส้น (และสมการปกติ) ได้อย่างรวดเร็ว ฉันเพิ่งมาถึง D n × n Ω เมตร× มม« n B n × เมตรA = D + B Ω BTA=D+BΩBTA=D+ B \Omega B^TDDDn × nn×nn\times nΩΩ\Omegam …


2
วิธีประมาณค่าพารามิเตอร์สำหรับตัวกรองคาลมาน
ในคำถามก่อนหน้านี้ฉันถามเกี่ยวกับการแจกแจงที่เหมาะสมกับข้อมูลเชิงประจักษ์ที่ไม่ใช่แบบเกาส์ ขอแนะนำให้ฉันออฟไลน์เพื่อลองใช้ข้อสันนิษฐานว่าข้อมูลเป็นแบบเกาส์และติดตั้งตัวกรองคาลมานก่อน จากนั้นขึ้นอยู่กับข้อผิดพลาดตัดสินใจว่ามันคุ้มค่าในการพัฒนาสิ่งที่นักเล่น นั่นทำให้รู้สึก ดังนั้นด้วยชุดข้อมูลอนุกรมเวลาที่ดีฉันต้องประเมินตัวแปรหลายตัวเพื่อให้ตัวกรองคาลมานทำงาน (แน่นอนว่าอาจมีแพ็คเกจ R อยู่ที่ไหนซักแห่ง แต่ฉันต้องการเรียนรู้วิธีการทำสิ่งนี้ด้วยตัวเอง)

3
ITT และ ATE ต่างกันอย่างไร
ฉันมีปัญหาในการทำความเข้าใจตัวประมาณค่าต่าง ๆ ที่สามารถใช้ในการประเมินผลกระทบ ฉันรู้ว่าตัวประมาณความตั้งใจในการปฏิบัติ (ITT) เปรียบเทียบความแตกต่างระหว่างบุคคลที่มีสิทธิ์โดยไม่ต้องใช้โปรแกรมและบุคคลที่มีสิทธิ์เข้าร่วมโปรแกรม อย่างไรก็ตามฉันคิดว่าผลการรักษาโดยเฉลี่ย (ATE) ก็วัดเช่นเดียวกัน อย่างไรก็ตามดูเหมือนว่า ATE จะพิจารณาการปฏิบัติตาม ดังนั้นจึงเปรียบเทียบผลลัพธ์ระหว่างผู้ที่มีคุณสมบัติเหมาะสมกับการเข้ารับการรักษากับผู้ที่ไม่มีคุณสมบัติ ถูกต้องหรือไม่

2
เหตุผลในการใช้ AUC?
โดยเฉพาะอย่างยิ่งในด้านวิทยาศาสตร์คอมพิวเตอร์ของวรรณกรรมการเรียนรู้ของเครื่อง AUC (พื้นที่ภายใต้เส้นโค้งลักษณะตัวดำเนินการรับ) เป็นเกณฑ์ยอดนิยมสำหรับการประเมินตัวแยกประเภท การใช้ AUC มีเหตุผลอะไรบ้าง เช่นมีฟังก์ชั่นการสูญเสียพิเศษซึ่งการตัดสินใจที่เหมาะสมที่สุดคือตัวจําแนกด้วย AUC ที่ดีที่สุดหรือไม่

6
วิธีที่ดีที่สุดในการโต้ตอบกับเซสชัน R ที่ทำงานในคลาวด์
ล็อคแล้ว คำถามและคำตอบของคำถามนี้ถูกล็อคเนื่องจากคำถามอยู่นอกหัวข้อ แต่มีความสำคัญทางประวัติศาสตร์ ขณะนี้ไม่ยอมรับคำตอบหรือการโต้ตอบใหม่ ฉันมี R ทำงานบน EC2 Amazon, ใช้รุ่นแก้ไขของBioconductor AMI ขณะนี้ฉันกำลังใช้ putty เพื่อ ssh ในเซิร์ฟเวอร์ของฉันเริ่มต้น R จากบรรทัดคำสั่งแล้วคัดลอกและวางสคริปต์ของฉันจาก notepad ++ ลงในเซสชั่นฉาบของฉัน สิ่งคือฉันเกลียดการตัดและวาง รู้สึกถึงยุคหินและบางครั้งฉันก็มีปัญหาเรื่องบัฟเฟอร์ที่ทำให้รหัสของฉันผิดพลาด ฉันไม่สามารถใช้RStudioเพราะมันไม่รองรับมัลติคอร์ซึ่งขึ้นอยู่กับฉัน วิธีที่สง่างามกว่านี้คืออะไร? / แก้ไข: ขอบคุณสำหรับคำแนะนำที่ดีทั้งหมด สำหรับตอนนี้ฉันได้เปลี่ยนไปใช้ foreach กับแบ็กเอนด์ doRedis ซึ่งใช้งานได้ดีกับ Mac, PC ของฉันและ amazon ผ่าน RStudio สวิตช์นี้ค่อนข้างง่ายเมื่อฉันเรียนรู้วิธีเขียนฟังก์ชันที่เลียนแบบ "lapply"โดยใช้ "foreach" (นอกจากนี้ doRedis ยอดเยี่ยมมาก!)
10 r 

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.