สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
ทฤษฎีข้อมูล จำกัด ทฤษฎีบทกลาง
รูปแบบที่ง่ายที่สุดของ CLT เชิงทฤษฎีข้อมูล ได้แก่ : ให้จะ IID ที่มีค่าเฉลี่ยและความแปรปรวน1 ปล่อยให้f_nเป็นความหนาแน่นของผลรวม\ frac {\ sum_ {i = 1} ^ n X_i} {\ sqrt {n}}และ\ phiเป็นความหนาแน่นแบบเกาส์มาตรฐาน จากนั้นข้อมูลเชิงทฤษฎี CLT ระบุว่าถ้าD (f_n \ | \ phi) = \ int f_n \ log (f_n / \ phi) dxมีขอบเขตสำหรับnบางตัวดังนั้นD (f_n \ | \ phi) \ to 0เป็นn \ …

5
การทำคลัสเตอร์เป็นวิธีการแยกข้อมูลสำหรับการถดถอยโลจิสติก
ฉันพยายามที่จะทำนายความสำเร็จหรือความล้มเหลวของนักเรียนตามคุณลักษณะบางอย่างที่มีรูปแบบการถดถอยโลจิสติก เพื่อปรับปรุงประสิทธิภาพของแบบจำลองฉันได้คิดถึงการแบ่งนักเรียนออกเป็นกลุ่มต่าง ๆ โดยพิจารณาจากความแตกต่างที่ชัดเจนและการสร้างแบบจำลองแยกกันสำหรับแต่ละกลุ่ม แต่ฉันคิดว่ามันอาจเป็นเรื่องยากที่จะระบุกลุ่มเหล่านี้โดยการสอบดังนั้นฉันจึงคิดว่าจะแยกนักเรียนออกเป็นกลุ่มโดยการรวมกลุ่มกับคุณลักษณะของพวกเขา นี่เป็นวิธีปฏิบัติทั่วไปในการสร้างแบบจำลองดังกล่าวหรือไม่? คุณจะแนะนำให้ฉันแบ่งมันออกเป็นกลุ่มชัดเจน (ตัวอย่างเช่นนักเรียนภาคเรียนแรกกับนักเรียนที่กลับมา) จากนั้นทำการจัดกลุ่มในกลุ่มเหล่านั้นหรือกลุ่มจากจุดเริ่มต้น หากต้องการพยายามชี้แจง: สิ่งที่ฉันหมายถึงคือฉันกำลังพิจารณาใช้อัลกอริทึมการจัดกลุ่มเพื่อแยกชุดฝึกอบรมสำหรับการถดถอยโลจิสติกออกเป็นกลุ่ม จากนั้นฉันจะทำการแยกการถดถอยแบบโลจิสติกส์สำหรับแต่ละกลุ่มเหล่านั้น จากนั้นเมื่อใช้การถดถอยโลจิสติกในการทำนายผลลัพธ์สำหรับนักเรียนฉันจะเลือกรูปแบบที่จะใช้ขึ้นอยู่กับกลุ่มที่พวกเขาเหมาะสมที่สุด บางทีฉันอาจทำสิ่งเดียวกันโดยรวมตัวระบุกลุ่มตัวอย่างเช่น 1 ถ้านักเรียนกลับมาและเป็น 0 ถ้าไม่ใช่ ตอนนี้คุณมีฉันคิดว่ามันอาจจะเป็นประโยชน์ในการจัดกลุ่มชุดข้อมูลการฝึกอบรมและการใช้ป้ายชื่อกลุ่มของพวกเขาเป็นคุณสมบัติในการถดถอยโลจิสติกมากกว่าการสร้างแบบจำลองการถดถอยโลจิสติกแยกสำหรับแต่ละประชากร หากมีประโยชน์ที่จะรวมตัวระบุกลุ่มสำหรับผู้ที่ส่งคืนนักเรียนกับนักเรียนใหม่อาจเป็นประโยชน์หรือไม่ที่จะขยายรายการกลุ่ม การจัดกลุ่มดูเหมือนเป็นวิธีธรรมชาติในการทำเช่นนี้ ฉันหวังว่าชัดเจน ...

2
จะประมาณความแม่นยำของอินทิกรัลได้อย่างไร?
สถานการณ์ที่พบบ่อยมากในคอมพิวเตอร์กราฟฟิคคือสีของบางพิกเซลเท่ากับส่วนที่สำคัญของฟังก์ชั่นที่มีมูลค่าจริง บ่อยครั้งที่ฟังก์ชั่นนั้นซับซ้อนเกินกว่าที่จะแก้ปัญหาเชิงวิเคราะห์ดังนั้นเราจึงเหลือการประมาณเชิงตัวเลข แต่ฟังก์ชั่นมักจะมีราคาแพงมากในการคำนวณดังนั้นเราจึงถูก จำกัด อย่างมากในจำนวนตัวอย่างที่เราสามารถคำนวณได้ (เช่นคุณไม่สามารถตัดสินใจที่จะรับตัวอย่างหนึ่งล้านตัวอย่างและทิ้งไว้ที่นี่) โดยทั่วไปแล้วสิ่งที่คุณต้องการทำคือประเมินฟังก์ชันที่จุดที่เลือกแบบสุ่มจนกระทั่งอินทิกรัลประมาณกลายเป็น "แม่นยำเพียงพอ" ซึ่งนำมาสู่คำถามจริงของฉัน: คุณประเมิน "ความถูกต้อง" ของอินทิกรัลอย่างไร? โดยเฉพาะอย่างยิ่งเรามีซึ่งดำเนินการโดยอัลกอริทึมคอมพิวเตอร์ที่ซับซ้อนและช้า เราต้องการประเมินf:R→Rf:R→Rf : \mathbb{R} \rightarrow \mathbb{R} k=∫baf(x) dxk=∫abf(x) dxk = \int_a^b f(x) \ dx เราสามารถคำนวณสำหรับเราปรารถนาได้ แต่มันมีราคาแพง ดังนั้นเราต้องการเลือกค่าหลายค่าแบบสุ่มและหยุดเมื่อค่าประมาณของกลายเป็นที่ยอมรับได้อย่างแม่นยำ แน่นอนว่าในการทำเช่นนี้เราจำเป็นต้องทราบว่าการประมาณการในปัจจุบันนั้นแม่นยำเพียงใดx x kf(x)f(x)f(x)xxxxxxkkk ฉันไม่แน่ใจด้วยซ้ำว่าเครื่องมือทางสถิติใดที่เหมาะสำหรับปัญหาประเภทนี้ แต่สำหรับฉันแล้วดูเหมือนว่าถ้าเราไม่รู้อะไรเกี่ยวกับอย่างแน่นอนปัญหาก็แก้ไม่ได้ ตัวอย่างเช่นถ้าคุณคำนวณหนึ่งพันครั้งและมันก็เป็นศูนย์เสมออินทิกรัลที่ประมาณไว้ของคุณจะเป็นศูนย์ แต่ไม่รู้อะไรเลยเกี่ยวกับf ( x ) fffff(x)f(x)f(x)fffมันยังคงเป็นไปได้ที่ทุกที่ยกเว้นจุดที่คุณสุ่มตัวอย่างดังนั้นการประเมินของคุณจึงผิดอย่างมาก!f(x)=1,000,000f(x)=1,000,000f(x) = 1,000,000 บางทีคำถามของฉันควรเริ่มด้วย"เราต้องรู้อะไรเกี่ยวกับเพื่อให้สามารถประเมินความถูกต้องของอินทิกรัลของเราได้fff ?" ตัวอย่างเช่นเรามักรู้ว่าเป็นไปไม่ได้ที่จะเป็นลบซึ่งดูเหมือนจะเป็นข้อเท็จจริงที่เกี่ยวข้อง ...fff แก้ไข:ตกลงดังนั้นสิ่งนี้ดูเหมือนจะสร้างคำตอบมากมายซึ่งเป็นสิ่งที่ดี แทนที่จะตอบกลับเป็นรายบุคคลฉันจะพยายามเติมภูมิหลังเพิ่มเติมที่นี่ เมื่อฉันบอกว่าเรารู้ "ไม่มีอะไร" …

1
ทดสอบคุณสมบัติมาร์คอฟในอนุกรมเวลา
รับ (ปฏิบัติ) เวลาชุดกับX T ∈ { 1 , . . , n }จะมีการทดสอบทางสถิติสำหรับการทดสอบด้วย null สมมติฐานที่ว่าP ( X T | X T - 1 , X T - 2 , . . . , X 1 ) = P ( X T | X T - 1 ) ( เช่นคุณสมบัติมาร์คอฟ)?Xเสื้อXเสื้อX_tXเสื้อ∈ { …

6
การระบุค่าผิดปกติสำหรับการถดถอยเชิงเส้น
ฉันกำลังวิจัยเกี่ยวกับการตอบสนองการทำงานของไร ฉันต้องการทำการถดถอยเพื่อประเมินพารามิเตอร์ (อัตราการโจมตีและเวลาจัดการ) ของฟังก์ชัน Rogers type II ฉันมีชุดข้อมูลของการวัด ฉันจะกำหนดค่าผิดปกติได้ดีที่สุดอย่างไร สำหรับการถดถอยของฉันฉันใช้สคริปต์ต่อไปนี้ใน R (การถดถอยเชิงเส้นที่ไม่ใช่): (dateet เป็นไฟล์ข้อความ 2 คอลัมน์แบบง่าย ๆ ที่เรียกว่าdata.txtไฟล์ที่มีN0ค่า (จำนวนเหยื่อเริ่มต้น) และFRค่า (จำนวนเหยื่อกินในช่วง 24 ชั่วโมง): library("nlstools") dat <- read.delim("C:/data.txt") #Rogers type II model a <- c(0,50) b <- c(0,40) plot(FR~N0,main="Rogers II normaal",xlim=a,ylim=b,xlab="N0",ylab="FR") rogers.predII <- function(N0,a,h,T) {N0 - lambertW(a*h*N0*exp(-a*(T-h*N0)))/(a*h)} params1 <- list(attackR3_N=0.04,Th3_N=1.46) RogersII_N …

3
กิจกรรมในชั้นเรียน / การทดลองเพื่อสอนแนวคิดทางสถิติ?
ฉันตั้งใจจะให้การบรรยายหนึ่งชั่วโมงแก่วัยรุ่นเกี่ยวกับสถิติ ฉันอาจจะเห็นพวกเขาเพียงครั้งเดียว สถานการณ์นี้อาจเกิดขึ้นซ้ำแล้วซ้ำอีก ฉันต้องการให้กิจกรรมบางอย่างแก่พวกเขาเพื่อให้พวกเขาได้รับประสบการณ์ทางสถิติ แต่ฉันถูกบังคับให้ทำกับคนที่ไม่รู้อะไรเกี่ยวกับความน่าจะเป็นการอนุมานเชิงสถิติการวิเคราะห์เชิงสำรวจเป็นต้น ความคิดของฉันคือการใช้ "เล่ห์เหลี่ยม" การสร้างภาพอย่างง่าย ๆ ซึ่งบางครั้งสื่อใช้และทำให้ debunk นิดหน่อย (โปรดอย่าให้ลิงค์กับ "วิธีการโกหกด้วยสถิติ" ให้ฉัน) อีกแนวคิดหนึ่งคือให้การมอบหมายให้พวกเขาทำการทดสอบเพื่อค้นหาบางสิ่ง ตัวอย่างเช่นการค้นหาว่าพวกเขาสามารถตรวจพบความแตกต่างระหว่างโคคาโคล่าและ RC โคล่าหรือไม่ ฉันกำลังมองหาคำแนะนำใด ๆ สำหรับสิ่งที่จะทำกับพวกเขาหรือทรัพยากรด้วยวัสดุที่เกี่ยวข้อง
11 teaching 

3
หนังสือที่ดีครอบคลุมกระบวนการเตรียมข้อมูลและเทคนิคการตรวจหาค่าผิดปกติ
ใคร ๆ ก็รู้ว่าหนังสือทันสมัยที่ครอบคลุมข้อมูลก่อนการประมวลผลโดยทั่วไปและโดยเฉพาะอย่างยิ่งเทคนิคการตรวจหาค่าผิดปกติหรือไม่ หนังสือเล่มนี้ไม่จำเป็นต้องให้ความสำคัญกับเรื่องนั้นเป็นพิเศษ แต่ควรจัดการกับหัวข้อดังกล่าวอย่างละเอียดถี่ถ้วน - ฉันจะไม่พอใจกับสิ่งที่เป็นจุดเริ่มต้นและเสนอราคารายการเอกสารคำอธิบายเกี่ยวกับเทคนิคต่าง ๆ จะต้องปรากฏใน หนังสือตัวเอง เทคนิคในการจัดการกับข้อมูลที่หายไปที่ต้องการ แต่ไม่จำเป็น ...

2
การคำนวณมิติ VC ของเครือข่ายประสาทเทียม
ถ้าฉันมีโทโพโลยีที่ไม่เกิดขึ้นอีกคงที่ (DAG) (ชุดคงที่ของโหนดและขอบ แต่อัลกอริทึมการเรียนรู้สามารถเปลี่ยนแปลงน้ำหนักบนขอบ) ของ sigmoid neurons กับเซลล์ประสาทซึ่งสามารถใช้สตริงใน{ - 1 , 1 } nเป็นอินพุตและนำไปสู่หนึ่งเอาต์พุต (ซึ่งส่งออกมูลค่าจริงที่เราปัดขึ้นเป็น 1 หรือลงไปที่ -1 หากเป็นค่าคงที่ที่กำหนดไว้แน่นอนจาก 0) มีวิธีใดในการคำนวณ (หรือโดยประมาณ) VC-dimension ของเครือข่ายนี้หรือไม่?nnn{ - 1 , 1 }n{−1,1}n\{-1,1\}^n หมายเหตุ ฉันถามการปรับปรุงอัลกอริทึมที่แม่นยำยิ่งขึ้นเล็กน้อยใน CS.SE: การคำนวณอย่างมีประสิทธิภาพหรือประมาณมิติ VC ของเครือข่ายประสาทเทียม


2
ฉันจะปรับปรุงเสถียรภาพเครือข่ายประสาทของฉันได้อย่างไร
ฉันใช้ neuralnet ใน R เพื่อสร้าง NN พร้อมอินพุต 14 ช่องและเอาต์พุตเดียว ฉันสร้าง / ฝึกอบรมเครือข่ายหลายครั้งโดยใช้ข้อมูลการฝึกอบรมอินพุตเดียวกันและสถาปัตยกรรมเครือข่าย / การตั้งค่าเดียวกัน หลังจากสร้างเครือข่ายแล้วฉันจะใช้กับชุดข้อมูลทดสอบแบบสแตนด์อโลนเพื่อคำนวณค่าที่คาดการณ์ไว้ ฉันพบว่ามีความแปรปรวนจำนวนมากในแต่ละรอบซ้ำของข้อมูลที่คาดการณ์ถึงแม้ว่าอินพุตทั้งหมด (ทั้งข้อมูลการฝึกอบรมและข้อมูลการทดสอบ) จะยังคงเหมือนเดิมทุกครั้งที่ฉันสร้างเครือข่าย ฉันเข้าใจว่าจะมีความแตกต่างของน้ำหนักที่ผลิตภายใน NN ในแต่ละครั้งและจะไม่มีเครือข่ายประสาทเทียมสองเครือข่ายเหมือนกัน แต่ฉันจะพยายามสร้างเครือข่ายที่สอดคล้องกันมากขึ้นในแต่ละขบวนรถไฟได้อย่างไรจากข้อมูลที่เหมือนกัน

2
จะทำการเปรียบเทียบโพสต์เฉพาะกิจในคำที่ใช้โต้ตอบกับแบบจำลองเอฟเฟกต์ผสมได้อย่างไร
ฉันกำลังทำงานกับชุดข้อมูลเพื่อประเมินผลกระทบของการทำแห้งต่อกิจกรรมของจุลินทรีย์ในตะกอน มีวัตถุประสงค์เพื่อตรวจสอบว่าผลกระทบของการอบแห้งแตกต่างกันไปตามประเภทของตะกอนและ / หรือความลึกภายในตะกอนหรือไม่ การออกแบบการทดลองมีดังนี้: ตะกอนปัจจัยแรกสอดคล้องกับตะกอนสามประเภท (รหัส Sed1, Sed2, Sed3) สำหรับตะกอนแต่ละประเภทการสุ่มตัวอย่างดำเนินการในสามไซต์ (3 ไซต์สำหรับ Sed1, 3 ไซต์สำหรับ Sed2, 3 ไซต์สำหรับ Sed3) มีการเข้ารหัสเว็บไซต์ : ไซต์ 1, ไซต์ 2, ... , ไซต์ 9 ปัจจัยต่อไปคืออุทกวิทยา : ภายในแต่ละไซต์ทำการสุ่มตัวอย่างในพื้นที่แห้งและในแปลงเปียก (แปลงแห้ง / เปียก) ภายในแต่ละพล็อตก่อนหน้าการสุ่มตัวอย่างจะดำเนินการที่สองความลึก (D1, D2) เป็นสามเท่า มีทั้งหมด n = 108 ตัวอย่าง = 3 ตะกอน * 3 …

4
การประเมินความสามารถคาดการณ์ของอนุกรมเวลา
สมมติว่าฉันมีซีรี่ส์เวลารายเดือนมากกว่า 20,000 รายการที่ครอบคลุมตั้งแต่ Jan'05 ถึง Dec'11 แต่ละเหล่านี้แสดงข้อมูลการขายทั่วโลกสำหรับผลิตภัณฑ์ที่แตกต่างกัน ถ้าหากฉันคำนวณการคาดการณ์สำหรับแต่ละคนฉันต้องการเน้นเฉพาะผลิตภัณฑ์จำนวนเล็กน้อยที่ "สำคัญ" จริงหรือไม่ ฉันสามารถจัดอันดับผลิตภัณฑ์เหล่านั้นตามรายได้รวมต่อปีและตัดรายการโดยใช้ Pareto แบบดั้งเดิม ถึงกระนั้นฉันก็ดูเหมือนว่าแม้ว่าพวกเขาจะไม่ได้มีส่วนช่วยอะไรมาก แต่ผลิตภัณฑ์บางอย่างนั้นง่ายที่จะคาดการณ์ว่าการปล่อยพวกเขาออกไปจะเป็นการตัดสินที่ไม่ดี ผลิตภัณฑ์ที่ขายมูลค่า 50 ดอลลาร์ในแต่ละเดือนในช่วง 10 ปีที่ผ่านมาอาจไม่ฟังดูมากนัก แต่มันต้องใช้ความพยายามเพียงเล็กน้อยในการสร้างการคาดการณ์เกี่ยวกับยอดขายในอนาคตที่ฉันอาจทำได้เช่นกัน สมมุติว่าฉันแบ่งผลิตภัณฑ์ออกเป็นสี่หมวดหมู่: รายได้สูง / ง่ายต่อการคาดการณ์ - รายได้ต่ำ / ง่ายต่อการคาดการณ์ - รายได้สูง / ยากต่อการคาดการณ์ - รายได้ต่ำ / ยากต่อการคาดการณ์ ฉันคิดว่ามันสมเหตุสมผลที่จะทิ้งไว้ข้างหลังเฉพาะซีรี่ส์เวลาที่เป็นของกลุ่มที่สี่ แต่ฉันจะประเมิน "การคาดการณ์" ได้อย่างไร ค่าสัมประสิทธิ์ของความแปรปรวนดูเหมือนจะเป็นจุดเริ่มต้นที่ดี แต่จะเกิดอะไรขึ้นถ้าอนุกรมเวลาของฉันแสดงฤดูกาล / การเลื่อนระดับ / เอฟเฟกต์ปฏิทิน / แนวโน้มที่แข็งแกร่ง ฉันคิดว่าฉันควรประเมินจากการสุ่มส่วนประกอบเท่านั้นและไม่ใช่หนึ่งในข้อมูล …

1
ค่าสัมประสิทธิ์จินีและขอบเขตข้อผิดพลาด
ฉันมีชุดข้อมูลเวลาที่มี N = 14 นับในแต่ละช่วงเวลาและฉันต้องการคำนวณค่าสัมประสิทธิ์ Gini และข้อผิดพลาดมาตรฐานสำหรับการประมาณนี้ในแต่ละช่วงเวลา เนื่องจากฉันมีเพียง N = 14 นับในแต่ละครั้งที่ฉันดำเนินการคำนวณความแปรปรวนของขนุนคือจากสม 7 ของ Tomson Ogwang 'วิธีการที่สะดวกในการคำนวณดัชนี Gini และ' ข้อผิดพลาดมาตรฐาน' ที่ไหนเป็นสัมประสิทธิ์จีนีของค่า N โดยไม่ต้ององค์ประกอบและเป็นค่าเฉลี่ยของk)var( G ) = n - 1n× ∑nk = 1( G ( n , k ) - G¯( n ) )2var⁡(G)=n-1n×Σk=1n(G(n,k)-G¯(n))2\operatorname{var}(G) = \frac{n-1}{n} \times \sum_{k=1}^n (G(n,k)-\bar{G}(n))^2G ( n …

3
ทำไมคนเราถึงใช้อายุที่เท่ากันในการศึกษาความสัมพันธ์ทางพันธุกรรม?
ทำไมคนเราถึงใช้อายุและอายุเท่ากันในการศึกษาความสัมพันธ์ทางพันธุกรรม? ฉันสามารถเข้าใจการใช้อายุถ้ามันได้รับการระบุว่าเป็นตัวแปรสำคัญ

2
การรายงานผลลัพธ์ของการถดถอยเชิงเส้นอย่างง่าย: มีข้อมูลอะไรให้บ้าง
ฉันเพิ่งทำการถดถอยเชิงเส้นแบบง่าย ๆ (ใน) ใน Genstat และต้องการรวมการสรุปรวบยอดและมีความหมายของผลลัพธ์ในรายงานของฉัน ฉันไม่แน่ใจว่าข้อมูลที่ฉันควรจะรวมหรือจำนวนเท่าใด บิตหลักของเอาต์พุต Genstat ของฉันมีลักษณะเช่นนี้: Summary of analysis Source d.f. s.s. m.s. v.r. F pr. Regression 1 8128935. 8128935. 814.41 <.001 Residual 53 529015. 9981. Total 54 8657950. 160332. Percentage variance accounted for 93.8 Standard error of observations is estimated to be 99.9. Estimates of …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.