สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
ความแตกต่างระหว่างซีรีย์ดริฟท์และซีรีย์ที่มีเทรนด์
ชุดมีดริฟท์สามารถจำลองเป็น ที่เป็นดริฟท์ (คงที่) และ 1 Yเสื้อ= c + ϕ yt - 1+ εเสื้อYเสื้อ=ค+φYเสื้อ-1+εเสื้อy_t = c + \phi y_{t-1} + \varepsilon_tคคcϕ = 1φ=1\phi=1 ชุดที่มีแนวโน้มสามารถจำลองเป็นที่เป็นดริฟท์ (คงที่),เป็นแนวโน้มเวลาที่กำหนดและ 1Yเสื้อ= c + δt + ϕ yt - 1+ εเสื้อYเสื้อ=ค+δเสื้อ+φYเสื้อ-1+εเสื้อy_t = c + \delta t + \phi y_{t-1} + \varepsilon_tคคcδเสื้อδเสื้อ\delta tφ= 1φ=1\phi=1 ทั้งสองซีรี่ส์เป็นและฉันคิดว่าทั้งคู่แสดงพฤติกรรมที่เพิ่มขึ้นผม( 1 )ผม(1)I(1) หากฉันมีซีรี่ส์ใหม่ที่แสดงพฤติกรรมที่เพิ่มขึ้นฉันจะรู้ได้อย่างไรว่าซีรี่ส์นี้เป็นซีรี่ส์ที่มีการดริฟท์หรือมีแนวโน้ม …

1
อะไรคือเงื่อนไขปกติสำหรับการทดสอบอัตราส่วนความน่าจะเป็น
ใครช่วยกรุณาบอกฉันว่าเงื่อนไขปกติสำหรับการกระจาย asymptotic ของการทดสอบอัตราส่วนความน่าจะเป็นคืออะไร? ทุกที่ที่ฉันมองมันเขียนว่า 'ภายใต้เงื่อนไขของระเบียบ' หรือ 'ภายใต้ระเบียบที่น่าจะเป็น' เงื่อนไขอะไรกันแน่? มีอนุพันธ์ของความน่าจะเป็นบันทึกแรกและตัวที่สองและเมทริกซ์ข้อมูลไม่เป็นศูนย์หรือไม่? หรืออย่างอื่นอย่างสิ้นเชิง?

2
การวัดแบบไม่อิงพารามิเตอร์ของความแข็งแรงของการเชื่อมโยงระหว่างลำดับและตัวแปรสุ่มแบบต่อเนื่อง
ฉันทิ้งปัญหาไว้ที่นี่เพื่อรับมัน ฉันมีตัวแปรสุ่มสองตัว หนึ่งในนั้นคือต่อเนื่อง (Y) และอีกอันหนึ่งซึ่งไม่ต่อเนื่องและจะเข้าหาเป็นลำดับ (X) ฉันวางพล็อตด้านล่างที่ฉันได้รับพร้อมกับข้อความค้นหา คนที่ส่งข้อมูลมาให้ฉันต้องการวัดความแข็งแกร่งของการเชื่อมโยงระหว่าง X และ Y ฉันกำลังมองหาแนวคิดที่จะไม่มาพร้อมกับข้อสันนิษฐานเกี่ยวกับกระบวนการที่สร้างข้อมูล หมายเหตุว่านี้ไม่ได้เกี่ยวกับการหาวิธีที่พาราไม่ใช่เพื่อทดสอบความแข็งแรงของความสัมพันธ์ (ในขณะที่บูต) แต่เกี่ยวกับการหาวิธีที่ไม่ใช่ตัวแปรที่จะวัดมัน ในทางตรงกันข้ามประสิทธิภาพไม่ใช่ปัญหาเนื่องจากมีจุดข้อมูลจำนวนมาก

1
อะไรทำให้รูปแบบตัว U อยู่ในความสัมพันธ์เชิงพื้นที่?
ฉันสังเกตเห็นในงานของฉันเองแบบนี้เมื่อตรวจสอบความสัมพันธ์เชิงพื้นที่ที่ระยะทางที่แตกต่างกันรูปแบบรูปตัวยูในความสัมพันธ์ที่โผล่ออกมา โดยเฉพาะอย่างยิ่งความสัมพันธ์เชิงบวกที่แข็งแกร่งที่ถังขยะขนาดเล็กลดลงตามระยะทางจากนั้นไปถึงหลุมที่จุดใดจุดหนึ่งแล้วไต่กลับขึ้นไป นี่คือตัวอย่างจากบล็อกอนุรักษ์ระบบนิเวศน์Macroecology สนามเด็กเล่น (3) - อัตเชิงพื้นที่ ความสัมพันธ์เชิงบวกที่เป็นบวกอัตโนมัติที่แข็งแกร่งเหล่านี้ในระยะทางที่ใหญ่กว่านั้นเป็นการละเมิดกฎข้อแรกของภูมิศาสตร์ภูมิศาสตร์ของ Tobler ดังนั้นฉันจึงคาดว่าจะเกิดจากรูปแบบอื่นในข้อมูล ฉันคาดหวังว่าพวกเขาจะถึงศูนย์ในระยะทางที่แน่นอนจากนั้นเลื่อนเมาส์ไปรอบ ๆ 0 ที่ระยะทางไกลกว่า (ซึ่งเป็นสิ่งที่เกิดขึ้นโดยทั่วไปในชุดอนุกรมเวลาที่มีคำสั่ง AR หรือ MA ต่ำ) หากคุณทำการค้นหารูปภาพของ Googleคุณสามารถค้นหาตัวอย่างอื่น ๆ ของรูปแบบประเภทเดียวกันนี้ได้ (ดูตัวอย่างอื่นที่นี่ได้ที่นี่ ) ผู้ใช้บนไซต์ GIS ได้โพสต์สองตัวอย่างที่รูปแบบปรากฏสำหรับ Moran I แต่ไม่ปรากฏสำหรับ Geary C ( 1 , 2 ) ร่วมกับงานของฉันเองรูปแบบเหล่านี้สามารถสังเกตได้จากข้อมูลต้นฉบับ แต่เมื่อปรับโมเดลให้เหมาะสมกับเงื่อนไขเชิงพื้นที่และตรวจสอบสิ่งตกค้างที่เหลือพวกมันจะไม่ปรากฏตัว ฉันไม่ได้เจอตัวอย่างในการวิเคราะห์อนุกรมเวลาที่แสดงพล็อต ACF ที่คล้ายกันดังนั้นฉันไม่แน่ใจว่ารูปแบบใดในข้อมูลดั้งเดิมจะทำให้เกิดสิ่งนี้ Scortchi ในความคิดเห็นนี้คาดการณ์ว่ารูปแบบไซน์ อาจเกิดจากรูปแบบตามฤดูกาลที่ถูกละเว้นในซีรีส์เวลานั้น แนวโน้มเชิงพื้นที่ประเภทเดียวกันอาจทำให้เกิดรูปแบบนี้ในรูปคู่เชิงพื้นที่ได้หรือไม่ หรือมันเป็นสิ่งประดิษฐ์อื่น ๆ ของวิธีการคำนวณความสัมพันธ์? …

1
วิธีสร้างเส้นโค้ง Precision-Recall เมื่อฉันมีเพียงค่าเดียวสำหรับ PR?
ฉันมีการกำหนด data mining ที่ฉันทำระบบดึงภาพตามเนื้อหา ฉันมี 20 ภาพจาก 5 สัตว์ ดังนั้นทั้งหมด 100 ภาพ ระบบของฉันคืนค่า 10 ภาพที่เกี่ยวข้องมากที่สุดไปยังภาพอินพุต ตอนนี้ฉันต้องประเมินประสิทธิภาพของระบบของฉันด้วยเส้นโค้ง Precision-Recall อย่างไรก็ตามฉันไม่เข้าใจแนวคิดของเส้นโค้ง Precision-Recall สมมติว่าระบบของฉันส่งคืนรูปภาพ 10 ภาพสำหรับภาพลิงกอริลลา แต่มี 4 ภาพเท่านั้นเป็นภาพลิงกอริลลา อีก 6 รูปที่ส่งคืนเป็นสัตว์อื่น ' ดังนั้น, ความแม่นยำคือ4/10 = 0.4(กลับมาที่เกี่ยวข้อง) / (คืนทั้งหมด) การเรียกคืนคือ4/20 = 0.2(คืนที่เกี่ยวข้อง) / (ที่เกี่ยวข้องทั้งหมด) ดังนั้นฉันจึงมีเพียงจุด<0.2,0.4>ไม่ใช่เส้นโค้ง ฉันจะมีเส้นโค้งอย่างไร (เช่นชุดของคะแนน) ฉันควรเปลี่ยนจำนวนภาพที่ส่งคืน (กรณีนี้กำหนดไว้ที่ 10 ในกรณีของฉัน) หรือไม่

2
Probit กำลังสองน้อยที่สุดสองขั้นตอน (2SLS)
ฉันได้รับการบอกว่าเป็นไปได้ที่จะเรียกใช้การถดถอย IV แบบสองขั้นตอนโดยขั้นตอนแรกเป็น probit และขั้นตอนที่สองคือ OLS เป็นไปได้ไหมที่จะใช้ 2SLS หากระยะแรกเป็น probit แต่ขั้นตอนที่สองเป็นแบบ probit / poisson?

1
การทดสอบชุดข้อมูลขนาดใหญ่เพื่อหาข้อได้เปรียบ - อย่างไรและเชื่อถือได้อย่างไร?
ฉันกำลังตรวจสอบส่วนหนึ่งของชุดข้อมูลของฉันที่มีค่าสองเท่า 46840 ตั้งแต่ 1 ถึง 1690 จัดกลุ่มในสองกลุ่ม เพื่อที่จะวิเคราะห์ความแตกต่างระหว่างกลุ่มเหล่านี้ฉันเริ่มต้นด้วยการตรวจสอบการกระจายของค่าเพื่อเลือกการทดสอบที่ถูกต้อง ทำตามคำแนะนำในการทดสอบความเป็นมาตรฐานฉันทำ qqplot, histogram & boxplot นี่ดูเหมือนจะไม่ใช่การแจกแจงแบบปกติ เนื่องจากไกด์ระบุค่อนข้างถูกต้องว่าการตรวจสอบเชิงกราฟิกล้วนไม่เพียงพอฉันจึงต้องการทดสอบการแจกแจงแบบปกติ เมื่อพิจารณาถึงขนาดของชุดข้อมูลและข้อ จำกัด ของการทดสอบ shapiro-wilks ใน R แล้วการแจกแจงที่ให้มาจะถูกทดสอบเพื่อความเป็นมาตรฐานและพิจารณาขนาดของชุดข้อมูลเป็นสิ่งที่น่าเชื่อถือหรือไม่ ( ดูคำตอบที่ยอมรับสำหรับคำถามนี้ ) แก้ไข: ข้อ จำกัด ของการทดสอบ Shapiro-Wilk ที่ฉันอ้างถึงคือชุดข้อมูลที่จะทดสอบนั้น จำกัด ไว้ที่ 5,000 คะแนน หากต้องการอ้างอิงคำตอบที่ดีอีกข้อเกี่ยวกับหัวข้อนี้: ปัญหาเพิ่มเติมของการทดสอบของ Shapiro-Wilk คือเมื่อคุณป้อนข้อมูลเพิ่มเติมโอกาสในการปฏิเสธสมมติฐานที่ใหญ่กว่านั้นจะกลายเป็นเรื่องใหญ่ ดังนั้นสิ่งที่เกิดขึ้นก็คือสำหรับข้อมูลจำนวนมากแม้จะตรวจพบความเบี่ยงเบนเล็ก ๆ น้อย ๆ จากภาวะปกติซึ่งนำไปสู่การปฏิเสธเหตุการณ์สมมติฐานว่างสำหรับการใช้งานจริงข้อมูลนั้นมากกว่าปกติพอ [... ] โชคดีที่ shapiro.test ปกป้องผู้ใช้จากเอฟเฟกต์ที่อธิบายข้างต้นโดย จำกัด …

3
การพัฒนารูปแบบอนุกรมเวลาที่เหมาะสมเพื่อทำนายยอดขายตามบันทึกเดือนที่ผ่านมา
ตอนนี้ฉันดำเนินธุรกิจออนไลน์มาสองปีติดต่อกันดังนั้นฉันจึงมีข้อมูลการขายรายเดือนเป็นเวลาประมาณสองปี ธุรกิจของฉันทุกเดือนได้รับผลกระทบอย่างแน่นอนจากการเปลี่ยนแปลงตามฤดูกาล (ทำได้ดีกว่าในวันคริสต์มาสเป็นต้น) และอาจมีปัจจัยอื่น ๆ ที่ฉันไม่ทราบ เพื่อที่จะทำนายยอดขายในอนาคตได้ดีขึ้นและเพื่อวัดประสิทธิภาพของแคมเปญการขายของฉันหรือผลกระทบของคู่แข่งรายใหม่ฉันต้องการที่จะพัฒนารูปแบบอนุกรมเวลาที่เหมาะสมเพื่อคาดการณ์ข้อมูลการขายปัจจุบันของฉันในอนาคต นี่คือเมื่อฉันเปรียบเทียบผลลัพธ์ของการทำนายของฉันกับผลลัพธ์จริงฉันสามารถทดสอบประสิทธิภาพของแคมเปญการขายของฉันหรือผลกระทบของคู่แข่ง คำถามของฉันคือเมื่อฉันมีข้อมูลการขาย 2 ปีมีอยู่แล้วฉันสามารถกำหนดรูปแบบอนุกรมเวลาทำนายสำหรับสิ่งนี้ได้หรือไม่ หมายเหตุ: ฉันสนใจแนวคิดพื้นหลังและทฤษฎีมากกว่าเครื่องมือกล่องดำ พูดถึงเครื่องมือฉันมี mathematica, matlab, R, Excel, Google Spreadsheet .... คุณตั้งชื่อมัน

2
จะทำการตรวจสอบความถูกต้องข้ามสำหรับ PCA เพื่อกำหนดจำนวนขององค์ประกอบหลักได้อย่างไร
ฉันกำลังพยายามเขียนฟังก์ชั่นของตัวเองสำหรับการวิเคราะห์องค์ประกอบหลัก PCA (แน่นอนมีหลายอย่างที่เขียนไปแล้ว แต่ฉันแค่สนใจที่จะใช้สิ่งต่าง ๆ ด้วยตัวเอง) ปัญหาหลักที่ฉันพบคือขั้นตอนการตรวจสอบข้ามและการคำนวณผลรวมของสี่เหลี่ยมที่คาดการณ์ไว้ (PRESS) มันไม่สำคัญว่าฉันจะใช้การตรวจสอบข้ามซึ่งเป็นคำถามส่วนใหญ่เกี่ยวกับทฤษฎีที่อยู่เบื้องหลัง แต่พิจารณาการตรวจสอบความถูกต้องแบบข้ามครั้งเดียว (LOOCV) จากทฤษฎีฉันพบว่าในการดำเนินการ LOOCV คุณต้อง: ลบวัตถุ ขนาดที่เหลือ ดำเนินการ PCA ด้วยองค์ประกอบจำนวนหนึ่ง ปรับขนาดวัตถุที่ถูกลบตามพารามิเตอร์ที่ได้รับใน (2) ทำนายวัตถุตามโมเดล PCA คำนวณ PRESS สำหรับวัตถุนี้ ปฏิบัติขั้นตอนวิธีเดียวกันกับวัตถุอื่นอีกครั้ง สรุปค่า PRESS ทั้งหมด กำไร เนื่องจากฉันใหม่มากในฟิลด์เพื่อให้แน่ใจว่าฉันถูกต้องฉันเปรียบเทียบผลลัพธ์กับผลลัพธ์จากซอฟต์แวร์บางตัวที่ฉันมี (เพื่อเขียนโค้ดบางตัวฉันทำตามคำแนะนำในซอฟต์แวร์) ฉันได้ผลลัพธ์เดียวกันทั้งหมดโดยคำนวณผลรวมที่เหลือของกำลังสองและแต่การคำนวณ PRESS เป็นปัญหาR2R2R^2 คุณช่วยบอกฉันหน่อยได้ไหมว่าสิ่งที่ฉันใช้ในขั้นตอนการตรวจสอบข้ามถูกต้องหรือไม่: case 'loocv' % # n - number of objects % # p - …

3
คำจำกัดความของนักบวชคอนจูเกตกึ่งคอนจูเกตและมีเงื่อนไขคืออะไร?
คำจำกัดความของนักบวชกึ่งคอนจูเกตและนักคอนจูเกตแบบมีเงื่อนไขคืออะไร ฉันพบพวกมันในการวิเคราะห์ข้อมูลแบบเบย์ของเจลแมนแต่ไม่พบคำจำกัดความของพวกเขา
12 bayesian 

2
วิธีการ MCMC - ตัวอย่างการเผาไหม้?
ในMCMCวิธีผมให้อ่านเกี่ยวกับเวลาหรือจำนวนตัวอย่างที่จะburn-in "burn"มันคืออะไรกันแน่และทำไมมันถึงต้องการ? ปรับปรุง: เมื่อ MCMC ทรงตัวแล้วมันจะยังคงเสถียรหรือไม่? แนวคิดเรื่องburn-inเวลาเกี่ยวข้องกับเวลาในการผสมอย่างไร?
12 sampling  mcmc 

4
การแสดง PCA ด้วยเมทริกซ์ระยะทางเท่านั้น
ฉันต้องการจัดกลุ่มชุดข้อมูลขนาดใหญ่ที่ฉันมีระยะทางแบบคู่เท่านั้น ฉันใช้อัลกอริทึม k-medoids แต่ใช้เวลานานเกินไปที่จะเรียกใช้ดังนั้นฉันต้องการเริ่มต้นด้วยการลดมิติของปัญหาโดยใช้ PCA อย่างไรก็ตามวิธีเดียวที่ฉันรู้ในการทำวิธีนี้คือการใช้เมทริกซ์ความแปรปรวนร่วมที่ฉันไม่ได้มีในสถานการณ์ของฉัน มีวิธีในการใช้ PCA ที่รู้ระยะทางแบบคู่เท่านั้นหรือไม่

1
การเปรียบเทียบค่าสัมประสิทธิ์การถดถอยของตัวแบบเดียวกันในชุดข้อมูลที่ต่างกัน
ฉันกำลังประเมินสารทำความเย็น (ก๊าซ) สองรายการที่ใช้ในระบบทำความเย็นเดียวกัน ฉันมีอุณหภูมิการดูดอิ่มตัว ( SSS ) อุณหภูมิกลั่น ( DDD ) และข้อมูลแอมแปร์ ( YYY ) สำหรับการประเมินผล มีชุดข้อมูลสอง (2) ชุด สารทำความเย็นที่ 1 ( R1R1R_1 ) และสารทำความเย็นที่สอง ( R2R2R_2 ) ฉันใช้แบบจำลองเชิงเส้นหลายตัวแปร ( SSS & DDD ) แบบจำลองพหุนามลำดับที่ 3 สำหรับการวิเคราะห์การถดถอย ฉันต้องการกำหนดจำนวนแอมแปร์ที่น้อยลง / มากขึ้น (หรือการวัดประสิทธิภาพที่คล้ายกันบางตัว) โดยเฉลี่ยโดยคิดเป็นเปอร์เซ็นต์โดยสารทำความเย็นตัวที่สอง ความคิดแรกของฉันคือ: กำหนดรุ่นที่จะใช้: Y= b0+ b1S+ b2D + b3SD …

2
แนวทางปฏิบัติที่ดีที่สุดสำหรับการสร้าง 'ข้อมูลที่เป็นระเบียบ'
Hadley Wickham เขียนบทความที่เป็นตัวเอกเรียกว่า "Tidy Data" ( ลิงก์ ) ใน JSS เมื่อปีที่แล้วเกี่ยวกับการจัดการข้อมูลและการนำข้อมูลเข้าสู่สภาพ "เหมาะสม" เพื่อทำการวิเคราะห์ อย่างไรก็ตามฉันสงสัยว่าวิธีปฏิบัติที่ดีที่สุดในแง่ของการนำเสนอข้อมูลแบบตารางในการทำงานคืออะไร สมมติว่าผู้ร่วมงานของคุณขอให้คุณให้ข้อมูลบางอย่างแก่เขา มีกฎทั่วไปอะไรบ้างที่คุณใช้เมื่อจัดโครงสร้างข้อมูลนั้น แนวทางใน "Tidy Data" ใช้ได้กับกรณีที่คุณแบ่งปันข้อมูลกับผู้เชี่ยวชาญที่ไม่ใช่ข้อมูลหรือไม่ เห็นได้ชัดว่านี่เป็นบริบทเฉพาะมาก แต่ฉันถามเกี่ยวกับ 'แนวทางปฏิบัติที่ดีที่สุด' ในระดับสูง
12 dataset  tables 

1
ตัวอย่างที่ใช้งานง่ายของการสุ่มตัวอย่างที่สำคัญ
พื้นหลังของฉันคือวิทยาศาสตร์คอมพิวเตอร์ ฉันค่อนข้างใหม่สำหรับวิธีการสุ่มตัวอย่าง monte carlo และแม้ว่าฉันจะเข้าใจคณิตศาสตร์ฉันมีเวลายากลำบากในการหาตัวอย่างที่ใช้งานง่ายสำหรับการสุ่มตัวอย่างที่สำคัญ แม่นยำยิ่งขึ้นใครบางคนสามารถให้ตัวอย่างของ: การแจกแจงเริ่มต้นหนึ่งไม่สามารถสุ่มตัวอย่างได้ แต่สามารถประมาณได้ การแจกแจงที่สำคัญซึ่งสามารถสุ่มตัวอย่างและเพียงพอสำหรับการแจกแจงเริ่มต้นนี้

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.