สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
การประมาณค่าพารามิเตอร์สำหรับกระบวนการเชิงพื้นที่
ฉันได้รับตารางของค่าจำนวนเต็มบวก ตัวเลขเหล่านี้แสดงถึงความเข้มที่ควรสอดคล้องกับความแข็งแกร่งของความเชื่อของบุคคลที่ครอบครองตำแหน่งกริดนั้น (ค่าที่สูงกว่าหมายถึงความเชื่อที่สูงกว่า) โดยทั่วไปแล้วคน ๆ หนึ่งจะมีอิทธิพลเหนือเซลล์กริดหลายเซลล์n×nn×nn\times n ฉันเชื่อว่ารูปแบบของความเข้มควร "ดูเกาส์เซียน" ในที่นั้นจะมีที่ตั้งกลางของความเข้มสูงและจากนั้นความเข้มจะลดลงอย่างรุนแรงในทุกทิศทาง โดยเฉพาะฉันต้องการสร้างแบบจำลองค่าที่มาจาก "Gaussian แบบปรับขนาด" พร้อมพารามิเตอร์สำหรับความแปรปรวนและอีกแบบสำหรับตัวประกอบสเกล มีสองปัจจัยที่ซับซ้อน: การไม่มีบุคคลจะไม่สอดคล้องกับค่าศูนย์เนื่องจากเสียงพื้นหลังและเอฟเฟกต์อื่น ๆ แต่ค่าควรน้อยกว่า พวกมันอาจเอาแน่เอานอนไม่ได้และในการประมาณครั้งแรกอาจเป็นการยากที่จะจำลองแบบเสียงเกาส์แบบง่าย ช่วงความเข้มอาจแตกต่างกันไป สำหรับอินสแตนซ์หนึ่งค่าอาจอยู่ในช่วงระหว่าง 1 ถึง 10 และในอีกกรณีระหว่าง 1 ถึง 100 ฉันกำลังมองหากลยุทธ์การประมาณค่าพารามิเตอร์ที่เหมาะสมหรือตัวชี้ไปยังเอกสารที่เกี่ยวข้อง ชี้ให้เห็นว่าทำไมฉันถึงเข้าถึงปัญหานี้ในทางที่ผิดทั้งหมดก็จะได้รับการชื่นชม :) ฉันได้อ่านเกี่ยวกับกระบวนการ kriging และ Gaussian แล้ว แต่ดูเหมือนว่าเป็นเครื่องจักรที่หนักมากสำหรับปัญหาของฉัน

5
วิธีที่จะทำให้ระดับความเข้มของสีที่ดี?
ฉันไม่ใช่สถิติที่ดี แต่ฉันคิดว่าฉันมาถูกที่แล้ว คำถามของฉันง่าย: ปัญหาของฉันประกอบด้วยการเปรียบเทียบประชากรของหลายรัฐในประเทศเล็ก ๆ แต่บางรัฐมีประชากร 3,000,000 คนและประชากร 2,000 คน ฉันวาดมันลงบนแผนที่และ "ความเข้ม" ของสีขึ้นอยู่กับว่าประชากรของทุกรัฐเปรียบเทียบกับประชากรของทั้งประเทศอย่างไร ปัญหาคือว่ารัฐที่มีประชากรจำนวนมากจะแสดงด้วยสีที่รุนแรงจริงๆและรัฐขนาดเล็กแทบจะไม่มีสีใด ๆ มีวิธีง่าย ๆ ในการ "ทำให้ปกติ" หรือทำให้ข้อมูลเปรียบเทียบได้หรือไม่? ฉันไม่รู้ว่าฉันอธิบายตัวเองถูกต้องหรือไม่ แต่ฉันหวังว่าบางคนสามารถช่วยฉันได้ โปรดแสดงความคิดเห็นหากคำถามของฉันไม่ชัดเจนและฉันจะชี้แจง ขอขอบคุณสำหรับความช่วยเหลือของคุณ!

4
วิธีการ PCA สำหรับข้อมูลมิติสูงมาก?
ในการทำการวิเคราะห์องค์ประกอบหลัก (PCA) คุณต้องลบค่าเฉลี่ยของแต่ละคอลัมน์ออกจากข้อมูลคำนวณเมทริกซ์สัมประสิทธิ์สหสัมพันธ์แล้วหาค่า eigenvectors และค่าลักษณะเฉพาะ ทีนี้, นี่คือสิ่งที่ฉันทำเพื่อนำไปใช้ใน Python, ยกเว้นมันจะทำงานกับเมทริกซ์เล็ก ๆ เท่านั้นเพราะวิธีการหาเมทริกซ์สัมประสิทธิ์สหสัมพันธ์ (corrcoef) ไม่ให้ฉันใช้อาร์เรย์ที่มีมิติสูง เนื่องจากฉันต้องใช้มันสำหรับรูปภาพการใช้งานปัจจุบันของฉันจึงไม่ช่วยฉันจริงๆ ฉันได้อ่านว่ามันเป็นไปได้ที่จะใช้เวลาเพียงแค่ข้อมูลเมทริกซ์ของคุณและคำนวณแทนD ^ \ D ด้านบน / nแต่ที่ไม่ทำงานสำหรับฉัน ดีฉันไม่แน่ใจอย่างแน่นอนว่าฉันเข้าใจความหมายของมันนอกเหนือจากข้อเท็จจริงที่ว่ามันควรจะเป็นเมทริกซ์n \ times nแทนที่จะเป็นp \ times p (ในกรณีของฉันp \ gg n ) ฉันอ่านเกี่ยวกับบทเรียนเหล่านี้ใน eigenfaces แต่ดูเหมือนว่าไม่มีใครอธิบายได้ในแบบที่ฉันจะได้รับD D ⊤ / n D ⊤ D / n n × n P × …
12 pca  python 

5
สามารถคำนวณค่าเบี่ยงเบนมาตรฐานสำหรับค่าเฉลี่ยฮาร์มอนิกได้หรือไม่?
สามารถคำนวณค่าเบี่ยงเบนมาตรฐานสำหรับค่าฮาร์มอนิกได้หรือไม่? ฉันเข้าใจว่าค่าเบี่ยงเบนมาตรฐานสามารถคำนวณได้สำหรับค่าเฉลี่ยเลขคณิต แต่ถ้าคุณมีค่าเฉลี่ยฮาร์มอนิกคุณจะคำนวณค่าเบี่ยงเบนมาตรฐานหรือ CV ได้อย่างไร

1
การค้นหากริด SVM ควรแสดงพื้นที่ที่มีความแม่นยำสูงด้วยความแม่นยำต่ำหรือไม่?
ฉันมีชุดฝึกอบรมเชิงบวก 12 ชุด (เซลล์มะเร็งที่ได้รับการรักษาด้วยยาที่มีกลไกการออกฤทธิ์ 12 แบบ) สำหรับชุดการฝึกอบรมเชิงบวกเหล่านี้ฉันต้องการฝึกอบรมเครื่องเวกเตอร์สนับสนุนเพื่อแยกความแตกต่างจากชุดเชิงลบที่มีขนาดเท่ากันจากการทดลอง แต่ละชุดมีระหว่าง 1,000 และ 6,000 เซลล์และมีคุณสมบัติ 476 รายการ (คุณสมบัติภาพ) ของแต่ละเซลล์แต่ละส่วนจะถูกปรับเชิงเส้นเป็น [0, 1] ฉันใช้LIBSVMและเคอร์เนล Gaussian RGB ใช้ crossvalidation ห้าเท่าฉันทำการค้นหากริดสำหรับlog₂ C ∈ [-5, 15] และlog₂ɣ∈ [-15, 3] ผลลัพธ์มีดังนี้: ฉันผิดหวังที่ไม่มีพารามิเตอร์ชุดเดียวที่ให้ความแม่นยำสูงสำหรับปัญหาการจำแนกประเภททั้ง 12 ข้อ ฉันรู้สึกประหลาดใจที่กริดไม่แสดงภูมิภาคที่มีความแม่นยำสูงซึ่งล้อมรอบไปด้วยความแม่นยำที่ต่ำกว่า นี่หมายถึงว่าฉันต้องขยายพื้นที่พารามิเตอร์การค้นหาหรือการค้นหากริดเป็นตัวบ่งชี้ว่ามีบางอย่างผิดปกติหรือไม่?
12 svm 

4
วิธีการสุ่มตัวอย่างจำนวน 10 ตัวอย่างจากรายการขนาดใหญ่โดยไม่มีการเปลี่ยนโดยรวม
ฉันมีชุดข้อมูลจำนวนมาก (จุดข้อมูล 20,000 จุด) ซึ่งฉันต้องการใช้ตัวอย่างข้อมูล 10 จุดซ้ำหลายครั้ง อย่างไรก็ตามเมื่อฉันเลือกจุดข้อมูลทั้ง 10 แล้วฉันต้องการให้พวกเขาไม่ได้รับเลือกอีกครั้ง ฉันลองใช้sampleฟังก์ชั่นนี้ แต่ดูเหมือนว่าจะไม่มีตัวเลือกตัวอย่างโดยไม่ต้องเปลี่ยนฟังก์ชั่นการโทรหลายครั้ง มีวิธีง่าย ๆ ในการทำเช่นนี้?
12 r  sample 

1
สถิติจากคณิตศาสตร์เศษส่วน
ฉันกำลังมองหาหนังสือ / ตำราเกี่ยวกับสถิติจากเศษส่วนทางคณิตศาสตร์ ฉันรู้ว่ามันไม่ใช่พื้นที่ที่รู้จักกันดีและมันค่อนข้างยากที่จะหาวรรณกรรมที่ดี ข้อเสนอแนะใด ๆ ยินดีต้อนรับ (หนังสือตำราสื่อออนไลน์)

3
เหตุใดจึงใช้ DV ที่ล้าหลังเป็นตัวแปรเครื่องมือ
ฉันได้รับรหัสการวิเคราะห์ข้อมูลที่ไม่ได้เป็นนักเศรษฐศาสตร์ฉันไม่สามารถเข้าใจได้ หนึ่งโมเดลรันการถดถอยตัวแปรเครื่องมือด้วยคำสั่ง Stata ต่อไปนี้ ivreg my_dv var1 var2 var3 (L.my_dv = D2.my_dv D3.my_dv D4.my_dv) ชุดข้อมูลนี้เป็นพาเนลที่มีการสังเกตแบบหลายลำดับสำหรับตัวแปรชุดนี้ ทำไมรหัสนี้ถึงใช้ค่า lagged ของ DV เป็นเครื่องดนตรี? ตามที่ฉันเข้าใจ (จากการขุดลงในตำราเรียนเก่า) การประมาณค่า IV จะถูกใช้เมื่อมีปัญหาเนื่องจาก regressor มีความสัมพันธ์กับคำที่ผิดพลาด อย่างไรก็ตามไม่มีการกล่าวถึงการเลือกหน่วงเวลาของ DV เป็นเครื่องมือ ความคิดเห็นในบรรทัดของรหัสนี้กล่าวถึง "causality" ความช่วยเหลือในการหาสิ่งที่เป็นเป้าหมายที่นี่จะได้รับการต้อนรับมากที่สุด

4
ฉันสามารถประมาณ (ตัวเลข) ค่าประมาณสำหรับการแจกแจงเบต้าด้วยอัลฟาและเบต้าขนาดใหญ่ได้อย่างไร
มีวิธีที่มีเสถียรภาพเชิงตัวเลขในการคำนวณค่าของการแจกแจงแบบเบต้าสำหรับจำนวนเต็มขนาดใหญ่ alpha, beta (เช่น alpha, beta> 1000000) หรือไม่ ที่จริงแล้วฉันต้องการเพียงแค่ช่วงความมั่นใจ 99% รอบ ๆ โหมดเท่านั้นหากนั่นทำให้ปัญหาง่ายขึ้น เพิ่ม : ฉันขอโทษคำถามของฉันไม่ได้ระบุไว้อย่างชัดเจนเหมือนที่ฉันคิด สิ่งที่ฉันต้องการทำคือ: ฉันมีเครื่องจักรที่ตรวจสอบผลิตภัณฑ์บนสายพานลำเลียง เศษส่วนของผลิตภัณฑ์เหล่านี้ถูกปฏิเสธโดยเครื่อง ตอนนี้หากผู้ประกอบการเครื่องจักรเปลี่ยนแปลงการตั้งค่าการตรวจสอบบางอย่างฉันต้องการแสดงให้เขา / เธอทราบอัตราการปฏิเสธโดยประมาณและคำแนะนำบางอย่างเกี่ยวกับความน่าเชื่อถือของการประมาณการในปัจจุบัน ดังนั้นฉันคิดว่าฉันปฏิบัติกับอัตราการปฏิเสธจริงเป็นตัวแปรสุ่ม X และคำนวณการแจกแจงความน่าจะเป็นสำหรับตัวแปรสุ่มนั้นตามจำนวนของวัตถุที่ถูกปฏิเสธ N และวัตถุที่ยอมรับ M ถ้าฉันถือว่าการกระจายก่อนหน้านี้เหมือนกันสำหรับ X นี่คือ การกระจายเบต้าขึ้นอยู่กับ N และ M ฉันสามารถแสดงการแจกแจงนี้ให้กับผู้ใช้โดยตรงหรือหาช่วงเวลา [l, r] เพื่อให้อัตราการปฏิเสธที่แท้จริงอยู่ในช่วงเวลานี้ด้วย p> = 0.99 (โดยใช้คำศัพท์ของ shabbychef) และแสดง ระยะห่าง สำหรับ M, N ขนาดเล็ก …


3
ฉันจะทดสอบได้อย่างไรว่าการจัดกลุ่มข้อมูลไบนารีของฉันมีความสำคัญ
ฉันกำลังทำตะกร้าสินค้าวิเคราะห์ชุดข้อมูลของฉันคือชุดของเวกเตอร์ธุรกรรมพร้อมรายการสินค้าที่ซื้อ เมื่อใช้ K-วิธีการในการทำธุรกรรมที่ฉันมักจะได้รับบางผล เมทริกซ์แบบสุ่มอาจแสดงกลุ่มบางส่วนเช่นกัน มีวิธีทดสอบว่าการจัดกลุ่มที่ฉันพบนั้นสำคัญหรือไม่หรืออาจเป็นเรื่องบังเอิญ ถ้าใช่ฉันจะทำอย่างไร

4
ตัวอย่างควรมีขนาดเท่าใดสำหรับเทคนิคการประมาณค่าและพารามิเตอร์ที่กำหนด?
มีกฎง่ายๆหรือแม้กระทั่งวิธีการใด ๆ ที่จะบอกว่าตัวอย่างขนาดใหญ่ควรจะประเมินโมเดลที่มีจำนวนพารามิเตอร์ที่กำหนดหรือไม่? ตัวอย่างเช่นถ้าฉันต้องการประมาณการถดถอยสี่เหลี่ยมน้อยที่สุดด้วยพารามิเตอร์ 5 ตัวตัวอย่างควรมีขนาดใหญ่แค่ไหน? ไม่ว่าคุณจะใช้เทคนิคการประเมินแบบใด (เช่นความน่าจะเป็นสูงสุด, กำลังสองน้อยที่สุด, GMM) หรือการทดสอบที่คุณจะทำการทดสอบ ควรพิจารณาความแปรปรวนตัวอย่างในการตัดสินใจหรือไม่?

1
จะหาจุดตัวอย่างที่มีอัตราส่วนค่าผิดปกติขนาดใหญ่ที่มีความหมายทางสถิติระหว่างสองค่าของจุดได้อย่างไร
ในฐานะแอปพลิเคชันตัวอย่างให้พิจารณาคุณสมบัติสองประการของผู้ใช้ Stack Overflow: นับตั้งแต่ชื่อเสียงและมุมมองโปรไฟล์ คาดว่าสำหรับผู้ใช้ส่วนใหญ่ค่าทั้งสองนั้นจะเป็นสัดส่วน: ผู้ใช้ตัวแทนสูงดึงดูดความสนใจมากขึ้นและได้รับมุมมองโปรไฟล์มากขึ้น ดังนั้นจึงเป็นเรื่องที่น่าสนใจในการค้นหาผู้ใช้ที่มีจำนวนการดูโปรไฟล์มากเมื่อเทียบกับชื่อเสียงโดยรวม สิ่งนี้สามารถระบุได้ว่าผู้ใช้นั้นมีแหล่งภายนอกที่มีชื่อเสียง หรืออาจแค่ว่าพวกเขามีรูปโปรไฟล์และชื่อแปลก ๆ ที่น่าสนใจ ทางคณิตศาสตร์ยิ่งขึ้นตัวอย่างจุดสองมิติแต่ละจุดคือผู้ใช้และผู้ใช้แต่ละคนมีค่าที่สำคัญสองค่าตั้งแต่ 0 ถึง + อินฟินิตี้: ชื่อเสียง จำนวนการดูโปรไฟล์ พารามิเตอร์ทั้งสองนั้นคาดว่าจะขึ้นอยู่กับแบบเส้นตรงและเราต้องการค้นหาจุดตัวอย่างซึ่งเป็นค่าผิดปกติที่ใหญ่ที่สุดในสมมติฐานนั้น แน่นอนว่าวิธีแก้ปัญหาที่ไร้เดียงสานั้นจะเป็นเพียงการดูโปรไฟล์แบ่งตามชื่อเสียงและการจัดเรียง อย่างไรก็ตามสิ่งนี้จะให้ผลลัพธ์ที่ไม่มีความหมายทางสถิติ ตัวอย่างเช่นหากผู้ใช้ตอบคำถามได้รับ 1 upvote และด้วยเหตุผลบางอย่างมี 10 การดูโปรไฟล์ซึ่งง่ายต่อการปลอมผู้ใช้นั้นจะปรากฏต่อหน้าผู้สมัครที่น่าสนใจมากกว่าที่มี 1,000 upvotes และ 5000 profile profile . ในกรณีการใช้ "โลกแห่งความเป็นจริง" ที่มากขึ้นเราอาจลองตอบคำถาม "ซึ่ง startups คือยูนิคอร์นที่มีความหมายมากที่สุด?" เช่นหากคุณลงทุน 1 ดอลลาร์ด้วยเงินทุนเพียงเล็กน้อยคุณสร้างยูนิคอร์น: https://www.linkedin.com/feed/update/urn:li:activity:6362648516858310656 ข้อมูลคอนกรีตที่สะอาดและง่ายต่อการใช้งานในโลกแห่งความจริง เพื่อทดสอบวิธีการแก้ปัญหาของคุณคุณสามารถใช้ไฟล์ที่ประมวลผลแล้วซึ่งถูกบีบอัดขนาดเล็ก (75M, ผู้ใช้ ~ 10M) …
12 ratio 

1
กราฟแสดงความสัมพันธ์อัตโนมัติ (หมีแพนด้า) คืออะไร
ฉันเป็นผู้เริ่มต้นและฉันพยายามที่จะเข้าใจสิ่งที่กราฟแสดงความสัมพันธ์อัตโนมัติ ฉันได้อ่านคำอธิบายต่าง ๆ จากแหล่งข้อมูลต่าง ๆ เช่นหน้านี้หรือหน้า Wikipedia ที่เกี่ยวข้องซึ่งฉันไม่ได้อ้างถึงที่นี่ ฉันมีรหัสง่ายๆนี้ที่ฉันมีวันที่ในดัชนีของฉันสำหรับปีและค่าจะเพิ่มขึ้นจาก 0 ถึง 365 สำหรับแต่ละดัชนี .. ( 1984-01-01:0, 1984-01-02:1 ... 1984-12-31:365) import numpy as np import pandas as pd from pandas.plotting import autocorrelation_plot import matplotlib.pyplot as plt dr = pd.date_range(start='1984-01-01', end='1984-12-31') df = pd.DataFrame(np.arange(len(dr)), index=dr, columns=["Values"]) autocorrelation_plot(df) plt.show() กราฟที่พิมพ์จะอยู่ที่ใด ฉันสามารถเข้าใจและดูว่าทำไมกราฟเริ่มต้น1.00ตั้งแต่: Autocorrelation ที่มี …

1
คนธรรมดาเข้าใจถึงความแตกต่างระหว่างการปรับประตูหลังและประตูหน้า
ฉันหมายถึงการปรับประตูหลังและการปรับประตูหน้าที่นี่ : การปรับประตูหลัง : ปัญหาทางระบาดวิทยาทางโบราณคดีในทางสถิติคือการปรับให้ได้ผลของคู่หูที่วัดได้ เกณฑ์ด้านหลังของ Pearl ทำให้ความคิดนี้เป็นเรื่องปกติ การปรับประตูหน้า : หากตัวแปรบางตัวไม่มีการตรวจสอบเราอาจต้องใช้วิธีการอื่นเพื่อระบุผลกระทบเชิงสาเหตุ หน้านี้ยังมาพร้อมกับคำจำกัดความทางคณิตศาสตร์ที่แม่นยำสำหรับคำสองคำข้างต้น คุณทำให้คนธรรมดาเข้าใจความแตกต่างระหว่างการปรับประตูหลังและประตูหน้าตามคำจำกัดความทางคณิตศาสตร์ข้างต้นได้อย่างไร
12 causality  dag 

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.