สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
การกระจายตัวของค่าสัมประสิทธิ์การถดถอย
สมมติว่าเรามีโมเดลเชิงเส้น Yผม=β0+β1xผม+εผมyi=β0+β1xi+ϵiy_i = \beta_0 + \beta_1 x_i + \epsilon_iที่ตรงตามสมมติฐานการถดถอยมาตรฐาน (Gauss-Markov) ทั้งหมด เราสนใจθ = 1 /β1θ=1/β1\theta = 1/\beta_1. คำถามที่ 1:ข้อสมมติฐานอะไรที่จำเป็นสำหรับการแจกแจงθ^θ^\hat{\theta} ที่จะกำหนดไว้อย่างดี? β1≠ 0β1≠0\beta_1 \neq 0 จะมีความสำคัญ --- คนอื่น ๆ ? คำถามที่ 2:เพิ่มการสันนิษฐานว่าข้อผิดพลาดเป็นไปตามการแจกแจงแบบปกติ เรารู้ว่าถ้าβ^1β^1\hat{\beta}_1 คือ MLE และ ก.( ⋅ )g(⋅)g(\cdot) เป็นฟังก์ชั่นโมโนโทน ก.(β^1)g(β^1)g\left(\hat{\beta}_1\right) เป็น MLE สำหรับ ก.(β1)g(β1)g(\beta_1). เป็นสิ่งที่จำเป็นต้องมีเพียงอย่างเดียวในพื้นที่ใกล้เคียงของβ1β1\beta_1? ในคำอื่น ๆ คือθ^= 1 /β^θ^=1/β^\hat{\theta} …


3
อะไรอาจเป็นคำจำกัดความที่ชัดเจนและใช้งานได้จริงสำหรับ“ ครอบครัวของสมมุติฐาน” (เทียบกับอัตราความผิดพลาดตามลำดับของครอบครัว)
เมื่อพยายามประเมินสิ่งที่ถือเป็นครอบครัวของสมมุติฐานในการทดลอง / โครงการ / การวิเคราะห์ฉันพบว่า "มีจุดประสงค์คล้ายกัน" และ "คล้ายกันในเนื้อหา" ที่ให้ไว้เป็นแนวทางในการกำหนดครอบครัว แต่สิ่งเหล่านี้ค่อนข้างเปิดกว้างสำหรับการตีความ พูดน้อยที่สุด) เห็นได้ชัดว่าถ้าในระหว่างการวิเคราะห์ฉันทำการทดสอบหลายวิธีในกลุ่มและแยกชุดการทดสอบความเป็นเนื้อเดียวกันของสัดส่วนที่ว่าฉันจะไม่รวมทุกอย่างเข้าด้วยกันเป็นสมมุติฐานตระกูลเดี่ยว อย่างไรก็ตามถ้าฉันมีการทดสอบกลุ่มที่เกี่ยวข้องกันหลายชุดกระบวนการเกณฑ์ใดที่นำพวกเขามารวมกันในครอบครัว (หรือแยกพวกมันออกเป็นครอบครัวแยก) สมาชิกทุกคนในครอบครัวควรมีตัวแปรตอบกลับที่เหมือนกันหรือไม่? ถ้าฉันมีตัวแปรตอบกลับต่างกัน แต่มีชุดคดีเดียวกันที่เกี่ยวข้องพวกนั้นทั้งหมดจะรวมอยู่ในครอบครัวของสมมติฐานหรือไม่?

2
ฉันสามารถเชื่อถือการถดถอยได้หรือไม่หากตัวแปรเกี่ยวข้องอัตโนมัติ
ตัวแปรทั้งสอง (ขึ้นอยู่กับและเป็นอิสระ) แสดงผลของความสัมพันธ์อัตโนมัติ ข้อมูลเป็นอนุกรมเวลาและเครื่องเขียน เมื่อฉันเรียกใช้ส่วนที่เหลือถดถอยจะไม่สัมพันธ์ สถิติ Durbin-Watson ของฉันมีค่ามากกว่าค่าวิกฤตที่สำคัญดังนั้นจึงมีหลักฐานว่าข้อผิดพลาดไม่มีความสัมพันธ์เชิงบวก เมื่อฉันพล็อต ACF เพื่อหาข้อผิดพลาดดูเหมือนว่าไม่มีความสัมพันธ์กันและสถิติ Ljung-Box นั้นเล็กกว่าค่าวิกฤต ฉันสามารถไว้วางใจผลลัพธ์การถดถอยของฉันได้หรือไม่สถิติ t- เชื่อถือได้หรือไม่


1
การแสดงสัดส่วนอย่างต่อเนื่อง
ฉันพยายามที่จะเห็นภาพข้อมูลผู้บริโภคบางส่วนซึ่งมี 4 หมวดหมู่ ผู้ใช้สามารถสลับไปมาระหว่างหมวดหมู่ต่างๆได้ฟรี ฉันต้องการเห็นสวิตช์สามหรือสี่อันล่าสุดสำหรับแต่ละคน ดังนั้นเราจะเริ่มต้นด้วยพล็อตที่มีคอลัมน์ที่มีสัดส่วน 4 แบบซ้อนกัน หลังจากนั้นเราก็จะได้ 16 เพราะแต่ละหมวดหมู่แบ่งออกเป็นสิ่งที่คนทำในครั้งก่อนแล้ว 64 และต่อ ๆ ไปจนกว่าถังขยะจะเล็กเกินไปที่จะเป็นประโยชน์ ฉันกำลังคิดว่าจะอยู่ระหว่างแผนภูมิ marimekko กับ barchart ที่ซ้อนกันหรือ dendro กรัมควรทำงานได้ แต่ฉันไม่รู้ด้วยซ้ำว่าจะเรียกว่าอะไร! หากใครสามารถช่วยกับประเภทของพล็อตที่ฉันควรจะใช้และถ้าคุณต้องการที่จะดีเป็นพิเศษวิธีการใช้ใน R แล้วฉันจะขอบคุณมาก

1
อัตราส่วน Log-likelihood ในการสรุปเอกสาร
ตอนแรกฉันถามสิ่งนี้เกี่ยวกับการล้นสแต็กและถูกส่งต่อไปยังไซต์นี้ดังนั้นต่อไปนี้: ฉันกำลังใช้วิธีการสรุปเอกสารตามเนื้อหาที่เลือกไม่ได้รับอนุญาตและคลายบีบอัดและฉันสับสนเกี่ยวกับสิ่งที่ตำราเรียนของฉันเรียกว่า หนังสือการพูดและการประมวลผลภาษาโดย Jurafsky & Martin อธิบายสั้น ๆ ดังนี้: LLR สำหรับคำหนึ่งเรียกว่าแลมบ์ดา (w) เป็นอัตราส่วนระหว่างความน่าจะเป็นในการสังเกต w ทั้งอินพุตและพื้นหลังคลังข้อมูลสมมติว่ามีความน่าจะเป็นเท่ากันทั้งใน corpora และความน่าจะเป็นในการสังเกต w ในทั้งสอง w ในอินพุตและคลังข้อมูลพื้นหลัง เมื่อสรุปลงมาแล้วเรามีตัวเศษ: "ความน่าจะเป็นในการสังเกต w ทั้งในอินพุทและในคอร์ปัสเบื้องหลังสมมติว่ามีความน่าจะเป็นเท่ากันทั้งใน corpora" - ฉันจะคำนวณความน่าจะเป็นที่จะใช้ที่นี่ได้อย่างไร และตัวส่วน: "ความน่าจะเป็นของการสังเกต w ในทั้งคู่โดยสมมติความน่าจะเป็นที่แตกต่างกันสำหรับ w ในอินพุตและคลังข้อมูลพื้นหลัง" - นี่ง่ายเหมือนความน่าจะเป็นของคำที่เกิดขึ้นในอินพุทคูณกับความน่าจะเป็นของคำที่เกิดขึ้นในคลังข้อมูลหรือไม่? อดีต: (นับ (คำ, อินพุต) / คำทั้งหมดในอินพุต) * (นับ (คำ, คลังข้อมูล) / คำทั้งหมดในคลัง) ฉันได้ดูกระดาษเอกสารอ้างอิงของฉันวิธีการที่ถูกต้องสำหรับสถิติของความประหลาดใจและความบังเอิญ (Dunning …

2
แนวปฏิบัติที่ดีที่สุดเมื่อรักษาข้อมูลช่วงเป็นต่อเนื่อง
ฉันกำลังดูว่าความอุดมสมบูรณ์นั้นเกี่ยวข้องกับขนาดหรือไม่ ขนาดคือ (แน่นอน) ต่อเนื่องอย่างไรก็ตามความอุดมสมบูรณ์จะถูกบันทึกไว้ในสเกลดังกล่าว A = 0-10 B = 11-25 C = 26-50 D = 51-100 E = 101-250 F = 251-500 G = 501-1000 H = 1001-2500 I = 2501-5000 J = 5001-10,000 etc... A ถึง Q ... 17 ระดับ ฉันคิดว่าวิธีหนึ่งที่เป็นไปได้คือการกำหนดตัวเลขให้กับตัวอักษรแต่ละตัว: อย่างน้อยที่สุด, สูงสุดหรือค่ามัธยฐาน (เช่น A = 5, B = …

4
ปรับขนาดข้อมูลที่มีขนาดต่างกันสำหรับการวางแผน
ดูที่ชุดข้อมูลต่อไปนี้: Date Visits Carts carts Orders Created converted Created 2011-11-11 12277 161 9 36 2011-11-12 11871 93 5 19 2011-11-13 13072 107 8 8 2011-11-14 13594 112 4 34 2011-11-15 12741 129 8 43 2011-11-16 15491 261 16 57 2011-11-17 13418 186 17 42 ฉันถูกขอให้พล็อตเรื่องนี้บนกราฟโดยใช้วันที่มีแกน X และข้อมูลส่วนที่เหลือบนแกน Y ปัญหาคือขนาดของข้อมูลแตกต่างกันอย่างมาก ที่การเข้าชมอยู่ในหลักพันและคำสั่งซื้อที่สร้างขึ้นนั้นอยู่ในระดับต่ำ …

2
การตรวจสอบข้ามสำหรับรุ่นผสมหรือไม่
เพื่อนร่วมงานของฉันและฉันกำลังปรับรุ่นของเอฟเฟกต์แบบผสมทั้งแบบเชิงเส้นและแบบไม่เชิงเส้นในอาร์เราถูกขอให้ทำการตรวจสอบความถูกต้องของแบบจำลองที่มีการติดตั้งเพื่อให้สามารถตรวจสอบได้ว่า นี่เป็นภารกิจที่ไม่สำคัญ แต่ในกรณีของเราเราต้องแบ่งข้อมูลทั้งหมดออกเป็นส่วนการฝึกอบรมและส่วนการทดสอบ (สำหรับจุดประสงค์ CV) ที่ไม่มีระดับร่วมกัน ตัวอย่างเช่น, ข้อมูลการฝึกอบรมอาจขึ้นอยู่กับกลุ่ม 1,2,3,4; โมเดลที่ถูกติดตั้งจะถูกตรวจสอบความถูกต้องข้ามกลุ่ม 5 ดังนั้นสิ่งนี้จึงสร้างปัญหาเนื่องจากเอฟเฟกต์แบบกลุ่มอ้างอิงที่ประเมินจากข้อมูลการฝึกอบรมไม่ได้ใช้กับข้อมูลการทดสอบ ดังนั้นเราไม่สามารถ CV โมเดล มีวิธีแก้ปัญหาที่ค่อนข้างตรงไปตรงมาหรือไม่? หรือมีใครเขียนแพคเกจเพื่อแก้ไขปัญหานี้หรือยัง คำใบ้ใด ๆ ยินดีต้อนรับ! ขอบคุณ!

3
ปัญหาการประมาณค่าในการติดตาม GPS
ปัญหา:พิจารณารถยนต์สองคัน (นำมาเป็นวัตถุแบบจุด) ชื่อหัวหน้าLLL และผู้ติดตาม FFFทั้งคู่ติดตั้งอุปกรณ์ GPS ที่สื่อสารกัน วัตถุประสงค์ของFFF คือการปฏิบัติตาม LLLให้ใกล้เคียงที่สุดเท่าที่จะเป็นไปได้ในภายหลัง ระบุว่าอุปกรณ์ GPS ทั้งหมดมีการกระจายข้อผิดพลาดแบบวงกลมข้อผิดพลาด (CEP) โดยมีค่าเฉลี่ยที่กำหนดμ = (μx,μY)μ=(μx,μy)\mu = (\mu_x,\mu_y) และเมทริกซ์ความแปรปรวนร่วมที่กำหนด Σ2 × 2Σ2×2\Sigma_{2\times 2}. ระบุว่า LLL ลัดเลาะเป็นเส้นโค้ง คCC ในระนาบเส้นโค้งที่คาดหวังไว้คืออะไร FFF? นอกจากนี้การกระจายของคืออะไรFFFเส้นทาง เป็นวิธีที่ดีที่สุดสำหรับอะไร FFF เพื่อประเมิน LLL ในช่วงเวลาหนึ่ง? พื้นหลัง:นี่เป็นปัญหาที่เกิดขึ้นจริงที่ฉันต้องเผชิญในงานทดลองและไม่ทำการบ้านไม่ว่าจะด้วยวิธีใดก็ตาม ฉันรับรู้ถึงเครื่องมือต่าง ๆ เช่นตัวกรองคาลมานเพื่อการประมาณค่าสถานะที่เหมาะสมเมื่อเผชิญกับสัญญาณรบกวนของสีขาว แต่ฉันไม่แน่ใจว่าจะขยายไปยังกรณีนี้ได้อย่างไร ฉันต้องการทราบวรรณกรรมการวิจัยที่เกี่ยวข้องด้วย

2
วิธีการที่ทันสมัยเพื่อค้นหาศูนย์ค่าเฉลี่ยส่วนของอนุกรมเวลา
ฉันมีอนุกรมเวลาที่มีเสียงดังซึ่งฉันต้องแบ่งส่วนออกเป็นส่วน ๆ ด้วยค่าเฉลี่ยเป็นศูนย์และส่วนที่ไม่มีค่าเฉลี่ยเป็นศูนย์ การค้นหาขอบเขตอย่างแม่นยำที่สุดเท่าที่จะเป็นไปได้มีความสำคัญ (ชัดเจนว่าขอบเขตอยู่ตรงไหนเป็นเรื่องส่วนตัว) ฉันคิดว่าตัวแปร cusum สามารถปรับให้ทำเช่นนี้ได้ แต่เนื่องจาก cusum เป็นหลักเกี่ยวกับการค้นหาการเปลี่ยนแปลงเดียวที่ทำให้กลยุทธ์การแบ่งกลุ่มทั้งหมดไม่ได้รับการแก้ไขอย่างสมบูรณ์ ฉันแน่ใจว่ามีการทำวิจัยเป็นจำนวนมากเกี่ยวกับปัญหานี้ แต่ไม่สามารถหาได้ ป.ล. จำนวนข้อมูลในอนุกรมเวลาเหล่านี้ค่อนข้างมากตัวอย่างมากถึงหลายร้อยล้านตัวอย่างและแต่ละตัวอย่างสามารถเป็นเวกเตอร์ที่มีองค์ประกอบสองร้อยชิ้นดังนั้นวิธีที่สามารถคำนวณได้อย่างรวดเร็วเป็นปัจจัยสำคัญ . PPS ไม่มีแท็กการแบ่งกลุ่มดังนั้นแท็กการจัดหมวดหมู่

1
การคำนวณด้วยตนเอง PACF
ฉันกำลังพยายามจำลองการคำนวณที่ SAS และ SPSS ทำเพื่อฟังก์ชั่นความสัมพันธ์อัตโนมัติบางส่วน (PACF) ใน SAS นั้นผลิตผ่าน Proc Arima ค่า PACF เป็นค่าสัมประสิทธิ์ของการตอบกลับอัตโนมัติของชุดดอกเบี้ยบนค่าที่ล่าช้าของชุดข้อมูล ตัวแปรที่ฉันสนใจคือการขายดังนั้นฉันจึงคำนวณ lag1, lag2 ... lag12 และฉันใช้การถดถอย OLS ต่อไปนี้: Yt=a0+a1Yt−1+a2Yt−2+a3Yt−3+…+a12Yt−12.Yt=a0+a1Yt−1+a2Yt−2+a3Yt−3+…+a12Yt−12.Y_t=a_0+a_1Y_{t-1}+a_2Y_{t-2}+a_3Y_{t-3}+\ldots+a_{12}Y_{t-12}. น่าเสียดายที่ค่าสัมประสิทธิ์ที่ฉันได้รับนั้นไม่ใกล้เคียงกับ PACF (ล่าช้า 1 ถึง 12) ที่ SAS หรือ SPSS ให้ ข้อเสนอแนะใด ๆ มีอะไรผิดปกติหรือเปล่า? สิ่งที่อยู่ในใจของฉันคือการประมาณกำลังสองน้อยที่สุดของแบบจำลองนี้อาจไม่เหมาะสมและอาจใช้เทคนิคการประมาณแบบอื่น ขอบคุณล่วงหน้า.

1
การคำนวณความน่าเชื่อถือระหว่างผู้ใช้ใน R พร้อมกับจำนวนเรตติ้งที่หลากหลาย?
วิกิพีเดียแสดงให้เห็นว่าวิธีหนึ่งที่จะดูที่ความน่าเชื่อถือระหว่างผู้ประเมินคือการใช้แบบจำลองผลกระทบแบบสุ่มเพื่อคำนวณintraclass สัมพันธ์ ตัวอย่างของความสัมพันธ์ภายใน intraclass พูดถึงการมอง σ2ασ2α+σ2ϵσα2σα2+σϵ2\frac{\sigma_\alpha^2}{\sigma_\alpha^2+\sigma_\epsilon^2} จากแบบจำลอง Yij=μ+αi+ϵijYij=μ+αi+ϵijY_{ij} = \mu + \alpha_i + \epsilon_{ij} "ที่ Y IJเป็นเจTHสังเกตในฉันTHกลุ่มμเป็นค่าเฉลี่ยโดยรวมไม่มีใครสังเกต, α ฉันเป็นผลสุ่มสังเกตร่วมกันโดยค่าทั้งหมดในกลุ่ม i และε IJเป็นคำที่ไม่มีใครสังเกตเสียง." นี่เป็นรูปแบบที่น่าสนใจโดยเฉพาะอย่างยิ่งเพราะในข้อมูลของฉันไม่มีผู้ให้คะแนนทุกสิ่ง (แม้ว่าส่วนใหญ่จะได้อันดับ 20+) และสิ่งต่าง ๆ ได้รับการจัดอันดับเป็นจำนวนตัวแปรหลายครั้ง (โดยปกติ 3-4) คำถาม # 0: "group i" ในตัวอย่างนั้น ("group i") เป็นการจัดกลุ่มสิ่งต่าง ๆ หรือไม่ คำถาม # 1: ถ้าฉันกำลังมองหาความน่าเชื่อถือระหว่างผู้ประเมินฉันไม่จำเป็นต้องมีโมเดลเอฟเฟกต์แบบสุ่มที่มีสองคำหนึ่งคำสำหรับผู้ประเมินและอีกหนึ่งสำหรับสิ่งที่ได้รับการจัดอันดับ ท้ายที่สุดแล้วทั้งคู่มีรูปแบบที่เป็นไปได้ คำถาม # 2: ฉันจะแสดงโมเดลนี้ใน …

4
ค้นหาช่วงความหนาแน่นของความน่าจะเป็น
ฉันมีเวกเตอร์ x <- c(1,2,3,4,5,5,5,6,6,6,6, 7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7, 7,7,7,7,7,7,7,7,8,8,8,8,9,9,9,10) (เวกเตอร์ที่แท้จริงของฉันมีความยาว> 10,000) และฉันต้องการหาช่วงเวลาที่ 90% ของความหนาแน่นอยู่ คือquantile(x, probs=c(0.05,0.95), type=5)ที่เหมาะสมที่สุดหรือมีวิธีอื่น ๆ ?
9 r 

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.