สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
การวิเคราะห์โพสต์ - ฮอคที่ถูกต้องคืออะไรสำหรับการวัด ANOVA ซ้ำสามทาง?
ฉันได้ทำการทดสอบ ANOVA ซ้ำสามทาง การวิเคราะห์หลังการประชุมอะไรถูกต้อง? นี่คือการออกแบบที่สมดุลอย่างสมบูรณ์ (2x2x2) โดยมีปัจจัยหนึ่งที่มีการวัดซ้ำภายในวัตถุ ฉันตระหนักถึงวิธีการหลายตัวแปรในการวัด ANOVA ซ้ำ ๆ ใน R แต่สัญชาตญาณแรกของฉันคือดำเนินการในลักษณะ aov () ที่เรียบง่ายของ ANOVA: aov.repeated <- aov(DV ~ IV1 * IV2 * Time + Error(Subject/Time), data=data) DV = ตัวแปรตอบกลับ IV1 = ตัวแปรอิสระ 1 (2 ระดับ, A หรือ B) IV2 = ตัวแปรอิสระ 2 (2 ระดับ, ใช่หรือไม่) IV3 …

2
อะไรคือความแตกต่างระหว่างความสัมพันธ์แบบอนุกรมและการมีหน่วยรูท
ฉันอาจจะผสมแนวความคิดอนุกรมเวลาและไม่ใช่อนุกรมเวลา แต่อะไรคือความแตกต่างระหว่างตัวแบบการถดถอยที่แสดงถึงสหสัมพันธ์แบบอนุกรมและแบบจำลองที่แสดงรูตหน่วย นอกจากนี้ทำไมคุณสามารถใช้การทดสอบ Durbin-Watson เพื่อทดสอบความสัมพันธ์แบบอนุกรม แต่ต้องใช้การทดสอบ Dickey-Fuller สำหรับรากหน่วย (หนังสือเรียนของฉันบอกว่านี่เป็นเพราะการทดสอบ Durbun Watson ไม่สามารถใช้ได้ในรุ่นที่มีความล่าช้าในตัวแปรอิสระ)

3
สร้างนักบวช ... ด้วยเงิน!
สมมติว่าฉันมี 'ผู้เชี่ยวชาญ' จากคนที่ผมอยากจะล้วงเอาการกระจายก่อนในบางตัวแปรXฉันต้องการที่จะกระตุ้นให้พวกเขาด้วยเงินจริง ความคิดที่จะล้วงเอาไพรเออร์ที่สังเกตความเข้าใจของตัวแปรสุ่มแล้ว divvy ขึ้นบางที่กำหนดไว้ 'กระเป๋า' ในหมู่ผู้เชี่ยวชาญขึ้นอยู่กับวิธีการที่ดีไพรเออร์ของพวกเขาตรงกับหลักฐาน อะไรคือวิธีที่แนะนำสำหรับส่วนสุดท้ายนี้การทำแผนที่นักบวชและหลักฐานลงบนเวกเตอร์การจ่ายเงินX n XkkkXXXnnnXXX
10 bayesian  prior 

6
ควอไทล์ใน Excel
ฉันสนใจคำจำกัดความของควอไทล์ที่มักใช้เมื่อคุณอยู่ในสถิติพื้นฐาน ฉันมีหนังสือประเภท Stat 101 และมันให้นิยามที่เข้าใจง่าย "ประมาณหนึ่งในสี่ของข้อมูลตรงกับหรือต่ำกว่าควอไทล์แรก ... " แต่มันให้ตัวอย่างที่จะคำนวณ Q1, Q2 และ Q3 สำหรับชุดข้อมูล 5, 7, 9, 10, 11, 13, 14, 15, 16, 17, 18, 18, 20, 21, 37 เนื่องจากมีข้อมูล 15 ชิ้นจึงเลือก 15 ค่ามัธยฐาน Q2 จากนั้นจะแยกข้อมูลที่เหลือออกเป็นสองส่วนคือ 5 ถึง 14 และ 16 ถึง 37 แต่ละอันประกอบด้วยข้อมูล 7 ชิ้นและพวกเขาพบค่ามัธยฐานของแต่ละชุดเหล่านี้คือ 10 และ 18 ตามลำดับในไตรมาสที่ …
10 excel  quantiles 

1
ทำไมเราไม่เชื่อสัญชาตญาณความน่าจะเป็น
หากเคยมีกรณีที่ชัดเจนนี้อยู่กับปัญหา Monty Hall แม้แต่ Paul Erdos ผู้ยิ่งใหญ่ก็ยังหลงกลกับปัญหานี้ คำถามของฉันซึ่งอาจยากที่จะตอบคือความน่าจะเป็นที่เรามั่นใจในคำตอบที่เราได้รับจากการโต้เถียงที่เข้าใจง่ายและยังผิด กฎหมายของ Benford เกี่ยวกับตัวเลขแรกและเวลารอคอยที่ขัดแย้งกันเป็นตัวอย่างที่มีชื่อเสียงอื่น ๆ เช่นนี้

3
วิธีการเปรียบเทียบความแม่นยำของแบบจำลองที่แตกต่างกันสองแบบโดยใช้นัยสำคัญทางสถิติ
ฉันกำลังทำงานกับการทำนายอนุกรมเวลา ฉันมีสองชุดข้อมูลและ\} ฉันมีสามรูปแบบการทำนาย:M3 ทั้งหมดของรูปแบบเหล่านี้จะได้รับการฝึกฝนโดยใช้ตัวอย่างในชุดข้อมูลและประสิทธิภาพการทำงานของพวกเขาจะวัดโดยใช้กลุ่มตัวอย่างในชุดข้อมูลD2สมมติว่าตัวชี้วัดประสิทธิภาพคือ MSE (หรืออย่างอื่น) ค่า MSE ของแบบจำลองเหล่านั้นเมื่อวัดสำหรับชุดข้อมูลมีและMSE_3ฉันจะทดสอบได้อย่างไรว่าการปรับปรุงโมเดลหนึ่งเหนืออีกโมเดลหนึ่งนั้นมีนัยสำคัญทางสถิติD 1 = { x1, x2, . . . . xn}D1={x1,x2,....xn}D1=\{x_1, x_2,....x_n\}D 2 = { xn+ 1 , xn+ 2 , xn+ 3 , . . . , xn+ k }D2={xn+1,xn+2,xn+3,....,xn+k}D2=\{x_n+1, x_n+2, x_n+3,...., x_n+k\}M1 , M2 , M3M1,M2,M3M1, M2, M3D 1D1D1D 2D2D2D …

1
การถดถอยกับข้อผิดพลาดของนักเรียนไร้ประโยชน์หรือไม่?
โปรดดูการแก้ไข เมื่อคุณมีข้อมูลที่มีก้อยมากการทำถดถอยด้วยความผิดพลาดของนักเรียนดูเหมือนจะเป็นสิ่งที่ใช้งานง่าย ขณะสำรวจความเป็นไปได้นี้ฉันพบบทความนี้: Breusch, TS, Robertson, JC, & Welsh, AH (1 พฤศจิกายน 1997) เสื้อผ้าใหม่ของจักรพรรดิ: บทวิจารณ์ของรูปแบบการถดถอยหลายตัวแปร Statistica Neerlandica, 51, 3. ) ( ลิงก์ , pdf ) ซึ่งระบุว่าพารามิเตอร์ scale และ degree of freedom ไม่สามารถระบุได้ด้วยความเคารพซึ่งกันและกันในบางแง่มุมและเนื่องจากการทำแบบถดถอยด้วยข้อผิดพลาด t ไม่ได้ทำอะไรมากไปกว่าการถดถอยเชิงเส้นมาตรฐาน Zellner (1976) เสนอรูปแบบการถดถอยซึ่งเวกเตอร์ข้อมูล (หรือเวกเตอร์ข้อผิดพลาด) ถูกแทนด้วยการรับรู้จากการแจกแจงของนักเรียนหลายตัวแปร รุ่นนี้ได้รับความสนใจเป็นอย่างมากเพราะดูเหมือนว่าจะขยายข้อสันนิษฐานแบบเกาส์เซียนแบบทั่วไปเพื่อให้มีการแจกแจงข้อผิดพลาดที่หนักกว่า จำนวนของผลลัพธ์ในเอกสารระบุว่าขั้นตอนการอนุมานมาตรฐานสำหรับแบบเกาส์เซียนยังคงเหมาะสมภายใต้สมมติฐานการกระจายแบบกว้างกว่าซึ่งนำไปสู่การเรียกร้องความทนทานของวิธีมาตรฐาน เราแสดงให้เห็นว่าแม้ว่าทั้งสองแบบจำลองทางคณิตศาสตร์จะมีความแตกต่างกัน แต่เพื่อจุดประสงค์ในการอนุมานเชิงสถิติพวกมันแยกไม่ออก ความหมายเชิงประจักษ์ของแบบจำลองหลายตัวแปร t นั้นเหมือนกับแบบจำลองแบบเกาส์เซียนอย่างแม่นยำ ดังนั้นข้อเสนอแนะของการแสดงข้อมูลที่กว้างกว่านั้นจึงเป็นการหลอกลวงและการเรียกร้องความแข็งแกร่งนั้นทำให้เข้าใจผิด บทสรุปเหล่านี้สามารถเข้าถึงได้จากมุมมองทั้งแบบประจำและแบบเบย์ เรื่องนี้ทำให้ฉันประหลาดใจ ฉันไม่มีความซับซ้อนทางคณิตศาสตร์ในการประเมินข้อโต้แย้งของพวกเขาดีดังนั้นฉันจึงมีคำถามสองสามข้อ: …

3
ส่วนที่เหลือสำหรับการถดถอยโลจิสติกและระยะทางของคุก
มีข้อสมมติฐานเฉพาะใด ๆ เกี่ยวกับข้อผิดพลาดของการถดถอยโลจิสติกหรือไม่เช่นความแปรปรวนคงที่ของข้อผิดพลาดและค่าปกติของส่วนที่เหลือ? นอกจากนี้โดยทั่วไปเมื่อคุณมีคะแนนที่มีระยะทางของ Cook มากกว่า 4 / n คุณจะลบออกไหม หากคุณลบออกคุณจะทราบได้อย่างไรว่ารุ่นที่มีจุดลบนั้นดีกว่า

3
การทำคลัสเตอร์แบบกระจาย
ฉันมีหลายดิสทริบิวชัน (10 ดิสทริบิวชั่นในรูปด้านล่าง) ในความเป็นจริงเหล่านี้คือฮิสโทแกรม: มี 70 ค่าในแกน x ซึ่งเป็นขนาดของอนุภาคบางอย่างในสารละลายและสำหรับแต่ละค่าของ x ค่าที่สอดคล้องกันของ y คือสัดส่วนของอนุภาคที่มีขนาดประมาณค่าของ x ฉันต้องการจัดกลุ่มการกระจายเหล่านี้ ขณะนี้ฉันใช้การจัดกลุ่มแบบลำดับชั้นกับระยะทางแบบยุคลิดเช่น ฉันไม่พอใจกับการเลือกระยะทาง ฉันได้ลองระยะทางข้อมูลเชิงทฤษฎีเช่น Kullback-Leibler แต่มีศูนย์อยู่ในข้อมูลจำนวนมากและสิ่งนี้ทำให้เกิดปัญหา คุณมีข้อเสนอระยะทางที่เหมาะสมและ / หรือวิธีการจัดกลุ่มอื่นหรือไม่
10 clustering 

1
เพิ่มหางสองเท่าในการทดสอบการเปลี่ยนรูปสองตัวอย่าง
สมมติว่าเรามีสองตัวอย่างและเราต้องการตรวจสอบว่าพวกมันถูกดึงมาจากการกระจายตัวเดียวกันหรือไม่ตัวอย่าง A, B ที่ประกอบไปด้วยจำนวนเต็มบางส่วนบอกว่า ถ้าเราทดสอบสิ่งนี้โดยใช้การทดสอบการเปลี่ยนรูปสองตัวอย่างโดยเฉพาะโดยดูที่การเรียงสับเปลี่ยนที่ความแตกต่างในค่าเฉลี่ยของกลุ่มตัวอย่างนั้นรุนแรงมากเท่าความแตกต่างที่สังเกต: มีเหตุผลใดที่คิดว่าเราสามารถคำนวณค่า p- สองด้านได้ ให้ความสำคัญกับการมองที่หางเดียวและเพิ่มความน่าจะเป็นเป็นสองเท่า? นี่คือสิ่งที่ดูเหมือนจะพูดในบันทึกการบรรยายของฉัน แต่ฉันไม่เข้าใจว่าทำไมเราจึงสามารถสันนิษฐานได้ว่าก้อยนั้นมีความสมมาตร คำอธิบายไม่ได้เตรียมพร้อม

1
ความแตกต่างระหว่างตัวแบบขอบและแบบมีเงื่อนไข
รุ่นร่อแร่บัญชีสำหรับความสัมพันธ์ในแต่ละคลัสเตอร์ ตัวแบบเงื่อนไขยังคำนึงถึงความสัมพันธ์ภายในแต่ละคลัสเตอร์ด้วย คำถามของฉันคือ: แบบจำลองส่วนขอบมีผลกระทบหลักในประชากรหรือไม่ในขณะที่แบบจำลองแบบมีเงื่อนไขมีผลกระทบหลักภายในกลุ่มและข้ามประชากรหรือไม่ การตีความสัมประสิทธิ์ของโมเดลร่อแร่นั้นเหมือนกับ "โมเดลปกติ" แต่สัมประสิทธิ์ของแบบจำลองตามเงื่อนไขนั้นเป็นอย่างไร

4
ความน่าจะเป็นในการหาลำดับคู่ฐานที่เฉพาะเจาะจง
การคิดถึงความน่าจะเป็นทำให้ฉันรู้ว่าฉันนับไม่ถ้วน ... พิจารณาลำดับของตัวอักษรฐานซึ่งมีแนวโน้มที่จะปรากฏขึ้นอย่างเท่าเทียมกัน ความน่าจะเป็นที่ลำดับนี้มีลำดับเฉพาะของคู่เบสที่น่าสนใจของความยาวคืออะไร,nnnR ≤ n,T,ค, และ GA,T,C, and GA,\; T, \; C, \text{ and } Gr ≤ nr≤nr\leq n มีลำดับที่แตกต่างกัน (เท่า ๆ กัน) ที่เป็นไปได้ เริ่มด้วยลำดับความสนใจที่จุดเริ่มต้นของลำดับเต็ม ลำดับเช่นนี้เป็นไปได้ เราสามารถเริ่มต้นลำดับความสนใจของเราในสถานที่ต่างกัน ดังนั้นคำตอบของฉันคือ R4 n - r n + 1 - r ( n + 1 - r ) / 4 r4n4n4^n4n - r4n-R4^{n-r}n …

1
จะคำนวณช่วงความมั่นใจสำหรับการทำนายอนุกรมเวลาได้อย่างไร
ฉันมีอนุกรมเวลา (สมมติว่าถึงX n ) และฉันจำเป็นต้องทำนายตัวอย่างถัดไป (สมมุติว่าX n + 1 , X n + 2 , … , X n + k ) โดยใช้โมเดลเช่นโครงข่ายประสาท หรือการถดถอยเชิงเส้นหลาย ณ เวลาที่ฉันมีตัวอย่างทั้งหมดจากX 1ถึงX nและจำเป็นต้องทำนายX n + 1 ; ในเวลาn + 1ฉันมีตัวอย่างทั้งหมดจากX 1ถึงXX1X1X_1XnXnX_nXn + 1, Xn + 2, … , Xn + kXn+1,Xn+2,...,Xn+kX_{n+1}, X_{n+2},\dots, X_{n+k}X1X1X_1XnXnX_nXn + 1Xn+1X_{n+1}n …

3
เกี่ยวกับการใช้โมเดล bigram (N-gram) เพื่อสร้างฟีเจอร์ vector สำหรับเอกสารข้อความ
วิธีการดั้งเดิมของการสร้างฟีเจอร์สำหรับการขุดข้อความเป็นวิธีถุงแบบคำและสามารถปรับปรุงได้โดยใช้ tf-idf สำหรับการตั้งค่าคุณลักษณะเวกเตอร์ที่แสดงลักษณะของเอกสารข้อความที่กำหนด ในปัจจุบันฉันกำลังพยายามใช้โมเดลภาษาสองแกรมหรือ (N-Gram) เพื่อสร้างเวกเตอร์คุณลักษณะ แต่ไม่ทราบวิธีการทำเช่นนั้นใช่หรือไม่ เราสามารถทำตามวิธีการของคำพูดเช่นการคำนวณจำนวนความถี่ในรูปแบบของ bi-gram แทนที่จะเป็นคำพูดและปรับปรุงมันด้วยวิธีการถ่วงน้ำหนัก tf-idf?

2
ความสัมพันธ์ระหว่างตัวแปรสองขั้วและตัวแปรต่อเนื่อง
ฉันพยายามที่จะหาความสัมพันธ์ระหว่างคู่และตัวแปรต่อเนื่อง จากการทำงานภาคพื้นดินของฉันในเรื่องนี้ฉันพบว่าฉันต้องใช้การทดสอบแบบอิสระและเงื่อนไขที่จำเป็นสำหรับมันคือการกระจายตัวของตัวแปรจะต้องเป็นปกติ ฉันทำการทดสอบ Kolmogorov-Smirnov เพื่อทดสอบความปกติและพบว่าตัวแปรต่อเนื่องไม่ปกติและเอียง (ประมาณ 4,000 จุดข้อมูล) ฉันทำการทดสอบ Kolmogorov-Smirnov สำหรับตัวแปรทั้งหมด ฉันควรแบ่งพวกเขาออกเป็นกลุ่มและทำแบบทดสอบหรือไม่? กล่าวคือถ้าฉันมีrisk level( 0= ไม่เสี่ยง1= เสี่ยง) และระดับคอเลสเตอรอลฉันควร: แบ่งพวกมันออกเป็นสองกลุ่มอย่างเช่น Risk level =0 (Cholestrol level) -> Apply KS Risk level =1 (Cholestrol level) -> Apply KS พาพวกเขาไปด้วยกันและทำการทดสอบ? (ฉันใช้กับชุดข้อมูลทั้งหมดเท่านั้น) หลังจากนั้นฉันควรทำอย่างไรหากมันยังไม่ปกติ แก้ไข: สถานการณ์ข้างต้นเป็นเพียงคำอธิบายที่ฉันพยายามให้สำหรับปัญหาของฉัน ฉันมีชุดข้อมูลซึ่งมีตัวแปรมากกว่า 1,000 รายการและตัวอย่างประมาณ 4000 รายการ พวกมันมีทั้งต่อเนื่องหรือเด็ดขาดในธรรมชาติ งานของฉันคือการทำนายตัวแปรแบบแบ่งขั้วตามตัวแปรเหล่านี้ (อาจเกิดขึ้นกับแบบจำลองการถดถอยโลจิสติก) ดังนั้นฉันคิดว่าการตรวจสอบเบื้องต้นจะเกี่ยวข้องกับการค้นหาความสัมพันธ์ระหว่างโดมิโนและตัวแปรต่อเนื่อง ฉันพยายามที่จะดูว่าการกระจายตัวของตัวแปรเป็นอย่างไรและด้วยเหตุนี้จึงพยายามไปทดสอบ …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.