สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
ทำอย่างไรจึงจะพอดีกับแบรดลีย์ - เทอร์รี่ - ลูซใน R โดยไม่มีสูตรที่ซับซ้อน?
แบรดลีย์ - เทอร์รี่ – ลูซ (BTL) โมเดลกล่าวว่าโดยที่คือความน่าจะเป็นที่วัตถุถูกตัดสินให้เป็น "ดีกว่า", ที่หนักกว่า ฯลฯ กว่า objectและและเป็นพารามิเตอร์พีJฉัน= l o gผมเสื้อ- 1(δJ-δผม)พีJผม=ล.โอก.ผมเสื้อ-1(δJ-δผม)p_{ji} = logit^{-1}(\delta_j - \delta_i)พีฉันเจพีผมJp_{ij}JJjผมผมiδผมδผม\delta_iδJδJ\delta_j ดูเหมือนว่าจะเป็นตัวเลือกสำหรับฟังก์ชัน glm โดยมี family = binomial อย่างไรก็ตามสูตรจะคล้ายกับ "ความสำเร็จ ~ S1 + S2 + S3 + S4 + ... " โดยที่ Sn เป็นตัวแปรจำลองนั่นคือ 1 ถ้าวัตถุ n เป็นวัตถุแรกในการเปรียบเทียบ -1 ถ้าเป็น วินาทีและ 0 …

2
ใช้แบบจำลองการถดถอยเพื่อคาดการณ์: เมื่อใดจะหยุด?
ฉันคำนวณรูปแบบการถดถอยเชิงเส้นอย่างง่ายจากการทดลองของฉันเพื่อคาดการณ์ ฉันได้อ่านแล้วว่าคุณไม่ควรคำนวณการทำนายสำหรับคะแนนที่ออกไปไกลเกินไปจากข้อมูลที่มี อย่างไรก็ตามฉันไม่สามารถหาคำแนะนำใด ๆ เพื่อช่วยให้ฉันรู้ว่าฉันสามารถคาดการณ์ได้ไกลแค่ไหน ตัวอย่างเช่นหากฉันคำนวณความเร็วในการอ่านสำหรับขนาดดิสก์ 50GB ฉันเดาว่าผลลัพธ์จะใกล้เคียงกับความเป็นจริง ขนาดของดิสก์ 100GB, 500GB เป็นเท่าไหร่ ฉันจะรู้ได้อย่างไรว่าการทำนายของฉันใกล้เคียงกับความเป็นจริง? รายละเอียดของการทดสอบของฉันคือ: ฉันวัดความเร็วในการอ่านของซอฟต์แวร์โดยใช้ขนาดดิสก์ที่แตกต่างกัน จนถึงตอนนี้ฉันวัดด้วย 5GB ถึง 30GB โดยเพิ่มขนาดดิสก์ 5GB ระหว่างการทดลอง (ทั้งหมด 6 การวัด) ผลลัพธ์ของฉันเป็นเส้นตรงและข้อผิดพลาดมาตรฐานมีขนาดเล็กในความคิดของฉัน

2
วิธีการจำลองการวัดซ้ำหลายตัวแปรผลลัพธ์ใน R?
@whuber ได้สาธิตวิธีจำลองผลลัพธ์หลายตัวแปร ( ,และy_3 ) ในครั้งเดียวy1y1y_1y2y2y_2y3y3y_3 ดังที่เราทราบข้อมูลระยะยาวมักเกิดขึ้นในการศึกษาทางการแพทย์ คำถามของฉันคือวิธีการจำลองการวัดผลซ้ำหลายตัวแปรใน R หรือไม่? ตัวอย่างเช่นเราวัดy1y1y_1 , y2y2y_2และy3y3y_3ๆ กันที่จุดเวลา 5 จุดสำหรับกลุ่มการรักษาที่แตกต่างกันสองกลุ่ม

1
ทำนายปัวซอง GLM พร้อมออฟเซ็ต
ฉันรู้ว่านี่อาจเป็นคำถามพื้นฐาน ... แต่ฉันดูเหมือนจะไม่พบคำตอบ ฉันเหมาะสมกับ GLM กับครอบครัวปัวซงแล้วลองดูการคาดคะเน แต่สิ่งที่พิจารณาจะนำมาพิจารณา: model_glm=glm(cases~rhs(data$year,2003)+lhs(data$year,2003), offset=(log(population)), data=data, subset=28:36, family=poisson()) predict (model_glm, type="response") ฉันได้รับคดีไม่ใช่อัตรา ... ฉันได้ลองแล้วเช่นกัน model_glm=glm(cases~rhs(data$year,2003)+lhs(data$year,2003)+ offset(log(population)), data=data, subset=28:36, family=poisson()) ด้วยผลลัพธ์เดียวกัน อย่างไรก็ตามเมื่อฉันทำนายจาก GAM โดยใช้ mgcv การคาดคะเนจะพิจารณาการชดเชย (ฉันได้รับอัตรา) ฉันทำอะไรบางอย่างหายไป?

1
วิธีการรับขอบเขตการตัดสินใจจาก linear SVM ใน R?
ฉันต้องการแพคเกจที่สามารถให้สมการสำหรับโมเดล SVM เชิงเส้นได้ ขณะนี้ฉันใช้e1071เช่นนั้น: library(e1071) m = svm(data, labels, type='C', kernel='linear', cost=cost, probability=FALSE, scale=scale) w = t(m$coefs) %*% data[m$index,] #Weight vector b = -model$rho #Offset อย่างไรก็ตามฉันไม่แน่ใจว่าe1071::svm()จะเลือกคลาสบวกและลบได้อย่างไรดังนั้นฉันคิดว่านี่อาจทำให้ชุดข้อมูลแตกต่างกัน ทุกคนสามารถยืนยันได้ว่าฟังก์ชั่นนี้ตัดสินใจว่าคลาสใดเป็นบวก นอกจากนี้ยังมีแพ็คเกจที่ดีกว่าสำหรับสิ่งนี้หรือไม่?
9 r  svm  e1071 

3
การใช้เหตุผลบ่อยครั้งและการปรับเงื่อนไขในการสังเกต (ตัวอย่างจาก Wagenmakers และคณะ)
ฉันไม่ใช่ผู้เชี่ยวชาญด้านสถิติ แต่ฉันรวบรวมว่ามีความขัดแย้งไม่ว่าการตีความ "ความเป็นไปได้" หรือ "เบย์" เป็นความน่าจะเป็น "ขวา" หรือไม่ จากWagenmakers และ อัลพี 183: พิจารณาการแจกแจงแบบสม่ำเสมอด้วยค่าเฉลี่ย μμ\mu และความกว้าง 111. วาดค่าสองค่าแบบสุ่มจากการแจกแจงเลเบลค่าที่เล็กที่สุดsss และที่ใหญ่ที่สุด ล.ล.lและตรวจสอบว่าค่าเฉลี่ย μμ\mu อยู่ในระหว่าง sss และ ล.ล.l. หากขั้นตอนนี้ซ้ำหลายครั้งค่าเฉลี่ยμμ\mu จะอยู่ในระหว่าง sss และ ล.ล.lในครึ่งหนึ่งของกรณี ดังนั้น,( s , l )(s,ล.)(s, l) ให้ช่วงความมั่นใจเป็นประจำ 50% สำหรับ μμ\mu. แต่สมมติว่าสำหรับการจับรางวัลโดยเฉพาะs = 9.8s=9.8s = 9.8 และ l = 10.7ล.=10.7l = 10.7. …

1
การจำแนกประเภทด้วยตัวทำนายที่โดดเด่นหนึ่งตัว
ฉันมีปัญหาการจำแนกประเภท( -class) โดยมีคำสั่งจาก 100 ตัวทำนายมูลค่าจริงซึ่งหนึ่งในนั้นดูเหมือนว่าจะมีพลังในการอธิบายมากกว่าคนอื่น ๆ ฉันอยากจะให้ลึกซึ้งยิ่งขึ้นถึงผลกระทบของตัวแปรอื่น ๆ อย่างไรก็ตามเทคนิคการเรียนรู้ของเครื่องมาตรฐาน (ป่าสุ่ม, SVM, ฯลฯ ) ดูเหมือนจะล้นมือโดยผู้ทำนายที่แข็งแกร่งคนหนึ่งและไม่ให้ข้อมูลที่น่าสนใจเกี่ยวกับคนอื่นkkk หากนี่เป็นปัญหาการถดถอยฉันก็แค่ถอยหลังตัวพยากรณ์ที่แข็งแกร่งแล้วใช้ส่วนที่เหลือเป็นอินพุตสำหรับอัลกอริทึมอื่น ๆ ฉันไม่เห็นว่าวิธีนี้สามารถแปลเป็นบริบทการจำแนกได้อย่างไร สัญชาตญาณของฉันคือปัญหานี้จะต้องเป็นเรื่องธรรมดาพอสมควร: มีเทคนิคมาตรฐานสำหรับจัดการกับมันหรือไม่?

2
ทำความเข้าใจและใช้การวิเคราะห์ความเชื่อมั่น
ฉันเพิ่งได้รับมอบหมายให้ทำโครงการวิเคราะห์ความเชื่อมั่นสำหรับการรวบรวมเอกสารบางอย่าง โดย Googling การวิจัยเกี่ยวกับความเชื่อมั่นจำนวนมากได้ผุดขึ้นมา คำถามของฉันคือ: อะไรคือวิธีการที่สำคัญ / อัลกอริทึมสำหรับการวิเคราะห์ความเชื่อมั่นในด้านการเรียนรู้ของเครื่องและการวิเคราะห์ทางสถิติ? มีผลลัพธ์ที่เป็นที่ยอมรับหรือไม่ มีซอฟต์แวร์โอเพ่นซอร์สที่มีอยู่ที่สามารถทำการวิเคราะห์ความเชื่อมั่นได้หรือไม่?

1
ชุดค่าผสม / คำถามความน่าจะเป็นแบบง่ายโดยพิจารณาจากความยาวสตริงและอักขระที่เป็นไปได้
สมมติว่า "การสุ่มเสร็จสมบูรณ์" และกำหนดสตริงที่มีความยาว 20 อักขระซึ่งแต่ละอักขระอาจเป็นหนึ่งใน 62 ตัวอักษรที่เป็นไปได้: จำนวนชุดค่าผสมทั้งหมดเป็นไปได้เท่าใด (การคาดเดา 20 ต่ออำนาจ 62) นอกจากนี้หากมีการเลือกสตริงใหม่แบบสุ่มหลังจากนั้นอีกหนึ่งรายการและเพิ่มลงในรายการของสตริงที่เลือกไว้จำนวนสตริงที่ต้องเลือกก่อนที่โอกาสในการเลือกสตริงที่เลือกไว้จะต่ำกว่า 1-in-100000 ( )?10-510-510^{-5} หมายเหตุ: 62 มาจาก: ตัวเลขตัวเลข (0-9), ตัวพิมพ์ใหญ่ (AZ) และตัวอักษรตัวเล็ก (az)

3
ความสัมพันธ์ระหว่างเมทริกซ์ใน R
ฉันมีปัญหาในการใช้งานcor()และcor.test()ฟังก์ชั่น ฉันมีเมทริกซ์สองตัว (เฉพาะค่าตัวเลขและจำนวนแถวและคอลัมน์เดียวกัน) และฉันต้องการให้มีจำนวนสหสัมพันธ์และค่า p ที่สอดคล้องกัน เมื่อฉันใช้cor(matrix1, matrix2)ฉันได้รับค่าสัมประสิทธิ์สหสัมพันธ์สำหรับเซลล์ทั้งหมด ฉันแค่ต้องการตัวเลขเดียวเป็นผลมาจากคร นอกจากนี้เมื่อฉันcor.test(matrix1, matrix2)ฉันได้รับข้อผิดพลาดต่อไปนี้ Error in cor.test.default(matrix1, matrix2) : 'x' must be a numeric vector ฉันจะรับค่า p สำหรับเมทริกซ์ได้อย่างไร คุณพบตารางง่ายๆที่ฉันต้องการเชื่อมโยงที่นี่: http://dl.dropbox.com/u/3288659/table_exp1_offline_MEANS.csv http://dl.dropbox.com/u/3288659/table_exp2_offline_MEANS.csv
9 r  correlation 

2
การใส่ข้อผิดพลาดอย่างเป็นระบบในการตอบแบบสำรวจ
ฉันมีแบบสำรวจขนาดใหญ่ที่นักเรียนถูกถามระดับการศึกษาของแม่ของพวกเขา บางคนข้ามไปและบางคนตอบผิด ฉันรู้สิ่งนี้เพราะมีตัวอย่างย่อยของผู้ตอบแบบสอบถามเริ่มต้นที่แม่ถูกสัมภาษณ์ในภายหลังและถามคำถามเดียวกัน (ฉันแน่ใจว่ามีข้อผิดพลาดจำนวนเล็กน้อยที่เกี่ยวข้องกับการตอบสนองของมารดาเช่นกัน) ความท้าทายของฉันคือการตัดสินใจว่าจะใช้ประโยชน์จากแหล่งข้อมูลที่เชื่อถือได้มากขึ้นในวินาทีนี้ได้อย่างไร อย่างน้อยที่สุดฉันสามารถใช้เพื่อระบุข้อมูลที่ขาดหายไปได้อย่างชาญฉลาดกว่าที่ฉันจะทำได้หากฉันสามารถพึ่งพากรณีที่สมบูรณ์เท่านั้น แต่ถ้าเด็ก 3/4 คนที่มีข้อมูลฉันสามารถตรวจสอบข้ามใครตอบว่า "แม่ของฉันไม่เคยเรียนจบชั้นประถมศึกษา" ขัดแย้งกับคำตอบของแม่แล้วดูเหมือนว่าฉันควรใช้การใส่ความคิดเพื่อสร้างชุดข้อมูลหลายชุดเพื่อจับความไม่แน่นอน [เพิ่ม: ฉันบอกว่าให้ทำ 3/4 แต่ตอนนี้ฉันตรวจสอบข้อมูลแล้วฉันอาจบอกคุณว่าใกล้ถึง 40% ไม่ตรงกัน] โดยส่วนตัวฉันจะใช้การศึกษาของแม่เป็นตัวทำนายในแบบผสม แต่ถ้าใครมีบางสิ่งที่จะพูดเกี่ยวกับสถานการณ์อื่นฉันก็ชอบที่จะเรียนรู้เกี่ยวกับพวกเขาเช่นกัน ฉันชอบที่จะรับคำแนะนำในวงกว้างหรือเฉพาะ ขอบคุณ! อัปเดต : ตอนนี้ฉันยังไม่ได้ตอบคำถามเลยแม้ว่าฉันจะชอบคำตอบของ Will และ Conjugate_Prior แต่ฉันก็ยังหวังว่าจะได้รับผลตอบรับทางเทคนิคและเฉพาะเจาะจงมากขึ้น Scatterplot ด้านล่างจะทำให้คุณเข้าใจว่าตัวแปรสองตัวนี้มีความสัมพันธ์กันอย่างไรใน 10,000 กรณีที่ทั้งสองมีอยู่ พวกเขาซ้อนกันในโรงเรียนมากกว่า 100 แห่ง พวกเขามีความสัมพันธ์กันที่ 0.78 คำตอบของนักเรียน - หมายถึง: 5.12 sd = 2.05 คำตอบของแม่หมายถึง = 5.02, sd = 1.92 …

1
วิธีการทำความเข้าใจมาตรฐานที่เหลืออยู่ในการวิเคราะห์การถดถอย
ตามการวิเคราะห์การถดถอยโดยตัวอย่างที่เหลือคือความแตกต่างระหว่างการตอบสนองและมูลค่าที่คาดการณ์จากนั้นจะกล่าวว่าทุกที่เหลือมีความแปรปรวนที่แตกต่างกันดังนั้นเราจึงต้องพิจารณาที่เหลือมาตรฐาน แต่ความแปรปรวนมีไว้สำหรับกลุ่มของค่าวิธีการที่ค่าเดียวอาจมีความแปรปรวนได้อย่างไร

1
ฉันจะพิสูจน์ได้อย่างไรว่าข้อมูลการทดสอบเป็นไปตามการกระจายแบบหางยาว
ฉันมีผลการทดสอบการตอบสนองของเซิร์ฟเวอร์ที่ล่าช้าหลายครั้ง จากการวิเคราะห์ทางทฤษฎีของเราการแจกแจงความล่าช้า (ฟังก์ชันการแจกแจงความน่าจะเป็นของความล่าช้าในการตอบกลับ) ควรมีพฤติกรรมแบบหางยาว แต่ฉันจะพิสูจน์ได้อย่างไรว่าผลการทดสอบมีการกระจายอย่างหนัก

2
การวิเคราะห์ข้อมูลภาษาฝรั่งเศสคืออะไร
วิธีการทางสถิติบางอย่าง - ฉันจำไม่ได้ว่ามันเป็นการวิเคราะห์องค์ประกอบหลักหรืออะไรทำนองนั้น - บางครั้งเรียกว่า "การวิเคราะห์ข้อมูลภาษาฝรั่งเศส" มันคืออะไรกันแน่? และบางคนบอกว่าชื่อนี้เป็นเรื่องน่าขันจริงหรือไม่และทำไม?

3
วิธีการใช้คำสัมประสิทธิ์สำหรับปัจจัยและเงื่อนไขเชิงโต้ตอบในสมการเชิงเส้น?
เมื่อใช้ R ฉันได้ติดตั้งโมเดลเชิงเส้นสำหรับตัวแปรการตอบสนองเดี่ยวจากการผสมผสานของตัวทำนายอย่างต่อเนื่องและไม่ต่อเนื่อง นี่เป็นพื้นฐาน uber แต่ฉันมีปัญหาในการเข้าใจว่าค่าสัมประสิทธิ์สำหรับปัจจัยแยกทำงานอย่างไร แนวคิด:เห็นได้ชัดว่าค่าสัมประสิทธิ์ของตัวแปรต่อเนื่อง 'x' ถูกนำมาใช้ในรูปแบบy = coefx(varx) + interceptแต่วิธีการที่ทำงานให้กับปัจจัย z ถ้าปัจจัยที่ไม่ใช่ตัวเลข?y = coefx(varx) + coefz(factorz???) + intercept เฉพาะ:ฉันได้ติดตั้งแบบจำลองใน R เป็นlm(log(c) ~ log(d) + h + a + f + h:a)ตำแหน่งhและfปัจจัยที่ไม่ต่อเนื่องและไม่ใช่ตัวเลข ค่าสัมประสิทธิ์คือ: Coefficients: Estimate (Intercept) -0.679695 log(d) 1.791294 h1 0.870735 h2 -0.447570 h3 0.542033 a 0.037362 f1 …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.