สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
การกรองดาต้าเฟรม
ยังคงเรียนรู้ฟังก์ชันพื้นฐานใน R ฟังก์ชั่นชุดย่อยดูเหมือนว่าจะกรองตามเงื่อนไขตามคอลัมน์เดียวโดยมีหรือไม่มีเงื่อนไขหลายข้อ? ฉันจะกรองข้อมูลจาก dataframe ได้อย่างไร เมื่อคุณได้รับเงื่อนไขที่หลากหลาย เมื่อเงื่อนไขจะต้องมีการใช้ข้ามคอลัมน์ที่มีอยู่ ตัวอย่าง: กำหนดกรอบข้อมูลที่มี name D1 D2 D3 D4 julius "A" "A" "B" "B" cate "D" "E" "A" "C" karo "A" "D" "C" "E" บอกว่าฉันต้องการที่จะกรอง dataframe นี้เพื่อให้เฉพาะชื่อที่ใด ๆ ของ D1 ถึง D4 เป็น 'E' แล้วฉันควรจะมี name D1 D2 D3 D4 cate "D" "E" "A" …
12 r 

2
Akinator.com และ Naive Bayes ตัวจําแนก
บริบท: ฉันเป็นโปรแกรมเมอร์ที่มีประสบการณ์ (ครึ่งหนึ่ง) ที่ถูกลืมในสถิติจากหลักสูตรของ uni เมื่อเร็ว ๆ นี้ฉันสะดุดกับhttp://akinator.comและใช้เวลาพยายามทำให้มันล้มเหลว แล้วใครล่ะ :) ฉันตัดสินใจที่จะหาว่ามันทำงานได้อย่างไร หลังจาก googling และอ่านโพสต์บล็อกที่เกี่ยวข้องและเพิ่มความรู้ (จำกัด ) ของฉันลงในมิกซ์ผลลัพธ์ฉันขึ้นมากับโมเดลต่อไปนี้ (ฉันแน่ใจว่าฉันจะใช้สัญลักษณ์ผิดโปรดอย่าฆ่าฉันเพื่อสิ่งนั้น): มีหัวเรื่อง (S) และคำถาม (Q) เป้าหมายของผู้ทำนายคือเลือกวิชาที่มีความน่าจะเป็นไปได้มากที่สุดในการเป็นวิชาที่ผู้ใช้กำลังคิดคำถามและคำตอบที่ได้รับมา ให้เกม G จะเป็นชุดของคำถามที่ถามและคำตอบที่ได้รับ:\}{q1,a1},{q2,a2}...{qn,an}{q1,a1},{q2,a2}...{qn,an}\{q_1, a_1\}, \{q_2, a_2\} ... \{q_n, a_n\} แล้วทำนายที่กำลังมองหา(G)}P(S|G)=P(G|S)∗P(S)P(G)P(S|G)=P(G|S)∗P(S)P(G)P(S|G) = \frac{P(G|S) * P(S)}{P(G)} ก่อนหน้าของวิชา ( ) อาจเป็นเพียงจำนวนครั้งที่ผู้ถูกเดาได้หารด้วยจำนวนเกมทั้งหมดP(S)P(S)P(S) ทำให้สมมติฐานที่ว่าคำตอบทั้งหมดเป็นอิสระเราสามารถคำนวณความน่าจะเป็นของเรื่อง S ที่ได้รับจากเกม G ดังนี้: P(G|S)=∏i=1..nP({qi,ai}|S)P(G|S)=∏i=1..nP({qi,ai}|S)P(G|S) = \prod_{i=1..n} P(\{q_i, …

3
การทำความเข้าใจการถดถอย SVM: ฟังก์ชั่นวัตถุประสงค์และ "ความเรียบ"
SVM สำหรับการจัดหมวดหมู่ทำให้เข้าใจได้ง่ายสำหรับฉัน: ฉันเข้าใจว่าการย่อขนาดให้ผลกำไรสูงสุด อย่างไรก็ตามฉันไม่เข้าใจวัตถุประสงค์นั้นในบริบทของการถดถอย ข้อความต่าง ๆ ( ที่นี่และที่นี่ ) อธิบายว่านี่เป็นการเพิ่ม "ความเรียบ" ให้สูงสุด ทำไมเราต้องการทำเช่นนั้น? อะไรคือความถดถอยที่เทียบเท่ากับแนวคิดของ "margin"?| | θ | |2||θ||2||\theta||^2 ต่อไปนี้เป็นคำตอบพยายามสองสามข้อ แต่ไม่มีผู้ใดที่ช่วยฉันเข้าใจ
12 regression  svm 

3
วิธีการเปรียบเทียบการอยู่รอดเฉลี่ยระหว่างกลุ่ม?
ฉันกำลังดูความอยู่รอดของคนไข้โดยใช้ Kaplan-Meier ในรัฐต่าง ๆ สำหรับโรคมะเร็ง มีความแตกต่างค่อนข้างมากระหว่างรัฐ ฉันจะเปรียบเทียบความอยู่รอดของค่ามัธยฐานระหว่างรัฐทั้งหมดและตัดสินว่ารัฐใดมีความแตกต่างอย่างมีนัยสำคัญจากค่าเฉลี่ยการอยู่รอดเฉลี่ยทั่วประเทศ?

2
เราจะทำแบบทดสอบสมมติฐาน MCMC กับแบบจำลองการถดถอยแบบผสมเอฟเฟกต์ด้วยความชันแบบสุ่มได้อย่างไร
ไลบรารี่ languageR จัดเตรียมวิธีการ (pvals.fnc) เพื่อทำการทดสอบ MCMC อย่างมีนัยสำคัญของเอฟเฟกต์คงที่ในรูปแบบการถดถอยเอฟเฟกต์เอฟเฟกต์แบบพอดีโดยใช้ lmer อย่างไรก็ตาม pvals.fnc ให้ข้อผิดพลาดเมื่อโมเดล lmer มีความลาดชันแบบสุ่ม มีวิธีการทำแบบทดสอบสมมติฐาน MCMC ของแบบจำลองดังกล่าวหรือไม่? ถ้าเป็นเช่นนั้นได้อย่างไร (หากได้รับคำตอบคำตอบควรมีตัวอย่างการทำงานใน R) ถ้าไม่มีเหตุผลทางความคิด / การคำนวณว่าทำไมไม่มีทาง? คำถามนี้อาจเกี่ยวข้องกับคำถามนี้แต่ฉันไม่เข้าใจเนื้อหาที่นั่นเพียงพอที่จะแน่ใจ แก้ไข 1 : หลักฐานของแนวคิดที่แสดงว่า pvals.fnc () ยังคงทำ 'บางสิ่งบางอย่าง' กับโมเดล lme4 แต่มันไม่ได้ทำอะไรกับแบบจำลองความชันแบบสุ่ม library(lme4) library(languageR) #the example from pvals.fnc data(primingHeid) # remove extreme outliers primingHeid = primingHeid[primingHeid$RT < 7.1,] …

3
คะแนนปัจจัยจากการตอบสนองแบบไม่ต่อเนื่องลำดับ
มีวิธีหลักการในการประเมินคะแนนปัจจัยเมื่อคุณมีลำดับเลขชี้กำลังตัวแปรไม่ต่อเนื่อง ฉันมีลำดับ , ไม่ต่อเนื่องตัวแปร ถ้าฉันตั้งสมมติฐานว่าการตอบสนองแต่ละอย่างนั้นเป็นตัวแปรต่อเนื่องแบบกระจายปกติแล้วฉันสามารถคำนวณเมทริกซ์สหสัมพันธ์โพลิคานิกฉันสามารถเรียกใช้การวิเคราะห์ปัจจัยในเมทริกซ์นี้และรับการโหลดปัจจัยสำหรับแต่ละตัวแปรnnnn×nn×nn\times n ฉันจะรวมการโหลดตัวประกอบและตัวแปรเพื่อประเมินคะแนนตัวประกอบได้อย่างไร วิธีทั่วไปในการประมาณคะแนนจะปรากฏว่าต้องการให้ฉันปฏิบัติกับข้อมูลลำดับเป็นช่วงเวลา ฉันคิดว่าฉันอาจต้องขุดลึกลงไปในความกล้าหาญของความสัมพันธ์ polychoric เพื่อหาฟังก์ชั่นการเชื่อมโยง

8
นักสถิติทำอะไร
เมื่อฉันบอกเพื่อนที่ไม่ใช่เชิงสถิติของฉันฉันเป็นนักเรียนที่จบการศึกษาระดับปริญญาเอกในด้านสถิติพวกเขาพูดว่า "โอ้คุณต้องการเป็นอาจารย์หรือไม่?" ฉันบอกพวกเขาว่าไม่จริงฉันวางแผนที่จะทำงานในอุตสาหกรรม จากนั้นพวกเขาก็ตอบกลับด้วย "และทำอะไร" ฉันไม่พบคำตอบที่ดีสำหรับคำถามนี้ ฉันต้องการให้พวกเขามีปัญหาที่น่าสนใจหลายอย่างที่นักสถิติทำงาน แต่การตอบสนองของฉันมักจะงงหรือเป็นเทคนิคเกินไป ฉันคิดว่าคนส่วนใหญ่นึกภาพเราทำงานใน excel และวิธีการคำนวณและส่วนเบี่ยงเบนมาตรฐาน ตอบคำถามที่สั้นและน่าสนใจคืออะไร ขอบคุณ! (ไม่แน่ใจว่าแท็กที่มีอยู่ดีสำหรับคำถามนี้คืออะไร)
12 careers 

2
พิกัดโคตรสำหรับ lasso หรือ elastic net
มีเอกสารหรือหนังสือที่ดีเกี่ยวกับการใช้โคตรประสานงานสำหรับ L1 (lasso) และ / หรือการทำให้เป็นระเบียบสุทธิแบบยืดหยุ่นสำหรับปัญหาการถดถอยเชิงเส้นหรือไม่?

3
คุณคำนวณความคาดหวังของ ?
ถ้ามีการแจกแจงแบบเอ็กซ์โพเนนเชียลพร้อมพารามิเตอร์และนั้นเป็นอิสระร่วมกันความคาดหวังของXiXiX_i(i=1,...,n)(i=1,...,n)(i=1,...,n)λλ\lambdaXiXiX_i (∑i=1nXi)2(∑i=1nXi)2 \left(\sum_{i=1}^n {X_i} \right)^2 ในแง่ของและและค่าคงที่อื่น ๆnnnλλ\lambda หมายเหตุ:คำถามนี้มีอากาศที่เป็นคำตอบทางคณิตศาสตร์/math//q/12068/4051 ผู้อ่านก็จะดูมันเช่นกัน


3
วิธีใช้สถิติ CDF และ PDF สำหรับการวิเคราะห์
นี่อาจเป็นคำถามทั่วไปมากเกินไป แต่ฉันหวังว่าฉันจะขอความช่วยเหลือได้ที่นี่ ฉันกำลังเริ่มงาน RA ในมหาวิทยาลัยของฉันและหัวข้อของฉันจะเกี่ยวข้องกับการวิเคราะห์การจราจรทางอินเทอร์เน็ต ฉันค่อนข้างใหม่สำหรับโลกแห่งการวิเคราะห์ แต่ฉันเดาว่าในโลกของการวิจัยนี่คือสิ่งที่ฉันต้องทำมากมาย ฉันเคยผ่านบทความสองสามฉบับและในหนังสือเหล่านั้นมากมายฉันพบว่าพวกเขาใช้ Probability Density (PDF), CDF, CCDF และอื่น ๆ เพื่ออธิบายผลลัพธ์ที่ได้รับ ตัวอย่างเช่น PDF ของระยะเวลาเซสชันของผู้ใช้ CDF ของจำนวนไบต์ที่ถ่ายโอนในแต่ละวันเป็นต้นฉันมีโอกาสในการเรียนและสถิติดังนั้นฉันจึงเข้าใจว่ามันคืออะไร แต่ฉันยังสับสนกับกรณีที่เลือกตัวแทน ดังนั้นหากมีใครออกไปทำกราฟและการวิเคราะห์ (ในหัวข้ออื่นใดโดยทั่วไปหรือสิ่งนี้) คุณสามารถบอกฉันได้ง่ายๆว่าในสถานการณ์ใดฉันจะใช้ตัวแทนอย่างใดอย่างหนึ่งหรืออย่างอื่นแทน

5
การจำแนกประเภทที่ดีกว่าของค่าเริ่มต้นในการถดถอยโลจิสติก
การเปิดเผยแบบเต็ม: นี่คือการบ้าน ฉันได้รวมลิงก์ไปยังชุดข้อมูล ( http://www.bertelsen.ca/R/logistic-regression.sav ) เป้าหมายของฉันคือการเพิ่มการคาดการณ์ของผู้ชำระหนี้ในชุดข้อมูลนี้ ทุกรุ่นที่ฉันคิดมานั้นคาดการณ์> 90% ของผู้ไม่ defaulters แต่ <40% ของผู้ defaulters ทำให้ประสิทธิภาพการจำแนกโดยรวมประมาณ 80% ดังนั้นฉันสงสัยว่ามีผลกระทบระหว่างการโต้ตอบตัวแปรหรือไม่ ภายในการถดถอยแบบโลจิสติกส์นอกเหนือจากการทดสอบชุดค่าผสมที่เป็นไปได้แต่ละวิธีมีวิธีการระบุผลกระทบที่อาจเกิดขึ้นจากการโต้ตอบ หรืออีกวิธีหนึ่งในการเพิ่มประสิทธิภาพของการจำแนกประเภทของ defaulters ฉันติดอยู่คำแนะนำใด ๆ จะเป็นประโยชน์ในการเลือกคำ R-code หรือไวยากรณ์ SPSS ของคุณ ตัวแปรหลักของฉันอยู่ในฮิสโทแกรมและสแกตเตอร์ล็อตต่อไปนี้ (ยกเว้นตัวแปร dichotomous) คำอธิบายของตัวแปรหลัก: age: Age in years employ: Years with current employer address: Years at current address income: Household income in …
12 r  logistic  spss  self-study 

1
การอัพเดตเชือกให้พอดีกับข้อสังเกตใหม่
ฉันเหมาะสมกับการถดถอยเชิงเส้น L1-normalized กับชุดข้อมูลที่มีขนาดใหญ่มาก (ที่มี n >> p.) ตัวแปรเป็นที่รู้จักล่วงหน้า แต่การสังเกตการณ์มาถึงกลุ่มเล็ก ๆ ฉันต้องการที่จะรักษาเชือกที่พอดีหลังจากแต่ละก้อน เห็นได้ชัดว่าฉันสามารถปรับโมเดลทั้งหมดได้อีกครั้งหลังจากเห็นการสังเกตชุดใหม่แต่ละชุด อย่างไรก็ตามสิ่งนี้จะไม่มีประสิทธิภาพพอสมควรเนื่องจากมีข้อมูลจำนวนมาก จำนวนข้อมูลใหม่ที่มาถึงในแต่ละขั้นตอนมีขนาดเล็กมากและความพอดีไม่น่าจะเปลี่ยนแปลงระหว่างขั้นตอนมากนัก มีอะไรที่ฉันสามารถทำได้เพื่อลดภาระการคำนวณโดยรวมหรือไม่? ฉันกำลังดูอัลกอริทึม LARS ของ Efron et al. แต่ยินดีที่จะพิจารณาวิธีการติดตั้งแบบอื่น ๆ ถ้ามันสามารถทำให้ "warm-start" ตามที่อธิบายไว้ข้างต้น หมายเหตุ: ฉันกำลังมองหาอัลกอริทึมเป็นหลัก แต่ตัวชี้ไปยังชุดซอฟต์แวร์ที่มีอยู่ซึ่งสามารถทำได้สิ่งนี้อาจพิสูจน์ได้ด้วย นอกเหนือจากวิถีบ่วงบาศปัจจุบันอัลกอริธึมก็แน่นอนยินดีที่จะรักษาสถานะอื่น แบรดลีย์เอฟรอน, เทรเวอร์ Hastie เลน Johnstone และโรเบิร์ตทิบชิรา นี , น้อยมุมถดถอย , พงศาวดารของสถิติ (ด้วยการอภิปราย) (2004) 32 (2), 407--499
12 regression  lasso 

3
ตรวจสอบความถูกต้องของแบบสอบถาม
ฉันกำลังออกแบบแบบสอบถามสำหรับวิทยานิพนธ์ของฉัน ฉันอยู่ระหว่างการตรวจสอบความถูกต้องของแบบสอบถามที่ฉันใช้การทดสอบอัลฟาของครอนบาคกับกลุ่มตัวอย่างเริ่มต้น คำตอบของแบบสอบถามอยู่ในระดับ Likert; ใครสามารถแนะนำการทดสอบเพิ่มเติมใด ๆ ที่จะนำไปใช้เพื่อช่วยทดสอบความถูกต้องของมัน ฉันไม่ใช่ผู้เชี่ยวชาญเกี่ยวกับสถิติดังนั้นความช่วยเหลือใด ๆ จะได้รับการชื่นชม ฉันได้ทำการวิจัยมาแล้วและดูเหมือนว่าฉันสามารถทำการวิเคราะห์ Rasch ได้หรือไม่มีใครมีเว็บไซต์ซอฟต์แวร์ฟรีที่จะใช้การทดสอบและคำแนะนำนี้หรือไม่

2
การวิเคราะห์รายการสำหรับมือใหม่ R
ฉันพยายามประเมินการทดสอบตัวเลือกหลายรายการ 20 ข้อ ฉันต้องการทำการวิเคราะห์รายการเช่นสามารถพบได้ในตัวอย่างนี้ ดังนั้นสำหรับคำถามแต่ละข้อฉันต้องการค่า P และค่าสหสัมพันธ์กับผลรวมและการกระจายตัวเลือกที่เลือก ฉันไม่รู้อะไรเกี่ยวกับแพคเกจซอฟต์แวร์ทางสถิติที่หลากหลาย แต่ฉันต้องการใช้ R เนื่องจากฉันพอใจกับการเขียนโปรแกรมและ R เป็นโอเพ่นซอร์ส หลอกเวิร์กโฟลว์ที่ฉันจินตนาการคือ: เตรียมข้อมูลใน excel และส่งออกเป็น CSV โหลดข้อมูลใน R โหลดแพ็คเกจที่ทำในสิ่งที่ฉันต้องการ รันคำสั่งของแพ็คเกจนั้น ส่งออกและรายงาน ฉันมั่นใจกับ 1 และ 2 แต่มีปัญหากับ 3 อาจเป็นเพราะฉันไม่มีคำศัพท์เชิงสถิติเพื่อเปรียบเทียบแพ็กเกจที่ฉันเรียกดูบน CRAN ltmดูเหมือนว่าจะเป็นแพ็คเกจที่ถูกต้อง แต่ฉันก็บอกไม่ได้ แพคเกจใดที่ใช้คำสั่งจะเป็นอย่างไร คำถามด้านข้าง: ในตัวอย่างที่เชื่อมโยงคุณคิดว่า MC และ MI จะทำอะไร

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.