สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
การทดสอบสมมติฐานเพื่อความเท่าเทียมกันของสัดส่วนกับ 3 ตัวอย่าง
ฉันมีชุดข้อมูลของข้อมูลลูกค้าโทรศัพท์มือถือพร้อมทวีต คอลัมน์แรกมีหมวดหมู่บางอย่างที่บัญชีอยู่ (ทั้ง A, B หรือ C) และคอลัมน์ที่สองมีค่าไบนารีว่าบัญชีนั้นได้ยกเลิกหรือไม่ เช่น A | cancelled C | active B | active A | cancelled สิ่งที่ฉันต้องการทำคือการทดสอบสมมติฐานบางอย่างเพื่อทดสอบว่าอัตราส่วนของบัญชีประเภท A, B และ C นั้นแตกต่างกันสำหรับบัญชีที่ใช้งานกับบัญชีที่ถูกยกเลิกหรือไม่ - สมมุติฐานว่าง ๆ นั้นเป็นสิ่งเดียวกัน มันเหมือนกับการทดสอบสมมุติฐานสำหรับสัดส่วนยกเว้นฉันไม่รู้ว่าจะทำอย่างไรกับ 3 ค่า

1
การตีความการประเมินความผิดพลาดนอกถุงสำหรับ RandomForestRegressor
ฉันใช้การสุ่มตัวอย่างแบบสุ่มของฟอเรสต์ในข้อมูลของฉันและฉันเห็นว่าคะแนน oob นั้นได้มาเป็น 0.83 ฉันไม่แน่ใจว่ามันจะเป็นเช่นนี้ได้อย่างไร ฉันหมายความว่าเป้าหมายของฉันมีค่าสูงในช่วง 10 ^ 7 ดังนั้นถ้าเป็น MSE มันน่าจะสูงกว่านี้มาก ฉันไม่เข้าใจสิ่งที่ 0.83 มีความหมายที่นี่ ฉันใช้การสุ่มตัวอย่าง RandomForestRegressor ของงูใหญ่ของชุดเครื่องมือ sklearn ฉันทำ model = RandomForestRegressor (max_depth = 7, n_estimators = 100, oob_score = True, n_jobs = -1) model.fit (trainX, trainY) จากนั้นฉันเห็น model.oob_score_ และรับค่าเช่น 0.83809026152005295

1
ใช้การวิเคราะห์องค์ประกอบหลักเทียบกับการวิเคราะห์การโต้ตอบ
ฉันกำลังวิเคราะห์ชุดข้อมูลที่เกี่ยวข้องกับชุมชน intertidal ข้อมูลเป็นเปอร์เซ็นต์การครอบคลุม (ของสาหร่ายทะเล, เพรียง, หอยแมลงภู่, ฯลฯ ) ในรูปสี่เหลี่ยม ฉันเคยคิดเกี่ยวกับการวิเคราะห์การติดต่อ (CA) ในแง่ของจำนวนสปีชีส์และการวิเคราะห์องค์ประกอบหลัก (PCA) เป็นสิ่งที่มีประโยชน์มากขึ้นสำหรับแนวโน้มเชิงเส้นสิ่งแวดล้อม (ไม่ใช่สปีชีส์) ฉันไม่ได้มีโชคใด ๆ ที่คิดว่า PCA หรือ CA จะเหมาะกว่าสำหรับเปอร์เซ็นต์การครอบคลุม (ไม่พบเอกสารใด ๆ ) และฉันไม่แน่ใจด้วยซ้ำว่าสิ่งที่ต่อยอดสูงสุดถึง 100% จะกระจายออกไปได้อย่างไร ? ฉันคุ้นเคยกับแนวทางคร่าวๆว่าหากความยาวของแกนการวิเคราะห์การโต้ตอบจดหมายที่ถูก detrended แรก (DCA) มากกว่า 2 คุณจะสามารถสันนิษฐานได้ว่าควรใช้ CA อย่างปลอดภัย ความยาวของแกน DCA 1 คือ 2.17 ซึ่งฉันไม่พบว่ามีประโยชน์

3
เหตุใดทฤษฎีบทของเบย์จึงใช้งานกราฟิกได้
จากมุมมองทางคณิตศาสตร์ทฤษฎีบท Bayes 'ทำให้รู้สึกที่สมบูรณ์แบบสำหรับฉัน (เช่นการสืบและการพิสูจน์) แต่สิ่งที่ฉันไม่ทราบว่ามีหรือไม่มีอาร์กิวเมนต์ทางเรขาคณิตหรือกราฟิกที่ดีที่สามารถแสดงเพื่ออธิบายทฤษฎีบทของ Bayes ฉันลอง Googling ไปรอบ ๆ เพื่อหาคำตอบและก็แปลกใจที่ฉันไม่พบอะไรเลย

6
อัลกอริทึมการเรียนรู้ของเครื่องใดที่สามารถปรับขนาดได้โดยใช้ hadoop / map-ลด
อัลกอริทึมการเรียนรู้ของเครื่องที่ปรับขนาดได้ดูเหมือนจะเป็นที่นิยมในทุกวันนี้ ทุก บริษัท มีการจัดการอะไรสั้น ๆ ของข้อมูลขนาดใหญ่ มีหนังสือเรียนเล่มหนึ่งหรือไม่ที่พูดถึงสิ่งที่กลไกการเรียนรู้ของเครื่องสามารถปรับขนาดโดยใช้สถาปัตยกรรมแบบขนานเช่น Map-Reduce และอัลกอริทึมใดที่ไม่สามารถทำได้? หรือเอกสารที่เกี่ยวข้อง?

3
หนังสือเกี่ยวกับนิเวศวิทยาทางสถิติ?
ฉันรู้ว่าคำถามนี้ถูกถามมาก่อน: หนังสืออ้างอิงสำหรับการศึกษาทางนิเวศวิทยาแต่ไม่ใช่สิ่งที่ฉันกำลังมองหา สิ่งที่ฉันกำลังมองหาคือถ้าใครสามารถแนะนำหนังสือที่ดี (หรืออ้างอิงที่เป็นที่ยอมรับ) เกี่ยวกับนิเวศวิทยาทางสถิติ? ฉันมีความเข้าใจเกี่ยวกับสถิติเป็นอย่างดีดังนั้นหนังสือเล่มนี้อาจอยู่ในระดับใดก็ได้ ฉันจะใช้หนังสือเล่มนี้เพื่อสอนตัวเองเกี่ยวกับการประยุกต์ใช้สถิติทางนิเวศวิทยามากกว่าสิ่งอื่นดังนั้นแม้แต่หนังสือเกริ่นนำที่มีตัวอย่างที่ดี / น่าสนใจก็จะได้รับการชื่นชมมาก นอกจากนี้งานวิจัยของฉันมีแนวโน้มที่จะมุ่งเน้นไปที่สถิติแบบเบย์ดังนั้นหนังสือที่รวมเอาสถิติแบบเบย์นั้นดียิ่งขึ้น!

4
ใช้การถดถอยโลจิสติกสำหรับตัวแปรขึ้นอยู่กับอย่างต่อเนื่อง
ฉันได้รับการแก้ไขสำหรับงานวิจัยของฉันเมื่อเร็ว ๆ นี้และต่อไปนี้เป็นความคิดเห็นของผู้ตรวจทานบนกระดาษของฉัน: ผลลัพธ์ที่ได้จากแบบจำลองเดียวไม่น่าเชื่อโดยเฉพาะการถดถอยเชิงเส้นมักจะมีข้อบกพร่องในการจัดการกับคนผิดปกติ ฉันขอแนะนำให้ผู้เขียนลองถดถอยโลจิสติกและเปรียบเทียบผลลัพธ์ที่สอดคล้องกับผลลัพธ์ปัจจุบัน หากได้ข้อสังเกตที่คล้ายกันผลลัพธ์จะมีความมั่นคงมากขึ้น ความคิดเห็นของผู้วิจารณ์ถูกต้องหรือไม่ การถดถอยโลจิสติกดีกว่าการถดถอยเชิงเส้นหลายครั้งหรือไม่ ปัญหาคือว่าตัวแปรตามของฉันไม่ได้จัดหมวดหมู่มันเป็นตัวแปรขนาด ฉันจะทำอะไรได้บ้าง คุณแนะนำวิธีการถดถอยแบบอื่นใดในการประเมินโมเดลของฉัน คะแนนขึ้นอยู่กับตัวแปรในตารางต่อไปนี้ ความใหม่ความถี่การครอบครองและคะแนนสุดท้ายเป็นตัวแปรอิสระ ฉันได้แยกตัวแปรเหล่านี้ออกจากไซต์แล้วและฉันตั้งสมมติฐานว่าตัวแปรอิสระเหล่านี้มีผลต่อคะแนนอย่างมาก ดังนั้นฉันเป็นตัวแทนของรุ่นต่อไปนี้: ยังไงก็ตามค่าของ R กำลังสองสำหรับโมเดลเชิงเส้นนี้คือ 0.316! ผู้ตรวจสอบยังแสดงความคิดเห็นเกี่ยวกับค่านี้เช่นกัน: ผลลัพธ์จะไม่น่าเชื่อถือเนื่องจากไม่มีตัวบ่งชี้คุณภาพของสัมประสิทธิ์ที่เรียนรู้ R ^ 2 ขนาดเล็กไม่สามารถบ่งบอกถึงประสิทธิภาพที่ดีเนื่องจากรุ่นอาจติดตั้งเกินขนาด 0.316 ต่ำมากสำหรับ R กำลังสองหรือไม่ ในเอกสารก่อนหน้านี้ฉันเห็นคุณค่าที่คล้ายกันมาก

2
การคำนวณช่วงเวลาการทำนาย
ผมได้ข้อมูลต่อไปนี้ตั้งอยู่ที่นี่ ฉันพยายามคำนวณช่วงความมั่นใจ 95% ของความบริสุทธิ์เฉลี่ยเมื่อเปอร์เซ็นต์ไฮโดรคาร์บอนเท่ากับ 1.0 ใน R ฉันป้อนสิ่งต่อไปนี้ > predict(purity.lm, newdata=list(hydro=1.0), interval="confidence", level=.95) fit lwr upr 1 89.66431 87.51017 91.81845 อย่างไรก็ตามฉันจะได้ผลลัพธ์นี้ด้วยตนเองได้อย่างไร ฉันพยายามใช้สมการต่อไปนี้ sn E W=s2( 1 +1ยังไม่มีข้อความ+(xn E W-x¯)2∑ (xผม-x¯)2)----------------------√snอีW=s2(1+1ยังไม่มีข้อความ+(xnอีW-x¯)2Σ(xผม-x¯)2)s_{new}=\sqrt{s^2\left(1+\frac{1}{N}+\frac{(x_{new}-\bar x)^2}{\sum(x_i-\bar x)^2}\right)} และฉันป้อนสิ่งต่อไปนี้ในอาร์ > SSE_line = sum((purity - (77.863 + 11.801*hydro))^2) > MSE = SSE_line/18 > t.quantiles <- qt(c(.025, .975), …

4
มีชื่อสำหรับแผนภูมินี้ - เรียงลำดับของการข้ามระหว่างแผนภูมิวงกลมและพล็อต mekko
มีชื่อของแผนภูมิประเภทนี้ด้านล่าง (ที่มาจากกระทรวงธุรกิจนวัตกรรมและการจ้างงานของนิวซีแลนด์สำหรับคนที่ฉันทำงาน แต่ฉันไม่ได้เกี่ยวข้องกับการสร้างพล็อตนี้)? มันประกอบด้วยสี่เหลี่ยมที่พื้นที่นั้นเป็นสัดส่วนกับตัวแปรและคล้ายกับการข้ามระหว่างแผนภูมิวงกลมพล็อตโมเสคและพล็อต mekko มันอาจใกล้เคียงกับเนื้อเรื่องของ mekko แต่มีความยุ่งยากว่าเราไม่ได้ทำงานกับคอลัมน์ แต่เป็นตัวต่อที่ซับซ้อนมากขึ้น ต้นฉบับดูดีขึ้นเล็กน้อยเนื่องจากมีเส้นขอบสีขาวระหว่างสี่เหลี่ยมสำหรับแต่ละภูมิภาค น่าแปลกที่จริง ๆ แล้วมันทำให้ฉันรู้สึกว่ากราฟิกทางสถิติไม่ได้แย่จนเกินไปแม้ว่ามันจะสามารถปรับปรุงให้ดีขึ้นได้จากการใช้สีที่แมปกับสิ่งที่มีความหมาย รุ่นที่มีประสิทธิภาพแบบโต้ตอบแสดงงบประมาณ 2011 สหรัฐได้ถูกนำมาใช้โดยนิวยอร์กไทม์ส ความท้าทายที่น่าสนใจคือการคิดอัลกอริธึมอัตโนมัติในการวาดและทำให้มันดูสมเหตุสมผลเช่นกัน สี่เหลี่ยมต้องได้รับอนุญาตให้มีอัตราส่วนกว้างยาวต่างกันภายในช่วงที่ยอมรับได้

3
การทดสอบทางสถิติเพื่อดูว่าความสัมพันธ์เป็นแบบเชิงเส้นหรือไม่เชิงเส้น
ฉันมีชุดข้อมูลตัวอย่างดังนี้: Volume <- seq(1,20,0.1) var1 <- 100 x2 <- 1000000 x3 <- 30 x4 = sqrt(x2/pi) H = x3 - Volume r = (x4*H)/(H + Volume) Power = (var1*x2)/(100*(pi*Volume/3)*(x4*x4 + x4*r + r*r)) Power <- jitter(Power, factor = 1, amount = 0.1) plot(Volume,Power) จากรูปสามารถบอกได้ว่าระหว่างความสัมพันธ์ 'ปริมาตร' และ 'พลัง' บางช่วงนั้นเป็นเส้นตรงจากนั้นเมื่อ 'ปริมาณ' ค่อนข้างน้อยความสัมพันธ์จะกลายเป็นไม่เป็นเชิงเส้น …

1
มีความหมายตามปกติของสัญลักษณ์ในสถิติหรือไม่?
ผมอ่านกระดาษในคชกรรมเส้นโค้ง ( DiMatteo et. al. คชกรรมโค้งกระชับกับเส้นโค้งฟรีปม 2001 ) และมาข้ามสัญลักษณ์\≏≏\bumpeqมันถูกใช้สองสามครั้งทั่วทั้งกระดาษ แต่ไม่เคยกำหนดไว้อย่างชัดเจน หลังจากค้นหา google และ stackexchange สองสามรายการจะปรากฏราวกับว่าสัญลักษณ์นั้นไม่ได้ใช้กันอย่างแพร่หลายหรือไม่ได้นิยามไว้ตามอัตภาพ ด้านล่างฉันให้ตัวอย่างกับบริบทจากเอกสารอ้างอิง ฉันขอโทษล่วงหน้าที่ไม่ได้กำหนดสัญลักษณ์อื่นใด แต่การทำเช่นนั้นจะเป็นการคัดลอกข้อความส่วนใหญ่จากกระดาษที่ฉันเชื่อมโยงและจะใช้กับคำถามเล็กน้อย จาก p1059 (สมการ 8): อนึ่งเราสามารถเห็นสิ่งนี้ในการประมาณอัตราส่วนความน่าจะเป็นสำหรับโมเดลปกติในสมการ (6) โดย p(y|kc,ξc)p(y|k,ξ)≏1n−−√((y−Bk,ξβ^)T(y−Bk,ξβ^)(y−Bk,ξcβc^)T(y−Bk,ξcβc^))n/2=exp(−BIC/2)p(y|kc,ξc)p(y|k,ξ)≏1n((y−Bk,ξβ^)T(y−Bk,ξβ^)(y−Bk,ξcβc^)T(y−Bk,ξcβc^))n/2=exp(−BIC/2)\frac{p(y|k^c,\xi^c)}{p(y|k,\xi)}\bumpeq\frac{1}{\sqrt{n}}\left(\frac{(y-B_{k,\xi}\hat{\beta})^T(y-B_{k,\xi}\hat{\beta})}{(y-B_{k,\xi^c}\hat{\beta^c})^T(y-B_{k,\xi^c}\hat{\beta^c})}\right)^{n/2}=exp(-\text{BIC}/2) จากบริบทดูเหมือนว่า≏≏\bumpeqแสดงถึงการประมาณ ถ้าเป็นกรณีนี้มันจะมีความหมายเหมือนกันกับสัญลักษณ์ธรรมดามากขึ้นสำหรับการประมาณเช่น≈≈\approxหรือ∼∼\sim ? หรือมันถูกใช้ในการแสดงชนิดหนึ่งของการประมาณที่≈≈\approxหรือ∼∼\simจะไม่เพียงพอหรือทำให้เข้าใจผิด?

1
การตีความแปลงไวโอลิน
ฉันกำลังเปรียบเทียบการกระจายของกลุ่มต่าง ๆ โดยใช้แผนการไวโอลิน แต่แหล่งข้อมูลออนไลน์ส่วนใหญ่ที่ฉันพบมีความเกี่ยวข้องกับวิธีการแปลงและการตีความผลลัพธ์ขั้นพื้นฐานมาก (การแปรผันค่ามัธยฐาน ฉันกำลังมองหาตัวอย่างโดยละเอียดที่ฉันสามารถปฏิบัติตามเป็นแนวทางของฉันในการตีความแผนการไวโอลินอย่างถูกต้อง

2
การวัดประสิทธิภาพลักษณนามที่รวมความไวและความจำเพาะ?
ฉันมีข้อมูลป้ายกำกับ 2 ชั้นซึ่งฉันจัดหมวดหมู่โดยใช้ตัวแยกประเภทหลายตัว และชุดข้อมูลมีความสมดุลดี เมื่อประเมินประสิทธิภาพของตัวจําแนกฉันต้องพิจารณาความถูกต้องของตัวจําแนกในการพิจารณาไม่เพียง แต่บวกที่แท้จริง แต่เชิงลบที่แท้จริงยัง ดังนั้นถ้าฉันใช้ความถูกต้องและถ้าลักษณนามมีความเอนเอียงไปทางบวกและจำแนกทุกอย่างเป็นบวกฉันจะได้ความแม่นยำประมาณ 50% แม้ว่ามันจะล้มเหลวในการจำแนกเชิงลบจริงก็ตาม คุณสมบัตินี้ถูกขยายให้มีความแม่นยำและเรียกคืนตามที่พวกเขามุ่งเน้นไปที่หนึ่งคลาสเท่านั้นและกลับไปที่คะแนน F1 (นี่คือสิ่งที่ฉันเข้าใจแม้จากบทความนี้เช่น " เกินความแม่นยำคะแนน F และ ROC: ครอบครัวของมาตรการแบ่งแยกสำหรับการประเมินผลงาน ") ดังนั้นฉันสามารถใช้ความไวและความเฉพาะเจาะจง (TPR และ TNR) เพื่อดูว่าตัวแยกประเภทดำเนินการสำหรับแต่ละคลาสได้อย่างไรโดยที่ฉันตั้งใจจะเพิ่มค่าเหล่านี้ให้มากที่สุด คำถามของฉันคือฉันกำลังมองหาการวัดที่รวมค่าทั้งสองนี้เข้าด้วยกันในการวัดที่มีความหมายเดียว ฉันตรวจดูมาตรการที่ให้ไว้ในบทความนั้น แต่ฉันคิดว่ามันไม่สำคัญ และจากความเข้าใจของฉันฉันสงสัยว่าทำไมเราไม่สามารถใช้บางอย่างเช่นคะแนน F แต่แทนที่จะใช้ความแม่นยำและการเรียกคืนฉันจะใช้ความไวและความเฉพาะเจาะจง ดังนั้นสูตรจะเป็น และเป้าหมายของฉันจะเพิ่มสูงสุด วัดนี้ ฉันคิดว่ามันจะเป็นตัวแทนมาก มีสูตรที่คล้ายกันอยู่แล้ว? และนี่จะสมเหตุสมผลหรือเป็นเสียงทางคณิตศาสตร์หรือไม่การวัดประสิทธิภาพของฉัน=2 * ความไว* เฉพาะเจาะจงความไว+ จำเพาะการวัดประสิทธิภาพของฉัน=2* * * *ความไว* * * *ความจำเพาะความไว+ความจำเพาะ \text{my Performance Measure} …

3
คำแนะนำสำหรับครูครั้งแรก (บทนำสู่ชีวสถิติ)
ฉันกำลังสอนชั้นแรกของฉันในฤดูใบไม้ร่วงนี้ (บทนำสู่ชีวสถิติ) ใครมีคำแนะนำสำหรับการสอนสถิติดีกว่า บางทีตัวอย่างที่คุณต้องการให้อาจารย์คนแรกของคุณใช้? ฉันใช้หลักการของชีวสถิติโดย Pagano และ Gauvreau แก้ไข: รายละเอียด คลาสนี้เป็นคลาสออนไลน์ที่ตรงกับสัปดาห์ละสองครั้งเป็นเวลา 1.5 ชั่วโมง นักเรียนจะฟังฉันบรรยายในขณะที่ดูงานนำเสนอ powerpoint / beamer (น่าเบื่อ?) ผสมกับการกระทำแท็บเล็ต / ปากกาเล็ก ๆ (น่าตื่นเต้น?) คลาสนี้เป็นเนื้อหาทางสถิติเริ่มต้นที่มากสอนวิศวกรชีวการแพทย์ส่วนใหญ่ นักศึกษาระดับบัณฑิตศึกษา (การพยาบาลนักศึกษาแพทย์สาธารณสุข ฯลฯ ) หลักสูตร : 1) ชีวสถิติคืออะไร 2) ความน่าจะเป็น 3) การทดสอบการวินิจฉัย (เช่นความจำเพาะความไวเส้นโค้ง ROC ส่วนใหญ่ที่นี่ b / c ช่วยให้เราสามารถใช้บางสิ่งที่เราเรียนรู้เกี่ยวกับความน่าจะเป็นเช่นกฎของเบย์) 4) การแจกแจง 5) การแจกแจงตัวอย่าง 6) ช่วงความเชื่อมั่น 7) …

5
วิธีการวัดประสิทธิภาพของลักษณนามเมื่อใกล้ถึง 100% ของเลเบลคลาสเป็นของคลาสเดียว?
ในข้อมูลของฉันฉันมีตัวแปรคลาสแสดงเป็นCค่าตัวแปรคลาสนี้คือ (ไบนารี) การสำรวจเกือบทั้งหมดเป็น 0 (ใกล้ 100% แม่นยำยิ่งขึ้น 97%) ฉันต้องการทดสอบ "ประสิทธิภาพ" สำหรับแบบจำลองการจำแนกประเภทที่แตกต่างกัน (อาจเป็นความแม่นยำ) สิ่งที่ฉันกลัวว่าจะเกิดขึ้นคือถ้าฉันมีรูปแบบการจำแนกที่จำแนกประเภทการสังเกตใด ๆ ในคลาส 0 เสมอโมเดลนั้นจะมีความแม่นยำ 97% (แม้ว่ามันจะไม่เคยพิจารณาตัวแปรอื่น ๆ ก็ตาม)คCC0 , 10,1{0, 1}คCC มีการทดสอบประสิทธิภาพที่รู้จักกันดีสำหรับแบบจำลองการจำแนกประเภทในการจัดการข้อมูลกับเหตุการณ์ที่เกิดขึ้นน้อยมากหรือไม่?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.