สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
VC-Dimensions ของ k- เพื่อนบ้านที่ใกล้ที่สุด
VC-Dimension ของอัลกอริทึมเพื่อนบ้านที่ใกล้ที่สุดคือ k คืออะไรถ้า k เท่ากับจำนวนคะแนนการฝึกอบรมที่ใช้? บริบท:คำถามนี้ถูกถามในหลักสูตรที่ฉันทำและคำตอบที่ได้คือ 0 แต่ฉันไม่เข้าใจว่าทำไมถึงเป็นเช่นนั้น สัญชาตญาณของฉันคือ VC-Dimension ควรเป็น 1 เพราะมันเป็นไปได้ที่จะเลือกสองแบบ (เช่นชุดของคะแนนการฝึกอบรม) เพื่อให้ทุกจุดถูกระบุว่าเป็นของคลาสหนึ่งตามรุ่นแรกและเป็นของคลาสอื่น ตามรุ่นที่สองดังนั้นจึงเป็นไปได้ที่จะแตกจุดเดียว ความผิดพลาดในการให้เหตุผลของฉันอยู่ที่ไหน

1
มีสูตรสำหรับรูปแบบทั่วไปของปัญหาตัวรวบรวมคูปองหรือไม่
ฉันพบปัญหาเกี่ยวกับตัวสะสมคูปองและพยายามหาสูตรสำหรับการวางหลักเกณฑ์ทั่วไป หากมีวัตถุที่แตกต่างกันชนิดและคุณต้องการรวบรวมอย่างน้อยkสำเนาของแต่ละmของวัตถุเหล่านั้น (โดยที่m ≤ N ) ความคาดหวังของวัตถุสุ่มที่คุณควรซื้อคือเท่าใด ปัญหาที่สะสมคูปองปกติมีM = NและK = 1ยังไม่มีข้อความNNkkkม.mmm ≤ Nm≤Nm \le Nm = Nm=Nm = Nk = 1k=1k = 1 มีตัวต่อเลโก้ 12 ชิ้นในชุดสะสม ฉันต้องการรวบรวม 3 สำเนาของแต่ละตัวเลข 10 (10 ใด ๆ ) ฉันสามารถซื้อพวกเขาแบบสุ่มครั้งละหนึ่ง ฉันควรคาดหวังว่าจะซื้อกี่ชุดก่อนที่จะมีสำเนา 3 ชุดสำหรับชุดละ 10 ชุด

3
วิธีการและตัวอย่างของการจัดกลุ่มกราฟใน“ R”
ฉันกำลังมองหาการจัดกลุ่ม / ผสานโหนดในกราฟโดยใช้การจัดกลุ่มกราฟใน 'r' นี่คือรูปแบบของเล่นที่น่าทึ่งของปัญหาของฉัน มี "กลุ่ม" สอง มี "สะพาน" เชื่อมต่อกับกลุ่ม นี่คือเครือข่ายผู้สมัคร: เมื่อฉันดูระยะการเชื่อมต่อ "hopcount" ถ้าคุณต้องการฉันจะได้เมทริกซ์ต่อไปนี้: mymatrix <- rbind( c(1,1,2,3,3,3,2,1,1,1), c(1,1,1,2,2,2,1,1,1,1), c(2,1,1,1,1,1,1,1,2,2), c(3,2,1,1,1,1,1,2,3,3), c(3,2,1,1,1,1,1,2,3,3), c(3,2,1,1,1,1,1,2,2,2), c(2,1,1,1,1,1,1,1,2,2), c(1,1,1,2,2,2,1,1,1,1), c(1,1,2,3,3,2,2,1,1,1), c(1,1,2,3,3,2,2,1,1,1)) ความคิดที่นี่: โชคหรือเนื่องจากความเรียบง่ายของของเล่นเมทริกซ์มีแพทช์ที่เห็นได้ชัดนี่ไม่ใช่กรณีในเมทริกซ์ (ใหญ่มาก) ถ้าฉันสุ่มความสัมพันธ์ระหว่างจุดกับแถวมันจะไม่สะอาด ฉันอาจจะผิดหนึ่ง - ดังนั้นถ้าฉันพิมพ์ผิดแจ้งให้ฉันทราบ Hop-count ที่นี่คือจำนวน hops ที่สั้นที่สุดเพื่อเชื่อมต่อจุดบนแถว i กับจุดบนคอลัมน์ j การกระโดดด้วยตัวเองยังคงเป็นการกระโดดดังนั้นเส้นทแยงมุมจึงเป็นเส้นโค้งทั้งหมด ดังนั้นในเมทริกซ์นี้ระยะทางที่มากขึ้น (ฮ็อพ) มีจำนวนมาก ถ้าฉันต้องการเมทริกซ์ที่แสดง "การเชื่อมต่อ" แทนระยะทางฉันสามารถทำ dot-inverse …

3
การตัดสินใจระหว่างตัวแบบการถดถอยเชิงเส้นหรือตัวแบบการถดถอยเชิงเส้น
เราควรเลือกระหว่างการใช้โมเดลการถดถอยเชิงเส้นหรือแบบจำลองการถดถอยเชิงเส้นอย่างไร เป้าหมายของฉันคือการทำนาย Y ในกรณีของชุดข้อมูลและy ที่เรียบง่ายฉันสามารถตัดสินใจได้อย่างง่ายดายว่ารูปแบบการถดถอยควรใช้โดยการพล็อตพล็อตกระจายxxxyyy ในกรณีที่มีหลายตัวแปรเช่นและY ฉันจะตัดสินใจได้อย่างไรว่าจะใช้รูปแบบการถดถอยแบบใด นั่นคือฉันจะตัดสินใจเกี่ยวกับการใช้โมเดลเชิงเส้นอย่างง่ายหรือแบบจำลองเชิงเส้นแบบไม่ได้เช่น quadric, cubic เป็นต้นx1,x2,...xnx1,x2,...xnx_1,x_2,...x_nyyy มีเทคนิคหรือวิธีการทางสถิติหรือแปลงกราฟิกเพื่ออนุมานและตัดสินใจว่าจะใช้รูปแบบการถดถอยหรือไม่?

1
ฉันจะค้นหา p-value ของการถดถอยแบบอิสระ
ฉันมีตัวแปรบางอย่างและฉันสนใจที่จะค้นหาความสัมพันธ์ที่ไม่ใช่เชิงเส้นระหว่างพวกเขา ดังนั้นฉันจึงตัดสินใจใส่เดือยหรือดินเหลืองและพิมพ์พล็อตที่ดี (ดูรหัสด้านล่าง) แต่ฉันยังต้องการที่จะมีสถิติบางอย่างที่ทำให้ฉันมีความคิดว่าความสัมพันธ์นั้นเป็นเรื่องของการสุ่ม ... นั่นคือฉันต้องการค่า p โดยรวมบางอย่างเช่นฉันมีการถดถอยเชิงเส้น กล่าวอีกนัยหนึ่งฉันต้องรู้ว่าเส้นโค้งที่พอดีนั้นเหมาะสมหรือไม่เนื่องจากรหัสของฉันจะพอดีกับเส้นโค้งกับข้อมูลใด ๆ x <- rnorm(1000) y <- sin(x) + rnorm(1000, 0, 0.5) cor.test(x,y) plot(x, y, xlab = xlab, ylab = ylab) spl1 <- smooth.spline(x, y, tol = 1e-6, df = 8) lines(spl1, col = "green", lwd = 2) spl2 <- loess(y ~ …
10 r  regression  splines  loess 

2
d ไพรม์ที่มีความน่าจะเป็น 100% ของอัตราการเข้าชมและความน่าจะเป็นการแจ้งเตือนที่ผิดพลาด 0%
ฉันต้องการคำนวณd primeสำหรับภารกิจหน่วยความจำที่เกี่ยวข้องกับการตรวจจับรายการเก่าและใหม่ ปัญหาที่ฉันมีคือบางวิชามีอัตราการเข้าชม 1 และ / หรืออัตราการเตือนที่ผิดพลาดเป็น 0 ซึ่งทำให้ความน่าจะเป็น 100% และ 0% ตามลำดับ สูตรสำหรับd primeคือd' = z(H) - z(F)ที่ใดz(H)และz(F)เป็นการแปลง z ของอัตราการเข้าชมและการเตือนที่ผิดพลาดตามลำดับ ในการคำนวณการแปลง z ฉันใช้ฟังก์ชัน Excel NORMSINV (เช่นz(H)=NORMSINV(hit rate)) อย่างไรก็ตามหากอัตราการเข้าชมหรืออัตราการเตือนที่ผิดพลาดเป็น 1 หรือ 0 ตามลำดับฟังก์ชันจะส่งคืนข้อผิดพลาด นี่เป็นเพราะการแปลง z ตามที่ฉันเข้าใจระบุพื้นที่ใต้เส้นโค้ง ROC ซึ่งไม่อนุญาตให้มีความน่าจะเป็นทางคณิตศาสตร์ 100% หรือ 0% ในกรณีนี้ฉันไม่แน่ใจวิธีคำนวณ d 'สำหรับตัวแบบที่มีประสิทธิภาพตามเพดาน เว็บไซต์หนึ่งแนะนำให้เปลี่ยนอัตรา 1 และ 0 ด้วย 1 …

1
Bootstrap: การประเมินอยู่นอกช่วงความมั่นใจ
ฉันทำการ bootstrapping ด้วยโมเดลผสม (มีหลายตัวแปรที่มีการโต้ตอบและหนึ่งตัวแปรสุ่ม) ฉันได้รับผลลัพธ์นี้ (บางส่วนเท่านั้น): > boot_out ORDINARY NONPARAMETRIC BOOTSTRAP Call: boot(data = a001a1, statistic = bootReg, R = 1000) Bootstrap Statistics : original bias std. error t1* 4.887383e+01 -1.677061e+00 4.362948e-01 t2* 3.066825e+01 1.264024e+00 5.328387e-01 t3* 8.105422e+01 2.368599e+00 6.789091e-01 t4* 1.620562e+02 4.908711e+00 1.779522e+00 ...... ตอนนี้ฉันต้องการได้รับช่วงความเชื่อมั่นสำหรับการสกัดกั้น: > boot.ci(boot_out,type=c("norm","basic","perc"), index=1) BOOTSTRAP …

1
วิธีการกำหนดจำนวนของผู้ประกอบการ convolutional ในซีเอ็นเอ็น?
ในงานด้านการมองเห็นคอมพิวเตอร์เช่นการจำแนกประเภทวัตถุด้วย Convolutional Neural Networks (CNN) เครือข่ายจะให้ประสิทธิภาพที่น่าดึงดูด แต่ฉันไม่แน่ใจว่าจะตั้งค่าพารามิเตอร์ในเลเยอร์ convolutional ได้อย่างไร ตัวอย่างเช่นรูปภาพระดับสีเทา ( 480x480) เลเยอร์ convolutional แรกอาจใช้โอเปอเรเตอร์ convolutional เช่น11x11x10ซึ่งหมายเลข10หมายถึงจำนวนของโอเปอเรเตอร์ convolutional คำถามคือวิธีการกำหนดจำนวนผู้ประกอบการ convolutional ใน CNN?

1
ROC curves สำหรับชุดข้อมูลที่ไม่สมดุล
พิจารณาการป้อนข้อมูลเมทริกซ์และเอาท์พุทไบนารีYXXXyyy วิธีทั่วไปในการวัดประสิทธิภาพของตัวจําแนกคือการใช้ ROC curves ในพล็อต ROC เส้นทแยงมุมคือผลลัพธ์ที่จะได้รับจากตัวจําแนกแบบสุ่ม ในกรณีที่เอาต์พุตไม่สมดุลประสิทธิภาพของตัวจําแนกแบบสุ่มสามารถปรับปรุงได้โดยเลือกหรือมีความน่าจะเป็นต่างกันyyy000111 ประสิทธิภาพของลักษณนามดังกล่าวสามารถแสดงในพล็อตกราฟ ROC ได้อย่างไร? ฉันคิดว่ามันควรเป็นเส้นตรงที่มีมุมต่างกันและไม่ใช่เส้นทแยงมุมอีกต่อไปใช่ไหม

3
นิยามการพึ่งพาหาง
ฉันพยายามค้นหาคำจำกัดความที่เรียบง่ายและกระชับของการพึ่งพาหางแบบใด ใครสามารถแบ่งปันสิ่งที่พวกเขาเชื่อว่ามันเป็น ประการที่สองถ้าฉันจะพล็อตแบบจำลองโดยใช้ copulas ที่แตกต่างกันบนกราฟฉันจะรู้ได้อย่างไรว่าอันไหนที่แสดงการพึ่งพาหาง
10 fat-tails 

2
วิธีรับตาราง ANOVA พร้อมข้อผิดพลาดมาตรฐานที่มีประสิทธิภาพ?
ฉันใช้การถดถอย OLS แบบรวมกลุ่มโดยใช้แพ็คเกจ plm ใน R แม้ว่าคำถามของฉันจะเกี่ยวกับสถิติพื้นฐานมากขึ้นดังนั้นฉันจึงลองโพสต์ที่นี่ก่อน) เนื่องจากผลการถดถอยของฉันให้ผลตกค้างแบบ heteroskedastic ฉันต้องการลองใช้ข้อผิดพลาดมาตรฐานที่มีประสิทธิภาพแบบ เป็นผลมาจากcoeftest(mod, vcov.=vcovHC(mod, type="HC0"))ฉันได้รับตารางที่มีการประมาณการข้อผิดพลาดมาตรฐานค่า t และค่า p สำหรับตัวแปรอิสระแต่ละตัวซึ่งโดยทั่วไปแล้วเป็นผลการถดถอยที่ "แข็งแกร่ง" ของฉัน สำหรับการพูดคุยถึงความสำคัญของตัวแปรต่าง ๆ ฉันต้องการพล็อตการแบ่งปันความแปรปรวนที่อธิบายโดยตัวแปรอิสระแต่ละตัวดังนั้นฉันต้องการผลรวมกำลังสองตามลำดับ อย่างไรก็ตามการใช้ฟังก์ชั่นaov()ฉันไม่รู้ว่าจะบอกให้ R ใช้ข้อผิดพลาดมาตรฐานที่มีประสิทธิภาพได้อย่างไร ตอนนี้คำถามของฉันคือฉันจะรับตาราง ANOVA / ผลรวมของกำลังสองที่อ้างถึงข้อผิดพลาดมาตรฐานที่มีประสิทธิภาพได้อย่างไร เป็นไปได้หรือไม่ที่จะคำนวณตามตาราง ANOVA จากการถดถอยด้วยข้อผิดพลาดมาตรฐานปกติ แก้ไข: กล่าวอีกนัยหนึ่งและไม่สนใจปัญหา R- ของฉัน: หาก Rไม่ได้รับผลกระทบจากการใช้ข้อผิดพลาดมาตรฐานที่มีประสิทธิภาพการสนับสนุนที่เกี่ยวข้องเพื่ออธิบายความแปรปรวนโดยตัวแปรอธิบายที่แตกต่างกันจะไม่เปลี่ยนแปลงหรือไม่22^2 แก้ไข: ใน R aov(mod)ให้ตาราง ANOVA ที่ถูกต้องสำหรับ panelmodel (plm) จริงหรือไม่?

2
อะไรคือวิธี Box-Jenkins สำหรับกระบวนการ ARIMA
วิกิพีเดียหน้าบอกว่ากล่องเจนกินส์เป็นวิธีการที่เหมาะสมรูปแบบ ARIMA ชุดเวลา ตอนนี้ถ้าฉันต้องการให้พอดีกับแบบจำลอง ARIMA กับอนุกรมเวลาฉันจะเปิด SAS, โทรproc ARIMA, จัดหาพารามิเตอร์และ SAS จะให้ค่าสัมประสิทธิ์ AR และ MA ตอนนี้ฉันสามารถลองชุดค่าผสมของp , d , qและ SAS ที่แตกต่างกันจะให้ค่าสัมประสิทธิ์ในแต่ละกรณี ฉันเลือกชุดที่มีเกณฑ์ข้อมูล Akaike ต่ำสุดP , d, qพี,d,Qp,d,qP , d, qพี,d,Qp,d,q คำถามของฉันคือ: ฉันใช้ Box-Jenkins ในกระบวนการข้างต้นได้ที่ไหน ฉันควรจะใช้ Box-Jenkins เพื่อหาค่าประมาณหรือไม่ หรือ SAS ใช้ภายในอย่างใด?P , d, qพี,d,Qp,d,q

1
การทำนายด้วยเอฟเฟกต์แบบสุ่มในเกม mgcv
ฉันสนใจในการสร้างแบบจำลองการจับปลาทั้งหมดโดยใช้ gam ใน mgcv เพื่อสร้างเอฟเฟกต์แบบสุ่มง่าย ๆ สำหรับเรือแต่ละลำ ฉันมีวิชา 98 วิชาดังนั้นฉันคิดว่าฉันจะใช้ gam แทน gamm เพื่อจำลองเอฟเฟกต์แบบสุ่ม แบบจำลองของฉันคือ: modelGOM <- gam(TotalFish ~ factor(SetYear) + factor(SetMonth) + factor(TimePeriod) + s(SST) + s(VesselID, bs = "re", by = dum) + s(Distance, by = TimePeriod) + offset(log(HooksSet)), data = GOM, family = tw(), method = "REML") …

3
เกณฑ์และการตัดสินใจสำหรับความไม่เป็นเส้นตรงในแบบจำลองทางสถิติคืออะไร
ฉันหวังว่าคำถามทั่วไปต่อไปนี้จะสมเหตุสมผล โปรดทราบว่าสำหรับวัตถุประสงค์ของคำถามนี้โดยเฉพาะฉันไม่สนใจเหตุผลทางทฤษฎี (โดเมนหัวเรื่อง) สำหรับการแนะนำที่ไม่ใช่เชิงเส้น ดังนั้นฉันจะกำหนดคำถามแบบเต็มดังนี้: กรอบตรรกะคืออะไร( เกณฑ์และหากเป็นไปได้กระบวนการตัดสินใจ ) สำหรับการนำเสนอแบบไม่เป็นเชิงเส้นในแบบจำลองเชิงสถิติด้วยเหตุผลนอกเหนือจากเชิงทฤษฎี (โดเมนเรื่อง)? เช่นเคยทรัพยากรและการอ้างอิงที่เกี่ยวข้องก็ยินดีต้อนรับเช่นกัน

2
วิธีการมองเห็นเปอร์เซ็นต์เปรียบเทียบกับจำนวนรายการ
ฉันกำลังพยายามหาวิธีที่ดีที่สุดในการมองเห็นแผนภูมิด้านล่างและเน้นประสิทธิภาพของการรักษาตามที่ระบุไว้กับจำนวนผู้ป่วยที่พยายามรักษา นี่คือลิงค์ไปยังหน้าจริง: http://curetogether.com/cluster-headaches/treatments/ อะไรคือวิธีที่ดีที่สุดในการเน้นประสิทธิภาพในขณะที่ยังคงเปรียบเทียบการรักษาได้ง่ายและดูว่าผู้ป่วยแต่ละรายให้คะแนนเท่าใด ความคิดของฉันคือการแสดงประสิทธิภาพเป็นเปอร์เซ็นต์ แต่ฉันไม่แน่ใจว่าจะทำให้พวกเขาเปรียบเทียบได้ง่ายและแสดงจำนวนผู้ป่วยที่ลองแต่ละวิธี ขอบคุณ!

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.