สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

6
วิธีการเตรียม / สร้างฟีเจอร์สำหรับการตรวจจับความผิดปกติ (ข้อมูลความปลอดภัยเครือข่าย)
เป้าหมายของฉันคือการวิเคราะห์บันทึกเครือข่าย (เช่น Apache, syslog, การตรวจสอบความปลอดภัยของ Active Directory และอื่น ๆ ) โดยใช้การตรวจจับกลุ่ม / ความผิดปกติเพื่อวัตถุประสงค์ในการตรวจจับการบุกรุก จากบันทึกฉันมีฟิลด์ข้อความจำนวนมากเช่นที่อยู่ IP ชื่อผู้ใช้ชื่อโฮสต์พอร์ตปลายทางพอร์ตต้นทางและอื่น ๆ (รวมทั้งหมด 15-20 ฟิลด์) ฉันไม่ทราบว่ามีการโจมตีในบันทึกหรือไม่และต้องการเน้นเหตุการณ์ที่น่าสงสัยที่สุด (ผู้ผิด) โดยปกติการตรวจจับความผิดปกติจะทำเครื่องหมายจุดที่มีความน่าจะเป็น / ความถี่ต่ำเป็นความผิดปกติ อย่างไรก็ตามครึ่งหนึ่งของบันทึกรายการบันทึกประกอบด้วยเขตข้อมูลที่ไม่ซ้ำกัน ดังนั้นครึ่งหนึ่งของการบันทึกในชุดข้อมูลจะมีความถี่ต่ำสุดที่เป็นไปได้ ถ้าฉันใช้การตรวจจับความผิดปกติโดยพิจารณาจากการจัดกลุ่ม (เช่นค้นหากลุ่มแล้วเลือกจุดที่อยู่ไกลจากศูนย์คลัสเตอร์ทั้งหมด) ฉันต้องหาระยะทางระหว่างจุดต่าง ๆ เนื่องจากฉันมีฟิลด์ 15-20 ฟิลด์มันจะเป็นพื้นที่แบบหลายมิติซึ่ง dimesions คือชื่อผู้ใช้พอร์ตที่อยู่ IP และอื่น ๆ อย่างไรก็ตามระยะทาง Mahalanobis สามารถใช้ได้กับฟีเจอร์การกระจายแบบปกติเท่านั้น ซึ่งหมายความว่าไม่มีทางที่จะหาระยะห่างระหว่างจุดข้อมูลและสร้างกลุ่ม ... ตัวอย่างเช่นลองนึกภาพว่าฉันมีผู้ใช้ Alice, Bob, Carol, Dave, Eve …

2
ตัดค่าเฉลี่ยกับค่ามัธยฐาน
ฉันมีชุดข้อมูลที่มีการโทรทั้งหมดไปยังบริการฉุกเฉินและเวลาตอบสนองของแผนกรถพยาบาล พวกเขายอมรับว่ามีข้อผิดพลาดบางอย่างกับเวลาตอบสนองเนื่องจากมีบางกรณีที่พวกเขาไม่ได้เริ่มบันทึก (ดังนั้นค่าคือ 0) หรือที่พวกเขาไม่หยุดนาฬิกา (ดังนั้นค่าอาจสูงมาก) ฉันต้องการทราบถึงแนวโน้มที่เป็นศูนย์กลางและฉันสงสัยว่ามันเป็นการดีกว่าถ้าใช้มัธยฐานหรือค่าเฉลี่ยที่ถูกตัดออกเพื่อกำจัดค่าผิดปกติหรือไม่

1
การเลือก k-value สำหรับการวิเคราะห์ตรวจจับ Local Outlier Factor (LOF)
ฉันมีชุดข้อมูลสามมิติและฉันพยายามใช้การวิเคราะห์ Local Outlier Factor เพื่อระบุค่าที่แปลกที่สุดหรือแปลกที่สุด เราจะตัดสินใจ k-value ที่จะใช้ในการวิเคราะห์ LOF ได้อย่างไร? ฉันเข้าใจสิ่งที่ค่า k กำหนดและดังนั้นฉันจึงไม่แปลกใจเลยที่ฉันเห็นผลลัพธ์ที่แตกต่างกันเล็กน้อยเมื่อใช้ k ที่ต่างกัน แต่ฉันไม่แน่ใจว่ามีลักษณะของชุดข้อมูลของฉันที่จะผลักดันฉันไปยังค่าหนึ่งมากกว่าค่าอื่น ๆ . ขอบคุณ!

1
ความแตกต่างระหว่างตัวแก้ปัญหาการเขียนโปรแกรม R กำลังสองต่างกันอย่างไร
ฉันกำลังมองหาแพ็คเกจเพื่อช่วยฉันแก้ปัญหาการหาค่าเหมาะที่สุดกำลังสองและฉันเห็นว่ามีแพ็คเกจต่างกันอย่างน้อยครึ่งโหล ตามหน้านี้ : QP (โปรแกรมกำลังสอง, 90C20): cplexAPI , kernlab , limSolve , LowRankQP , quadprog , Rcplex , Rmosek บางส่วนของเหล่านี้ (Rmosek และ cplexAPI) ขึ้นอยู่กับแพ็คเกจอื่น ๆ ดังนั้นฉันไม่สนใจสิ่งเหล่านั้น อะไรคือความแตกต่างที่โดดเด่นระหว่างแพ็คเกจ QP อื่น ๆ ?
9 r  optimization 

1
Monte Carlo == ใช้กระบวนการสุ่มหรือไม่
ฉันไม่เคยเรียนหลักสูตรสถิติอย่างเป็นทางการ แต่เนื่องจากงานวิจัยของฉันฉันพบบทความที่ใช้แนวคิดทางสถิติหลายอย่างต่อเนื่อง บ่อยครั้งที่ฉันจะเห็นคำอธิบายของกระบวนการมอนติคาร์โลที่นำไปใช้กับสถานการณ์ที่กำหนดและสำหรับสิ่งที่ฉันสามารถรวบรวม 9 จาก 10 ครั้งมันลงมาสู่การสุ่มของประชากรที่เรียบง่ายและการศึกษาที่ตามมา คำถามของฉัน: ในโลกทางสถิติMonte Carloเป็นคำรหัสสำหรับอัลกอริทึมใด ๆ ที่เกี่ยวข้องกับการสร้างจุด / ประชากร / ฯลฯ แบบสุ่มหรือมีอะไรมากกว่านั้นหรือไม่

1
คำนวณควอนไทล์ของผลรวมของการแจกแจงจากควอไทล์เฉพาะ
สมมติว่าอิสระตัวแปรสุ่มที่ quantiles ในบางระดับที่เฉพาะเจาะจงเป็นที่รู้จักกันผ่านการประมาณจากข้อมูล: , ... ,&lt;q_N) ตอนนี้ขอกำหนดตัวแปรสุ่มเป็นผลรวมx_i มีวิธีคำนวณค่าของควอไทล์ของผลรวมที่ระดับหรือไม่นั่นคือใน ?NNNX1,...,XNX1,...,XNX_1, ..., X_Nαα\alphaα=P(X1&lt;q1)α=P(X1&lt;q1)\alpha = P(X_1 < q_1)α=P(XN&lt;qN)α=P(XN&lt;qN)\alpha = P(X_N < q_N)ZZZZ=∑Ni=1XiZ=∑i=1NXiZ = \sum_{i=1}^N X_iαα\alphaqzqzq_zα=P(Z&lt;qZ)α=P(Z&lt;qZ)\alpha = P(Z < q_Z) ฉันคิดว่าในบางกรณีเช่นถ้าติดตามการกระจายแบบเกาส์นี้ก็ง่าย แต่ฉันก็ไม่แน่ใจในกรณีที่การกระจายของไม่เป็นที่รู้จัก ความคิดใด ๆXiXiX_i∀i∀i\forall iXiXiX_i
9 quantiles 

3
การสร้างแบบจำลองข้อมูลนับที่ตัวแปรออฟเซ็ตเป็น 0 สำหรับการสังเกตบางอย่าง
ฉันพยายามช่วยนักเรียนของเพื่อนร่วมงาน นักเรียนสังเกตและนับพฤติกรรมของนก (จำนวนสาย) ในชุดทดลอง จำนวนการโทรที่เกี่ยวข้องกับนกที่สังเกตได้เฉพาะในระหว่างการทดสอบแต่ละครั้งไม่สามารถระบุได้ แต่สามารถนับจำนวนนกที่สนับสนุนการบันทึกการโทรได้ ดังนั้นข้อเสนอแนะครั้งแรกของฉันคือการใส่หมายเลขของนกเป็นระยะชดเชยในรูปแบบ Poisson GLM เพราะฉะนั้นเราจะกระชับจำนวนที่คาดหวังของสายต่อนก ปัญหานี้คือว่าในช่วงเวลาที่สังเกตหลายครั้งไม่มีนก (และดังนั้นจึงไม่มีสาย) ถูกสังเกต ซอฟแวร์ (R ในกรณีนี้) บ่นเพราะ (R บ่นเกี่ยวกับการที่มีข้อมูล แต่ที่เป็นอย่างหมดจดผลมาจากการถูก)เข้าสู่ระบบ( 0 ) = - infเข้าสู่ระบบ⁡(0)=-INF\log(0) = -\infy-Infoffset(log(nbirds))-Inf ฉันสงสัยว่าจริง ๆ แล้วเราจำเป็นต้องมีแบบจำลองอุปสรรค์ (หรือคล้ายกัน) ที่เรามีรูปแบบทวินามแยกต่างหากสำหรับ "การสังเกตการโทร" (หรือไม่) และแบบจำลองการนับที่ถูกตัดทอนสำหรับจำนวนการโทร (ต่อนก) ในสถานการณ์ที่มีการโทรโดยที่เรารวมคำศัพท์ชดเชยเฉพาะในส่วนการนับของแบบจำลอง ต้องลองสิ่งนี้โดยใช้แพ็คเกจpsclใน R แต่ฉันยังคงได้รับข้อผิดพลาดเดิม: mod1 &lt;- hurdle(NumberCallsCOPO ~ Condition * MoonVis + offset(log(NumberCOPO)) | …

3
เครื่องกำเนิดเลขสุ่มของ Mathematica เบี่ยงเบนจากความน่าจะเป็นทวินาม?
สมมติว่าคุณพลิกเหรียญ 10 ครั้งแล้วโทรหา 1 "เหตุการณ์" หากคุณเรียกใช้ 1,000,000 ของ "กิจกรรม" เหล่านี้สัดส่วนของเหตุการณ์ที่มีส่วนหัวระหว่าง 0.4 ถึง 0.6 คือเท่าใด ความน่าจะเป็นแบบทวินามจะแนะนำว่านี่คือประมาณ 0.65 แต่รหัส Mathematica ของฉันบอกฉันเกี่ยวกับ 0.24 นี่คือไวยากรณ์ของฉัน: In[2]:= X:= RandomInteger[]; In[3]:= experiment[n_]:= Apply[Plus, Table[X, {n}]]/n; In[4]:= trialheadcount[n_]:= .4 &lt; Apply[Plus, Table[X, {n}]]/n &lt; .6 In[5]:= sample=Table[trialheadcount[10], {1000000}] In[6]:= Count[sample2,True]; Out[6]:= 245682 อุบัติเหตุอยู่ที่ไหน

1
มันยุติธรรมแค่ไหนที่จะใช้คำว่า "ทำนาย" สำหรับการถดถอย (โลจิสติก)?
ความเข้าใจของฉันคือว่าแม้การถดถอยไม่ได้ก่อให้เกิดเวรกรรม มันสามารถให้ความสัมพันธ์ระหว่างตัวแปร y และตัวแปร x และทิศทางที่เป็นไปได้ ฉันถูกไหม? ฉันมักพบวลีที่คล้ายกับ "x ทำนาย y" แม้ในตำราเรียนส่วนใหญ่และในหน้าหลักสูตรออนไลน์ต่างๆ และคุณมักจะเรียก regressors เป็นตัวทำนายและ y เป็นคำตอบ มันยุติธรรมแค่ไหนที่จะใช้กับการถดถอยเชิงเส้น? วิธีการเกี่ยวกับการถดถอยโลจิสติก? (ถ้าฉันมีเกณฑ์ t ซึ่งฉันสามารถเปรียบเทียบความน่าจะเป็นได้หรือไม่)

2
การลบค่าผิดปกติจากข้อมูล - จำนวนค่าผิดพลาดสูงสุดที่คุณสามารถลบได้หรือไม่
ฉันมีข้อมูลผิดปกติอยู่สองสามตัวและฉันต้องการแยกพวกเขาออกเพื่อดูว่าการเปลี่ยนแปลงนี้มีผลหรือไม่ ในความเห็นของคุณจำนวนสูงสุดของค่าผิดปกติที่หนึ่งควร จำกัด ตัวเองคืออะไร? ขอบคุณ!
9 outliers 

3
วิธีการจัดเรียงข้อมูล 2D ใหม่เพื่อให้ได้ค่าสหสัมพันธ์อย่างไร
ฉันมีชุดข้อมูลอย่างง่ายต่อไปนี้ที่มีตัวแปรต่อเนื่องสองตัว เช่น: d = data.frame(x=runif(100,0,100),y = runif(100,0,100)) plot(d$x,d$y) abline(lm(y~x,d), col="red") cor(d$x,d$y) # = 0.2135273 ฉันต้องจัดเรียงข้อมูลใหม่เพื่อให้มีความสัมพันธ์ระหว่างตัวแปรให้เป็น ~ 0.6 ฉันต้องการเก็บค่าเฉลี่ยและสถิติเชิงพรรณนาอื่น ๆ (sd, min, max, ฯลฯ .) ของตัวแปรทั้งสองให้คงที่ ฉันรู้ว่าเป็นไปได้ที่จะสร้างความสัมพันธ์กับข้อมูลที่ได้รับเช่น: d2 = with(d,data.frame(x=sort(x),y=sort(y))) plot(d2$x,d2$y) abline(lm(y~x,d2), col="red") cor(d2$x,d2$y) # i.e. 0.9965585 ถ้าฉันพยายามใช้sampleฟังก์ชั่นสำหรับงานนี้: cor.results = c() for(i in 1:1000){ set.seed(i) d3 = with(d,data.frame(x=sample(x),y=sample(y))) cor.results = c(cor.results,cor(d3$x,d3$y)) …
9 r  correlation 

1
ML ประมาณค่าการแจกแจงเอ็กซ์โปเนนเชียล (พร้อมข้อมูลเซ็นเซอร์)
ในการวิเคราะห์การเอาตัวรอดคุณจะถือว่าเวลาการอยู่รอดของ rvมีการแจกแจงแบบเอ็กซ์โพเนนเชียล พิจารณาว่าตอนนี้ฉันมี "ผล" ของ IID RV ของx_iมีเพียงบางส่วนของผลลัพธ์เหล่านี้ที่จริงแล้ว "รับรู้เต็มที่" เช่นการสังเกตที่เหลือยังคง "มีชีวิตอยู่"XผมXiX_ix1, … ,xnx1,…,xnx_1,\dots,x_nXผมXiX_i ถ้าฉันต้องการทำการประมาณ ML สำหรับพารามิเตอร์ rateของการกระจายฉันจะใช้การสังเกตการณ์ที่ไม่ได้รับรู้ในลักษณะที่สอดคล้อง / เหมาะสมได้อย่างไร ฉันเชื่อว่าพวกเขายังคงมีข้อมูลที่เป็นประโยชน์สำหรับการประเมินλλ\lambda ใครช่วยแนะนำฉันเกี่ยวกับวรรณกรรมในหัวข้อนี้ ฉันแน่ใจว่ามันมีอยู่ อย่างไรก็ตามฉันมีปัญหาในการค้นหาคำหลัก / คำค้นหาที่ดีสำหรับหัวข้อ

1
ถ้า X / Y มีการแจกแจงแบบเดียวกับ Z จริงหรือไม่ที่ X มีการแจกแจงแบบเดียวกับ YZ?
ให้ X, Y และ Z เป็นสามตัวแปรสุ่มอิสระ ถ้า X / Y มีการแจกแจงแบบเดียวกับ Z จริงหรือไม่ที่ X มีการแจกแจงแบบเดียวกับ YZ?

1
ความคาดหวังของสินค้าที่มีการสั่งซื้อสูงกว่าของการแจกแจงแบบปกติ
ฉันมีสองกระจายตามปกติตัวแปรและกับศูนย์ค่าเฉลี่ยและความแปรปรวนเมทริกซ์\ฉันสนใจในการพยายามที่จะคำนวณค่าของในแง่ของรายการของ\X1X1X_1X2X2X_2ΣΣ\SigmaE[X21X22]E[X12X22]E[X_1^2 X_2^2]ΣΣ\Sigma ฉันใช้กฎความน่าจะเป็นทั้งหมดเพื่อให้ได้ แต่ฉันไม่แน่ใจว่าสิ่งที่คาดหวังภายในจะลดลง มีวิธีอื่นที่นี่หรือไม่E[X21X22] = E[X21E[X22|X1] ]E[X12X22]=E[X12E[X22|X1]]E[X_1^2 X_2^2] = E[X_1^2 E[X_2^2 | X_1]] ขอบคุณ แก้ไข:ตัวแปรยังกระจายหลายตัวแปรตามปกติ

1
วิธีการคำนวณฟังก์ชั่นความน่าจะเป็น
อายุการใช้งาน 3 ส่วนอิเล็กทรอนิกส์และ2.1 ตัวแปรสุ่มได้รับการจำลองเป็นตัวอย่างที่สุ่มจากขนาด 3 จากการกระจายชี้แจงกับพารามิเตอร์\ theta ฟังก์ชันความน่าจะเป็นคือสำหรับ\ theta&gt; 0X1= 3 ,X2= 1.5 ,X1=3,X2=1.5,X_{1} = 3, X_{2} = 1.5,X3= 2.1X3=2.1X_{3} = 2.1θθ\thetaθ &gt; 0θ&gt;0\theta > 0 ฉ3( x | θ ) =θ3e x p ( - 6.6 θ )ฉ3(x|θ)=θ3อีxพี(-6.6θ)f_{3}(x|\theta) = \theta^{3} exp(-6.6\theta)ที่x = ( 2 , 1.5 , 2.1 )x=(2,1.5,2.1)x …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.