สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
การตรวจจับกลุ่มของรหัสที่มา "คล้ายกัน"
สมมติว่าฉันมีนักเรียน 400 คน (ที่อยู่ในมหาวิทยาลัยใหญ่) ที่ต้องทำโครงงานวิทยาศาสตร์คอมพิวเตอร์และพวกเขาต้องทำงานคนเดียว (ไม่มีกลุ่มนักเรียน) ตัวอย่างของโครงการอาจให้ "ใช้การแปลงฟูริเยร์ที่รวดเร็วใน Fortran" (ฉันรู้ว่ามันไม่ฟังดูเซ็กซี่ แต่นั่นทำให้คำถามของฉันง่ายขึ้น) ฉันเป็นคนที่ถูกต้องและฉันต้องการส่งกิจวัตรเพื่อตรวจสอบว่ามีกลุ่มนักเรียนที่เสนอการใช้งานที่ "คล้ายกันมากเกินไปที่จะเขียนอย่างอิสระอย่างแท้จริง" นี่คือการค้นหากลุ่มที่ไม่มีการดูแล ฉันคิดว่าคำถามนี้เกี่ยวกับคุณลักษณะที่จะใช้มากกว่าอัลกอริทึมการจัดกลุ่มที่จะใช้ สิ่งแรกที่ฉันจะทำคือจดหมายโดยฮิสโทแกรมจดหมาย โดยหลักการแล้วเนื่องจากคนขี้โกงฉลาดกว่านั้นในที่สุดฉันก็ลองเลือกการเรียงสับเปลี่ยนแบบสุ่มเพื่อดูว่ามีฮิสโตแกรมของตัวอักษร (ที่มีการเรียงสับเปลี่ยน) อยู่หรือไม่ ยิ่งไปกว่านั้นผู้ที่ไม่สำรวจโครงสร้างของรหัสเฉพาะการกระจายตัวอักษรเพียงเล็กน้อย ... คุณมีทางออกอะไร มีซอฟต์แวร์หรือแพ็คเกจที่มีอยู่เฉพาะสำหรับปัญหานั้นหรือไม่ (อันที่จริงในสมัยก่อนครูวิทยาศาสตร์คอมพิวเตอร์อ้างว่าพวกเขามีเครื่องมือประเภทนั้น แต่ตอนนี้ฉันสงสัยว่าพวกเขามีอะไรที่ง่ายมาก) ฉันเดาว่าทนายความจากการพัฒนาซอฟต์แวร์มีปัญหาประเภทนั้นด้วย (ไม่ใช่กับนักเรียน 1,000 คน แต่ด้วยรหัสขนาดใหญ่ 2 รหัส ... ซึ่งทำให้สิ่งต่าง ๆ ยากขึ้น)?

1
คุณใช้อัลกอริธึม EM ในการคำนวณ MLEs สำหรับสูตรตัวแปรแฝงของโมเดลปัวซองที่มีค่าศูนย์ได้อย่างไร
แบบจำลองการถดถอยปัวซงแบบ zero zero ถูกกำหนดไว้สำหรับตัวอย่างโดย และจะถือว่าพารามิเตอร์และไปY i = { 0 ด้วยความน่าจะเป็นp i + ( 1 - p i ) e - λ i k ด้วยความน่าจะเป็น( 1 - p i ) e - λ ฉัน λ k i / k ! λ = ( λ 1 , … , λ n ) …

1
การวิเคราะห์อนุกรมเวลาแบบอะซิงโครนัส
ฉันพยายามวิเคราะห์ช่วงเวลารอคอยของอนุกรมเวลาของราคาหุ้นสองแห่ง ในการวิเคราะห์อนุกรมเวลาปกติเราสามารถทำ Cross Correlaton, VECM (Granger Causality) อย่างไรก็ตามวิธีการหนึ่งจะจัดการเดียวกันในอนุกรมเวลาเว้นระยะไม่สม่ำเสมอ สมมติฐานคือเครื่องมือหนึ่งนำไปสู่อีกอันหนึ่ง ฉันมีข้อมูลสำหรับสัญลักษณ์ทั้งสองถึงไมโครวินาที ฉันดูแพ็คเกจ RTAQ และลองใช้ VECM RTAQ นั้นเพิ่มเติมในอนุกรมเวลาที่ไม่เปลี่ยนแปลงในขณะที่ VECM ไม่สำคัญในช่วงเวลาเหล่านี้ > dput(STOCKS[,])) structure(c(29979, 29980, 29980, 29980, 29981, 29981, 29991, 29992, 29993, 29991, 29990, 29992), .Dim = c(6L, 2L), .Dimnames = list(NULL, c("Pair_Bid", "Calc_Bid" )), index = structure(c(1340686178.55163, 1340686181.40801, 1340686187.2642, 1340686187.52668, 1340686187.78777, 1340686189.36693), …

1
ทำไมฉันถึงได้ผลลัพธ์ที่แตกต่างกันมากสำหรับโพลี (raw = T) กับโพลี ()
ฉันต้องการสร้างแบบจำลองตัวแปรเวลาที่แตกต่างกันสองแบบซึ่งบางตัวมีการวางตัวเป็นเส้นตรงในข้อมูลของฉัน (age + cohort = period) เมื่อทำสิ่งนี้ฉันพบปัญหาlmerและการโต้ตอบpoly()แต่อาจไม่ จำกัด เพียงlmerฉันได้รับผลลัพธ์เดียวกันกับnlmeIIRC เห็นได้ชัดว่าความเข้าใจของฉันในสิ่งที่ฟังก์ชั่นโพลี () ไม่เพียงพอ ฉันเข้าใจสิ่งที่poly(x,d,raw=T)ทำและฉันคิดว่าหากไม่มีraw=Tมันทำให้มีหลายชื่อแบบหลายมุมฉาก (ฉันไม่สามารถพูดได้ว่าฉันเข้าใจความหมายที่แท้จริง) ซึ่งทำให้กระชับได้ง่ายขึ้น แต่ไม่อนุญาตให้คุณตีความสัมประสิทธิ์โดยตรง ฉันอ่านว่าเพราะฉันใช้ฟังก์ชั่นการทำนายการคาดคะเนควรจะเหมือนกัน แต่พวกเขาก็ไม่ได้แม้ว่าแบบจำลองมาบรรจบกันตามปกติ ฉันใช้ตัวแปรที่อยู่ตรงกลางและก่อนอื่นฉันคิดว่าบางทีพหุนาม orthogonal อาจนำไปสู่ความสัมพันธ์ที่มีผลคงที่ที่สูงขึ้นกับคำที่มีการทำงานร่วม collinear แต่ดูเหมือนว่าจะเทียบเคียงได้ ฉันได้วางแบบสรุปสองแบบไว้ที่นี่แล้ว แปลงเหล่านี้หวังแสดงให้เห็นถึงขอบเขตของความแตกต่าง ฉันใช้ฟังก์ชันคาดการณ์ซึ่งมีเฉพาะใน dev เท่านั้น เวอร์ชั่นของ lme4 (ได้ยินเกี่ยวกับที่นี่ ) แต่เอฟเฟกต์คงที่จะเหมือนกันในเวอร์ชั่น CRAN (และพวกมันก็ดูเหมือนตัวเองเช่น ~ 5 สำหรับการโต้ตอบเมื่อ DV ของฉันมีช่วง 0-4) สายลเมอร์คือ cohort2_age =lmer(churchattendance ~ poly(cohort_c,2,raw=T) * age_c + ctd_c …

2
การถดถอยโลจิสติกสำหรับมัลติคลาส
ฉันได้แบบจำลองสำหรับการถดถอยโลจิสติกสำหรับมัลติคลาสที่กำหนดโดย P(Y=j|X(i))=exp(θTjX(i))1 +∑km =1exp(θTม.X( i ))P(Y=J|X(ผม))=ประสบการณ์⁡(θJTX(ผม))1+Σม.=1kประสบการณ์⁡(θม.TX(ผม)) P(Y=j|X^{(i)}) = \frac{\exp(\theta_j^TX^{(i)})}{1+ \sum_{m=1}^{k}\exp(\theta_m^T X^{(i)})} โดยที่ k คือจำนวนคลาส theta คือพารามิเตอร์ที่จะประมาณ j คือคลาส jth Xi คือข้อมูลการฝึกอบรม ดีสิ่งหนึ่งที่ฉันไม่ได้เป็นวิธีการที่ได้มาเป็นส่วนหนึ่งหาร ปกติรูปแบบ ฉันหมายความว่ามันทำให้ความน่าจะเป็นอยู่ระหว่าง 0 ถึง 11 + ∑m = 1kประสบการณ์( θTม.X( i ))1+Σม.=1kประสบการณ์⁡(θม.TX(ผม)) 1+ \sum_{m=1}^{k}\exp(\theta_m^T X^{(i)}) ฉันหมายถึงฉันเคยชินกับการถดถอยโลจิสติก P( Y= 1 | X( i )) = 1 / ( 1 …

1
ความถี่อัลลีลที่สังเกตเห็นมีค่าน้อยกว่าที่คาดการณ์ไว้หรือไม่
คำถาม : ฉันจะสร้างการทดสอบเพื่อตรวจสอบได้อย่างไรว่า "ภูเขา" - ความถี่ทั้งหมด (รูปที่ 1) ที่สังเกตได้นั้นลดลงอย่างมีนัยสำคัญในภูเขากลางถึงภาคใต้มากกว่าที่ทำนายไว้ (รูปที่ 2) โดยรูปแบบการเลือกเชิงนิเวศ ( ดูรายละเอียดด้านล่าง ) ปัญหา : ความคิดเริ่มต้นของฉันคือการถดถอยส่วนที่เหลือของแบบจำลองกับละติจูด: ลองจิจูดและระดับความสูง (ซึ่งส่งผลเฉพาะการทำงานร่วมกันระหว่างละติจูดและลองจิจูดเป็นสำคัญ) ปัญหาคือสิ่งที่เหลืออยู่ (รูปที่ 3) อาจสะท้อนถึงการเปลี่ยนแปลงที่ไม่ได้อธิบายโดยแบบจำลองและ / หรือว่าเป็นสิ่งที่เกิดขึ้นทางชีวภาพเช่นอัลลีลไม่มีเวลาที่จะแพร่กระจายไปทางทิศใต้ถึงศักยภาพหรือมีอุปสรรคบางอย่างต่อการไหลของยีน หากคุณเปรียบเทียบความถี่ที่สังเกตได้ (รูปที่ 1) กับที่คาดหวัง (รูปที่ 2) มีความแตกต่างอย่างชัดเจนโดยเฉพาะอย่างยิ่งในภาคกลางถึงภูเขาทางตอนใต้ของสวีเดนและนอร์เวย์ ฉันยอมรับว่าตัวแบบอาจไม่สามารถอธิบายการเปลี่ยนแปลงทั้งหมดได้ แต่ฉันสามารถทดสอบแบบมีเหตุผลเพื่อสำรวจความคิดที่ว่าอัลลีลภูเขาไม่ถึงศักยภาพในใจกลางภูเขาทางตอนใต้หรือไม่ พื้นหลัง: ฉันมีเครื่องหมาย AFLP bi-allelic ซึ่งการกระจายความถี่ดูเหมือนว่าเกี่ยวข้องกับภูเขา (และละติจูด: ลองจิจูด) เมื่อเทียบกับที่อยู่อาศัยระดับต่ำบนคาบสมุทรสแกนดิเนเวีย (รูปที่ 1) "ภูเขา" - อัลลีลเกือบคงที่ในภาคเหนือซึ่งเป็นภูเขา มันเกือบจะหายไปหรือคงที่สำหรับ "ที่ราบลุ่ม" …

1
การทดสอบสมมติฐานเกี่ยวกับเมทริกซ์ความแปรปรวนร่วมแบบผกผัน
สมมติว่าฉันสังเกตIID และความปรารถนาในการทดสอบเอช0 :เวช( Σ - 1 ) =สำหรับเมทริกซ์คล้อยตามและเวกเตอร์ มีงานที่รู้จักกับปัญหานี้หรือไม่?xผม∼ N( μ , Σ )xi∼N(μ,Σ)x_i \sim \mathcal{N}\left(\mu,\Sigma\right)H0: A H0:A H_0: A\ ( Σ- 1) =a(Σ−1)=a\left(\Sigma^{-1}\right) = aAAAaaa ความพยายามที่ชัดเจน (กับฉัน) จะผ่านการทดสอบอัตราส่วนความน่าจะเป็น แต่ดูเหมือนว่าการเพิ่มความเป็นไปได้สูงสุดภายใต้ข้อ จำกัด ของจะต้องใช้ตัวแก้ SDPและอาจมีขนดกสวยH0H0H_0


2
R เทียบเท่ากับตัวเลือกของคลัสเตอร์เมื่อใช้การถดถอยแบบทวินามลบ
ฉันพยายามจำลองการทำงานของเพื่อนร่วมงานและกำลังย้ายการวิเคราะห์จาก Stata ไปยัง R โมเดลที่เธอใช้เรียกใช้ตัวเลือก "cluster" ภายในฟังก์ชัน nbreg เพื่อจัดกลุ่มข้อผิดพลาดมาตรฐาน ดูhttp://repec.org/usug2007/crse.pdfสำหรับคำอธิบายที่สมบูรณ์เกี่ยวกับสิ่งที่และเหตุผลของตัวเลือกนี้ คำถามของฉันคือวิธีการเรียกใช้ตัวเลือกเดียวกันนี้สำหรับการถดถอยทวินามลบภายใน R? รูปแบบหลักในกระดาษของเรามีการระบุไว้ใน Stata ดังนี้ xi: nbreg cntpd09 logpop08 pcbnkthft07 pccrunion07 urbanpop pov00 pov002 edu4yr /// black04 hispanic04 respop i.pdpolicy i.maxloan rollover i.region if isser4 != 1, cluster(state) และฉันได้แทนที่สิ่งนี้ด้วย pday<-glm.nb(cntpd09~logpop08+pcbnkthft07+pccrunion07+urbanpop+pov00+pov002+edu4yr+ black04+hispanic04+respop+as.factor(pdpolicy)+as.factor(maxloan)+rollover+ as.factor(region),data=data[which(data$isser4 != 1),]) ซึ่งเห็นได้ชัดว่าขาดชิ้นส่วนข้อผิดพลาดของคลัสเตอร์ เป็นไปได้ไหมที่จะทำการจำลองแบบที่แน่นอน? ถ้าเป็นเช่นนั้นได้อย่างไร ถ้าไม่ทางเลือกที่เหมาะสมคืออะไร? ขอบคุณ [แก้ไข] …

1
การโต้ตอบของคำอิสระและไม่เป็นอิสระหมายความว่าอย่างไร
ถ้าฉันพอดีข้อมูลของฉันกับสิ่งที่ชอบlm(y~a*b)ในไวยากรณ์ R ซึ่งaเป็นตัวแปรไบนารีและbเป็นตัวแปรตัวเลขa:bคำศัพท์การโต้ตอบคือความแตกต่างระหว่างความชันของy~bที่a= 0 และที่a= 1 ตอนนี้สมมติว่าความสัมพันธ์ระหว่างyและbคือ curvilinear ถ้าตอนนี้ผมพอดีlm(y~a*poly(b,2))แล้วa:poly(b,2)1คือการเปลี่ยนแปลงในการเปลี่ยนแปลงที่y~bมีเงื่อนไขในระดับaดังกล่าวข้างต้นและa:poly(b,2)2การเปลี่ยนแปลงในเงื่อนไขในระดับของy~b^2 aต้องใช้การถักด้วยมือ แต่หากค่าสัมประสิทธิ์การโต้ตอบแตกต่างจากศูนย์อย่างใดอย่างหนึ่งฉันสามารถยืนยันได้ว่ามันหมายถึงaไม่เพียง แต่ส่งผลกระทบในแนวดิ่งyแต่ยังรวมถึงตำแหน่งของจุดสูงสุดและความชันของความy~b+b^2โค้ง แล้วถ้าฉันพอดีlm(y~a*bs(b,df=3))ล่ะ ฉันจะตีความอย่างไรa:bs(b,df=3)1, a:bs(b,df=3)2และa:bs(b,df=3)3เงื่อนไข? การกระจัดตามแนวดิ่งของyเส้นโค้งเหล่านี้เกิดจากaที่แต่ละส่วนในสามส่วนหรือไม่

1
การติดตามของ Pillai มีลักษณะทั่วไปและการติดตามของ Hotelling-Lawley หรือไม่
ในการตั้งค่าการถดถอยหลายตัวแปรหลายตัวแปร (vector regressor และ regressand) การทดสอบหลักสี่แบบสำหรับสมมติฐานทั่วไป (Wilk's Lambda, Pillai-Bartlett, Hotelling-Lawley และรูตที่ใหญ่ที่สุดของ Roy) ทั้งหมดขึ้นอยู่กับค่าลักษณะเฉพาะของเมทริกซ์ , โดยที่และคือเมทริกซ์รูปแบบ 'อธิบาย' และ 'รวม'HE−1HE−1H E^{-1}HHHEEE ฉันสังเกตเห็นว่าสถิติของ Pillai และ Hotelling-Lawley สามารถแสดงเป็น สำหรับตามลำดับ0 ฉันกำลังมองหาที่แอพลิเคชันที่กระจายของร่องรอยนี้, ที่กำหนดไว้สำหรับ analogues ประชากรของและเป็นที่น่าสนใจสำหรับกรณี (ข้อผิดพลาดแบบโมดูโลในการทำงานของฉัน) ฉันอยากรู้ว่ามีการรวมกันของสถิติตัวอย่างสำหรับทั่วไปหรือการวางนัยทั่วไปอื่น ๆ ที่รวบรวมการทดสอบแบบดั้งเดิมสองรายการหรือมากกว่านั้น ฉันรู้ว่าไม่เท่ากับหรือψκ=Tr(H[κH+E]−1),ψκ=Tr(H[κH+E]−1),\psi_{\kappa} = \mbox{Tr}\left(H\left[\kappa H + E\right]^{-1}\right),κ=1,0κ=1,0\kappa = 1, 0HHHEEEκ κ 0 1κ=2κ=2\kappa = 2κκ\kappaκκ\kappa000111ตัวเศษดูเหมือน Chi-square ภายใต้ null …

3
สถิติและสารสนเทศต่างกันอย่างไร
เรามักจะบอกว่าสถิติเป็นเพียงการจัดการกับข้อมูล แต่เราก็รู้ว่าสารสนเทศก็ยังได้รับความรู้จากการวิเคราะห์ข้อมูล ตัวอย่างเช่นคนชีวสารสนเทศสามารถไปโดยสิ้นเชิงโดยไม่ชีวสถิติ ฉันต้องการทราบว่าอะไรคือความแตกต่างที่สำคัญระหว่างสถิติและสารสนเทศ

1
รูปแบบของการคลิกเมาส์ (หรือแป้นพิมพ์) และทำนายการกระทำของผู้ใช้คอมพิวเตอร์
ขึ้นอยู่กับรูปแบบชั่วคราวของการคลิกเมาส์ (รายการเวลาในการคลิก ) เป็นไปได้หรือไม่ที่จะทำนายกิจกรรมของผู้ใช้คอมพิวเตอร์?[t1,t2,t3,…][t1,t2,t3,…][t_1,t_2,t_3,\ldots] ตัวอย่างเช่นจาก: การทำงานกับการใช้เวลากับ Facebook เทียบกับการดูรูปถ่ายและเล่นเกมคอมพิวเตอร์ หากพวกเขาเป็นการคาดการณ์ที่ละเอียดยิ่งขึ้น (เช่นการเล่น StarCraft vs Counter Strike vs SimCity) ฉันก็สนใจเช่นกัน ในขณะที่ (สามารถได้ยินได้ว่าใครบางคนกำลังเล่นอยู่ (เนื่องจากการคลิกที่รวดเร็วและต่อเนื่อง) หรือดูรูปภาพ (การคลิกระยะห่างเท่า ๆ กัน) ฉันสนใจถ้ามีการค้นพบที่เป็นวัตถุประสงค์เพิ่มเติม (สิ่งพิมพ์การวิจัยบนบล็อกเป็นต้น) . แก้ไข: ฉันสนใจในการคลิกแป้นพิมพ์อย่างเท่าเทียมกัน (โดยไม่แยกความแตกต่างว่าจะกดปุ่มใด) หรือวิธีการรวม (เมาส์ + คีย์บอร์ด)

2
regularization
มีหลายวิธีในการดำเนินการทำให้เป็นมาตรฐาน - L0L0L_0, L1L1L_1และ L2L2L_2บรรทัดฐานตามบรรทัดฐานเช่น ตามFriedman Hastie & Tibsharani , regularizer ที่ดีที่สุดขึ้นอยู่กับปัญหา: คือธรรมชาติของฟังก์ชั่นเป้าหมายที่แท้จริง, พื้นฐานที่ใช้เฉพาะ, อัตราส่วนสัญญาณต่อเสียงรบกวน, และขนาดตัวอย่าง มีการวิจัยเชิงประจักษ์เปรียบเทียบวิธีการและประสิทธิภาพของวิธีการทำให้เป็นมาตรฐานแบบต่างๆหรือไม่?

6
วิธีการประเมินพลังการทำนายของชุดตัวพยากรณ์เชิงหมวดหมู่ของผลลัพธ์ไบนารี คำนวณความน่าจะเป็นหรือการถดถอยโลจิสติก?
ฉันพยายามที่จะตรวจสอบว่าความน่าจะเป็นแบบง่าย ๆ จะสามารถแก้ปัญหาของฉันได้หรือไม่ถ้าจะใช้ (และเรียนรู้) วิธีการที่ซับซ้อนกว่านี้เช่นการถดถอยแบบโลจิสติกส์ ตัวแปรการตอบสนองในปัญหานี้คือการตอบสนองแบบไบนารี (0, 1) ฉันมีตัวแปรตัวทำนายจำนวนหนึ่งที่จัดหมวดหมู่และไม่มีการเรียงลำดับ ฉันพยายามที่จะพิจารณาว่าชุดค่าผสมของตัวแปรตัวทำนายใดให้สัดส่วนที่สูงที่สุดของ 1 ฉันต้องการการถดถอยแบบโลจิสติกส์หรือไม่? การคำนวณสัดส่วนในตัวอย่างที่ฉันตั้งไว้สำหรับการรวมกันของตัวทำนายหมวดหมู่แต่ละชุดจะเป็นประโยชน์อย่างไร

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.