สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
ปัญหาในเชิงลึกที่ร้ายแรงของความน่าจะเป็นสำหรับการพลิกเหรียญ
ให้บอกว่าฉันทำ 10,000 flips เหรียญ ฉันต้องการทราบความน่าจะเป็นของการพลิกหลายครั้งเพื่อให้ได้ 4 หัวติดต่อกันหรือมากกว่าติดต่อกัน การนับจะทำหน้าที่ดังต่อไปนี้คุณจะนับหนึ่งรอบการพลิกต่อเนื่องที่เป็นแค่หัว (4 หัวหรือมากกว่า) เมื่อก้อยกระทบและแตกแนวของหัวการนับจะเริ่มอีกครั้งจากการโยนครั้งต่อไป นี่จะทำซ้ำ 10,000 ครั้ง ฉันต้องการทราบความน่าจะเป็นไม่ใช่เพียง 4 หัวขึ้นไปในแถว แต่ 6 หรือมากกว่าและ 10 หรือมากกว่า หากต้องการให้ชัดเจนหากมีริ้ว 9 หัวมันจะนับเป็น 1 ริ้ว 4 หรือมากกว่า (และ / หรือ 6 หรือมากกว่า) ไม่ใช่ 2 เส้นแยกกัน ตัวอย่างเช่นหากเหรียญมาถึง THTHTHTHHHHHH /// THAHTHT .... การนับจะเป็น 13 และเริ่มต้นอีกครั้งบนก้อยถัดไป สมมุติว่าข้อมูลออกมาเอียงไปทางขวาอย่างมาก หมายความว่าเฉลี่ย 40 พลิกโดยเฉลี่ยเพื่อให้ได้แนว 4 …

1
การตีความความหนาแน่นแบบมีเงื่อนไข
ฉันต้องการทราบวิธีการตีความแปลงความหนาแน่นตามเงื่อนไขอย่างถูกต้อง ฉันได้ใส่สองด้านล่างที่ผมสร้างขึ้นใน R cdplotกับ ตัวอย่างเช่นความน่าจะเป็นของผลลัพธ์เท่ากับ 1 เมื่อVar 1เท่ากับ 150 ประมาณ 80% หรือไม่ พื้นที่สีเทาเข้มคือความน่าจะเป็นแบบมีเงื่อนไขResultซึ่งเท่ากับ 1 ใช่ไหม? จากcdplotเอกสารประกอบ: cdplot คำนวณความหนาแน่นตามเงื่อนไขของ x ที่กำหนดระดับของ y ที่ถ่วงน้ำหนักด้วยการแจกแจงส่วนขอบของ y ความหนาแน่นจะได้รับมาจากระดับ y การสะสมนี้มีผลต่อการตีความแปลงเหล่านี้อย่างไร

3
ทำความเข้าใจกับเส้นประสีน้ำเงินใน ACF จาก R
ฉันมีปัญหาเล็กน้อยในการทำความเข้าใจเส้นประสีน้ำเงินในภาพต่อไปนี้ของฟังก์ชั่นความสัมพันธ์อัตโนมัติ: มีคนให้คำอธิบายง่ายๆกับฉันว่าพวกเขาบอกอะไรฉัน

3
ผลรวมถ่วงน้ำหนักของตัวแปรสุ่ม Poisson อิสระสองตัว
การใช้วิกิพีเดียฉันพบวิธีคำนวณความน่าจะเป็นของมวลฟังก์ชันที่เกิดจากผลรวมของตัวแปรสุ่มปัวซองสองตัว อย่างไรก็ตามฉันคิดว่าวิธีการที่ฉันมีผิด ให้เป็นตัวแปรสุ่มปัวซองสองตัวที่มีค่าเฉลี่ยและโดยที่และเป็นค่าคงที่จากนั้นฟังก์ชันสร้างความน่าจะเป็นของจะถูกกำหนดโดย ตอนนี้การใช้ความจริงที่ว่าฟังก์ชันสร้างความน่าจะเป็นสำหรับตัวแปรสุ่มของปัวซองคือเราสามารถเขียนฟังก์ชันสร้างความน่าจะเป็นของ ผลรวมของตัวแปรสุ่ม Poisson อิสระสองตัว X1,X2X1,X2X_1, X_2λ1,λ2λ1,λ2\lambda_1, \lambda_2S2=a1X1+a2X2S2=a1X1+a2X2S_2 = a_1 X_1+a_2 X_2a1a1a_1a2a2a_2S2S2S_2G X ฉัน (z)= e λ ฉัน ( z - 1 ) G S 2 ( z )GS2(z)=E(zS2)=E(za1X1+a2X2)GX1(za1)GX2(za2).GS2(z)=E⁡(zS2)=E⁡(za1X1+a2X2)GX1(za1)GX2(za2). G_{S_2}(z) = \operatorname{E}(z^{S_2})= \operatorname{E}(z^{a_1 X_1+a_2 X_2}) G_{X_1}(z^{a_1})G_{X_2}(z^{a_2}). GXi(z)=eλi(z−1)GXi(z)=eλi(z−1)G_{X_i}(z) = \textrm{e}^{\lambda_i(z - 1)} S2G S 2 (z)Pr(S2=k)= G ( k …

3
สร้างแผนผังความน่าจะเป็นของเส้นทางสำหรับการเดินทางผ่านเว็บไซต์
ขณะนี้ฉันกำลังทำการวิเคราะห์บนเว็บไซต์ที่ต้องการให้ฉันสร้างแผนผังการตัดสินใจแสดงเส้นทางที่เป็นไปได้ที่ผู้คนใช้เมื่อใดก็ตามที่พวกเขามาถึงเว็บไซต์ ฉันกำลังจัดการกับสิ่งdata.frameที่แสดงเส้นทางของลูกค้าทั้งหมดไปยังเว็บไซต์โดยเริ่มจากหน้าแรก ตัวอย่างเช่นลูกค้าสามารถใช้เส้นทางต่อไปนี้: Homepage - pg 1 Kitchen Items page - pg 2 Pots and Pans page - pg 3 ดังนั้นลูกค้ารายนี้จะมีการเดินทาง 3 หน้า สิ่งที่ฉันต้องการทำใน R คือการรวมพา ธ ของลูกค้าทั้งหมดและกำหนดความน่าจะเป็นให้กับลูกค้าตามเส้นทางที่แน่นอนในไซต์ ตัวอย่างเช่นหากฉันต้องตรวจสอบเส้นทางทั้งหมดฉันจะพบว่า 34% ของผู้ที่มาถึงหน้าแรกให้ไปที่ 'หน้ารายการครัว' R มีสถานที่นี้หรือไม่? ฉันค้นหาวิธีการต่าง ๆ ผ่านแพ็คเกจ rpartและpartykitแต่ดูเหมือนว่าพวกเขาไม่ได้ช่วยอะไรเลย ผู้ควบคุมทิศทางที่ถูกต้องสำหรับสิ่งนี้จะได้รับการชื่นชมอย่างมาก!

2
ความสับสนที่เกี่ยวข้องกับความแตกต่างของกระบวนการ kriging และ gaussian
ฉันมีเวลายากที่จะเข้าใจความแตกต่างระหว่างกระบวนการ kriging และ gaussian คืออะไร ฉันหมายถึงวิกิบอกว่าพวกเขาเหมือนกัน แต่สูตรการทำนายแตกต่างกันมาก ฉันสับสนเล็กน้อยว่าทำไมพวกเขาถึงเรียกว่าคล้ายกัน ชี้แจง?

3
จำกัด เพียงวิธีการรวมวงดนตรีที่ใช้ต้นไม้ในปัญหาเล็ก ๆ และปัญหาใหญ่ p?
วิธีการทั้งมวลของต้นไม้เช่น Random Forest และอนุพันธ์ถัดมา (เช่นป่าที่มีเงื่อนไข) ซึ่งล้วนเป็นประโยชน์ในสิ่งที่เรียกว่าปัญหา "small n , large p " เพื่อระบุความสำคัญของตัวแปรที่เกี่ยวข้อง ที่จริงเรื่องนี้ดูเหมือนจะเป็นจริง แต่คำถามของฉันคือความสามารถนี้จะนำไปได้ไกลแค่ไหน? เราสามารถมีข้อสังเกตได้ 30 ข้อและตัวแปร 100 ตัว? อะไรคือจุดแตกหักของวิธีการดังกล่าวและมีกฎที่เหมาะสมของหัวแม่มือที่มีอยู่? ฉันต้องการและจะยอมรับคำตอบที่ได้รับการสนับสนุนจากลิงก์ไปยังหลักฐานจริง (ไม่ใช่การคาดเดา) โดยใช้ชุดข้อมูลจำลองหรือชุดข้อมูลจริง ฉันไม่ได้พบมากในหลัง ( ที่นี่และที่นี่) ดังนั้นความคิด / คำแนะนำของคุณ / (ในหัวข้อ) คำแนะนำการอ้างอิงยินดีต้อนรับมากที่สุด!

2
ความแตกต่างระหว่างการถดถอยเชิงเส้นของ logit-transformed, การถดถอยโลจิสติกและการผสมแบบโลจิสติกคืออะไร?
สมมติว่าฉันมีนักเรียน 10 คนแต่ละคนพยายามแก้ปัญหาคณิตศาสตร์ 20 ข้อ ปัญหาคะแนนถูกต้องหรือไม่ถูกต้อง (ใน longdata) และประสิทธิภาพของนักเรียนแต่ละคนสามารถสรุปได้ด้วยการวัดความแม่นยำ (ใน subjdata) แบบจำลอง 1, 2 และ 4 ด้านล่างดูเหมือนจะให้ผลลัพธ์ที่แตกต่างกัน แต่ฉันเข้าใจว่าพวกเขากำลังทำสิ่งเดียวกัน ทำไมพวกเขาถึงให้ผลลัพธ์ที่แตกต่างกัน? (ฉันรวมโมเดล 3 ไว้สำหรับการอ้างอิง) library(lme4) set.seed(1) nsubjs=10 nprobs=20 subjdata = data.frame('subj'=rep(1:nsubjs),'iq'=rep(seq(80,120,10),nsubjs/5)) longdata = subjdata[rep(seq_len(nrow(subjdata)), each=nprobs), ] longdata$correct = runif(nsubjs*nprobs)<pnorm(longdata$iq/50-1.4) subjdata$acc = by(longdata$correct,longdata$subj,mean) model1 = lm(logit(acc)~iq,subjdata) model2 = glm(acc~iq,subjdata,family=gaussian(link='logit')) model3 = glm(acc~iq,subjdata,family=binomial(link='logit')) model4 …

1
จะหาการกระจายของส่วนต่างจากการกระจายแบบร่วมที่มีการพึ่งพาหลายตัวแปรได้อย่างไร
หนึ่งในปัญหาในหนังสือเรียนของฉันถูกวางไว้ดังนี้ เวกเตอร์ต่อเนื่องสุ่มสองมิติมีฟังก์ชันความหนาแน่นต่อไปนี้: fX,Y(x,y)={15xy20if 0 &lt; x &lt; 1 and 0 &lt; y &lt; xotherwisefX,Y(x,y)={15xy2if 0 &lt; x &lt; 1 and 0 &lt; y &lt; x0otherwise f_{X,Y}(x,y)= \begin{cases} 15xy^2 & \text{if 0 < x < 1 and 0 < y < x}\\ 0 & \text{otherwise}\\ \end{cases} แสดงว่าฟังก์ชันความหนาแน่นของส่วนขอบและคือ:f YfXfXf_XfYfYf_Y fX(x)={5x40if 0 &lt; …

1
ความหนาแน่นของหุ่นยนต์ที่เดินแบบสุ่มในกราฟเรขาคณิตแบบสุ่มที่ไม่มีที่สิ้นสุด
พิจารณาอนันต์กราฟเรขาคณิตแบบสุ่มในสถานที่ที่โหนดเป็นไปตามกระบวนการจุด Poisson ที่มีความหนาแน่นและขอบจะอยู่ระหว่างโหนดที่อยู่ใกล้กว่าง ดังนั้นความยาวของขอบจึงเป็นไปตาม PDF ดังต่อไปนี้:ρρ\rhoddd f(l)={2ld2l≤d0l&gt;df(l)={2ld2l≤d0l&gt;d f(l)= \begin{cases} \frac{2 l}{d^2} \;\quad l \le d \\ 0 \qquad\; l > d \end{cases} ในกราฟข้างต้นพิจารณาโหนดภายในวงกลมของรัศมีศูนย์กลางที่แหล่งกำเนิด สมมติว่าในเวลาt = 0เราวางหุ่นยนต์ตัวเล็ก ๆ ไว้ในแต่ละโหนดที่กล่าวถึง นั่นคือความหนาแน่นของหุ่นยนต์บนเครื่องบินโดย:rrrt=0t=0t=0 โดยที่lคือระยะทางจากจุดกำเนิด รูปต่อไปนี้แสดงตัวอย่างตำแหน่งเริ่มต้นของหุ่นยนต์g(l)={ρl≤r0l&gt;dg(l)={ρl≤r0l&gt;d g(l)= \begin{cases} \rho \quad l \le r \\ 0 \quad\; l > d \end{cases} lll ในแต่ละขั้นตอนหุ่นยนต์จะไปที่หนึ่งในเพื่อนบ้านแบบสุ่ม ทีนี้คำถามของฉันคือ: ฟังก์ชันความหนาแน่นของหุ่นยนต์ที่คืออะไร? เป็นไปได้ที่จะคำนวณฟังก์ชั่นความหนาแน่นเมื่อt …

4
บทแนะนำที่ดีสำหรับเครื่อง Boltzmann ที่ จำกัด (RBM)
ฉันกำลังศึกษาเครื่อง Boltzmann ที่ จำกัด (RBM) และกำลังมีปัญหาบางอย่างในการทำความเข้าใจการคำนวณความน่าจะเป็นของบันทึกเกี่ยวกับพารามิเตอร์ของ RBM แม้ว่าจะมีการตีพิมพ์รายงานวิจัยจำนวนมากเกี่ยวกับ RBM แต่ก็ไม่มีขั้นตอนโดยละเอียดของตราสารอนุพันธ์ หลังจากค้นหาออนไลน์ฉันสามารถค้นหาพวกเขาในเอกสารนี้: Fischer, A. , &amp; Igel, C. (2012) บทนำของเครื่องจักร Boltzmann ที่ถูก จำกัด ใน L. Alvarez et al. (บรรณาธิการ): CIARP, LNCS 7441, pp. 14–36, Springer-Verlag: Berlin-Heidelberg ( pdf ) อย่างไรก็ตามรายละเอียดของเอกสารนี้ก้าวหน้าเกินไปสำหรับฉัน ใครช่วยชี้ให้ฉันดูบทสอน / ชุดการบรรยายที่ดีเกี่ยวกับ RBM ได้หรือไม่? แก้ไข: @David ส่วนที่สับสนแสดงอยู่ด้านล่าง (สมการที่ 29 ในหน้า …
10 references  rbm 

1
เทคนิคการขุดข้อมูลในการรณรงค์ของโอบามา
ฉันเจอบทความนี้เกี่ยวกับทีมขุดข้อมูลในแคมเปญเลือกตั้งของโอบามา น่าเสียดายที่บทความมีความคลุมเครือเกี่ยวกับเครื่องจักรจริงของอัลกอริทึมทางสถิติ อย่างไรก็ตามมันฟังดูราวกับว่าเทคนิคทั่วไปเป็นที่รู้จักในสังคมศาสตร์และการเมือง เนื่องจากนี่ไม่ใช่ความเชี่ยวชาญของฉันทุกคนสามารถชี้ให้ฉันที่ (ภาพรวม) วรรณกรรมเกี่ยวกับเทคนิคเหล่านี้ได้หรือไม่

2
ความแตกต่างของตัวแปรสุ่มแกมมา
รับตัวแปรสุ่มอิสระสองตัวและการกระจายความแตกต่างคือคืออะไร?Y ∼ G a m m a ( α Y , β Y ) D = X - YX∼Gamma(αX,βX)X∼Gamma(αX,βX)X\sim \mathrm{Gamma}(\alpha_X,\beta_X)Y∼Gamma(αY,βY)Y∼Gamma(αY,βY)Y\sim \mathrm{Gamma}(\alpha_Y,\beta_Y)D=X−YD=X−YD=X-Y หากผลลัพธ์ไม่เป็นที่รู้จักฉันจะไปหาผลลัพธ์ได้อย่างไร

3
วิธีการดูข้อมูลอนุกรมเวลาขนาดใหญ่แบบโต้ตอบ?
ฉันมักจะจัดการกับข้อมูลอนุกรมเวลาที่มีขนาดพอสมควรจำนวน 50-200 ล้านคู่กับการประทับเวลาที่เกี่ยวข้องและต้องการเห็นภาพเหล่านั้นแบบไดนามิก มีซอฟต์แวร์ที่มีอยู่ให้ทำอย่างมีประสิทธิภาพหรือไม่ ห้องสมุดและรูปแบบข้อมูลเป็นอย่างไร Zoom-cacheเป็นตัวอย่างหนึ่งของการมุ่งเน้นไปที่อนุกรมเวลาขนาดใหญ่ ในซูมแคชข้อมูลสรุปที่ความละเอียดหลายอย่างเพื่อให้ง่ายต่อการดูที่ความละเอียดที่แตกต่างกัน แก้ไข: หากมีที่อื่นฉันควรถามคำถามนี้หรือค้นหาคำตอบโปรดแจ้งให้เราทราบ

2
ข้อมูลลำดับหรือช่วงเวลาจำเป็นสำหรับการทดสอบยศ Wilcoxon ที่ลงนามหรือไม่?
เมื่อดูที่แหล่งข้อมูลออนไลน์หลายแห่งฉันดูเหมือนจะไม่ได้รับคำตอบที่ตรง มีคนช่วยอธิบายให้ฉันฟังได้ไหมถ้าข้อมูลลำดับนั้นเพียงพอที่จะใช้สำหรับ WSRT และถ้าไม่ใช่การทดสอบเครื่องหมายเป็นทางเลือกที่เหมาะสมหรือไม่? ในที่สุดนี้เป็นโครงการวิทยานิพนธ์ของฉันที่มหาวิทยาลัยและหากมีการอ้างอิง / วรรณคดีใด ๆ ที่จะรวมอยู่ในคำตอบก็จะได้รับการชื่นชมมากเพราะฉันต้องพิสูจน์ตัวเลือกการทดสอบของฉันทั้งสองทางและจนถึงตอนนี้มีคำตอบจากเว็บไซต์ ไม่สามารถอ้างอิงได้!)

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.