สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
ความแตกต่างระหว่างประเภทของ SVM
ฉันใหม่เพื่อรองรับเครื่องเวกเตอร์ คำอธิบายสั้น ๆ svmฟังก์ชั่นจากe1071แพคเกจใน R มีตัวเลือกต่างๆ: C-การจัดหมวดหมู่ nu-การจัดหมวดหมู่ การจำแนกประเภทหนึ่ง (สำหรับการตรวจจับสิ่งแปลกใหม่) eps-ถดถอย nu-ถดถอย อะไรคือความแตกต่างในการหยั่งรู้ระหว่างห้าประเภท? ควรใช้อันไหนในสถานการณ์ใด

2
เราควรทำประวัติย่อเสมอ
คำถามของฉัน: ฉันควรทำ CV สำหรับชุดข้อมูลที่ค่อนข้างใหญ่หรือไม่? ฉันมีชุดข้อมูลที่ค่อนข้างใหญ่และฉันจะใช้อัลกอริทึมการเรียนรู้ของเครื่องกับชุดข้อมูล เนื่องจากพีซีของฉันไม่เร็ว CV บางครั้งอาจใช้เวลานานเกินไป โดยเฉพาะ SVM ไม่สิ้นสุดเพราะมีพารามิเตอร์การปรับแต่งมากมาย ดังนั้นถ้าฉันทำ CV ฉันต้องเลือกข้อมูลที่ค่อนข้างเล็ก ในทางกลับกันชุดตรวจสอบควรมีขนาดใหญ่เช่นกันดังนั้นฉันคิดว่าเป็นความคิดที่ดีที่จะใช้ชุดตรวจสอบที่มีขนาดเท่ากัน (หรือใหญ่กว่า) ชุดฝึกอบรม (คือ CV แทนฉันใช้ชุดการตรวจสอบความถูกต้องขนาดใหญ่สำหรับการปรับพารามิเตอร์) ตอนนี้ฉันมีอย่างน้อยสองตัวเลือก ทำ CV ในชุดข้อมูลขนาดเล็ก ใช้ชุดฝึกอบรมที่มีขนาดค่อนข้างใหญ่และชุดการตรวจสอบโดยไม่มีประวัติย่อ ความคิดอื่น ๆ ความคิดที่ดีที่สุดคืออะไร? ความคิดเห็นทั้งภาคทฤษฎีและภาคปฏิบัติยินดีต้อนรับ

2
คำศัพท์เชิงบวกหมายถึงความสัมพันธ์ระหว่างตัวแปรที่เป็นองค์ประกอบหรือไม่?
สมมติว่าฉันใช้การถดถอยเชิงเส้นที่มีรูปแบบy=β0+β1A+β2B+β3AB+ϵy=β0+β1A+β2B+β3AB+ϵy = \beta_0 + \beta_1A+\beta_2B+\beta_3AB +\epsilon. ถ้า β3β3\beta_3 เป็นค่าบวกนี่หมายความถึงความสัมพันธ์เชิงบวกระหว่าง AAA และ BBB? (ตรงกันข้ามความสัมพันธ์เชิงลบถ้าβ3β3\beta_3 เป็นลบหรือไม่)


2
ทำความเข้าใจกับแผนการขายไอศกรีมของ PCA นี้เทียบกับอุณหภูมิ
ฉันกำลังใช้ข้อมูลหุ่นจำลองของอุณหภูมิเทียบกับการขายไอศกรีมและจัดหมวดหมู่โดยใช้ K หมายถึง (n กลุ่ม = 2) เพื่อแยกแยะความแตกต่าง 2 ประเภท (หุ่นจำลองทั้งหมด) ตอนนี้ฉันกำลังทำการวิเคราะห์ส่วนประกอบหลักในข้อมูลนี้และเป้าหมายของฉันคือเข้าใจสิ่งที่ฉันเห็น ฉันรู้ว่าวัตถุประสงค์ PCA คือการลดมิติ (ไม่ชัดเจนในกรณีนี้) และแสดงความแปรปรวนขององค์ประกอบ แต่คุณจะอ่านพล็อต PCA ด้านล่างได้อย่างไรนั่นคือเรื่องราวที่คุณสามารถบอกเกี่ยวกับอุณหภูมิเทียบกับไอศกรีมในพล็อต PCA ได้อย่างไร พีซีรุ่น 1 (X) และ 2nd (Y) หมายถึงอะไร?

2
ตัวแปรสุ่มที่ Markov, อสมการ Chebyshev แน่น
ฉันสนใจที่จะสร้างตัวแปรสุ่มซึ่งความไม่เท่าเทียมกันของ Markov หรือ Chebyshev แน่น ตัวอย่างเล็ก ๆ น้อย ๆ คือตัวแปรสุ่มต่อไปนี้ P(X=1)=P(X=−1)=0.5P(X=1)=P(X=-1)=0.5P(X=1)=P(X=-1) = 0.50.5 ค่าเฉลี่ยของมันคือศูนย์แปรปรวนคือ 1 และ1 สำหรับตัวแปรสุ่ม chebyshev นี้จะแน่น (ถือด้วยความเสมอภาค)P(|X|≥1)=1P(|X|≥1)=1P(|X| \ge 1) = 1 P(|X|≥1)≤Var(X)12=1P(|X|≥1)≤Var(X)12=1P(|X|\ge 1) \le \frac{\text{Var}(X)}{1^2} = 1 มีตัวแปรสุ่มที่น่าสนใจ (ไม่เหมือนกัน) ที่ Markov และ Chebyshev แน่นกว่านี้หรือไม่? ตัวอย่างบางส่วนจะดี

2
อนุญาตให้ใช้ค่าเฉลี่ยในชุดข้อมูลเพื่อปรับปรุงความสัมพันธ์ได้หรือไม่
ฉันมีชุดข้อมูลที่มีตัวแปรตามและตัวแปรอิสระ ทั้งคู่ไม่ใช่อนุกรมเวลา ฉันมี 120 ข้อสังเกต ค่าสัมประสิทธิ์สหสัมพันธ์เท่ากับ 0.43 หลังจากการคำนวณนี้ฉันได้เพิ่มคอลัมน์สำหรับตัวแปรทั้งสองโดยมีค่าเฉลี่ยสำหรับการสังเกตทุก 12 ครั้งทำให้เกิดคอลัมน์ใหม่ 2 คอลัมน์ที่มีการสังเกต 108 ครั้ง (คู่) ค่าสัมประสิทธิ์สหสัมพันธ์ของคอลัมน์เหล่านี้คือ 0.77 ดูเหมือนว่าฉันจะปรับปรุงความสัมพันธ์ในลักษณะนี้ อนุญาตให้ทำเช่นนี้หรือไม่ ฉันเพิ่มอำนาจการอธิบายของตัวแปรอิสระโดยใช้ค่าเฉลี่ยหรือไม่

1
การแจกแจงเบต้าสองครั้งจะกำหนดพารามิเตอร์หรือไม่
หากฉันให้ปริมาณสองค่าและตำแหน่งที่สอดคล้องกัน (แต่ละอัน) ในช่วงเวลาเปิดฉันจะหาพารามิเตอร์ของการแจกแจงแบบเบต้าที่มีปริมาณเหล่านั้นในตำแหน่งที่ระบุได้หรือไม่?(q1,q2)(q1,q2)(q_1,q_2)(l1,l2)(l1,l2)(l_1,l_2)(0,1)(0,1)(0,1)

1
การตรวจหาการเปลี่ยนแปลงคู่เคียงแบบเบย์ออนไลน์
ฉันกำลังอ่านรายงานการตรวจหาการเปลี่ยนแปลงไบเซียนออนไลน์โดย Adams และ MacKay ( ลิงก์ ) ผู้แต่งเริ่มต้นด้วยการเขียนการแจกแจงการทำนายแบบชายขอบ: โดยที่P(xt+1|x1:t)=∑rtP(xt+1|rt,x(r)t)P(rt|x1:t)(1)P(xt+1|x1:t)=∑rtP(xt+1|rt,xt(r))P(rt|x1:t)(1) P(x_{t+1} | \textbf{x}_{1:t}) = \sum_{r_t} P(x_{t+1} | r_t, \textbf{x}_t^{(r)}) P(r_t | \textbf{x}_{1:t}) \qquad \qquad (1) xtxtx_tคือการสังเกตในเวลา ;ttt x1:tx1:t\textbf{x}_{1:t}หมายถึงชุดการสังเกตจนกระทั่งเวลา ;ttt rt∈Nrt∈Nr_t \in \mathbb{N}คือ runlength ปัจจุบัน (เวลานับตั้งแต่การเปลี่ยนแปลงครั้งล่าสุดสามารถเป็น 0); และ x(r)txt(r)\textbf{x}_t^{(r)}เป็นชุดของการสังเกตที่เกี่ยวข้องกับการทำงานr_trtrtr_t อีคิว 1 ถูกต้องเป็นทางการ (ดูคำตอบด้านล่างโดย @JuhoKokkala) แต่ความเข้าใจของฉันคือถ้าคุณต้องการทำนายเกี่ยวกับคุณจะต้องขยายดังต่อไปนี้:xt+1xt+1x_{t+1} P(xt+1|x1:t)=∑rt,rt+1P(xt+1|rt+1,x(r)t)P(rt|x1:t)P(rt+1|rt)(1b)P(xt+1|x1:t)=∑rt,rt+1P(xt+1|rt+1,xt(r))P(rt|x1:t)P(rt+1|rt)(1b) P(x_{t+1} | \textbf{x}_{1:t}) = \sum_{r_t, r_{t+1}} …

2
การถดถอยของดิสก์ยูนิตเริ่มต้นจากตัวอย่าง "เว้นระยะสม่ำเสมอ"
ฉันต้องแก้ปัญหาการถดถอยที่ซับซ้อนบนดิสก์ยูนิต คำถามดั้งเดิมดึงดูดความคิดเห็นที่น่าสนใจ แต่ไม่มีคำตอบที่น่าเสียดาย ในขณะเดียวกันฉันได้เรียนรู้เพิ่มเติมเกี่ยวกับปัญหานี้ดังนั้นฉันจะพยายามแยกปัญหาดั้งเดิมออกเป็นปัญหาย่อยและดูว่าฉันโชคดีขึ้นในครั้งนี้หรือไม่ ฉันมีเซ็นเซอร์อุณหภูมิ 40 ตัวอยู่ในวงแหวนแคบ ๆ ภายในดิสก์ยูนิตเป็นประจำ: เซ็นเซอร์เหล่านี้รับอุณหภูมิในเวลา อย่างไรก็ตามเนื่องจากความแปรปรวนของเวลามีขนาดเล็กกว่าการแปรผันของอวกาศเรามาทำให้ปัญหาง่ายขึ้นโดยไม่สนใจความแปรปรวนของเวลาและสมมติว่าเซ็นเซอร์แต่ละตัวให้เวลาฉันโดยเฉลี่ยเท่านั้น ซึ่งหมายความว่าฉันมี 40 ตัวอย่าง (หนึ่งตัวสำหรับเซ็นเซอร์แต่ละตัว) และฉันไม่มีตัวอย่างซ้ำ ฉันต้องการสร้างพื้นผิวการถดถอยจากข้อมูลเซ็นเซอร์ การถดถอยมีสองเป้าหมาย:T= f( ρ , θ ) + ϵT=f(ρ,θ)+ϵT=f(\rho,\theta)+\epsilon ฉันต้องการที่จะประเมินค่าเฉลี่ยรัศมีอุณหภูมิT_ด้วยการถดถอยเชิงเส้นฉันได้ประมาณพื้นผิวซึ่งเป็นพื้นผิวอุณหภูมิเฉลี่ยแล้วดังนั้นฉันจึงต้องรวมพื้นผิวของฉันกับใช่ไหม? ถ้าฉันใช้พหุนามเพื่อการถดถอยขั้นตอนนี้ควรเป็นเค้กชิ้นหนึ่งTm e a n=ก.1( ρ ) + ϵTmean=g1(ρ)+ϵT_{mean}=g_1(\rho)+\epsilonθθ\theta ฉันต้องการที่จะประเมินโปรไฟล์อุณหภูมิรัศมีเช่นว่าในแต่ละตำแหน่งรัศมีPT95=ก.2( ρ ) + ϵT95=g2(ρ)+ϵT_{95}=g_2(\rho)+\epsilonP( T( ρ ) &lt;T95( ρ ) ) = .95P(T(ρ)&lt;T95(ρ))=.95P(T(\rho)<T_{95}(\rho))=.95 ด้วยสองเป้าหมายนี้ฉันควรใช้เทคนิคใดในการถดถอยของดิสก์ยูนิต แน่นอนกระบวนการแบบเกาส์มักใช้สำหรับการถดถอยเชิงพื้นที่ …

1
ตัวแบบเชิงเส้นตรงที่ข้อมูลมีความไม่แน่นอนโดยใช้ R
สมมติว่าฉันมีข้อมูลที่มีความไม่แน่นอน ตัวอย่างเช่น: X Y 1 10±4 2 50±3 3 80±7 4 105±1 5 120±9 ธรรมชาติของความไม่แน่นอนอาจเป็นการวัดซ้ำหรือการทดลองหรือความไม่แน่นอนของเครื่องมือวัด ผมอยากจะพอดีกับเส้นโค้งไปโดยใช้ R, lmบางสิ่งบางอย่างที่ปกติผมจะทำอย่างไรกับ อย่างไรก็ตามสิ่งนี้ไม่ได้คำนึงถึงความไม่แน่นอนในข้อมูลเมื่อมันทำให้ฉันมีความไม่แน่นอนในค่าสัมประสิทธิ์แบบพอดีและดังนั้นจึงมีการคาดการณ์ช่วงเวลา ดูที่เอกสารlmหน้านี้มี: ... น้ำหนักสามารถใช้เพื่อระบุว่าการสังเกตที่ต่างกันมีความแตกต่างกัน ... ดังนั้นฉันคิดว่าบางทีนี่อาจจะเกี่ยวข้องกับเรื่องนี้ ฉันรู้ทฤษฎีการทำด้วยตนเอง แต่ฉันสงสัยว่ามันเป็นไปได้ที่จะทำเช่นนั้นกับlmฟังก์ชั่น ถ้าไม่มีมีฟังก์ชั่นอื่น ๆ (หรือแพ็คเกจ) ที่สามารถทำสิ่งนี้ได้หรือไม่? แก้ไข เห็นความคิดเห็นบางส่วนนี่คือคำชี้แจงบางอย่าง ใช้ตัวอย่างนี้: x &lt;- 1:10 y &lt;- c(131.4,227.1,245,331.2,386.9,464.9,476.3,512.2,510.8,532.9) mod &lt;- lm(y ~ x + I(x^2)) summary(mod) ให้ฉัน: Residuals: Min …

1
บางคนสามารถอธิบายได้ว่าฉันอายุ 5 ปีเกี่ยวกับปัญหานี้จากหนังสือ ESL ของ Hastie หรือไม่?
ฉันทำงานผ่านหนังสือ ESL ของ Hastie และฉันมีช่วงเวลาที่ยากลำบากสำหรับคำถาม 2.3 คำถามดังต่อไปนี้: เรากำลังพิจารณาการประมาณเพื่อนบ้านที่ใกล้ที่สุดที่จุดเริ่มต้นและระยะทางเฉลี่ยจากจุดกำเนิดไปยังจุดข้อมูลที่ใกล้เคียงที่สุดจะได้รับจากสมการนี้ ฉันไม่รู้ว่าจะเริ่มต้นอย่างไรในแง่ของการพยายามหามา ฉันรู้ว่าจุดข้อมูลส่วนใหญ่อยู่ใกล้กับขอบเขตของพื้นที่ตัวอย่างมากกว่าจุดข้อมูลอื่น ๆ (การสาปแช่งของมิติ) แต่ฉันมีปัญหาในการแปลสิ่งนี้เป็นความรู้สึกเชิงพีชคณิต / ความน่าจะเป็นเชิงเส้น ขอบคุณ!

2
ปัวซงที่ไม่มีการตัดทอนเป็นศูนย์และปัวซงพื้นฐานซ้อนกันหรือไม่ซ้อนกันหรือไม่
ฉันได้เห็นมากมายที่พูดถึงว่าการถดถอยปัวซองพื้นฐานเป็นเวอร์ชันซ้อนกันของการถดถอยปัวซองแบบไม่พอง ตัวอย่างเช่นไซต์นี้ระบุว่าเป็นเพราะหลังมีพารามิเตอร์พิเศษเพื่อจำลองศูนย์เพิ่มเติม แต่รวมถึงพารามิเตอร์การถดถอยปัวซองเช่นเดียวกับอดีตแม้ว่าหน้าจะมีการอ้างอิงที่ไม่เห็นด้วย สิ่งที่ฉันไม่สามารถหาข้อมูลเกี่ยวกับได้คือว่าปัวซงที่ถูกตัดทอนและศูนย์ปัวซงพื้นฐานซ้อนกันหรือไม่ ถ้าปัวซองที่ถูกตัดทอนเป็นศูนย์เป็นเพียงปัวซองที่มีสเปคพิเศษที่ความน่าจะเป็นของการนับศูนย์เป็นศูนย์แล้วฉันคิดว่ามันน่าจะเป็นไปได้ แต่ฉันหวังว่าจะได้คำตอบที่ชัดเจนยิ่งขึ้น เหตุผลที่ฉันสงสัยว่ามันจะส่งผลต่อว่าฉันควรใช้การทดสอบของ Vuong (สำหรับแบบจำลองที่ไม่ซ้อนกัน) หรือการทดสอบไคสแควร์ขั้นพื้นฐานมากขึ้นตามความแตกต่างของ loglikelihoods (สำหรับแบบจำลองแบบซ้อน) Wilson (2015)พูดถึงว่าการทดสอบ Vuong นั้นเหมาะสมสำหรับการเปรียบเทียบการถดถอยแบบ zero-inflated กับการทดสอบพื้นฐานหรือไม่ แต่ฉันไม่สามารถหาแหล่งที่มาซึ่งกล่าวถึงข้อมูลที่ไม่มีการตัดทอนได้

1
วิธีการแพร่กระจายอย่างเหมาะสมดึงเมื่อคำนวณหลายความคาดหวัง
สมมติว่าเราต้องการคำนวณความคาดหวัง: EYEX|Y[f(X,Y)]EYEX|Y[ฉ(X,Y)]E_YE_{X|Y}[f(X,Y)] สมมติว่าเราต้องการประมาณค่านี้โดยใช้การจำลองมอนติคาร์โล EYEX|Y[f(X,Y)]≈1RS∑r=1R∑s=1Sf(xr,s,yr)EYEX|Y[ฉ(X,Y)]≈1RSΣR=1RΣs=1Sฉ(xR,s,YR)E_YE_{X|Y}[f(X,Y)] \approx \frac1{RS}\sum_{r=1}^R\sum_{s=1}^Sf(x^{r,s},y^r) แต่สมมติว่ามันมีค่าใช้จ่ายสูงในการดึงตัวอย่างจากการแจกแจงทั้งสองค่าเพื่อให้เราสามารถวาดหมายเลขคงที่เท่านั้น KKK เราควรจัดสรรอย่างไร ตัวอย่างรวมถึงดึงไปที่การกระจายแต่ละครั้งหรือในสุดขั้วหนึ่งเสมอในด้านนอกและเสมอในด้านในรองในทางกลับกัน ฯลฯ .....KKKK/2K/2K/2K−1K-1K-1 สัญชาตญาณของฉันบอกฉันว่ามันจะต้องทำอย่างไรกับความแปรปรวน / เอนโทรปีของการแจกแจงที่สัมพันธ์กัน สมมติว่าด้านนอกหนึ่งเป็นจุดมวลแล้วส่วนหนึ่งของที่ช่วยลดข้อผิดพลาด MC จะวาดที่ 1 ของและวาดของxy KKKYYYK−1K-1K-1X|YX|YX|Y หวังว่านี่จะชัดเจน

6
ฉันต้องการเรียนรู้เกี่ยวกับทฤษฎีความน่าจะเป็นทฤษฎีการวัดและการเรียนรู้ของเครื่องจักรในที่สุด ฉันจะเริ่มที่ไหน [ปิด]
ปิด คำถามนี้จะต้องมีมากขึ้นมุ่งเน้น ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้มุ่งเน้นที่ปัญหาเดียวโดยแก้ไขโพสต์นี้ ปิดให้บริการใน3 ปีที่ผ่านมา ฉันต้องการเรียนรู้เกี่ยวกับทฤษฎีความน่าจะเป็นทฤษฎีการวัดและการเรียนรู้ของเครื่องจักรในที่สุด เป้าหมายสูงสุดของฉันคือการใช้การเรียนรู้ของเครื่องในซอฟต์แวร์ ฉันศึกษาแคลคูลัสและความน่าจะเป็นพื้นฐานในวิทยาลัย แต่มันก็สวยมาก คุณรู้หลักสูตรออนไลน์หรือหนังสือบางเล่มที่ฉันสามารถใช้เพื่อเรียนรู้เกี่ยวกับวิชาเหล่านี้ ฉันพบแหล่งข้อมูลมากมายบนเว็บ แต่พวกเขาดูเหมือนจะกำหนดเป้าหมายไปยังผู้ชมที่มีความเชี่ยวชาญ ฉันรู้ว่ามันต้องใช้เวลาพอสมควร แต่ฉันจะเริ่มได้ที่ไหนถ้าฉันต้องการเรียนรู้ตั้งแต่ต้น?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.