สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
การจัดกึ่งกลางจำเป็นเมื่อทำการสแตรปป์ตัวอย่างหมายถึงอะไร?
เมื่ออ่านเกี่ยวกับวิธีประมาณการกระจายตัวของค่าเฉลี่ยตัวอย่างฉันเจอวิธีการบูตแบบไม่มีพารามิเตอร์ เห็นได้ชัดว่าเราสามารถประมาณการกระจายตัวของโดยการกระจายของˉ X ∗ n - ˉ X nโดยที่ˉ X ∗ nหมายถึงค่าเฉลี่ยตัวอย่างของตัวอย่างบูตตัวอย่างX¯n- μX¯n−μ\bar{X}_n-\muX¯* * * *n- X¯nX¯n∗−X¯n\bar{X}_n^*-\bar{X}_nX¯* * * *nX¯n∗\bar{X}_n^* คำถามของฉันคือ: ฉันต้องการจุดศูนย์กลางหรือไม่ เพื่ออะไร? ฉันไม่สามารถประมาณโดยP ( ˉ X ∗ n ≤ x ) ได้ใช่ไหมP ( X)¯n≤ x )P(X¯n≤x)\mathbb{P}\left(\bar{X}_n \leq x\right)P ( X)¯* * * *n≤ x )P(X¯n∗≤x)\mathbb{P}\left(\bar{X}_n^* \leq x\right)

2
ถ้า p> n, lasso เลือกได้ไม่เกิน n ตัวแปร
แรงจูงใจอย่างหนึ่งของตาข่ายยางยืดคือข้อ จำกัด ของ LASSO ดังต่อไปนี้: ในกรณีสายบาศกเลือกตัวแปร n ส่วนใหญ่ก่อนที่จะอิ่มตัวเนื่องจากลักษณะของปัญหาการปรับให้เหมาะสมของนูน นี่ดูเหมือนจะเป็นคุณสมบัติที่ จำกัด สำหรับวิธีการเลือกตัวแปร ยิ่งไปกว่านั้นเชือกไม่ได้กำหนดไว้อย่างชัดเจนเว้นแต่ขอบเขตของ L1-norm ของสัมประสิทธิ์มีค่าน้อยกว่าค่าที่แน่นอนp > np>np > n ( http://onlinelibrary.wiley.com/doi/10.1111/j.1467-9868.2005.00503.x/full ) ฉันเข้าใจว่า LASSO เป็นปัญหาการเขียนโปรแกรมสมการกำลังสอง แต่ยังสามารถแก้ไขได้ผ่าน LARS หรือการไล่ระดับสีแบบองค์ประกอบที่ชาญฉลาด แต่ฉันไม่เข้าใจว่าในอัลกอริธึมเหล่านี้ฉันพบปัญหาหรือไม่ถ้าโดยที่คือจำนวนตัวทำนายและคือขนาดตัวอย่าง และทำไมปัญหานี้แก้ไขได้โดยใช้สุทธิยืดหยุ่นที่ฉันเพิ่มปัญหาไปตัวแปรที่ชัดเจนเกินหน้าp n p + n pp > np>np > nพีppnnnp + np+np+nพีpp

1
ปัญหาการเพิ่มประสิทธิภาพ
เพื่อนคนหนึ่งของฉันขายเครื่องปั่นรุ่นต่างๆ เครื่องปั่นบางเครื่องนั้นเรียบง่ายและราคาถูกเครื่องปั่นอื่น ๆ นั้นซับซ้อนและแพงกว่า ข้อมูลของเขาประกอบด้วยราคาของเครื่องปั่นแต่ละเครื่อง (ซึ่งกำหนดโดยเขา) ในแต่ละเดือนและจำนวนหน่วยขายสำหรับแต่ละรุ่น เพื่อสร้างสัญกรณ์เขารู้เดือนเวกเตอร์ ที่คือราคาของรุ่นเครื่องปั่นในช่วงเดือนและเป็นจำนวนหน่วยขายของรูปแบบการปั่นในช่วงเดือนJj = 1 , … , n ( p 1 j , … , p k j )kkkj=1,…,nj=1,…,nj=1,\dots,np i j i j n i j i j(p1j,…,pkj)and(n1j,…,nkj),(p1j,…,pkj)and(n1j,…,nkj), (p_{1j},\dots,p_{kj}) \qquad \textrm{and} \qquad (n_{1j},\dots,n_{kj}) \, , pijpijp_{ij}iiijjjnijnijn_{ij}iiijjj เมื่อได้รับข้อมูลเขาต้องการกำหนดราคาซึ่งจะเพิ่มมูลค่าสูงสุดของยอดขายในอนาคตของเขา(p∗1,…,p∗k)(p1∗,…,pk∗)(p^*_1,\dots,p^*_k) ฉันมีความคิดบางอย่างเกี่ยวกับวิธีเริ่มแบบจำลองปัญหานี้ด้วยการถดถอยแบบปัวซอง แต่ฉันไม่ต้องการบูรณาการล้อ นอกจากนี้ยังเป็นการดีที่จะพิสูจน์ว่าค่าสูงสุดที่ต้องการนั้นมีอยู่ภายใต้เงื่อนไขบางประการ ใครช่วยกรุณาชี้ให้ฉันวรรณกรรมของปัญหาชนิดนี้?

1
การถดถอยเชิงเส้นและความสัมพันธ์เชิงพื้นที่
ฉันต้องการทำนายความสูงของต้นไม้ในบางพื้นที่โดยใช้ตัวแปรบางอย่างที่ได้จากการรับรู้จากระยะไกล เช่นชีวมวลโดยประมาณ ฯลฯ ฉันต้องการใช้การถดถอยเชิงเส้นก่อน (ฉันรู้ว่ามันไม่ใช่ความคิดที่ดีที่สุด แต่มันเป็นขั้นตอนที่ต้องทำสำหรับโครงการของฉัน) ฉันต้องการทราบว่าการปรับตัวสัมพันธ์สัมพันธ์เชิงพื้นที่อัตโนมัติมีผลกระทบอย่างไรและมีวิธีที่ง่ายที่สุดในการแก้ไขปัญหานี้หากเป็นไปได้ ฉันทำทุกอย่างตามวิธี R

1
การบูตสแตรปเป็นวิธีที่ถูกต้องในการประเมินความไม่แน่นอนของค่ามัธยฐานหรือไม่?
Bootstrapping ทำงานได้ดีในการเข้าถึงความไม่แน่นอนในการประมาณค่าเฉลี่ยอย่างไรก็ตามฉันจำได้ว่าการอ่าน bootstrap นั้นไม่ได้ผลดีในการประเมินความไม่แน่นอนในการประมาณแบบควอนไทล์ (โดยเฉพาะค่ามัธยฐาน) ฉันจำไม่ได้ว่าฉันอ่านตรงไหนและไม่สามารถหาอะไรได้มากมายจากการค้นหาโดย Google อย่างรวดเร็ว ความคิดเกี่ยวกับเรื่องนี้และการอ้างอิงใด ๆ จะได้รับการชื่นชมอย่างมาก

1
ค่าที่คาดหวังและความแปรปรวนของฟังก์ชันติดตาม
สำหรับตัวแปรสุ่มและเมทริกซ์กึ่งบวกแน่นอนA : มีการแสดงออกที่ง่ายสำหรับค่าที่คาดไว้\ mathop {\ mathbb E} [Tr (X ^ TAX)]และความแปรปรวน , Var [Tr (X ^ TAX)] ? โปรดทราบว่าAไม่ใช่ตัวแปรสุ่ม A E [ T r ( X T A X ) ] V a r [ T r ( X T A X ) ] AX∈RhX∈RhX \in \mathbb{R}^hAAAE[Tr(XTAX)]E⁡[Tr(XTAX)]\mathop {\mathbb E}[Tr(X^TAX)]Var[Tr(XTAX)]Var[Tr(XTAX)]Var[Tr(X^TAX)]AAA

5
เทคนิคการจัดกลุ่มที่เหมาะสมสำหรับข้อมูลชั่วคราวหรือไม่
ฉันมีข้อมูลชั่วคราวของความถี่กิจกรรม ฉันต้องการระบุกลุ่มในข้อมูลที่ระบุช่วงเวลาที่แตกต่างกับระดับกิจกรรมที่คล้ายกัน เป็นการดีที่ฉันต้องการระบุกลุ่มโดยไม่ต้องระบุจำนวนกลุ่มก่อน เทคนิคการจัดกลุ่มที่เหมาะสมคืออะไร หากคำถามของฉันมีข้อมูลไม่เพียงพอที่จะตอบชิ้นส่วนของข้อมูลที่ฉันต้องจัดหาเพื่อกำหนดเทคนิคการจัดกลุ่มที่เหมาะสมคืออะไร ด้านล่างนี้เป็นภาพประกอบของชนิดข้อมูล / การจัดกลุ่มที่ฉันจินตนาการ:

1
การได้รับ Negentropy ติดขัด
ดังนั้นคำถามนี้มีส่วนเกี่ยวข้องบ้าง แต่ฉันพยายามอย่างพยายามทำให้ตรงไปตรงมาที่สุด เป้าหมาย:เรื่องสั้นสั้น ๆ มีการกำเนิดของการปฏิเสธที่ไม่เกี่ยวข้องกับการสั่งซื้อที่สูงขึ้นและฉันพยายามที่จะเข้าใจว่ามันได้รับมาอย่างไร พื้นหลัง: (ฉันเข้าใจทั้งหมดนี้) ฉันศึกษาด้วยตนเองหนังสือ'การวิเคราะห์องค์ประกอบอิสระ'พบได้ที่นี่ (คำถามนี้มาจากหัวข้อ 5.6 ในกรณีที่คุณมีหนังสือ - 'การประมาณค่าเอนโทรปีของฟังก์ชันที่ไม่ใช่พหุนาม') เรามีซึ่งเป็นตัวแปรสุ่มและเราต้องการประมาณค่าลบจากการสังเกตบางอย่างที่เรามี รูปแบบไฟล์ PDF ของจะได้รับโดยซีตา) Negentropy เป็นเพียงความแตกต่างระหว่างเอนโทรปีค่าของตัวแปรสุ่มมาตรฐานเสียนและเอนโทรปีค่าของxเอนโทรปีของดิฟเฟอเรนเชียลได้รับจากเช่นนั้น:xxxxxxpx(ζ)px(ζ)p_x(\zeta)xxxHHH H(x)=−∫∞−∞px(ζ)log(px(ζ))dζH(x)=−∫−∞∞px(ζ)log(px(ζ))dζ H(x) = -\int_{-\infty}^{\infty} p_x(\zeta) \: log(p_x(\zeta)) \: d\zeta และดังนั้นการได้รับการปฏิเสธคือ J(x)=H(v)−H(x)J(x)=H(v)−H(x)J(x) = H(v) - H(x) ที่เป็นมาตรฐาน RV เสียนกับรูปแบบไฟล์ PDF ได้รับจากซีตา)vvvϕ(ζ)ϕ(ζ)\phi(\zeta) ตอนนี้ซึ่งเป็นส่วนหนึ่งของวิธีการใหม่นี้หนังสือของฉันได้รับการประมาณ PDF ของซึ่งได้รับจาก:xxx px(ζ)=ϕ(ζ)[1+∑iciFi(ζ)]px(ζ)=ϕ(ζ)[1+∑iciFi(ζ)] p_x(\zeta) = \phi(\zeta) [1 + \sum_{i} c_i …

3
องค์ประกอบของ PCA แสดงถึงความแปรปรวนจริง ๆ หรือไม่? พวกเขาสามารถรวมมากกว่า 100% ได้หรือไม่
"การเรียนรู้ของเครื่องสำหรับแฮ็กเกอร์" ของ O'Reilly กล่าวว่าองค์ประกอบหลักแต่ละรายการแสดงถึงเปอร์เซ็นต์ของความแปรปรวน ฉันได้อ้างอิงส่วนที่เกี่ยวข้องของหน้าด้านล่าง (บทที่ 8, p.207) เมื่อพูดกับผู้เชี่ยวชาญคนอื่นพวกเขาตกลงกันว่าเป็นเปอร์เซ็นต์ อย่างไรก็ตาม 24 องค์ประกอบรวมถึง 133.2095% นั่นเป็นอย่างไร เมื่อเราเชื่อมั่นว่าเราสามารถใช้ PCA ได้เราจะทำเช่นนั้นใน R อย่างไร อีกครั้งนี้เป็นสถานที่ที่ R ส่อง: PCA ทั้งหมดสามารถทำได้ในหนึ่งบรรทัดของรหัส เราใช้ฟังก์ชัน princomp เพื่อเรียกใช้ PCA: pca <- princomp(date.stock.matrix[,2:ncol(date.stock.matrix)]) หากเราเพียงพิมพ์ pca ลงใน R เราจะเห็นข้อมูลสรุปอย่างย่อขององค์ประกอบหลัก: Call: princomp(x = date.stock.matrix[, 2:ncol(date.stock.matrix)]) Standard deviations: Comp.1 Comp.2 Comp.3 Comp.4 Comp.5 Comp.6 Comp.7 …
13 r  pca 

3
การวัดมาตรฐานของความเป็นก้อนหรือไม่?
ฉันมีข้อมูลจำนวนมากและฉันต้องการทำสิ่งที่ดูเหมือนง่ายมาก ในชุดข้อมูลขนาดใหญ่นี้ฉันสนใจว่าองค์ประกอบเฉพาะรวมตัวกันเป็นจำนวนเท่าใด สมมติว่าข้อมูลของฉันเป็นชุดที่ได้รับคำสั่งดังนี้: {A, C, B, D, A, Z, T, C ... } สมมติว่าฉันต้องการทราบว่ามีแนวโน้มที่จะพบว่าติดกับแต่ละอื่น ๆ ซึ่งตรงข้ามกับการกระจายแบบสุ่ม (หรือมากกว่าอย่างสม่ำเสมอ) ตลอดทั้งชุด นี่คือคุณสมบัติที่ฉันเรียกว่า "clumpiness" ทีนี้มีการวัดง่ายๆของข้อมูล "clumpiness" หรือไม่? นั่นคือสถิติบางอย่างที่จะบอกฉันว่าห่างจากการกระจายแบบสุ่มเท่าไหร่? และถ้าไม่มีวิธีง่ายๆในการทำเช่นนี้สิ่งที่ยากจะเป็นอย่างไรประมาณ? คำแนะนำใด ๆ ชื่นชมอย่างมาก!

5
การประมาณค่าเปอร์เซ็นต์เป็นตัวแปรตามในการถดถอย
ฉันมีคะแนนร้อยละของนักเรียนในการสอบ 38 ครั้งเป็นตัวแปรตามในการศึกษาของฉัน เปอร์เซ็นต์อันดับจะคำนวณโดย (อันดับของนักเรียน / จำนวนนักเรียนในการสอบ) ตัวแปรตามนี้มีการกระจายเกือบสม่ำเสมอและฉันต้องการที่จะประเมินผลกระทบของตัวแปรบางอย่างในตัวแปรตาม ฉันใช้วิธีการถดถอยแบบใด

2
ฉันจะใช้ค่าของเพื่อทดสอบสมมติฐานเชิงเส้นในการวิเคราะห์การถดถอยแบบหลายค่าได้อย่างไร
กราฟด้านล่างเป็นแผนการกระจายที่เหลือของการทดสอบการถดถอยซึ่ง "ปกติ", "homoscedasticity" และ "อิสระ" สมมติฐานได้รับการพบอย่างแน่นอน! สำหรับการทดสอบสมมติฐาน"linearity"ถึงแม้ว่าโดยการดูที่กราฟสามารถคาดเดาได้ว่าความสัมพันธ์นั้นเป็นเส้นโค้ง แต่คำถามคือ: ค่าของ "R2 Linear" สามารถใช้ในการทดสอบสมมติฐานเชิงเส้นได้อย่างไร ช่วงที่ยอมรับได้สำหรับค่าของ "R2 Linear" คืออะไรเพื่อตัดสินใจว่าความสัมพันธ์นั้นเป็นเส้นตรงหรือไม่ จะทำอย่างไรเมื่อไม่ตรงตามสมมติฐานเชิงเส้นตรงและการแปลงค่า IV ก็ไม่ได้ช่วย !! นี่คือลิงค์ไปยังผลลัพธ์ทั้งหมดของการทดสอบ แผนการกระจาย:

6
แหล่งข้อมูลสำหรับการเรียนรู้วิธีการใช้วิธีการทั้งมวล
ฉันเข้าใจในทางทฤษฎี (เรียงลำดับ) ว่าพวกเขาจะทำงานอย่างไร แต่ฉันไม่แน่ใจว่าจะดำเนินการอย่างไรโดยใช้วิธีการรวมกลุ่ม (เช่นการออกเสียงลงคะแนนการผสมน้ำหนัก ฯลฯ ) แหล่งข้อมูลที่ดีสำหรับการใช้วิธีการทั้งมวลคืออะไร มีทรัพยากรเฉพาะเกี่ยวกับการนำไปใช้ใน Python หรือไม่? แก้ไข: เพื่อให้ชัดเจนขึ้นจากการอภิปรายในความคิดเห็นฉันไม่ได้มองหาอัลกอริทึมทั้งมวลเช่น randomForest เป็นต้น แต่ฉันสงสัยว่าคุณจะรวมการจำแนกประเภทที่แตกต่างจากอัลกอริทึมที่แตกต่างกันได้อย่างไร ตัวอย่างเช่นสมมติว่ามีคนใช้การถดถอยแบบลอจิสติก SVM และวิธีการอื่นในการทำนายระดับการสังเกตการณ์ เป็นวิธีที่ดีที่สุดในการไปเกี่ยวกับการประเมินที่ดีที่สุดของชั้นเรียนตามการคาดการณ์เหล่านี้คืออะไร?

4
ค้นหาภาพประกอบที่แท้จริงของคำพูดของชาวประมงเกี่ยวกับ DoE
ทีมของฉันและฉันอยากจะนำเสนอให้กับนักสถิติของ บริษัท เกี่ยวกับการออกแบบการทดลอง นักสถิติเหล่านี้ยังเป็นลูกค้าของเราและพวกเขามักจะไม่ปรึกษาเราก่อนรวบรวมข้อมูล คุณรู้หรือไม่ตัวอย่างจริงที่แสดงให้เห็นถึงการอ้างอิงที่มีชื่อเสียงของชาวประมง"ในการโทรหานักสถิติหลังจากการทดลองเสร็จสิ้นอาจไม่มากไปกว่าการขอให้เขาทำการตรวจชันสูตรศพ: เขาอาจจะบอกได้ว่าการทดลองเสียชีวิต ของ." ? โดยเฉพาะอย่างยิ่งเรากำลังมองหาภาพประกอบในบริบทอุตสาหกรรม / ยา / ชีวภาพ เราคิดว่าเป็นตัวอย่างของการวิเคราะห์ทางสถิติที่สรุปไม่ได้ซึ่งอาจประสบความสำเร็จหากได้รับการออกแบบมาเบื้องต้น แต่อาจมีภาพประกอบอื่น ๆ ที่เป็นไปได้

2
เหตุใดปัญหารกรุงรังจึงไม่สามารถทำได้สำหรับตัวอย่างขนาดใหญ่
สมมติว่าเรามีชุดของจุด\} แต่ละจุดถูกสร้างขึ้นโดยใช้การกระจาย เพื่อให้ได้มาซึ่งหลังสำหรับเราเขียน ตามที่กระดาษ Minka ฯ เมื่อวันที่คาดว่าจะมีการขยายพันธุ์ที่เราต้องการคำนวณที่จะได้รับหลังและดังนั้นปัญหาจะกลายเป็นยากสำหรับตัวอย่างที่มีขนาดใหญ่ขนาดNอย่างไรก็ตามฉันไม่สามารถเข้าใจได้ว่าทำไมเราถึงต้องคำนวณจำนวนนี้ในกรณีนี้เพราะสำหรับเดี่ยวy ฉัน p ( y i | x ) = 1y={y1,y2,…,yN}y={y1,y2,…,yN}\mathbf{y} = \{y_1, y_2, \ldots, y_N \}yiyiy_ixP(x|Y)αP(Y|x)P(x)=P(x) N Πฉัน=1P(Yฉัน|x) 2Np(x|y)Nyip(yi|x)=12N(x,1)+12N(0,10).p(yi|x)=12N(x,1)+12N(0,10). p(y_i| x) = \frac12 \mathcal{N}(x, 1) + \frac12 \mathcal{N}(0, 10). xxxp(x|y)∝p(y|x)p(x)=p(x)∏i=1Np(yi|x).p(x|y)∝p(y|x)p(x)=p(x)∏i=1Np(yi|x). p(x| \mathbf{y}) \propto p(\mathbf{y}| x) p(x) = p(x) \prod_{i = 1}^N p(y_i | …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.