สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
การกระจายตัวตัวอย่างของรัศมีของการแจกแจงแบบปกติ 2D
การกระจายปกติ bivariate ที่มีค่าเฉลี่ยและแปรปรวนเมทริกซ์Σสามารถเขียนอีกครั้งในพิกัดเชิงขั้วที่มีรัศมีRและมุมθ คำถามของฉันคือคือการกระจายตัวอย่างของสิ่งที่R , ที่อยู่, ระยะห่างจากจุดxไปยังศูนย์ประมาณˉ xได้รับตัวอย่างแปรปรวนเมทริกซ์S ?μμ\muΣΣ\Sigmarrrθθ\thetar^r^\hat{r}xxxx¯x¯\bar{x}SSS พื้นหลัง: ระยะทางจริงจากจุดxค่าเฉลี่ยμดังต่อไปนี้การกระจายฮอยต์ ด้วยค่าลักษณะเฉพาะλ 1 , λ 2ของΣและλ 1 > λ 2พารามิเตอร์รูปร่างของมันคือq = 1rrrxxxμμ\muλ1,λ2λ1,λ2\lambda_{1}, \lambda_{2}ΣΣ\Sigmaλ1>λ2λ1>λ2\lambda_{1} > \lambda_{2}และพารามิเตอร์ขนาดของมันคือω=λ1+λ2 ฟังก์ชันการแจกแจงสะสมเป็นที่รู้จักกันว่าเป็นความแตกต่างสมมาตรระหว่างสองฟังก์ชันของ Marcum Qq=1(λ1+λ2)/λ2)−1√q=1(λ1+λ2)/λ2)−1q=\frac{1}{\sqrt{(\lambda_{1}+\lambda_{2})/\lambda_{2})-1}}ω=λ1+λ2ω=λ1+λ2\omega = \lambda_{1} + \lambda_{2} การจำลองแสดงให้เห็นว่าการเสียบค่าประมาณและSสำหรับμและΣลงใน cdf จริงนั้นใช้ได้กับตัวอย่างขนาดใหญ่ แต่ไม่ใช่สำหรับตัวอย่างขนาดเล็ก แผนภาพต่อไปนี้แสดงผลลัพธ์จาก 200 ครั้งx¯x¯\bar{x}SSSμμ\muΣΣ\Sigma จำลอง 20 เวกเตอร์ปกติ 2 มิติสำหรับการรวมกันของ ( x -axis), ω (แถว) และควอนไทล์ …

1
เนื่องจากการแจกแจงเบต้ามีความคล้ายคลึงกันในรูปแบบทวินามทำไมเราจึงต้องการการกระจายเบต้า
ปรากฏว่าการแจกแจงทวินามนั้นคล้ายคลึงกันมากในรูปแบบของการแจกแจงแบบเบต้าและฉันสามารถกำหนดค่าคงที่อีกครั้งใน pdf ทั้งสองเพื่อให้พวกเขามีลักษณะเดียวกัน แล้วทำไมเราถึงต้องมีการแจกแจงเบต้า มันมีวัตถุประสงค์เฉพาะหรือไม่? ขอบคุณ!

1
การทดสอบฟรีดแมนกับการทดสอบวิลคอกซัน
ฉันพยายามประเมินประสิทธิภาพของอัลกอริทึมการจัดหมวดหมู่การเรียนรู้ของเครื่องภายใต้การดูแล ข้อสังเกตตกอยู่ในชั้นเรียนเล็กน้อย (2 ในขณะนี้ แต่ฉันต้องการที่จะพูดคุยเรื่องนี้กับปัญหาหลายชั้น) ที่ดึงมาจากประชากร 99 วิชา หนึ่งในคำถามที่ฉันต้องการจะตอบคือถ้าอัลกอริทึมแสดงความแตกต่างอย่างมีนัยสำคัญในความถูกต้องของการจำแนกประเภทระหว่างคลาสอินพุต สำหรับกรณีการจำแนกเลขฐานสองฉันกำลังเปรียบเทียบความแม่นยำหมายถึงระหว่างชั้นเรียนของอาสาสมัครโดยใช้การทดสอบWilcoxon ที่จับคู่ (เนื่องจากการแจกแจงแบบพื้นฐานไม่ใช่แบบปกติ) เพื่อพูดคุยขั้นตอนนี้กับปัญหาหลายชั้นฉันต้องการใช้แบบทดสอบฟรีดแมน อย่างไรก็ตามค่า p ที่ได้รับจากทั้งสองโพรซีเดอร์ในกรณีของไบนารี IV จะแตกต่างกันไปอย่างดุเดือดด้วยการทดสอบ Wilcoxon ที่ให้ผลp < .001ในขณะที่p = .25การทดสอบฟรีดแมน สิ่งนี้ทำให้ฉันเชื่อว่าฉันมีความเข้าใจผิดขั้นพื้นฐานเกี่ยวกับโครงสร้างของการทดสอบฟรีดแมน มันไม่เหมาะสมที่จะใช้การทดสอบฟรีดแมนในกรณีนี้เพื่อเปรียบเทียบผลของการวัดซ้ำของความถูกต้องในทุกวิชาหรือไม่ รหัส R ของฉันเพื่อรับผลลัพธ์เหล่านั้น ( subjectคือตัวระบุหัวเรื่อง, accความแม่นยำ DV และexpectedคลาสการสังเกต IV): > head(subject.accuracy, n=10) subject expected acc 1 10 none 0.97826087 2 10 high 0.55319149 3 …

1
คุณจะตรวจสอบการยศาสตร์ของกระบวนการสุ่มจากเส้นทางตัวอย่างได้อย่างไร?
คุณจะตรวจสอบความถูกต้องตามหลักสรีรศาสตร์ของกระบวนการสโตแคสติกที่อยู่กับที่จากฐานตัวอย่างได้อย่างไร เราสามารถตรวจสอบการยศาสตร์จากเส้นทางตัวอย่างเดียวได้หรือไม่? หรือเราต้องการตัวอย่างหลายเส้นทาง? แรงจูงใจหนึ่งในการตรวจสอบความถูกต้องตามหลักสรีรศาสตร์คือในอนุกรมเวลาเพื่อให้แน่ใจว่าคุณสามารถใช้ค่าเฉลี่ยของเส้นทางตัวอย่างเมื่อเวลาผ่านไปอย่างปลอดภัยตามค่าประมาณของประชากรโดยเฉลี่ย

1
การชี้แจงความคาดหวังสูงสุด
ผมพบว่าการกวดวิชาที่เป็นประโยชน์มากเกี่ยวกับอัลกอริทึม EM ตัวอย่างและรูปภาพจากบทช่วยสอนนั้นยอดเยี่ยมมาก คำถามที่เกี่ยวข้องเกี่ยวกับการคำนวณความน่าจะเป็นการเพิ่มความคาดหวังทำงานอย่างไร ฉันมีคำถามอื่นเกี่ยวกับวิธีการเชื่อมต่อทฤษฎีที่อธิบายในบทช่วยสอนกับตัวอย่าง gtgtg_tlogP(x;Θ)log⁡P(x;Θ)\log P(x;\Theta)gt(Θ^(t))=logP(x;Θ^(t))gt(Θ^(t))=log⁡P(x;Θ^(t))g_t( \hat{\Theta}^{(t)}) = \log P(x; \hat{\Theta}^{(t)}) gtgtg_t Θ^(0)A=0.6Θ^A(0)=0.6\hat{\Theta}_A^{(0)} = 0.6Θ^(0)B=0.5Θ^B(0)=0.5\hat{\Theta}_B^{(0)} = 0.5Θ^(1)A=0.71Θ^A(1)=0.71\hat{\Theta}_A^{(1)} = 0.71Θ^(1)B=0.58Θ^B(1)=0.58\hat{\Theta}_B^{(1)} = 0.58Θ^(0)Θ^(0)\hat{\Theta}^{(0)}Θ^(1)Θ^(1)\hat{\Theta}^{(1)} Q(z)Q(z)Q(z)Q(z)=P(z|x;Θ)Q(z)=P(z|x;Θ)Q(z)=P(z|x;\Theta) ขอบคุณ.

3
โมดูลาร์เครือข่ายของนิวแมนใช้งานได้กับกราฟน้ำหนักที่ลงนามแล้วหรือไม่?
ต้นแบบของกราฟถูกกำหนดไว้ในตัวหน้าวิกิพีเดีย ในการโพสต์ที่แตกต่างกันบางคนอธิบายว่า modularity สามารถคำนวณได้ง่าย (และขยายใหญ่สุด) สำหรับเครือข่ายที่มีน้ำหนักเนื่องจากเมทริกซ์ adjacencyสามารถมีความสัมพันธ์ที่มีคุณค่า อย่างไรก็ตามฉันต้องการทราบว่าสิ่งนี้จะใช้ได้กับขอบที่มีการเซ็นชื่อและมีค่าเช่นตั้งแต่ -10 ถึง +10 คุณสามารถให้สัญชาติญาณพิสูจน์หรืออ้างอิงถึงปัญหานี้ได้หรือไม่?AฉันเจAijA_{ij}

2
Laplace smoothing และ Dirichlet มาก่อน
ในบทความวิกิพีเดียเรื่อง Laplace smoothing (หรือการปรับให้เรียบขึ้น) กล่าวกันว่าจากมุมมองแบบเบย์ สิ่งนี้สอดคล้องกับค่าคาดหวังของการแจกแจงหลังโดยใช้การแจกแจง Dirichlet แบบสมมาตรพร้อมพารามิเตอร์เหมือนก่อนαα\alpha ฉันสับสนเกี่ยวกับความจริงที่ว่า ใครช่วยให้ฉันเข้าใจว่าทั้งสองสิ่งนั้นเท่ากัน? ขอบคุณ!

1
ฉันควรทำอย่างไรเมื่อค่าของ AIC ต่ำและใกล้เคียงกัน?
Chris Chatfield ซึ่งมีหนังสือและเอกสารคุณภาพมากมายที่ฉันชอบอ่านใน (1) ให้คำแนะนำต่อไปนี้: ตัวอย่างเช่นควรเลือกตัวเลือกระหว่างรุ่นอนุกรมเวลาของ ARIMA ที่มีค่า AIC ต่ำและประมาณเท่ากันโดยไม่เกิดขึ้นกับ AIC ขั้นต่ำ แต่จะให้การคาดการณ์ที่ดีที่สุดสำหรับข้อมูลล่าสุดของปีที่ผ่านมา เหตุผลสำหรับคำแนะนำดังกล่าวคืออะไร? หากเป็นเสียงเหตุใดการคาดการณ์ :: auto.arima และรูทีนการพยากรณ์อื่นจึงไม่ทำตาม ยังไม่ได้ใช้งาน? มันได้รับการกล่าวถึงที่นี่ว่าจะมองหารูปแบบที่เกิดขึ้นเพียงเพื่อให้ขั้นต่ำ AIC อาจจะไม่ได้เป็นความคิดที่ดี เหตุใดตัวเลือกในการมีโมเดล ARIMA ที่มีค่าต่ำ แต่ประมาณเท่ากัน (เช่นภายใน 1 หรือ 2 ค่าของ AIC ขั้นต่ำ) ไม่ได้เป็นค่าเริ่มต้นในซอฟต์แวร์การพยากรณ์อนุกรมเวลาส่วนใหญ่n≥1n≥1n\ge1 (1) Chatfield, C. (1991) หลีกเลี่ยงข้อผิดพลาดทางสถิติ วิทยาศาสตร์สถิติ, 6 (3), 240–252 ออนไลน์ที่มีอยู่ URL: https://projecteuclid.org/euclid.ss/1177011686

4
วิธีแก้ไขค่าสัมประสิทธิ์หนึ่งค่าและทำให้พอดีกับค่าอื่น ๆ
ฉันต้องการแก้ไขสัมประสิทธิ์บางอย่างด้วยตัวเองพูดแล้วพอดีสัมประสิทธิ์กับตัวทำนายอื่น ๆ ทั้งหมดในขณะที่รักษาβ 1 = 1.0ในโมเดลβ1= 1.0β1=1.0\beta_1=1.0β1= 1.0β1=1.0\beta_1=1.0 ฉันจะบรรลุสิ่งนี้โดยใช้ R ได้อย่างไร ฉันต้องการทำงานกับ LASSO ( glmnet) โดยเฉพาะอย่างยิ่งถ้าเป็นไปได้ อีกวิธีหนึ่งคือวิธีการที่ฉันสามารถ จำกัด ค่าสัมประสิทธิ์นี้ในช่วงที่เฉพาะเจาะจงบอกว่า ?0.5 ≤ บีตา1≤ 1.00.5≤β1≤1.00.5\le\beta_1\le1.0

2
มันหมายความว่าอย่างไรเมื่อทุกขอบในเครือข่าย / กราฟในโลกแห่งความเป็นจริงมีความเป็นไปได้ที่จะเกิดขึ้นโดยบังเอิญ
ฉันใช้วิธีการแยกเครือข่ายกระดูกสันหลังที่ระบุไว้ในบทความนี้: http://www.pnas.org/content/106/16/6483.abstract โดยทั่วไปผู้เขียนเสนอวิธีการตามสถิติที่ก่อให้เกิดความน่าจะเป็นสำหรับแต่ละขอบของกราฟที่เกิดขึ้นโดยบังเอิญ ฉันใช้การตัดนัยสำคัญทางสถิติทั่วไปที่ 0.05 ฉันใช้วิธีนี้กับเครือข่ายในโลกแห่งความจริงหลายแห่งและบางเครือข่ายก็น่าสนใจที่ไม่มีอะไรจะสำคัญ ฉันพยายามที่จะเข้าใจว่าสิ่งนี้เกี่ยวข้องกับเครือข่าย เวลาอื่นที่ฉันใช้วิธีการกับเครือข่ายและไม่มีขอบออกมาเป็นสำคัญคือเมื่อฉันใช้วิธีการกับเครือข่ายแบบสุ่มที่ฉันสร้างขึ้นซึ่งเป็นสิ่งที่เราคาดหวัง ในฐานะที่เป็นตัวอย่างเครือข่ายโลกแห่งความจริงคุณอาจเห็นภาพเครือข่ายล่าสุดที่เกิดขึ้นกับนักเศรษฐศาสตร์ซึ่งแสดงให้เห็นถึงการแบ่งขั้วของวุฒิสภาสหรัฐอเมริกาในช่วง 25 ปีที่ผ่านมา: http://www.economist.com/news/united-states/21591190 -United ฉันใช้วิธีการแยกเครือข่ายกระดูกสันหลังกับเครือข่ายเหล่านั้นและไม่มีขอบปรากฏขึ้นอย่างมีนัยสำคัญ ถึงแม้ว่าขอบดิบจะแสดงสิ่งที่แนบและการจัดกลุ่มแบบพิเศษ แต่ก็เป็นไปได้หรือไม่ เครือข่ายการลงคะแนนของวุฒิสภาเป็นแบบสุ่มหรือไม่

2
อธิบายวิธีการทั่วไปของช่วงเวลาให้กับผู้ที่ไม่ใช่นักสถิติ
ฉันจะอธิบายวิธีการทั่วไปในช่วงเวลาและวิธีการที่ใช้กับนักสถิติที่ไม่ใช่? จนถึงตอนนี้ฉันจะไปด้วย: มันเป็นสิ่งที่เราใช้ในการประเมินเงื่อนไขเช่นค่าเฉลี่ยและการเปลี่ยนแปลงตามตัวอย่างที่เรารวบรวม ฉันจะอธิบายส่วนที่คุณประเมินเวกเตอร์พารามิเตอร์โดยการลดความแปรปรวนได้อย่างไร

1
วิธีการคำนวณค่าเฉลี่ยและค่าเบี่ยงเบนมาตรฐานสำหรับการแจกแจงแบบปกติโดยใช้ 2 เปอร์เซนต์
ฉันพยายามคำนวณค่าเฉลี่ยและส่วนเบี่ยงเบนมาตรฐานจาก 2 เปอร์เซนต์สำหรับการแจกแจงล็อกนอร์มอล ฉันประสบความสำเร็จในการคำนวณสำหรับการแจกแจงแบบปกติโดยใช้X = mean + sd * Zและการหาค่าเฉลี่ยและ sd ฉันคิดว่าฉันขาดสมการเมื่อพยายามทำแบบเดียวกันกับการแจกแจงแบบล็อกนอร์มัล ฉันดูวิกิพีเดียและพยายามใช้ln(X) = mean + sd * Zแต่ฉันสับสนว่าค่าเฉลี่ยและ sd ในกรณีนี้เป็นการแจกแจงแบบปกติหรือ lognormal ฉันควรใช้สมการใด และฉันจะต้องมากกว่า 2 เปอร์เซ็นต์เพื่อแก้การคำนวณ?
11 r  lognormal 

2
การแจกแจงผลรวมของกำลังสองของตัวแปรสุ่มแบบกระจาย T
ฉันกำลังมองหาที่การกระจายตัวของผลรวมของสี่เหลี่ยมของตัวแปรสุ่ม T-กระจายที่มีหางตัวแทนααα\alphaที่ X คือ RV ที่ฟูเรียร์สำหรับX2X2X^2 , F(t)F(t)\mathscr{F}(t)ทำให้ผมมีวิธีแก้ปัญหาสำหรับตารางก่อนที่จะบิดF(t)nF(t)n\mathscr{F}(t)^n n F(t)=∫∞0exp(itx2)⎛⎝⎜⎜⎜(αα+x2)α+12α−−√ B(α2,12)⎞⎠⎟⎟⎟dxF(t)=∫0∞exp⁡(itx2)((αα+x2)α+12α B(α2,12))dx\mathscr{F}(t)=\int_0^{\infty } \exp \left(i\, t\, x^2\right)\left(\frac{\left(\frac{\alpha }{\alpha +x^2}\right)^{\frac{\alpha +1}{2}} }{\sqrt{\alpha }\ B\left(\frac{\alpha }{2},\frac{1}{2}\right)}\right) \, \mathrm{d}x ด้วยα=3α=3\alpha=3 , การแก้ปัญหาเป็นไปได้ แต่เทอะทะและไม่สามารถที่จะผกผันที่จะทำสิ่งที่ตรงกันข้ามฟูริเยร์สำหรับF(t)nF(t)n\mathscr{F}(t)^n n ดังนั้นคำถามคือ: มีการทำงานกับการแจกแจงความแปรปรวนตัวอย่างหรือค่าเบี่ยงเบนมาตรฐานของตัวแปรสุ่มแบบกระจายทีหรือไม่? (สำหรับนักศึกษา T สิ่ง Chi-square คือไปยังเกาส์เซียน) ขอบคุณ. (วิธีแก้ปัญหาที่เป็นไปได้) ฉันพบว่าX2X2X^2คือฟิชเชอร์F(1,α)F(1,α)F(1,\alpha)กระจายดังนั้นจะดูที่ผลรวมของตัวแปรกระจายฟิชเชอร์ (วิธีแก้ปัญหาที่เป็นไปได้) จากฟังก์ชั่นลักษณะค่าเฉลี่ยของ summed X 2 มีช่วงเวลาเดียวกันสองช่วงแรกของการแจกแจงแบบF ( n , …

2
เหตุใดการใช้ข้อมูลแบบตัดขวางเพื่อสรุป / ทำนายการเปลี่ยนแปลงตามยาวของสิ่งที่ไม่ดี
ฉันกำลังมองหากระดาษที่ฉันหวังว่าจะมีอยู่ แต่ไม่รู้ว่ามันจะเป็นอย่างไร มันอาจเป็นชุดของกรณีศึกษาและ / หรือข้อโต้แย้งจากทฤษฎีความน่าจะเป็นเกี่ยวกับสาเหตุที่ใช้ข้อมูลภาคตัดขวางในการอนุมาน / ทำนายการเปลี่ยนแปลงตามยาวอาจเป็นสิ่งที่ไม่ดี (เช่นนั้นไม่จำเป็น ฉันได้เห็นความผิดพลาดที่เกิดขึ้นในสองวิธีใหญ่ ๆ : การอนุมานนั้นเกิดขึ้นเพราะคนที่ร่ำรวยกว่าในอังกฤษเดินทางมากขึ้นจากนั้นเมื่อสังคมได้รับความนิยมมากขึ้นประชากรโดยรวมจะเดินทางมากขึ้น การอนุมานนั้นกลายเป็นเรื่องจริงเป็นระยะเวลานานกว่าทศวรรษ และรูปแบบที่คล้ายคลึงกันกับการใช้ไฟฟ้าในประเทศ: ข้อมูลแบบภาคตัดขวางหมายถึงการเพิ่มขึ้นอย่างมากของรายได้ซึ่งไม่ได้เกิดขึ้นตามกาลเวลา มีหลายสิ่งที่เกิดขึ้นรวมถึงผลกระทบของหมู่และข้อ จำกัด ด้านอุปทาน มันจะมีประโยชน์มากที่จะมีการอ้างอิงเดียวที่รวบรวมกรณีศึกษาเช่นนั้น และ / หรือใช้ทฤษฎีความน่าจะเป็นเพื่อแสดงให้เห็นว่าเหตุใดการใช้ข้อมูลภาคตัดขวางเพื่ออนุมาน / ทำนายการเปลี่ยนแปลงระยะยาวอาจทำให้เข้าใจผิดได้มาก มีกระดาษชนิดนี้อยู่หรือไม่ถ้าอย่างนั้นมันคืออะไร?

7
คุณจะอธิบายความสำคัญทางสถิติต่อผู้ที่ไม่มีพื้นฐานทางสถิติได้อย่างไร
ที่มา: ฉันต้องทำการวิเคราะห์ข้อมูลสำหรับลูกค้า (ทนายความบางประเภท) ซึ่งเป็นผู้เริ่มต้นแน่นอนในสถิติ เขาถามฉันว่าคำว่า "นัยสำคัญทางสถิติ" หมายถึงอะไรและฉันพยายามอธิบายจริงๆ ... แต่เนื่องจากฉันไม่เก่งในการอธิบายสิ่งที่ฉันล้มเหลว;)

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.