สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
ฉันจะเปรียบเทียบ 2 วิธีที่มีการกระจาย Laplace ได้อย่างไร
ฉันต้องการเปรียบเทียบ 2 ตัวอย่างหมายถึงผลตอบแทน 1 นาที ฉันคิดว่าพวกเขากระจาย Laplace (ตรวจสอบแล้ว) และฉันแบ่งผลตอบแทนออกเป็น 2 กลุ่ม ฉันจะตรวจสอบว่ามีความแตกต่างอย่างมีนัยสำคัญได้อย่างไร ฉันคิดว่าฉันไม่สามารถปฏิบัติต่อพวกเขาเหมือนการแจกแจงแบบปกติเพราะแม้ว่าพวกเขาจะมีค่ามากกว่า 300 ค่า แต่ QQ-plot แสดงให้เห็นว่ามีความแตกต่างอย่างมากกับการกระจายแบบปกติ

1
ทำไมส่วนประกอบทั้งหมดของ PLS จึงอธิบายเพียงส่วนหนึ่งของความแปรปรวนของข้อมูลต้นฉบับเท่านั้น
ฉันมีชุดข้อมูลซึ่งประกอบด้วยตัวแปร 10 ตัว ฉันวิ่งสี่เหลี่ยมน้อยที่สุดบางส่วน (PLS) เพื่อทำนายตัวแปรการตอบสนองเดียวโดยตัวแปร 10 ตัวเหล่านี้แยกส่วนประกอบ 10 PLS แล้วคำนวณความแปรปรวนของแต่ละองค์ประกอบ จากข้อมูลเดิมฉันได้รวมผลต่างของตัวแปรทั้งหมดซึ่งก็คือ 702 จากนั้นฉันก็แบ่งความแปรปรวนของส่วนประกอบ PLS แต่ละตัวด้วยผลรวมนี้เพื่อให้ได้เปอร์เซ็นต์ของความแปรปรวนที่อธิบายโดย PLS และส่วนประกอบทั้งหมดด้วยกันน่าประหลาดใจเพียงอธิบาย 44% ของความแปรปรวนดั้งเดิม คำอธิบายของสิ่งนั้นคืออะไร? ไม่ควรจะเป็น 100%

1
Kriging Interpolation ทำงานอย่างไร
ฉันกำลังทำงานกับปัญหาที่ฉันต้องใช้ Kriging เพื่อทำนายค่าของตัวแปรบางตัวตามตัวแปรโดยรอบบางตัว ฉันต้องการติดตั้งรหัสด้วยตนเอง ดังนั้นฉันจึงต้องอ่านเอกสารมากเกินไปเพื่อให้เข้าใจว่ามันทำงานอย่างไร แต่ฉันก็สับสนมาก โดยทั่วไปฉันเข้าใจว่ามันเป็นค่าเฉลี่ยถ่วงน้ำหนัก แต่ฉันไม่เข้าใจกระบวนการคำนวณน้ำหนักอย่างสมบูรณ์จากนั้นจึงทำนายค่าของตัวแปร ทุกคนสามารถอธิบายให้ฉันในแง่ง่ายด้านคณิตศาสตร์ของวิธีการแก้ไขนี้และวิธีการทำงานหรือไม่

1
ทำไมสัดส่วนตัวอย่างถึงไม่มีการกระจายแบบทวินาม
ในการตั้งค่าทวินามตัวแปรสุ่ม X ที่ให้จำนวนความสำเร็จนั้นมีการแจกแจงแบบทวินาม สัดส่วนตัวอย่างสามารถคำนวณได้เป็นโดยที่คือขนาดตัวอย่างของคุณ ตำราของฉันระบุว่าXnXn\frac{X}{n}nnn สัดส่วนนี้ไม่ได้มีการกระจายทวินาม แต่ตั้งแต่เป็นเพียงรุ่นปรับขนาดของการกระจาย binomially ตัวแปรสุ่มไม่ควรก็ยังมีการกระจายทวินาม?XnXn\frac{X}{n}XXX

4
ถูกต้องหรือไม่ (การสร้าง Truncated-norm-multivariate-Gaussian)
ถ้า นั่นคือ X∈Rn, X∼N(0–,σ2I)X∈Rn, X∼N(0_,σ2I)X\in\mathbb{R}^n,~X\sim \mathcal{N}(\underline{0},\sigma^2\mathbf{I})fX(x)=1(2πσ2)n/2exp(−||x||22σ2)fX(x)=1(2πσ2)n/2exp⁡(−||x||22σ2) f_X(x) = \frac{1}{{(2\pi\sigma^2)}^{n/2}} \exp\left(-\frac{||x||^2}{2\sigma^2}\right) ฉันต้องการการแจกแจงแบบปกติที่ถูกตัดทอนในกรณีแบบหลายตัวแปร แม่นยำมากขึ้นฉันต้องการสร้างเกณฑ์ปกติ (ค่า ) หลายตัวแปร Gaussianเซนต์ โดยที่≥a≥a\geq aYYYfY(y)={c.fX(y), if ||y||≥a0, otherwise .fY(y)={c.fX(y), if ||y||≥a0, otherwise . f_Y(y) = \begin{cases} c.f_X(y), \text{ if } ||y||\geq a \\[2mm] 0, \text{ otherwise }. \end{cases} c=1Prob{||X||≥a}c=1Prob{||X||≥a}c=\frac{1}{Prob\big\{||X||\geq a\big\}} ตอนนี้ฉันสังเกตต่อไปนี้: หาก ,x=(x1,x2,…,xn)x=(x1,x2,…,xn)x=(x_1,x_2,\ldots,x_n)||x||≥a||x||≥a||x||\geq a ⟹|xn|≥T≜max(0,(a2−∑n−11x2i))−−−−−−−−−−−−−−−−−−−−√⟹|xn|≥T≜max(0,(a2−∑1n−1xi2))\implies |x_n|\geq T\triangleq …

2
การสั่งซื้อแบบนูนหมายถึงการครอบงำทางด้านขวาหรือไม่?
ให้สองการแจกแจงแบบต่อเนื่องและ , มันไม่ชัดเจนสำหรับฉันว่าความสัมพันธ์ของการปกครองนูนในหมู่พวกเขา:FXFX\mathcal{F}_XFYFY\mathcal{F}_Y (0)FX&lt;cFY(0)FX&lt;cFY(0)\quad \mathcal{F}_X <_c \mathcal{F}_Y หมายความว่า (1)F−1Y(q)≤F−1X(q),∀q∈[0.5,1](1)FY−1(q)≤FX−1(q),∀q∈[0.5,1](1)\quad F_Y^{-1}(q) \leq F_X^{-1}(q),\quad \forall q\in[0.5,1] ถือหรือถ้ามีสมมติฐานเพิ่มเติมที่จำเป็นหากจะถือ?(1)(1)(1) นิยามของการปกครองแบบนูน หากการกระจายอย่างต่อเนื่องสองครั้งและพึงพอใจ:FXFX\mathcal{F}_XFYFY\mathcal{F}_Y (2)F−1YFX(x) is convex in x(2)FY−1FX(x) is convex in x(2)\quad F_Y^{-1}F_X(x)\text{ is convex in } x [0] จากนั้นเราเขียน: FX&lt;cFYFX&lt;cFYF_X <_c F_Y และบอกว่าที่ถูกต้องมากขึ้นกว่าเบ้\เนื่องจากและคือการแจกแจงความน่าจะเป็นก็หมายความว่าอนุพันธ์ของเป็นการลดความและไม่ใช่เชิงลบ [1], คือนูน [2],และข้ามกันอย่างมากสองครั้ง [2] และ [2] สำหรับ :FYFY\mathcal{F}_YFXFX\mathcal{F}_XFXFXF_XFYFYF_Y(2)(2)(2)F−1YFX(x)FY−1FX(x)F_Y^{-1}F_X(x)F−1YFX(x)−xFY−1FX(x)−xF_Y^{-1}F_X(x)-xFXFXF_XFaY+bFaY+bF_{aY+b} ∀ p ∈ [ …

2
การชั่งน้ำหนักเป็นไปตามความแม่นยำ (เช่นการแปรผกผัน) เป็นส่วนสำคัญของการวิเคราะห์อภิมาน
การชั่งน้ำหนักตามความแม่นยำเป็นศูนย์กลางของการวิเคราะห์เมตาหรือไม่ Borenstein และคณะ (2009) เขียนว่าสำหรับการวิเคราะห์อภิมานเป็นไปได้ทั้งหมดที่จำเป็นคือ: การศึกษารายงานการประเมินจุดที่สามารถแสดงเป็นตัวเลขเดียว ความแปรปรวนสามารถคำนวณได้สำหรับการประเมินจุดนั้น ไม่ชัดเจนสำหรับฉันทันทีว่าทำไม (2) จำเป็นอย่างยิ่ง แต่ที่จริงแล้ววิธีการวิเคราะห์เมตาดาต้าที่ได้รับการยอมรับอย่างกว้างขวางทั้งหมดนั้นขึ้นอยู่กับแผนการชั่งน้ำหนักที่มีความแม่นยำ (เช่นความแปรปรวนผกผัน) ซึ่งต้องการการประมาณความแปรปรวนสำหรับขนาดผลการศึกษาของแต่ละคน โปรดทราบว่าในขณะที่วิธีการของ Hedges (Hedges &amp; Olkin, 1985; Hedges &amp; Vevea, 1998) และวิธีของ Hunter and Schmidt (Hunter &amp; Schmidt, 2004) โดยทั่วไปใช้การถ่วงน้ำหนักขนาดตัวอย่างวิธีการเหล่านี้ใช้เฉพาะกับความแตกต่างของค่าเฉลี่ย ค่าเบี่ยงเบนมาตรฐานที่อื่น มันทำให้รู้สึกว่าน้ำหนักแปรผกผันกับความแปรปรวนในการศึกษาแต่ละครั้งจะลดความแปรปรวนในการประมาณขนาดผลกระทบโดยรวมดังนั้นรูปแบบการให้น้ำหนักนี้เป็นคุณสมบัติที่จำเป็นของวิธีการทั้งหมดหรือไม่? เป็นไปได้หรือไม่ที่จะทำการตรวจสอบอย่างเป็นระบบโดยไม่ต้องเข้าถึงความแปรปรวนของขนาดเอฟเฟกต์แต่ละขนาดและยังคงเรียกผลลัพธ์ว่าเป็นการวิเคราะห์อภิมาน ขนาดตัวอย่างดูเหมือนจะมีศักยภาพในฐานะพร็อกซีเพื่อความแม่นยำเมื่อความแปรปรวนไม่พร้อมใช้งาน ยกตัวอย่างเช่นเราสามารถใช้น้ำหนักตัวอย่างขนาดหนึ่งในการศึกษาที่กำหนดขนาดเอฟเฟกต์เป็นความแตกต่างของค่าเฉลี่ยดิบหรือไม่ สิ่งนั้นจะส่งผลต่อความสอดคล้องและประสิทธิภาพของขนาดผลเฉลี่ยที่ได้อย่างไร

1
โมเดลเมทริกซ์สำหรับโมเดลเอฟเฟกต์ผสม
ในlmerฟังก์ชั่นภายในlme4ในRมีการเรียกร้องให้สร้างเมทริกซ์รูปแบบของผลกระทบสุ่มตามที่อธิบายไว้ที่นี่ , หน้า 7-9ZZZ คำนวณ entails KhatriRao และ / หรือผลิตภัณฑ์ Kronecker สองเมทริกซ์และx_i J i X iZZZJผมJผมJ_iXผมXผมX_i เมทริกซ์เป็นคำหนึ่ง: "เมทริกซ์ตัวบ่งชี้ของดัชนีปัจจัยการจัดกลุ่ม" แต่ดูเหมือนว่าจะเป็นเมทริกซ์เบาบางที่มีการเข้ารหัสแบบดัมมี่เพื่อเลือกหน่วย (ตัวอย่างเช่นอาสาสมัครในการวัดซ้ำ) ที่สอดคล้องกับระดับลำดับขั้นสูง การสังเกตใด ๆ เมทริกซ์ที่ดูเหมือนว่าจะทำหน้าที่เป็นตัวเลือกของการวัดในระดับที่ต่ำกว่าลำดับชั้นเพื่อให้การรวมกันของทั้งสอง "เตอร์" จะให้ผลผลิตเมทริกซ์,ของแบบฟอร์มแสดงในกระดาษผ่านตัวอย่างต่อไปนี้:X i Z iJผมJผมJ_iXผมXผมX_iZผมZผมZ_i (f&lt;-gl(3,2)) [1] 1 1 2 2 3 3 Levels: 1 2 3 (Ji&lt;-t(as(f,Class="sparseMatrix"))) 6 x 3 sparse Matrix of class "dgCMatrix" …

2
ทำไมต้องใช้ Durbin-Watson แทนการทดสอบความสัมพันธ์อัตโนมัติ
การทดสอบ Durbin-Watson จะทดสอบความสัมพันธ์แบบอัตโนมัติของส่วนที่เหลือที่ล่าช้า 1 แต่จะทำการทดสอบความสัมพันธ์แบบอัตโนมัติที่ความล่าช้า 1 โดยตรง นอกจากนี้คุณสามารถทดสอบความสัมพันธ์อัตโนมัติที่ lag 2,3,4 และมีการทดสอบ portmanteau ที่ดีสำหรับการ autocorrelation ที่ความล่าช้าหลายครั้งและรับกราฟที่ดีและตีความง่าย [เช่นฟังก์ชัน acf () ใน R] Durbin-Watson นั้นไม่เข้าใจง่ายและมักให้ผลลัพธ์ที่สรุปไม่ได้ ดังนั้นทำไมจึงใช้ นี่เป็นแรงบันดาลใจจากคำถามนี้เกี่ยวกับความไม่ลงรอยกันของการทดสอบ Durbin-Watson บางอย่าง แต่แยกออกจากกันอย่างชัดเจน

2
นอกเหนือจาก Durbin-Watson แล้วการทดสอบสมมติฐานใดบ้างที่สามารถสร้างผลลัพธ์ที่สรุปไม่ได้?
สถิติทดสอบ Durbin-Watsonสามารถนอนในภูมิภาคที่สรุปไม่ได้ที่มันเป็นไปไม่ได้อย่างใดอย่างหนึ่งที่จะปฏิเสธหรือล้มเหลวที่จะปฏิเสธสมมติฐาน (ในกรณีนี้ศูนย์อัต) การทดสอบทางสถิติอื่นใดที่สามารถให้ผลลัพธ์ที่ "สรุปไม่ได้"? มีคำอธิบายทั่วไป (การโบกมือเป็นไร) เพราะเหตุใดชุดทดสอบนี้จึงไม่สามารถทำการตัดสินใจไบนารี "ปฏิเสธ" / "ไม่สามารถปฏิเสธ" ได้? มันจะเป็นโบนัสถ้ามีใครสามารถพูดถึงผลกระทบของการตัดสินใจเชิงทฤษฎีซึ่งเป็นส่วนหนึ่งของคำตอบของพวกเขาในแบบสอบถามหลัง - การมีหมวดหมู่เพิ่มเติมของข้อสรุป (ใน) หมายความว่าเราต้องพิจารณาค่าใช้จ่ายของ Type I และ Type II ข้อผิดพลาดในวิธีที่ซับซ้อนมากขึ้น?

1
แยกแยะระหว่างเอฟเฟกต์ระยะสั้นและระยะยาว
ฉันอ่านบทความต่อไปนี้ในกระดาษ: ความจริงที่ว่ามีความแตกต่างระหว่างค่าสัมประสิทธิ์ระยะสั้นและระยะยาวเป็นผลมาจากข้อกำหนดของเราซึ่งรวมถึงตัวแปรภายนอกที่ล่าช้า พวกเขาใช้การถดถอยในความแตกต่างแรกและรวมถึงความล่าช้าของตัวแปรตาม ตอนนี้พวกเขาโต้แย้งว่าถ้าคุณดูการประมาณค่า (เช่นเรียกการประมาณนี้ว่า ) จากผลลัพธ์นั่นคือผลระยะสั้นของต่อตัวแปรตาม นอกจากนี้พวกเขายืนยันว่าการดูที่ / (1 - การประเมินความล่าช้า) ให้ผลระยะยาวของ p กับตัวแปรตามพีพีpพีพีpพีพีp สามารถดูเอกสารได้ที่: https://www.ecb.europa.eu/pub/pdf/scpwps/ecbwp1328.pdfและการอภิปรายเกี่ยวกับผลกระทบระยะสั้น / ยาวในหน้า 20 ในเชิงอรรถ 23 ฉันไม่เข้าใจว่าทำไมคุณสามารถแยกแยะความแตกต่างระหว่างเอฟเฟ็กต์ระยะสั้นและระยะยาวของกับตัวแปรตาม หากมีคนอธิบายความคิดของพวกเขาให้ละเอียดยิ่งขึ้นมันก็จะมีประโยชน์มากพีพีp

1
ฟังก์ชันความน่าจะเป็นที่ได้รับสำหรับ IV-probit
ดังนั้นฉันจึงมีรูปแบบไบนารี่โดยที่เป็นตัวแปรที่ไม่ซ่อนเร้นและข้อสังเกต กำหนดและจึงเป็นเครื่องมือของฉัน ดังนั้นในระยะสั้นรูปแบบคือ เนื่องจากข้อกำหนดข้อผิดพลาดไม่ขึ้นกับ แต่ ฉันใช้ประโยชน์จากรุ่น IV-probity∗1y1∗y_1^*y1∈{0,1}y1∈{0,1}y_1 \in \{0,1\}y2y2y_2y1y1y_1z2z2z_2y∗1y2y1===δ1z1+α1y2+u1δ21z1+δ22z2+v2=zδ+v21[y∗&gt;0]y1∗=δ1z1+α1y2+u1y2=δ21z1+δ22z2+v2=zδ+v2y1=1[y∗&gt;0]\begin{eqnarray} y_1^*&=& \delta_1 z_1 + \alpha_1 y_2 + u_1 \\ y_2 &=& \delta_{21} z_1 + \delta_{22}z_2 + v_2 = \textbf{z}\delta + v_2 \\ y_1 &=& \text{1}[y^*>0] \end{eqnarray}(u1v2)∼N(0,[1ηητ2]).(u1v2)∼N(0,[1ηητ2]).\begin{eqnarray} \begin{pmatrix} u_1 \\ v_2 \end{pmatrix} \sim \mathcal{N} \left(\textbf{0} \; , \begin{bmatrix} 1 &\eta \\ \eta …

1
ชี้แจงเกี่ยวกับการอ่านคำย่อ
ต่อไปนี้เป็น Nomogram ที่สร้างขึ้นจากชุดข้อมูล mtcars พร้อมแพ็กเกจ rms สำหรับสูตร: mpg ~ wt + am + qsec ตัวแบบนั้นดูดีด้วย R2 ที่ 0.85 และ P &lt;0.00001 &gt; mod Linear Regression Model ols(formula = mpg ~ wt + am + qsec, data = mtcars) Model Likelihood Discrimination Ratio Test Indexes Obs 32 LR chi2 60.64 R2 …

1
การอ้างอิง: ส่วนท้ายของ c ผกผัน
ฉันเกือบจะแน่ใจว่าฉันได้เห็นผลลัพธ์ต่อไปนี้ในสถิติ แต่ฉันจำไม่ได้ว่าอยู่ที่ไหน ถ้าเป็นตัวแปรสุ่มแบบบวกและดังนั้นเมื่อโดยที่คือ CDF ของXE ( X ) &lt; ∞ ε F - 1 ( 1 - ε ) → 0 ε → 0 + F XXXXE(X)&lt;∞E(X)&lt;∞\mathbb{E}(X)<\inftyεF−1(1−ε)→0εF−1(1−ε)→0\varepsilon F^{-1}(1-\varepsilon) \to 0ε→0+ε→0+\varepsilon\to 0^+FFFXXX นี้เป็นเรื่องง่ายที่จะเห็นทางเรขาคณิตโดยใช้ความเสมอภาคและโดยพิจารณาตัดแนวนอนที่ของพื้นที่ใต้เส้นโค้งของ integrand 1-Fε 1 - FE(X)=∫1−FE(X)=∫1−F\mathbb{E}(X)=\int 1-Fεε\varepsilon1−F1−F1-F คุณรู้จักการอ้างอิงสำหรับผลลัพธ์นี้และมีชื่อหรือไม่

4
วิธีหลีกเลี่ยงคำ log (0) ในการถดถอย
ฉันติดตามเวกเตอร์ X และ Y อย่างง่าย: &gt; X [1] 1.000 0.063 0.031 0.012 0.005 0.000 &gt; Y [1] 1.000 1.000 1.000 0.961 0.884 0.000 &gt; &gt; plot(X,Y) ฉันต้องการทำการถดถอยโดยใช้บันทึกของ X เพื่อหลีกเลี่ยงการบันทึก (0) ฉันพยายามใส่ +1 หรือ +0.1 หรือ +0.00001 หรือ +0.000000000000001: &gt; summary(lm(Y~log(X))) Error in lm.fit(x, y, offset = offset, singular.ok = singular.ok, …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.