สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
การติดตั้งโมเดลเชิงเส้นตรงแบบเฮเทอโรเซสติกสำหรับการตอบสนองแบบทวินาม
ผมมีข้อมูลจากการออกแบบการทดลองต่อไปนี้: ข้อสังเกตของฉันมีการนับจำนวนของตัวเลขของความสำเร็จ (คนK) ออกจากจำนวนของการทดลอง (ตรงN) วัดสองกลุ่มแต่ละประกอบด้วยIบุคคลจากTการรักษาที่ในแต่ละชุดปัจจัยดังกล่าวมีRการทำซ้ำ . ดังนั้นทั้งหมดที่ฉันมี 2 * I * T * R K 'และสอดคล้องN ' s ข้อมูลมาจากชีววิทยา แต่ละคนเป็นยีนที่ฉันวัดระดับการแสดงออกของสองรูปแบบทางเลือก (เนื่องจากปรากฏการณ์ที่เรียกว่าการประกบทางเลือก) ดังนั้นKคือระดับการแสดงออกของหนึ่งในรูปแบบและNคือผลรวมของระดับการแสดงออกของทั้งสองรูปแบบ ตัวเลือกระหว่างสองรูปแบบในสำเนาที่แสดงออกเพียงครั้งเดียวถือว่าเป็นการทดลองของ Bernoulli ดังนั้นKจากNสำเนาตามทวินาม แต่ละกลุ่มประกอบด้วยยีนที่แตกต่างกัน ~ 20 และยีนในแต่ละกลุ่มมีหน้าที่ทั่วไปซึ่งแตกต่างกันระหว่างสองกลุ่ม สำหรับยีนแต่ละตัวในแต่ละกลุ่มฉันมีการวัดประมาณ 30 ตัวอย่างจากแต่ละเนื้อเยื่อที่แตกต่างกัน (การรักษา) ฉันต้องการประเมินผลกระทบที่กลุ่มและการรักษามีต่อความแปรปรวนของ K / N การแสดงออกของยีนเป็นที่รู้กันว่า overdispersed ดังนั้นการใช้ทวินามลบในรหัสด้านล่าง เช่นRรหัสของข้อมูลจำลอง: library(MASS) set.seed(1) I = 20 # individuals in …

1
ช่วงความเชื่อมั่นสำหรับผลการรักษาโดยเฉลี่ยจากน้ำหนักคะแนนความชอบ?
ฉันพยายามที่จะประเมินผลการรักษาโดยเฉลี่ยจากข้อมูลการสังเกตโดยใช้น้ำหนักคะแนนความชอบ (โดยเฉพาะ IPTW) ฉันคิดว่าฉันคำนวณ ATE อย่างถูกต้อง แต่ฉันไม่ทราบวิธีคำนวณช่วงความมั่นใจของ ATE ในขณะที่คำนึงถึงน้ำหนักความชอบแบบผกผัน นี่คือสมการที่ฉันใช้ในการคำนวณผลการรักษาโดยเฉลี่ย (อ้างอิง Med Med. 10 ก.ย. 2010; 29 (20): 2137–2148): โดยที่จำนวนวิชาทั้งหมด,สถานะการรักษา,สถานะผลลัพธ์และคะแนนความชอบTE=1ยังไม่มีข้อความΣ1ยังไม่มีข้อความZผมYผมพีผม-1ยังไม่มีข้อความΣ1ยังไม่มีข้อความ( 1 -Zผม)Yผม1 -พีผมATE=1ยังไม่มีข้อความΣ1ยังไม่มีข้อความZผมYผมพีผม-1ยังไม่มีข้อความΣ1ยังไม่มีข้อความ(1-Zผม)Yผม1-พีผมATE=\frac1N\sum_1^N\frac{Z_iY_i}{p_i}-\frac1N\sum_1^N\frac{(1-Z_i)Y_i}{1-p_i}ยังไม่มีข้อความ=ยังไม่มีข้อความ=N=Zผม=Zผม=Z_i=Yผม=Yผม=Y_i=พีผม=พีผม=p_i= ไม่มีใครทราบแพ็คเกจ R ที่จะคำนวณช่วงความมั่นใจของผลการรักษาโดยเฉลี่ยโดยคำนึงถึงน้ำหนักหรือไม่ สามารถระบุsurveyความช่วยเหลือในแพคเกจที่นี่? ฉันสงสัยว่าสิ่งนี้จะได้ผลหรือไม่: library(survey) sampsvy=svydesign(id=~1,weights=~iptw,data=df) svyby(~surgery=='lump',~treatment,design=sampsvy,svyciprop,vartype='ci',method='beta') #which produces this result: treatment surgery == "lump" ci_l ci_u No 0.1644043 0.1480568 0.1817876 Yes 0.2433215 0.2262039 0.2610724 ฉันไม่รู้ว่าจะไปจากที่นี่เพื่อหาช่วงความมั่นใจของความแตกต่างระหว่างสัดส่วน …

1
วิธีการออกกำลังกาย 2.2a.16 ของ“ สถิติที่แข็งแกร่ง: วิธีการที่อยู่บนพื้นฐานของฟังก์ชั่นอิทธิพล”
ในหน้า 180 ของสถิติที่แข็งแกร่ง: วิธีการที่ขึ้นอยู่กับฟังก์ชั่นอิทธิพลหนึ่งพบคำถามต่อไปนี้: 16: แสดงว่าสำหรับประมาณค่าสถานที่ค่าคงที่เสมอ {2} ค้นหาขอบเขตบนที่สอดคล้องกันในจุดแยกตัวอย่าง จำกัดทั้งในกรณีที่เป็นเลขคี่หรือเป็นคู่ε∗≤12ε∗≤12\varepsilon^*\leq\frac{1}{2}ε∗nεn∗\varepsilon^*_nnnnnnn ส่วนที่สอง (หลังจากช่วงเวลา) เป็นเรื่องเล็กน้อย (ให้ไว้ก่อน) แต่ฉันไม่สามารถหาวิธีที่จะพิสูจน์ส่วนแรก (ประโยค) ของคำถาม ในส่วนของหนังสือที่เกี่ยวข้องกับคำถามนี้พบ (p98): คำจำกัดความ 2: จุดแตกหักตัวอย่าง จำกัดของตัวประมาณที่ตัวอย่างมอบให้โดย:ε∗nεn∗\varepsilon^*_nTnTnT_n(xl,…,xn)(xl,…,xn)(x_l,\ldots, x_n) ε∗n(Tn;xi,…,xn):=1nmax{m:maxi1,…,imsupy1,…,ym|Tn(z1,…,zn)|&lt;∞}εn∗(Tn;xi,…,xn):=1nmax{m:maxi1,…,imsupy1,…,ym|Tn(z1,…,zn)|&lt;∞}\varepsilon^*_n(T_n;x_i,\ldots,x_n):=\frac{1}{n}\max\{m:\max_{i_1,\ldots,i_m}\sup_{y_1,\ldots,y_m}\;|T_n(z_1,\ldots,z_n)|<\infty\} โดยที่ตัวอย่าง(z1,…,zn)(z1,…,zn)(z_1,\ldots,z_n)ได้มาจากการแทนที่mmm data points xi1,…,ximxi1,…,ximx_{i_1},\ldots,x_{i_m}ด้วยค่าที่กำหนดเอง y1,…,ym.y1,…,ym.y_1,\ldots,y_m. คำนิยามอย่างเป็นทางการของตัวมันเองทำงานเกือบหนึ่งหน้า แต่สามารถคิดได้ว่าเป็น แม้ว่าจะไม่ได้กำหนดไว้อย่างชัดเจน สามารถเดาได้ว่าตำแหน่งที่ไม่แปรเปลี่ยนหมายความว่าต้องเป็นไปตาม ε∗ε∗\varepsilon^*ε∗=limn→∞ε∗nε∗=limn→∞εn∗\varepsilon^*=\underset{n\rightarrow\infty}{\lim}\varepsilon^*_nTnTnT_nTn(x1,…,xn)=Tn(x1+c,…,xn+c), for all c∈RTn(x1,…,xn)=Tn(x1+c,…,xn+c), for all c∈RT_n(x_1,\ldots,x_n)= T_n(x_1+c,\ldots,x_n+c), \text{ for all } c\in \Bbb{R} ฉัน (ลอง) ตอบคำถามของ …

1
วิธีทดสอบค่ามัธยฐานของประชากรได้อย่างไร
ฉันมีตัวอย่าง 250 หน่วย การกระจายไม่สมมาตร ฉันต้องการทดสอบสมมุติฐานว่าค่ามัธยฐานของประชากรแตกต่างจาก 3.5 ดังนั้นฉันคิดว่าการทดสอบตัวอย่างหนึ่งรายการจะเหมาะสม ฉันรู้ว่าการทดสอบยศวิลคอกซันนั้นไม่เหมาะสมเพราะการแจกแจงนั้นไม่สมมาตร การทดสอบเครื่องหมายเหมาะสมที่จะใช้หรือไม่? หากไม่มีใครสามารถแนะนำการทดสอบอื่น ๆ ได้?

1
ปรับอัตราเดิมพันเทียบกับอัตราส่วนอัตราต่อรอง
ในการวิเคราะห์การถดถอยหลายตัวแปรดูเหมือนว่าผู้คนใช้คำจำกัดความที่แตกต่างกันของอัตราส่วนอัตราต่อรองที่ปรับ คุณช่วยอธิบายให้ฉันฟังได้ว่าอะไรคือOR ที่ปรับแล้วและมันแตกต่างจากOR ที่ไม่ได้ปรับหรือ ขอบคุณ!

3
ประเมินมวลผลไม้ในถุงจากผลรวมที่เกี่ยวข้องเท่านั้นหรือไม่
อาจารย์ที่มหาวิทยาลัยของฉันตั้งคำถามเช่นนี้ (ไม่ใช่เพื่อทำการบ้านเนื่องจากชั้นเรียนจบแล้วและฉันไม่ได้อยู่ในนั้น) ฉันไม่สามารถหาวิธีเข้าหามันได้ คำถามเกี่ยวกับถุง 2 ใบที่บรรจุผลไม้หลากหลายประเภท: ถุงใบแรกมีผลไม้ที่เลือกแบบสุ่มดังต่อไปนี้: + ------------- + -------- + + --------- | เส้นผ่าศูนย์กลางซม มวล g | เน่าเสีย? | + ------------- + -------- + + --------- | 17.28 | 139.08 | 0 | | 6.57 | 91.48 | 1 | | 7.12 | 74.23 | 1 | | …

1
รากศัพท์ที่น่าสนใจของ R กำลังสอง
หลายปีที่ผ่านมาฉันพบตัวตนนี้ผ่านการทดลองเล่นกับข้อมูลและการแปลงร่าง หลังจากอธิบายให้อาจารย์สถิติของฉันเขามาในชั้นถัดไปด้วยการพิสูจน์แบบหน้าเดียวโดยใช้สัญลักษณ์เวกเตอร์และเมทริกซ์ น่าเสียดายที่ฉันทำกระดาษให้เขาเสีย (นี่คือย้อนกลับไปในปี 2007) ทุกคนสามารถสร้างหลักฐานใหม่ได้หรือไม่? ให้เป็นจุดข้อมูลดั้งเดิมของคุณ กำหนดชุดข้อมูลใหม่โดยหมุนชุดเดิมตามมุม ; เรียกจุดเหล่านี้y'_i)(xi,yi)(xi,yi)(x_i,y_i)θθ\theta(x′i,y′i)(xi′,yi′)(x'_i,y'_i) ค่า R กำลังสองของชุดคะแนนเดิมเท่ากับผลลบของอนุพันธ์เทียบกับของบันทึกธรรมชาติของค่าเบี่ยงเบนมาตรฐานสำหรับแต่ละพิกัดของชุดคะแนนใหม่แต่ละชุดจะประเมินที่θθ\thetaθ=0θ=0\theta=0 r2=−(ddθln(σx′)∣∣θ=0)(ddθln(σy′)∣∣θ=0)r2=−(ddθln⁡(σx′)|θ=0)(ddθln⁡(σy′)|θ=0)r^2= - \left(\left.\frac{d}{d\theta}\ln(\sigma_{x'})\right|_{\theta=0} \right) \left(\left.\frac{d}{d\theta}\ln(\sigma_{y'})\right|_{\theta=0} \right)

2
สร้างเมทริกซ์แน่นอนบวกที่เป็นสมมาตรพร้อมรูปแบบการระบุช่องว่างที่กำหนดไว้ล่วงหน้า
ฉันกำลังพยายามสร้างเมทริกซ์สหสัมพันธ์ (symmetric psd) ด้วยโครงสร้าง sparsity ที่ระบุไว้ล่วงหน้า (ระบุโดยกราฟบนโหนด ) โหนดที่เชื่อมต่อในกราฟมีความสัมพันธ์ส่วนที่เหลือทั้งหมดคือ 0 และเส้นทแยงมุมคือ 1 ทั้งหมดหน้า× pp×pp\times pพีppρ ∼ U( 0 , 1 )ρ∼U(0,1)\rho \sim U(0,1) ฉันพยายามสร้างเมทริกซ์นี้หลายครั้ง แต่ไม่ค่อยได้เมทริกซ์สหสัมพันธ์ที่ถูกต้อง มีวิธีที่ฉันสามารถรับประกันเมทริกซ์สหสัมพันธ์หรือไม่? โปรดทราบว่าฉันสามารถมีความสัมพันธ์เชิงบวกเท่านั้นดังนั้นเป็นต้นไม่ใช่ตัวเลือกρ ∼ U( - 1 , 1 )ρ∼U(−1,1)\rho \sim U(-1,1) ความช่วยเหลือใด ๆ ที่ชื่นชมอย่างมาก!

3
มิติ VC ของสี่เหลี่ยมผืนผ้า
หนังสือ "รู้เบื้องต้นเกี่ยวกับการเรียนรู้ของเครื่อง" โดย Ethem Alpaydınระบุว่ามิติ VC ของสี่เหลี่ยมผืนผ้าที่จัดเรียงตามแนวแกนคือ 4 แต่สี่เหลี่ยมจะแบ่งชุดของจุด collinear สี่จุดด้วยจุดบวกและลบอย่างไร บางคนสามารถอธิบายและพิสูจน์มิติ VC ของสี่เหลี่ยมได้หรือไม่?

1
ฉันจะตีความความแปรปรวนของเอฟเฟกต์แบบสุ่มได้อย่างไรในโมเดลผสมแบบเส้นตรงทั่วไป
ในโลจิสติกส์แบบจำลองเชิงเส้นผสมแบบเชิงเส้นทั่วไป (ครอบครัว = ทวินาม) ฉันไม่รู้วิธีตีความความแปรปรวนของผลกระทบแบบสุ่ม: Random effects: Groups Name Variance Std.Dev. HOSPITAL (Intercept) 0.4295 0.6554 Number of obs: 2275, groups: HOSPITAL, 14 ฉันจะตีความผลลัพธ์ที่เป็นตัวเลขนี้ได้อย่างไร ฉันมีตัวอย่างของผู้ป่วยไตวายเรื้อรังในการศึกษาแบบหลายศูนย์ ฉันกำลังทดสอบว่าความน่าจะเป็นของผู้ป่วยที่ได้รับการรักษาด้วยยาลดความดันโลหิตเฉพาะนั้นเหมือนกันระหว่างศูนย์หรือไม่ สัดส่วนของผู้ป่วยที่รักษาแตกต่างกันอย่างมากระหว่างศูนย์ แต่อาจเกิดจากความแตกต่างในลักษณะพื้นฐานของผู้ป่วย ดังนั้นฉันจึงประมาณแบบจำลองเชิงเส้นผสมแบบทั่วไป (โลจิสติก) ปรับสำหรับคุณสมบัติหลักของผู้ป่วย นี่คือผลลัพธ์ที่ได้: Generalized linear mixed model fit by maximum likelihood ['glmerMod'] Family: binomial ( logit ) Formula: HTATTO ~ AGE + …
9 r  lme4-nlme 

3
ImageNet: ข้อผิดพลาดห้าอันดับแรกหมายถึงอะไร
หนึ่งในวิธีการประเมินผลสำหรับการแข่งขัน ImageNet (จำแนกภาพ 1,000 หมวดหมู่) เป็นข้อผิดพลาด 5 อันดับแรกนั่นหมายความว่าอย่างไร ดู: http://www.image-net.org/challenges/LSVRC/

2
การสุ่มตัวอย่าง CDF ผกผันสำหรับการแจกแจงแบบผสม
เวอร์ชันย่อที่ไม่อยู่ในบริบท ปล่อยให้เป็นตัวแปรสุ่มด้วย CDF yyyF(⋅)≡{θθ+(1−θ)×CDFlog-normal(⋅;μ,σ) y = 0 y &gt; 0F(⋅)≡{θ y = 0 θ+(1−θ)×CDFlog-normal(⋅;μ,σ) y &gt; 0 F(\cdot) \equiv \cases{\theta & y = 0 \\ \theta + (1-\theta) \times \text{CDF}_{\text{log-normal}}(\cdot; \mu, \sigma) & y > 0} สมมติว่าฉันต้องการจำลองการจับด้วยวิธี inverse CDF เป็นไปได้ไหม ฟังก์ชั่นนี้ไม่ได้มีสิ่งที่ตรงกันข้าม จากนั้นอีกครั้งมีการสุ่มตัวอย่างการแปลงผกผันสำหรับการกระจายการผสมของการแจกแจงปกติสองรายการซึ่งแสดงให้เห็นว่ามีวิธีที่รู้จักในการใช้การสุ่มตัวอย่างการแปลงผกผันที่นี่yyy ฉันทราบวิธีสองขั้นตอน แต่ฉันไม่ทราบวิธีนำไปใช้กับสถานการณ์ของฉัน (ดูด้านล่าง) รุ่นยาวที่มีพื้นหลัง ฉันติดตั้งโมเดลต่อไปนี้สำหรับการตอบสนองที่มีค่าเวกเตอร์โดยใช้ MCMC (โดยเฉพาะสแตน):yi=(y1,…,yK)iyi=(y1,…,yK)iy^i = …

2
การตรวจสอบสมมติฐานอัตราต่อรองที่เก็บรักษาไว้ในการถดถอยโลจิสติกอันดับโดยใช้ฟังก์ชั่น polr
ฉันได้ใช้ฟังก์ชั่น 'polr' ในแพ็คเกจ MASS เพื่อเรียกใช้การถดถอยโลจิสติกอันดับสำหรับตัวแปรตอบกลับหมวดหมู่ตามลำดับที่มีตัวแปรอธิบายต่อเนื่อง 15 ตัว ฉันได้ใช้รหัส (แสดงด้านล่าง) เพื่อตรวจสอบว่ารูปแบบของฉันเป็นไปตามอัตราต่อรองสัดส่วนสมมติฐานคำแนะนำต่อไประบุไว้ในคู่มือยูซีแอล อย่างไรก็ตามฉันกังวลเล็กน้อยเกี่ยวกับผลลัพธ์ที่บ่งบอกว่าไม่เพียง แต่มีค่าสัมประสิทธิ์ในจุดตัดต่าง ๆ ที่คล้ายกัน แต่พวกมันเหมือนกันหมด (ดูกราฟด้านล่าง) FGV1b &lt;- data.frame(FG1_val_cat=factor(FGV1b[,"FG1_val_cat"]), scale(FGV1[,c("X","Y","Slope","Ele","Aspect","Prox_to_for_FG", "Prox_to_for_mL", "Prox_to_nat_border", "Prox_to_village", "Prox_to_roads", "Prox_to_rivers", "Prox_to_waterFG", "Prox_to_watermL", "Prox_to_core", "Prox_to_NR", "PCA1", "PCA2", "PCA3")])) b &lt;- polr(FG1_val_cat ~ X + Y + Slope + Ele + Aspect + Prox_to_for_FG + Prox_to_for_mL + …

2
สารตกค้างเกี่ยวข้องกับการรบกวนพื้นฐานอย่างไร
ในวิธีกำลังสองน้อยที่สุดเราต้องการประมาณค่าพารามิเตอร์ที่ไม่รู้จักในโมเดล: YJ= α + βxJ+εJ( j = 1 ... n )Yj=α+βxj+εj(j=1...n)Y_j = \alpha + \beta x_j + \varepsilon_j \enspace (j=1...n) เมื่อเราทำเช่นนั้น (สำหรับค่าที่สังเกตได้) เราจะได้เส้นการถดถอยที่พอดี: YJ=α^+β^x +อีJ( J = 1 , . . . n )Yj=α^+β^x+ej(j=1,...n)Y_j = \hat{\alpha} + \hat{\beta}x +e_j \enspace (j =1,...n) ตอนนี้เห็นได้ชัดว่าเราต้องการตรวจสอบบางแปลงเพื่อให้แน่ใจว่าสมมติฐานเป็นจริง สมมติว่าคุณต้องการตรวจสอบ homoscedasticity อย่างไรก็ตามในการทำเช่นนี้เรากำลังตรวจสอบเหลืออยู่ สมมติว่าคุณตรวจสอบพล็อตค่าที่ตกค้างเทียบกับที่คาดการณ์ไว้ถ้านั่นแสดงให้เราเห็นว่า heteroscedasticity นั้นชัดเจนแล้วสิ่งนั้นเกี่ยวข้องกับคำว่ารบกวนอย่างไร heteroscedasticity …

1
เกณฑ์ใดที่ใช้สำหรับการแยกตัวแปรออกเป็นตัวแปรอธิบายและการตอบสนองสำหรับวิธีการบวชในระบบนิเวศ
ฉันมีตัวแปรต่าง ๆ ที่มีผลกระทบต่อประชากร โดยทั่วไปฉันได้ทำรายการสินค้าของกิ้งกือและวัดค่าอื่น ๆ ของภูมิประเทศเช่น: ชนิดและปริมาณตัวอย่างที่เก็บได้ สภาพแวดล้อมที่แตกต่างกันที่สัตว์เป็น ค่า pH เปอร์เซ็นต์ของสารอินทรีย์ ปริมาณของ P, K, Mg, Ca, Mn, Fe, Zn, Cu ความสัมพันธ์ของ Ca + Mg / K โดยทั่วไปฉันต้องการใช้ PCA เพื่อกำหนดว่าตัวแปรใดที่ขับเคลื่อนความแปรปรวนของตัวอย่างและทำให้ฟอเรสต์ (สภาพแวดล้อม) แตกต่างกัน ฉันควรใช้ตัวแปรใดสำหรับ "ตัวแปร" และตัวแปรใดสำหรับ "บุคคล"

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.