สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
ข้อ จำกัด ของวิธีการเคอร์เนลคืออะไรและเมื่อใดที่จะใช้วิธีเคอร์เนล
วิธีการเคอร์เนลมีประสิทธิภาพมากในงานการจัดหมวดหมู่ที่ได้รับการควบคุม ดังนั้นสิ่งที่เป็นข้อ จำกัด ของวิธีการเคอร์เนลและเมื่อใช้วิธีเคอร์เนล? โดยเฉพาะอย่างยิ่งในยุคข้อมูลขนาดใหญ่ความก้าวหน้าของวิธีการเคอร์เนลคืออะไร? อะไรคือความแตกต่างระหว่างวิธีเคอร์เนลและการเรียนรู้แบบหลายตัวอย่าง? หากข้อมูลมี500x10000, 500เป็นนับตัวอย่างและ10000เป็นมิติของแต่ละคุณลักษณะแล้วในกรณีนี้เราสามารถใช้วิธีการเคอร์เนล?


1
การทดสอบทางสถิติใดที่ควรใช้เพื่อทดสอบการเพิ่มประสิทธิภาพของรายการยีน
ฉันได้ทำการทดลองเพื่อทดสอบความไวของเซลล์ต่อตัวแทนทำลาย DNA ที่แน่นอน เราพบว่ามี 270 ยีนที่ไวต่อยาโดยเฉพาะและจำนวนยีนที่วิเคราะห์ได้ทั้งหมดคือ 3668. 38 จาก 270 ยีนที่ละเอียดอ่อนจัดอยู่ในประเภท "ยีนซ่อมแซมดีเอ็นเอ" หากจำนวนของ "ยีนซ่อมแซมดีเอ็นเอ" ที่มีอยู่ในจีโนมคือ 112 และจำนวนทั้งหมดของยีนในจีโนมคือ 3668 ยีนที่มีความละเอียดอ่อนเพิ่มคุณค่าในยีนซ่อมแซมดีเอ็นเอหรือไม่ ควรใช้การทดสอบทางสถิติใด ฉันจะขอบคุณถ้าคุณสามารถบอกเครื่องมือในการคำนวณค่า p ออนไลน์ได้

1
ความแตกต่างระหว่างความน่าจะเป็นและตรรกะฟัซซี่คืออะไร
ฉันทำงานกับฟัซซี่ลอจิก (FL) มาหลายปีแล้วและฉันรู้ว่ามีความแตกต่างระหว่างฟลอริด้าและความน่าจะเป็นเป็นพิเศษเกี่ยวกับวิธีที่ฟลอริด้าจัดการกับความไม่แน่นอน อย่างไรก็ตามฉันอยากจะถามว่ามีความแตกต่างระหว่างฟลอริด้าและความน่าจะเป็นมากกว่านี้หรือไม่? กล่าวอีกนัยหนึ่งถ้าฉันจัดการกับความน่าจะเป็น (รวมข้อมูลความรู้รวม) ฉันจะทำเช่นเดียวกันกับฟลอริด้า?
10 bayes  fuzzy 

1
บันทึกโอกาสสำหรับ GLM
ในรหัสต่อไปนี้ฉันทำการถดถอยโลจิสติกในข้อมูลที่จัดกลุ่มโดยใช้ glm และ "ด้วยมือ" โดยใช้ mle2 ทำไมฟังก์ชั่น logLik ใน R จึงให้ความเป็นไปได้ในการบันทึก logLik (fit.glm) = - 2.336 ที่แตกต่างจากหนึ่ง logLik (fit.ml) = - 5.514 ฉันได้รับด้วยมือ? library(bbmle) #successes in first column, failures in second Y <- matrix(c(1,2,4,3,2,0),3,2) #predictor X <- c(0,1,2) #use glm fit.glm <- glm(Y ~ X,family=binomial (link=logit)) summary(fit.glm) #use mle2 invlogit …

1
การแก้ไข Hommel Hochberg คืออะไร
ฉันเพิ่งได้รับการแนะนำให้รู้จักกับการแก้ไข Hommel Hochberg ฉันกำลังพยายามหาคำอธิบายง่ายๆเกี่ยวกับสิ่งนี้ / ทำจริง ๆ แต่ไม่มีโชค ใครช่วยกรุณาให้คำอธิบายสั้น ๆ และง่าย ๆ เกี่ยวกับการแก้ไข Hommel Hochberg?

3
การประมาณพารามิเตอร์ของการแจกแจงแบบสม่ำเสมอ: ไม่เหมาะสมมาก่อน
เรามีตัวอย่าง Nจากการแจกแจงแบบสม่ำเสมอโดยที่ไม่ทราบประมาณจากข้อมูลXiXiX_i[0,θ][0,θ][0,\theta]θθ\thetaθθ\theta ดังนั้นกฎของเบย์ ... f(θ|Xi)=f(Xi|θ)f(θ)f(Xi)f(θ|Xi)=f(Xi|θ)f(θ)f(Xi)f(\theta | {X_i}) = \frac{f({X_i}|\theta)f(\theta)}{f({X_i})} และโอกาสก็คือ: f(Xi|θ)=∏Ni=11θf(Xi|θ)=∏i=1N1θf({X_i}|\theta) = \prod_{i=1}^N \frac{1}{\theta} (แก้ไข: เมื่อ0≤Xi≤θ0≤Xi≤θ0 \le X_i \le \thetaสำหรับiทั้งหมดiiiและ 0 เป็นอย่างอื่น - ขอบคุณ whuber) แต่ไม่มีข้อมูลอื่น ๆ เกี่ยวกับθθ\thetaดูเหมือนว่าก่อนหน้านี้ควรมีสัดส่วน111 (เช่นรูปแบบเดียวกัน) หรือ1L1L\frac{1}{L} (Jeffreys ก่อนหน้า?) ใน[0,∞][0,∞][0,\infty]แต่อินทิกรัลของฉันไม่ มาบรรจบกันและฉันไม่แน่ใจว่าจะดำเนินการอย่างไร ความคิดใด ๆ

3
Bootstrapping residencies: ฉันทำถูกไหม?
ก่อนอื่น: จากสิ่งที่ฉันเข้าใจส่วนที่เหลือในการบูตสแตรปทำงานได้ดังนี้: ปรับโมเดลให้เหมาะสมกับข้อมูล คำนวณส่วนที่เหลือ ลองสุ่มดูส่วนที่เหลือแล้วเพิ่มลงใน 1 ปรับโมเดลให้เหมาะกับชุดข้อมูลใหม่จาก 3 ทำซ้ำnครั้ง แต่เพิ่มส่วนที่เหลือที่ถูก resampled ให้พอดีจาก 1 เสมอ ถูกต้องจนถึงตอนนี้หรือไม่ สิ่งที่ฉันต้องการจะทำคือสิ่งที่แตกต่างออกไปเล็กน้อย: ฉันต้องการประมาณค่าพารามิเตอร์และการทำนายความไม่แน่นอนสำหรับอัลกอริทึมที่ประมาณค่าตัวแปรสภาพแวดล้อม สิ่งที่ผมมีคือปราศจากข้อผิดพลาดอนุกรมเวลา (จากการจำลอง) ของตัวแปรที่x_trueซึ่งฉันจะเพิ่มเสียงบางอย่างในการสั่งซื้อเพื่อสร้างชุดข้อมูลที่สังเคราะห์x_noise xจากนั้นฉันพยายามค้นหาพารามิเตอร์ที่เหมาะสมโดยปรับอัลกอริธึมของฉันด้วยผลรวมของกำลังสองsum((x_estimate - x_true)^2)(! ไม่x_estimate - x!) เป็นฟังก์ชันวัตถุประสงค์ เพื่อที่จะดูว่าอัลกอริทึมของฉันทำงานอย่างไรและเพื่อสร้างตัวอย่างของการแจกแจงพารามิเตอร์ของฉันฉันต้องการที่จะ resample x_noiseเพิ่มให้x_trueพอดีกับแบบจำลองของฉันอีกครั้งล้างและทำซ้ำ นั่นเป็นวิธีที่ถูกต้องในการประเมินความไม่แน่นอนของพารามิเตอร์หรือไม่ ฉันสามารถแปลความพอดีกับชุดข้อมูล bootstrapped ว่าเป็นความไม่แน่นอนในการทำนายหรือฉันต้องทำตามขั้นตอนที่ฉันโพสต์ไว้ด้านบนหรือไม่ / แก้ไข: ฉันคิดว่าฉันยังไม่ได้ทำให้ชัดเจนว่าแบบจำลองของฉันทำอะไร คิดว่ามันเป็นสิ่งที่ต้องการวิธีลดเสียง มันไม่ใช่รูปแบบการทำนายมันเป็นอัลกอริทึมที่พยายามดึงสัญญาณต้นแบบของข้อมูลด้านสิ่งแวดล้อมที่มีเสียงดัง / edit ^ 2: สำหรับผู้ใช้ MATLAB ที่นั่นฉันได้เขียนตัวอย่างการถดถอยเชิงเส้นอย่างรวดเร็วและสกปรกของสิ่งที่ฉันหมายถึง นี่คือสิ่งที่ฉันเชื่อว่าการบู๊ตแบบธรรมดา "(โปรดแก้ไขฉันหากฉันผิด): http://pastebin.com/C0CJp3d1 นี่คือสิ่งที่ฉันต้องการทำ: …

1
การทดสอบการเปลี่ยนรูปเป็นการเปรียบเทียบตัวอย่างเดี่ยวกับค่าเฉลี่ย
เมื่อผู้คนทำการทดสอบการเปลี่ยนรูปเพื่อเปรียบเทียบตัวอย่างเดียวกับค่าเฉลี่ย (เช่นคุณอาจทำกับการทดสอบการเปลี่ยนรูป) วิธีการจัดการค่าเฉลี่ยเป็นอย่างไร ฉันได้เห็นการใช้งานที่ใช้ค่าเฉลี่ยและตัวอย่างสำหรับการทดสอบการเปลี่ยนรูป แต่ก็ไม่มีความชัดเจนในสิ่งที่พวกเขากำลังทำจริงภายใต้ประทุน มีวิธีที่มีความหมายในการทำแบบทดสอบการเปลี่ยนรูป (เช่น t-test) สำหรับตัวอย่างหนึ่งกับค่าเฉลี่ยที่สมมติหรือไม่? หรือมิฉะนั้นพวกเขาเพียงแค่เริ่มต้นการทดสอบที่ไม่ใช่การเปลี่ยนแปลงภายใต้ประทุน? (เช่นแม้จะเรียกใช้ฟังก์ชันการเรียงสับเปลี่ยนหรือตั้งค่าสถานะทดสอบการเปลี่ยนรูปแบบ แต่การเริ่มต้นเป็นมาตรฐาน t-test หรือฟังก์ชั่นที่คล้ายกัน) ในการทดสอบการเปลี่ยนรูปสองตัวอย่างมาตรฐานหนึ่งกลุ่มจะมีสองกลุ่มและสุ่มการกำหนดป้ายกำกับ อย่างไรก็ตามสิ่งนี้จัดการได้อย่างไรเมื่อ "กลุ่ม" หนึ่งมีค่าเฉลี่ยที่สันนิษฐาน เห็นได้ชัดว่าค่าเฉลี่ยที่สันนิษฐานนั้นไม่มีขนาดตัวอย่างในตัวมันเอง ดังนั้นวิธีทั่วไปในการทำงานค่าเฉลี่ยในรูปแบบการเปลี่ยนแปลงคืออะไร? ตัวอย่าง "หมายถึง" ถือว่าเป็นจุดเดียวหรือไม่? กลุ่มตัวอย่างมีขนาดเท่ากันหรือไม่ ตัวอย่างขนาดไม่ จำกัด ? เนื่องจากค่าเฉลี่ยที่สันนิษฐานไว้คือสมมุติว่า - ฉันบอกว่าในทางเทคนิคจะมีการสนับสนุนที่ไม่มีที่สิ้นสุดหรือการสนับสนุนใดก็ตามที่คุณต้องการสมมติ อย่างไรก็ตามสิ่งเหล่านี้ไม่เป็นประโยชน์อย่างมากสำหรับการคำนวณจริง ตัวอย่างขนาดเท่ากันที่มีค่าทั้งหมดเท่ากับค่าเฉลี่ยดูเหมือนจะเป็นสิ่งที่ทำในบางครั้งด้วยการทดสอบบางอย่าง (เช่นคุณเพียงแค่เติมอีกครึ่งหนึ่งของคู่ด้วยตำแหน่งที่สมมติ) มันสมเหตุสมผลดีเนื่องจากเป็นตัวอย่างที่มีความยาวเท่ากันคุณจะเห็นว่าค่าเฉลี่ยที่คุณสันนิษฐานนั้นถูกต้องโดยไม่มีความแปรปรวนหรือไม่ ดังนั้นคำถามของฉันคือ: ในทางปฏิบัติจริง ๆ แล้วผู้คนเลียนแบบการสุ่มเปลี่ยนรูปแบบป้ายกำกับการทดสอบเมื่อชุดที่สองเป็นค่าเฉลี่ย ถ้าเป็นเช่นนั้นผู้คนจะจัดการกับการสุ่มป้ายกำกับเมื่อพวกเขาทำเช่นนี้ได้อย่างไร

1
SMOTE พ่นข้อผิดพลาดสำหรับปัญหาความไม่สมดุลหลายระดับ
ฉันกำลังพยายามใช้ SMOTE เพื่อแก้ไขความไม่สมดุลในปัญหาการจำแนกประเภทของฉัน แม้ว่า SMOTE ทำงานได้อย่างสมบูรณ์บนชุดข้อมูล iris ตามเอกสารวิธีใช้ SMOTE แต่จะไม่ทำงานบนชุดข้อมูลที่คล้ายกัน นี่คือลักษณะของข้อมูลของฉัน หมายเหตุมันมีสามคลาสที่มีค่า 1, 2, 3 > data looking risk every status 1 0 1 0 1 2 0 0 0 1 3 0 0 0 2 4 0 0 0 1 5 0 0 0 1 6 3 0 0 …

2
AIC, ข้อผิดพลาด anova: โมเดลไม่ได้ติดตั้งทั้งหมดกับจำนวนการสังเกตเท่ากันทุกรุ่นไม่ได้พอดีกับชุดข้อมูลขนาดเดียวกันทั้งหมด
ฉันมีโมเดลเช่นนี้: require(nlme) set.seed(123) n <- 100 k <- 5 cat <- as.factor(rep(1:k, n)) cat_i <- 1:k # intercept per kategorie x <- rep(1:n, each = k) sigma <- 0.2 alpha <- 0.001 y <- cat_i[cat] + alpha * x + rnorm(n*k, 0, sigma) plot(x, y) m1 <- lm(y ~ x) …
10 r  mixed-model  aic 

4
วิธีการคำนวณค่าเบี่ยงเบนมาตรฐานแบบ 2 มิติด้วยค่าเฉลี่ย 0 ล้อมรอบด้วยขีด จำกัด
ปัญหาของฉันเป็นดังนี้: ฉันวาง 40 ลูกในคราวเดียวจากจุดหนึ่งไม่กี่เมตรเหนือพื้น ลูกบอลกลิ้งและมาพัก เมื่อใช้สายตาคอมพิวเตอร์ฉันคำนวณจุดศูนย์กลางมวลในระนาบ XY ฉันสนใจเฉพาะระยะทางจากจุดศูนย์กลางของมวลไปยังลูกบอลแต่ละลูกซึ่งคำนวณโดยใช้รูปทรงเรขาคณิตที่เรียบง่าย ตอนนี้ฉันอยากรู้ค่าเบี่ยงเบนมาตรฐานด้านเดียวจากศูนย์กลาง ดังนั้นฉันจะสามารถรู้ได้ว่ามีลูกบอลจำนวนหนึ่งอยู่ในรัศมี std หนึ่งลูกมากกว่าภายในรัศมี 2 * std เป็นต้น ฉันจะคำนวณค่าเบี่ยงเบนมาตรฐานด้านเดียวได้อย่างไร วิธีการปกติจะระบุว่าครึ่งหนึ่งของลูกบอลอยู่ใน "ด้านลบ" ของค่าเฉลี่ย 0 แน่นอนว่าไม่มีเหตุผลในการทดลองนี้ ฉันต้องตรวจสอบให้แน่ใจว่าลูกบอลเป็นไปตามการกระจายมาตรฐานหรือไม่ ขอบคุณสำหรับความช่วยเหลือ

3
แบบฝึกหัดที่ 2.2 ขององค์ประกอบของการเรียนรู้ทางสถิติ
หนังสือเรียนจะสร้างข้อมูล 2 ระดับก่อนผ่าน: ซึ่งจะช่วยให้: แล้วมันจะถามว่า: ฉันพยายามที่จะแก้ปัญหานี้โดยการสร้างแบบจำลองนี้ครั้งแรกด้วยโมเดลกราฟิกนี้: ที่ไหน ccc คือฉลาก h(1≤h≤10)h(1≤h≤10)h\,(1\le h \le 10) คือดัชนีของค่าเฉลี่ยที่เลือก mchmhcm_h^cและ xxxเป็นจุดข้อมูล นี้จะให้ Pr(x∣mch)=Pr(mch∣h,c=blue)=Pr(mch∣h,c=orange)=Pr(h)=Pr(c)=N(mch,I/5)N((1,0)T,I)N((0,1)T,I)11012Pr(x∣mhc)=N(mhc,I/5)Pr(mhc∣h,c=blue)=N((1,0)T,I)Pr(mhc∣h,c=orange)=N((0,1)T,I)Pr(h)=110Pr(c)=12 \begin{align*} \Pr(x\mid m_h^c) =& \mathcal{N}(m_h^c,\mathbf{I}/5)\\ \Pr(m_h^c\mid h,c=\mathrm{blue}) =& \mathcal{N}((1,0)^T,\mathbf{I})\\ \Pr(m_h^c\mid h,c=\mathrm{orange}) =& \mathcal{N}((0,1)^T,\mathbf{I})\\ \Pr(h) =& \frac{1}{10}\\ \Pr(c) =& \frac{1}{2} \end{align*} ในทางตรงกันข้ามเขตแดนเป็น\} ด้วยกฎของเบย์เรามี{x:Pr(c=blue∣x)=Pr(c=orange∣x)}{x:Pr(c=blue∣x)=Pr(c=orange∣x)}\{x:\Pr(c=\mathrm{blue}\mid x)=\Pr(c=\mathrm{orange}\mid x)\} Pr(c∣x)=Pr(x∣c)=Pr(x∣c)Pr(c)∑cPr(x∣c)Pr(c)∑h∫mchPr(h)Pr(mch∣h,c)Pr(x∣mch)Pr(c∣x)=Pr(x∣c)Pr(c)∑cPr(x∣c)Pr(c)Pr(x∣c)=∑h∫mhcPr(h)Pr(mhc∣h,c)Pr(x∣mhc) \begin{align*} \Pr(c\mid x) =& \frac{\Pr(x\mid c)\Pr(c)}{\sum_c\Pr(x\mid c)\Pr(c)}\\ …

1
ประโยชน์ของการใช้การทดสอบการเปลี่ยนรูปคืออะไร?
เมื่อทำการทดสอบสมมติฐานบางตัวเทียบกับสมมติฐานทางเลือกโดยสถิติทดสอบโดยที่ให้ใช้การทดสอบการเปลี่ยนรูปกับชุดของการเปลี่ยนลำดับบนและเรามีสถิติใหม่ ยู( X)U(X)U(X)X= {xผม, . . . ,xn}X={xi,...,xn}X = \{ x_i, ..., x_n\}GGGXXXT( X) : =# { π∈ G : U( πX) ≥ คุณ( X) }| G |.T(X):=#{π∈G:U(πX)≥U(X)}|G|. T(X) := \frac{\# \{\pi \in G: U(\pi X) \geq U(X)\}}{|G|}. ประโยชน์ของการใช้แบบทดสอบการเปลี่ยนรูปมากกว่าไม่ใช้มันคืออะไร? คือเมื่อการทดสอบการเรียงสับเปลี่ยนทำงานอย่างไร มีเงื่อนไขอะไรที่จะทำให้เกิดขึ้น เช่นเงื่อนไขบางอย่างในสถิติการทดสอบและ / หรือตามสมมติฐานว่าง?ยูUU ตัวอย่างเช่น, ควร เท่ากับ p-value ขึ้นอยู่กับสำหรับตัวอย่าง ? …

2
ค่าเดียวนี้ตรงกับการแจกแจงนั้นหรือไม่
นี่รู้สึกเหมือนเป็นคำถามที่ไร้เดียงสา แต่ฉันมีปัญหาในการดูคำตอบ ฉันมี 30 ชุดหนึ่งค่า ฉันได้รับค่าที่ 31 อย่างอิสระ สมมติฐานที่ว่างเปล่าคือค่าที่ 31 เป็นส่วนหนึ่งของการแจกแจงแบบเดียวกัน ทางเลือกคือมันแตกต่างกัน ฉันต้องการค่า p หรือค่าความน่าจะเป็นบางประเภท ฉันมีความคิดบางอย่าง: นี่คล้ายกับต้องการทำแบบทดสอบสองตัวอย่าง - ยกเว้นว่าสำหรับตัวอย่างที่สองฉันมีเพียงค่าเดียวและค่า 30 ค่าไม่จำเป็นต้องกระจายแบบปกติ หากแทนการวัด 30 รายการฉันมีการวัด 10,000 ตำแหน่งอันดับของการวัดเดี่ยวสามารถให้ข้อมูลที่เป็นประโยชน์ได้ ฉันจะคำนวณความน่าจะเป็นหรือค่า p นี้ได้อย่างไร ขอบคุณ! Yannick

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.