สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
การใช้ตัวทำนายแบบวงกลมในการถดถอยเชิงเส้น
ฉันกำลังพยายามปรับโมเดลให้เหมาะสมโดยใช้ข้อมูลลม (0, 359) และช่วงเวลาของวัน (0, 23) แต่ฉันกังวลว่าพวกเขาจะไม่พอดีกับการถดถอยเชิงเส้นเนื่องจากพวกเขาไม่ใช่พารามิเตอร์เชิงเส้น ฉันต้องการแปลงพวกเขาโดยใช้ Python ฉันได้เห็นการกล่าวถึงการคำนวณค่าเฉลี่ยเวคเตอร์โดยวิธีการทำบาปและ cos ขององศาอย่างน้อยก็ในกรณีลม แต่ไม่มากนัก มีห้องสมุดไพ ธ อนหรือวิธีการที่เกี่ยวข้องที่อาจเป็นประโยชน์หรือไม่?

3
เหตุการณ์อคติการถดถอยโลจิสติกที่หายาก: วิธีจำลอง p ต่ำสุดด้วยตัวอย่างน้อยที่สุด?
CrossValidated มีหลายคำถามเกี่ยวกับเวลาและวิธีการที่จะใช้การแก้ไขเหตุการณ์อคติที่หายากโดยพระบาทสมเด็จพระเจ้าอยู่หัวและเซง (2001) ฉันกำลังมองหาสิ่งที่แตกต่าง: การสาธิตแบบจำลองขั้นต่ำที่มีอคติอยู่ โดยเฉพาะอย่างยิ่งราชาและเซงรัฐ "... ในเหตุการณ์ที่หายากข้อมูลอคติในความน่าจะเป็นความหมายอย่างมีนัยสำคัญกับขนาดตัวอย่างเป็นพันและอยู่ในทิศทางที่สามารถคาดการณ์ได้: ความน่าจะเป็นของเหตุการณ์โดยประมาณนั้นเล็กเกินไป" นี่คือความพยายามของฉันในการจำลองอคติดังกล่าวใน R: # FUNCTIONS do.one.sim = function(p){ N = length(p) # Draw fake data based on probabilities p y = rbinom(N, 1, p) # Extract the fitted probability. # If p is constant, glm does y ~ 1, the intercept-only model. …

3
ความสำคัญของโหนดอคติในเครือข่ายประสาทเทียม
ฉันอยากรู้ว่าโหนด bias สำคัญต่อประสิทธิภาพของเครือข่ายประสาทยุคใหม่อย่างไร ฉันสามารถเข้าใจได้อย่างง่ายดายว่ามันมีความสำคัญในเครือข่ายตื้นที่มีตัวแปรอินพุตเพียงไม่กี่ตัว อย่างไรก็ตามโครงข่ายประสาทที่ทันสมัยเช่นในการเรียนรู้เชิงลึกมักจะมีตัวแปรอินพุตจำนวนมากในการตัดสินใจว่ามีการกระตุ้นเซลล์ประสาทบางอย่างหรือไม่ จะลบพวกเขาออกจากเพียงแค่เช่น LeNet5 หรือ ImageNet มีผลกระทบที่แท้จริงหรือไม่?

5
วิธีใช้การสลายตัว Cholesky หรือทางเลือกสำหรับการจำลองข้อมูลที่สัมพันธ์กัน
ฉันใช้การสลายตัวของ Cholesky เพื่อจำลองตัวแปรสุ่มที่มีความสัมพันธ์ซึ่งได้รับเมทริกซ์สหสัมพันธ์ สิ่งนี้คือผลลัพธ์ไม่เคยทำซ้ำโครงสร้างความสัมพันธ์ตามที่ได้รับ นี่คือตัวอย่างเล็ก ๆ ใน Python เพื่อแสดงสถานการณ์ import numpy as np n_obs = 10000 means = [1, 2, 3] sds = [1, 2, 3] # standard deviations # generating random independent variables observations = np.vstack([np.random.normal(loc=mean, scale=sd, size=n_obs) for mean, sd in zip(means, sds)]) # observations, a row per …

1
สิ่งที่จะสรุปได้จากพล็อต lasso (glmnet)
ต่อไปนี้คือโครงร่างของ glmnet ที่มีค่าเริ่มต้นอัลฟา (1 ดังนั้น lasso) โดยใช้mtcarsชุดข้อมูลใน R พร้อมกับmpgDV และอื่น ๆ เป็นตัวแปรตัวทำนาย glmnet(as.matrix(mtcars[-1]), mtcars[,1]) สิ่งที่เราสามารถสรุปได้จากพล็อตนี้เกี่ยวกับตัวแปรที่แตกต่างกันโดยเฉพาะอย่างยิ่งam, cylและwt(สีแดง, สีดำและสีแสงเส้นสีน้ำเงิน)? เราจะวลีผลลัพธ์ในรายงานที่จะเผยแพร่อย่างไร ฉันคิดถึงสิ่งต่อไปนี้: wtmpgเป็นปัจจัยบ่งชี้ที่สำคัญที่สุดของ mpgมันเป็นในเชิงลบที่มีผลต่อ cylmpgเป็นปัจจัยบ่งชี้เชิงลบที่อ่อนแอของ ammpgอาจจะเป็นปัจจัยบ่งชี้ในเชิงบวกของ ตัวแปรอื่น ๆ mpgที่มีการพยากรณ์ไม่ได้ที่แข็งแกร่งของ ขอบคุณสำหรับความคิดของคุณเกี่ยวกับเรื่องนี้ (หมายเหตุ: cylเป็นเส้นสีดำซึ่งไม่ถึง 0 จนกระทั่งอยู่ใกล้มาก) แก้ไข: ต่อไปนี้คือพล็อต (mod, xvar = 'lambda') ซึ่งแสดงแกน x ในลำดับที่กลับด้านบนของพล็อต: (ป.ล. : หากคุณพบว่าคำถามนี้น่าสนใจ / สำคัญโปรดโหวตขึ้น;)

3
สูตรสำหรับสร้างตัวแปรสุ่มที่สัมพันธ์กันทำงานอย่างไร
หากเรามีตัวแปรสุ่มแบบธรรมดา 2 ตัวตัวแปรที่ไม่เกี่ยวข้องX1,X2X1,X2X_1, X_2เราสามารถสร้างตัวแปรสุ่มที่สัมพันธ์กัน 2 สูตร Y=ρX1+1−ρ2−−−−−√X2Y=ρX1+1−ρ2X2Y=\rho X_1+ \sqrt{1-\rho^2} X_2 แล้วจะมีความสัมพันธ์ρกับX 1YYYρρ\rhoX1X1X_1 บางคนสามารถอธิบายได้ว่าสูตรนี้มาจากไหน

3
เพียร์สันเป็นพารามิเตอร์ทำไมและ Spearman ไม่ใช่พารามิเตอร์
เห็นได้ชัดว่าสัมประสิทธิ์สหสัมพันธ์ของเพียร์สันเป็นพารามิเตอร์และโรของสเปียร์แมนไม่ใช่พารามิเตอร์ ฉันมีปัญหาในการเข้าใจสิ่งนี้ ตามที่ฉันเข้าใจแล้ว Pearson คำนวณเป็น และคำนวณ Spearman ด้วยวิธีเดียวกันยกเว้นเราแทนที่ค่าทั้งหมดด้วยอันดับของพวกเขาrxy=cov(X,Y)σxσyrxy=cov(X,Y)σxσy r_{xy} = \frac{cov(X,Y)}{\sigma_x\sigma_y} Wikipedia พูดว่า ความแตกต่างระหว่างโมเดลพารามิเตอร์และโมเดลที่ไม่ใช่พารามิเตอร์คืออดีตมีพารามิเตอร์จำนวนคงที่ในขณะที่รุ่นหลังจะเพิ่มจำนวนพารามิเตอร์ด้วยจำนวนข้อมูลการฝึกอบรม แต่ฉันไม่เห็นพารามิเตอร์ใด ๆ ยกเว้นกลุ่มตัวอย่างเอง บางคนบอกว่าการทดสอบพาราเมทริกถือว่าการแจกแจงแบบปกติและบอกต่อไปว่าเพียร์สันถือว่าข้อมูลการแจกแจงแบบปกติ แต่ฉันล้มเหลวที่จะดูว่าทำไมเพียร์สันถึงต้องการ ดังนั้นคำถามของฉันคืออะไรที่ทำให้พารามิเตอร์และไม่ใช่พารามิเตอร์ในบริบทของสถิติ? เพียร์สันกับสเปียร์แมนพอดีกันยังไง

5
มีรุ่นใดของ t-SNE สำหรับการสตรีมข้อมูลหรือไม่
ความเข้าใจของฉันเกี่ยวกับt-SNEและการประมาณ Barnes-Hut คือจุดข้อมูลทั้งหมดจำเป็นต้องใช้เพื่อให้การคำนวณการโต้ตอบกับแรงทั้งหมดในเวลาเดียวกันและแต่ละจุดสามารถปรับได้ในแผนที่ 2d (หรือมิติที่ต่ำกว่า) มีเวอร์ชั่นใดบ้างที่สามารถจัดการกับการสตรีมข้อมูลได้อย่างมีประสิทธิภาพหรือไม่ ดังนั้นหากการสำรวจของฉันมาถึงทีละครั้งมันจะหาตำแหน่งที่ดีที่สุดบนแผนที่ 2d เพื่อทำการสำรวจใหม่หรืออัปเดตทุกจุดบนแผนที่ 2d เป็นบัญชีสำหรับการสังเกตใหม่ ht สิ่งนี้จะสมเหตุสมผลหรือไม่หรือขัดกับการตั้งค่าของ t-sne

1
ช่วงเวลาการทำนายขึ้นอยู่กับการตรวจสอบข้าม (CV)
ในหนังสือข้อความและการบรรยาย youtube ฉันได้เรียนรู้มากมายเกี่ยวกับแบบจำลองซ้ำ ๆ เช่นการส่งเสริม แต่ฉันไม่เคยเห็นอะไรเลยเกี่ยวกับช่วงเวลาการทำนาย การตรวจสอบความถูกต้องไขว้ถูกใช้สำหรับสิ่งต่อไปนี้: การเลือกรุ่น : ลองใช้รุ่นที่แตกต่างกันและเลือกรุ่นที่เหมาะสมที่สุด ในกรณีของการส่งเสริมให้ใช้ CV เพื่อเลือกพารามิเตอร์การปรับ การประเมินโมเดล : ประเมินประสิทธิภาพของโมเดลที่เลือก พารามิเตอร์หลายตัวมีความสำคัญต่อการประเมินแบบจำลองโดยหนึ่งในนั้นคือข้อผิดพลาดในการทำนายที่คาดหวัง การตรวจสอบความถูกต้องของข้อมูลให้การประมาณที่ดีของข้อผิดพลาดในการทำนายเช่นเดียวกับที่อธิบายไว้ในหนังสือ "องค์ประกอบของการเรียนรู้ทางสถิติ" แต่เราจะใช้ข้อผิดพลาดการคาดการณ์เพื่อสร้างช่วงเวลาการทำนายได้อย่างไร และถ้าคุณทำนายราคาของบ้านตัวอย่างเช่นช่วงเวลาการทำนายจะสูงกว่าสำหรับบ้านที่ 500,000 ยูโรเมื่อเทียบกับบ้านที่มี 200,000 ยูโร เราจะประเมินช่วงเวลาการทำนายเหล่านี้โดยใช้การตรวจสอบความถูกต้องไขว้ได้อย่างไร

3
ความสับสนกับอัตราการค้นพบที่ผิดและการทดสอบหลายอย่าง (ใน Colquhoun 2014)
ฉันได้อ่านบทความที่ยอดเยี่ยมนี้โดย David Colquhoun: การตรวจสอบอัตราการค้นพบที่ผิดพลาดและการตีความค่า p ผิดพลาด (2014) ในสาระสำคัญที่เขาอธิบายว่าทำไมอัตราการค้นพบที่ผิดพลาด (FDR) สามารถจะสูงถึงแม้ว่าเราควบคุมสำหรับข้อผิดพลาดประเภทที่มี\30 %30%30\%α = 0.05α=0.05\alpha=0.05 อย่างไรก็ตามฉันยังสับสนว่าจะเกิดอะไรขึ้นถ้าฉันใช้การควบคุม FDR ในกรณีของการทดสอบหลายครั้ง บอกเด็ก ๆ ว่าฉันได้ทำการทดสอบตัวแปรแต่ละตัวแล้วและคำนวณค่าโดยใช้ขั้นตอน Benjamini-Hochberg ผมหนึ่งตัวแปรที่มีความสำคัญกับqฉันกำลังถาม FDR สำหรับการค้นพบนี้คืออะไร?QQqQ= 0.049Q=0.049q=0.049 ฉันสามารถสันนิษฐานได้อย่างปลอดภัยว่าในระยะยาวหากฉันทำการวิเคราะห์ดังกล่าวเป็นประจำ FDR ไม่ใช่30 %30%30\%แต่ต่ำกว่า5 %5%5\%เพราะฉันใช้ Benjamini-Hochberg นั่นรู้สึกผิดฉันจะบอกว่าค่าQQq -value สอดคล้องกับค่าพีพีpค่าในกระดาษของ Colquhoun และการใช้เหตุผลของเขาที่นี่เช่นกันดังนั้นการใช้ค่าQQqเกณฑ์ที่0.050.050.05ฉันเสี่ยงที่จะ "ทำให้คนโง่" Colquhoun ใส่ไว้) ใน30 %30%30\%ของคดี อย่างไรก็ตามฉันพยายามอธิบายอย่างเป็นทางการมากกว่าและล้มเหลว

2
การวิเคราะห์ความยืดหยุ่น / ริดจ์ / เชือก
ฉันได้รับความสนใจในขั้นตอนสุทธิที่ยืดหยุ่นสำหรับการคาดการณ์การหดตัว / การเลือก ดูเหมือนว่าทรงพลังมาก แต่จากมุมมองทางวิทยาศาสตร์ฉันไม่รู้ดีว่าต้องทำอะไรเมื่อได้สัมประสิทธิ์ ฉันจะตอบคำถามอะไร นี่คือตัวแปรที่มีอิทธิพลต่อผลลัพธ์มากที่สุดและมีสัมประสิทธิ์ซึ่งให้อัตราส่วนความแปรปรวน / ความเอนเอียงที่ดีที่สุดระหว่างการตรวจสอบความถูกต้อง? แน่นอนว่านี่เป็นวิธีการบรรยาย / การคาดการณ์ที่ดีมากเมื่อเปรียบเทียบกับวิธีการประเมินค่าความเชื่อมั่นแบบดั้งเดิม ขณะนี้ Tibshirani & Co. ได้ทำการศึกษาการประมาณค่าอนุมาน แต่ยังอยู่ระหว่างการทดลอง บางคนกำลังใช้ตัวแปรที่ถูกเลือกโดยเครือข่ายอีลาสติกเพื่อทำการวิเคราะห์เชิงอนุมานแบบคลาสสิก แต่นั่นจะขจัดข้อ จำกัด ในความแปรปรวนที่เกิดจากเทคนิค ปัญหาอีกประการหนึ่งคือเนื่องจากพารามิเตอร์แลมบ์ดาและอัลฟาสำหรับตาข่ายยืดหยุ่นถูกเลือกโดยการตรวจสอบความถูกต้องของข้อมูลพวกเขาจึงมีความแปรปรวนแบบสุ่ม ดังนั้นทุกครั้งที่คุณเรียกใช้ (เช่น.) cv.glmnet () คุณจะเลือกเซตย่อยที่แตกต่างกันเล็กน้อยของตัวทำนายที่มีค่าสัมประสิทธิ์ต่างกันอยู่เสมอ ฉันว่าเกี่ยวกับการแก้ปัญหานี้โดยพิจารณาแลมบ์ดาและอัลฟาที่ถูกต้องเป็นตัวแปรสุ่มและดำเนินการขั้นตอนการตรวจสอบความถูกต้องอีกครั้ง n เพื่อรับการแจกแจงของพารามิเตอร์เหล่านี้ วิธีนี้สำหรับผู้ทำนายทุกคนฉันจะมีจำนวนครั้งและทุกค่าสัมประสิทธิ์ฉันจะมีการแจกแจงผล สิ่งนี้จะให้ผลลัพธ์ generalizable เพิ่มเติมกับฉันช่วงสถิติ (เช่น sd ของสัมประสิทธิ์) มันน่าสนใจที่จะเห็นว่าแลมบ์ดาและอัลฟ่าเลือกวิธีนี้ใกล้เคียงกับการแจกแจงแบบไม่แสดงอาการหรือไม่เพราะมันจะเปิดทางสำหรับการทดสอบการอนุมาน (แต่ฉันไม่ใช่นักสถิติดังนั้นฉันไม่ควรพูดเกี่ยวกับสิ่งที่ฉันทำ ไม่เข้าใจ) ดังนั้นในที่สุดคำถามของฉันคือ: เมื่อคุณได้รับการทำนายและค่าสัมประสิทธิ์จากตาข่ายยืดหยุ่นด้วยการตรวจสอบข้ามตามอัลฟาและแลมบ์ดาซึ่งคุณควรนำเสนอผลลัพธ์เหล่านี้และวิธีการ? คุณควรพูดคุยกับพวกเขาอย่างไร? เราเรียนรู้อะไร เรากำลังตั้งสมมุติฐาน / การวางนัยทั่วไปอะไร

2
เครือข่ายประสาทกำเริบสามารถนำมาใช้สำหรับการจำแนกลำดับได้อย่างไร
RNN สามารถใช้สำหรับการทำนายหรือลำดับการแมปลำดับ แต่จะใช้ RNN ในการจำแนกได้อย่างไร? ฉันหมายถึงเราให้ลำดับทั้งหมดหนึ่งป้ายกำกับ

4
สาเหตุของการกระจายข้อมูลตามปกติ
อะไรคือทฤษฎีบทบางอย่างที่อาจอธิบายได้ (เช่นโดยทั่วไป) ว่าทำไมข้อมูลในโลกแห่งความจริงจึงอาจได้รับการกระจายตามปกติ? มีอยู่สองอย่างที่ฉันรู้: ทฤษฎีบทขีด จำกัด กลาง (แน่นอน) ซึ่งบอกเราว่าผลรวมของตัวแปรสุ่มอิสระหลายตัวที่มีค่าเฉลี่ยและความแปรปรวน (แม้ว่าพวกเขาจะไม่กระจายตัวเหมือนกัน) มีแนวโน้มที่จะกระจายตามปกติ Let X และ Y เป็น RV อย่างต่อเนื่องเป็นอิสระที่มีความหนาแน่นอนุพันธ์ดังกล่าวที่มีความหนาแน่นร่วมกันของพวกเขาเท่านั้นขึ้นอยู่กับ + 2 จากนั้น X และ Y เป็นปกติx2x2x^2Y2Y2y^2 (cross-post จากmathexchange ) แก้ไข: เพื่อความกระจ่างแจ้งฉันไม่ได้ทำการอ้างสิทธิ์ใด ๆ เกี่ยวกับจำนวนข้อมูลในโลกแห่งความเป็นจริงที่กระจายตามปกติ ฉันแค่ถามเกี่ยวกับทฤษฎีที่สามารถให้ข้อมูลเชิงลึกเกี่ยวกับกระบวนการที่อาจนำไปสู่การกระจายข้อมูลตามปกติ

2
วิธีการเลือกโครงสร้างแบบสุ่มและแบบคงที่ในโมเดลเชิงเส้นผสม
พิจารณาข้อมูลต่อไปนี้จากการออกแบบสองทางภายในวิชา: df <- "http://personality-project.org/r/datasets/R.appendix4.data" df <- read.table(df,header=T) head(df) Observation Subject Task Valence Recall 1 1 Jim Free Neg 8 2 2 Jim Free Neu 9 3 3 Jim Free Pos 5 4 4 Jim Cued Neg 7 5 5 Jim Cued Neu 9 6 6 Jim Cued Pos 10 ฉันต้องการวิเคราะห์สิ่งนี้โดยใช้แบบจำลองเชิงเส้นผสม …

4
อะไรกันแน่? พวกเขาได้รับมาอย่างไร
โดยทั่วไปเราได้รับการแนะนำให้รู้จักกับวิธีการประมาณช่วงเวลาโดย "การเทียบช่วงเวลาของประชากรกับตัวอย่างตัวอย่าง" จนกว่าเราจะประมาณพารามิเตอร์ทั้งหมดของประชากร ดังนั้นในกรณีที่มีการแจกแจงแบบปกติเราจะต้องใช้ช่วงเวลาที่หนึ่งและสองเพราะพวกเขาอธิบายการกระจายตัวนี้อย่างเต็มที่ E( X) = μ⟹Σni = 1Xผม/ n= X¯E(X)=μ⟹Σผม=1nXผม/n=X¯E(X) = \mu \implies \sum_{i=1}^n X_i/n = \bar{X} E( X2) = μ2+ σ2⟹Σni = 1X2ผม/ nE(X2)=μ2+σ2⟹Σผม=1nXผม2/nE(X^2) = \mu^2 + \sigma^2 \implies \sum_{i=1}^n X_i^2/n และเราสามารถคำนวณทางทฤษฎีได้มากถึงช่วงเวลาเพิ่มเติมตาม:nnn E(Xr)⟹∑ni=1Xri/nE(Xr)⟹∑i=1nXir/nE(X^r) \implies \sum_{i=1}^nX_i^r /n ฉันจะสร้างสัญชาตญาณได้อย่างไรว่าช่วงเวลาใดเป็นจริง ฉันรู้ว่าพวกเขามีอยู่เป็นแนวคิดในฟิสิกส์และคณิตศาสตร์ แต่ฉันคิดว่ามันไม่สามารถใช้ได้โดยตรงโดยเฉพาะอย่างยิ่งเพราะฉันไม่รู้วิธีที่จะทำให้นามธรรมจากแนวคิดมวลชนไปสู่จุดข้อมูล ดูเหมือนว่าจะใช้คำเฉพาะในทางสถิติซึ่งแตกต่างจากการใช้งานในสาขาอื่น อะไรลักษณะของข้อมูลของฉันกำหนดวิธีการที่หลายคน ( ) ในช่วงเวลาที่มีโดยรวม?rrr

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.