สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
ความแตกต่างคือสถิติสรุป: ค่าสัมประสิทธิ์จินีและส่วนเบี่ยงเบนมาตรฐาน
มีสถิติสรุปหลายอย่าง เมื่อคุณต้องการที่จะอธิบายการแพร่กระจายของการกระจายที่คุณสามารถใช้สำหรับตัวอย่างส่วนเบี่ยงเบนมาตรฐานหรือสัมประสิทธิ์จีนี ฉันรู้ว่าค่าเบี่ยงเบนมาตรฐานขึ้นอยู่กับแนวโน้มกลางนั่นคือการเบี่ยงเบนจากค่าเฉลี่ยและค่าสัมประสิทธิ์ Gini เป็นการวัดทั่วไปของการกระจายตัว ผมยังไม่ทราบว่าค่าสัมประสิทธิ์ Gini มีลดลงและผูกไว้บน [0 1] และค่าเบี่ยงเบนมาตรฐานไม่ได้ คุณสมบัติเหล่านี้เป็นสิ่งที่ดีที่จะรู้ แต่ความเข้าใจส่วนเบี่ยงเบนมาตรฐานสามารถให้ Gini ไม่สามารถและหนีบในทางกลับกันได้? ถ้าฉันต้องเลือกที่จะใช้หนึ่งในสองสิ่งที่เป็นประโยชน์ของการใช้หนึ่งเมื่อเทียบกับคนอื่นเมื่อมันเป็นข้อมูลและลึกซึ้ง

2
อะไรคือความแตกต่างระหว่าง
ผมอ่านเกี่ยวกับเมตริกถดถอยในหลาม scikit การเรียนรู้ด้วยตนเองและแม้ว่าหนึ่งของพวกเขาแต่ละคนมีสูตรของตัวเองฉันไม่สามารถบอกสังหรณ์ใจว่าอะไรคือความแตกต่างระหว่างและคะแนนความแปรปรวนและดังนั้นเมื่อจะใช้อย่างใดอย่างหนึ่งหรืออื่นในการประเมิน โมเดลของฉันR2R2R^2

3
ความสัมพันธ์ระหว่างทฤษฎีเกมกับการเรียนรู้การเสริมกำลังคืออะไร?
ฉันสนใจ(ลึก) เสริมสร้างการเรียนรู้ (RL) ก่อนลงดำน้ำในสาขานี้ฉันควรเรียนในGame Theory (GT)หรือไม่? วิธีGTและRLเกี่ยวข้อง?

1
การสร้างแบบจำลองแบบเบส์ของเวลารอรถไฟ: การกำหนดโมเดล
นี่เป็นความพยายามครั้งแรกของฉันสำหรับใครบางคนที่มาจากค่ายบ่อย ๆ เพื่อทำการวิเคราะห์ข้อมูลแบบเบย์ ฉันอ่านบทช่วยสอนจำนวนหนึ่งและบทไม่กี่บทจากการวิเคราะห์ข้อมูลแบบเบย์โดย A. Gelman เนื่องจากตัวอย่างการวิเคราะห์ข้อมูลอิสระมากขึ้นหรือน้อยลงอย่างแรกที่ฉันเลือกคือเวลาในการรอรถไฟ ฉันถามตัวเองว่าอะไรคือการกระจายเวลารอคอย ชุดข้อมูลนั้นมีอยู่ในบล็อกและได้รับการวิเคราะห์แตกต่างกันเล็กน้อยและนอก PyMC เป้าหมายของฉันคือการประเมินเวลารอรถไฟที่คาดว่าจะได้รับจากข้อมูล 19 รายการ โมเดลที่ฉันสร้างขึ้นมีดังต่อไปนี้: μ∼N(μ^,σ^)μ∼N(μ^,σ^)\mu \sim N(\hat\mu,\hat\sigma) σ∼|N(0,σ^)|σ∼|N(0,σ^)|\sigma \sim |N(0,\hat\sigma)| λ∼Γ(μ,σ)λ∼Γ(μ,σ)\lambda \sim \Gamma(\mu,\sigma) ρ∼Poisson(λ)ρ∼Poisson(λ)\rho \sim Poisson(\lambda) โดยที่คือค่าเฉลี่ยของข้อมูลและคือส่วนเบี่ยงเบนมาตรฐานของข้อมูลคูณด้วย 1,000μ^μ^\hat\muσ^σ^\hat\sigma ฉันจำลองเวลารอคอยที่คาดว่าจะเป็นโดยใช้การแจกแจงปัวซอง พารามิเตอร์ rate สำหรับการแจกแจงนี้ถูกสร้างแบบจำลองโดยใช้การแจกแจงแกมม่าเนื่องจากเป็นการเชื่อมต่อแบบคอนจูเกตกับการแจกแจงแบบปัวซอง ไฮเปอร์ - ไพรเออร์และถูกสร้างแบบจำลองด้วยการแจกแจงแบบปกติและแบบครึ่งปกติ ค่าเบี่ยงเบนมาตรฐานถูกทำให้กว้างที่สุดเท่าที่จะเป็นได้ρρ\rhoμμ\muσσ\sigmaσσ\sigma ฉันมีคำถามมากมาย แบบจำลองนี้มีความเหมาะสมสำหรับงานหรือไม่ ฉันทำผิดพลาดเริ่มต้นหรือไม่? แบบจำลองสามารถทำให้ง่ายขึ้นได้หรือไม่ (ฉันมักจะทำให้สิ่งต่าง ๆ ง่ายขึ้น)? ฉันจะตรวจสอบได้อย่างไรว่าพารามิเตอร์ด้านหลัง ( ) เหมาะกับข้อมูลจริงหรือไม่?ρρ\rho ฉันจะดึงตัวอย่างจากการกระจาย Poisson ที่ติดตั้งเพื่อดูตัวอย่างได้อย่างไร …
12 bayesian  pymc 

1
ช่วงความเชื่อมั่นและความไม่แน่นอนของค่า P สำหรับการทดสอบการเปลี่ยนรูป
ฉันกำลังเรียนรู้การทดสอบแบบสุ่มในขณะนี้ มีคำถามอยู่สองข้อในใจของฉัน: ใช่มันง่ายและใช้งานง่ายวิธีคำนวณค่า p ด้วยการทดสอบการสุ่ม (ซึ่งฉันคิดว่าเหมือนกับการทดสอบการเรียงสับเปลี่ยน?) อย่างไรก็ตามเราจะสร้างช่วงความมั่นใจได้ 95% ในขณะที่เราทำการทดสอบแบบพาราเมตริกได้อย่างไร เมื่อฉันอ่านเอกสารจาก University of Washington เกี่ยวกับการทดสอบการเรียงสับเปลี่ยนมีประโยคหนึ่งในหน้า 13 ที่บอกว่า: 1000 พีชคณิต .... ความไม่แน่นอนที่อยู่ใกล้ p = 0.05 เป็นเรื่องเกี่ยวกับ \%± 1 %±1%\pm 1\% ฉันสงสัยว่าเราจะมีความไม่แน่นอนนี้ได้อย่างไร

1
วิธีปรับน้ำหนักให้เป็นค่า Q ด้วยการประมาณฟังก์ชั่นเชิงเส้น
ในการเรียนรู้การเสริมแรงการประมาณฟังก์ชั่นเชิงเส้นมักใช้เมื่อมีพื้นที่ของรัฐขนาดใหญ่ (เมื่อค้นหาตารางจะไม่สามารถทำได้) รูปแบบของคุ้มค่ากับฟังก์ชั่นการประมาณเชิงเส้นจะถูกกำหนดโดยถาม-Q−Q- Q ( s , a ) = w1ฉ1( s , a ) + w2ฉ2( s , a ) + ⋯ ,Q(s,a)=w1f1(s,a)+w2f2(s,a)+⋯,Q(s,a) = w_1 f_1(s,a) + w_2 f_2(s,a) + \cdots, ที่มีน้ำหนักและฉฉันเป็นคุณสมบัติWผมWผมw_iฉผมฉผมf_i คุณสมบัติที่กำหนดไว้ล่วงหน้าโดยผู้ใช้ คำถามของฉันคือน้ำหนักถูกกำหนดอย่างไร ฉันได้อ่าน / ดาวน์โหลดสไลด์การบรรยายบางอย่างเกี่ยวกับการเรียนรู้ด้วยฟังก์ชั่นการประมาณ ส่วนใหญ่มีสไลด์บนการถดถอยเชิงเส้นที่ตามมา เนื่องจากเป็นเพียงสไลด์จึงมีแนวโน้มที่จะไม่สมบูรณ์ ฉันสงสัยว่าการเชื่อมต่อ / ความสัมพันธ์ระหว่างสองหัวข้อคืออะไรถาม-Q-Q-

3
จะเป็นอย่างไรถ้าเส้นทาง c ไม่สำคัญ แต่เส้นทาง a และ b เป็นอย่างไร ผลทางอ้อมในการไกล่เกลี่ย
ในโมเดลสื่อกลางแบบคลาสสิคเรามีเส้นทางที่แสดงในแผนภาพด้านล่าง , ซึ่งในขั้นตอนแรกของการทดสอบผลการไกล่เกลี่ยของ M ระหว่าง X และ Y คือ X นั้นมีความสัมพันธ์อย่างมีนัยสำคัญกับ Y (ดังแสดงในแผง A ในรูป) แต่ผมชนเข้ากับสถานการณ์ที่เส้นทางและเส้นทางขมีความสำคัญอย่างยิ่ง แต่ไม่เส้นทาง C เมื่อเปรียบเทียบกับ Path c เส้นทาง Path c 'ไม่มีนัยสำคัญ แต่ค่าสัมประสิทธิ์ลดลง ในกรณีนี้มันยังคงมีค่าที่จะพูดคุยเกี่ยวกับความสัมพันธ์ระหว่าง X, Y และ M หรือไม่? ถ้าเป็นเช่นนั้นวิธีที่ดีที่สุดในการจัดการความสัมพันธ์นี้ในบทความคืออะไร? เราสามารถอ้างได้ว่า X มีผลทางอ้อม แต่ไม่ใช่ผลกระทบโดยตรงกับ Y หรือไม่? ฉันกำลังทดสอบรูปแบบเส้นทางเดียวกันกับสามตัวอย่าง166n1=124,n2=49,n3=166n1=124,n2=49,n3=166n_1 = 124, n_2 = 49, n_3 = 166

2
วิธีการหมุนตัวประกอบ (varimax, oblimin ฯลฯ ) - ชื่อนี้มีความหมายว่าอย่างไรและมีวิธีการอย่างไร?
การวิเคราะห์ปัจจัยมีวิธีการหมุนหลายวิธีเช่น varimax, quartimax, equamax, promax, oblimin เป็นต้นฉันไม่สามารถหาข้อมูลใด ๆ ที่เกี่ยวข้องกับชื่อของพวกเขากับการกระทำทางคณิตศาสตร์หรือสถิติที่แท้จริง ทำไมถึงเรียกว่า "equa-max" หรือ "quarti-max" แกนหรือเมทริกซ์หมุนไปทางใดดังนั้นพวกเขาจึงมีชื่อเช่นนี้? น่าเสียดายที่พวกเขาส่วนใหญ่ถูกประดิษฐ์ขึ้นในปี 1950 - 1970 ดังนั้นฉันไม่สามารถติดต่อผู้เขียนได้

3
ทรัพยากรสำหรับการวิเคราะห์อนุกรมเวลาที่ขัดจังหวะใน R
ฉันค่อนข้างใหม่สำหรับอาร์ฉันได้พยายามอ่านการวิเคราะห์อนุกรมเวลาและเสร็จสิ้นแล้ว Shumway และ Stoffer ของการวิเคราะห์อนุกรมเวลาและการประยุกต์ใช้ 3rd Edition , การพยากรณ์ที่ยอดเยี่ยมของ Hyndman : หลักการและการปฏิบัติ Avril Coghlan ใช้ R สำหรับการวิเคราะห์อนุกรมเวลา A. Ian McLeod และคณะการวิเคราะห์อนุกรมเวลาด้วย R การวิเคราะห์อนุกรมเวลาของ Dr. Marcel Dettling แก้ไข: ฉันไม่แน่ใจว่าจะจัดการอย่างไร แต่ฉันพบทรัพยากรที่มีประโยชน์นอกการตรวจสอบความถูกต้องของ Cross ฉันต้องการที่จะรวมไว้ที่นี่ในกรณีที่ทุกคนสะดุดกับคำถามนี้ การวิเคราะห์การถดถอยแบบแบ่งกลุ่มของการศึกษาอนุกรมเวลาแบบขัดจังหวะในการวิจัยการใช้ยา ฉันมีอนุกรมเวลาแบบไม่แปรตามจำนวนรายการที่ใช้ (นับข้อมูล) ที่วัดทุกวันเป็นเวลา 7 ปี การแทรกแซงถูกนำไปใช้กับประชากรที่ศึกษาประมาณช่วงกลางของอนุกรมเวลา การแทรกแซงนี้ไม่ได้คาดหวังว่าจะให้ผลทันทีและระยะเวลาของการโจมตีของผลกระทบนั้นเป็นสิ่งที่ไม่สามารถเข้าใจได้ ใช้ Hyndman ของforecastแพคเกจผมได้ติดตั้งรูปแบบ ARIMA auto.arima()ข้อมูลก่อนการแทรกแซงโดยใช้ แต่ฉันไม่แน่ใจว่าจะใช้แบบนี้เพื่อตอบว่ามีการเปลี่ยนแปลงอย่างมีนัยสำคัญทางสถิติในแนวโน้มและปริมาณจำนวน # for simplification I will …
12 r  time-series 

2
การเพิ่มประสิทธิภาพเครื่องเวกเตอร์สนับสนุนด้วยการเขียนโปรแกรม Quadratic
ฉันพยายามที่จะเข้าใจกระบวนการสำหรับการฝึกอบรมเชิงเส้นเครื่องเวกเตอร์การสนับสนุน ฉันรู้ว่าคุณสมบัติของ SMV ช่วยให้พวกเขาได้รับการปรับให้เร็วที่สุดมากกว่าการใช้ตัวแก้ปัญหาการเขียนโปรแกรมแบบสี่เหลี่ยมจัตุรัส แต่เพื่อจุดประสงค์ในการเรียนรู้ ข้อมูลการฝึกอบรม set.seed(2015) df <- data.frame(X1=c(rnorm(5), rnorm(5)+5), X2=c(rnorm(5), rnorm(5)+3), Y=c(rep(1,5), rep(-1, 5))) df X1 X2 Y 1 -1.5454484 0.50127 1 2 -0.5283932 -0.80316 1 3 -1.0867588 0.63644 1 4 -0.0001115 1.14290 1 5 0.3889538 0.06119 1 6 5.5326313 3.68034 -1 7 3.1624283 2.71982 -1 8 5.6505985 …
12 r  svm  optimization 

3
Non-linearity ก่อนชั้น Softmax สุดท้ายในเครือข่ายประสาทเทียม
ฉันกำลังศึกษาและพยายามใช้โครงข่ายประสาทเทียม แต่ฉันคิดว่าคำถามนี้ใช้ได้กับผู้เรียนหลายคนโดยทั่วไป เซลล์ส่งออกในเครือข่ายของฉันเป็นตัวแทนของการเปิดใช้งานของแต่ละชั้นเรียน: เซลล์ประสาทที่ใช้งานมากที่สุดสอดคล้องกับระดับที่คาดการณ์ไว้สำหรับการป้อนข้อมูลที่กำหนด ในการพิจารณาค่าใช้จ่ายข้ามเอนโทรปีสำหรับการฝึกอบรมฉันเพิ่มเลเยอร์ softmax ที่ส่วนท้ายของเครือข่ายเพื่อให้ค่าการเปิดใช้งานของเซลล์ประสาทแต่ละค่าถูกตีความเป็นค่าความน่าจะเป็น คำถามของฉันคือ: เซลล์ประสาทในชั้นเอาต์พุตควรใช้ฟังก์ชันที่ไม่ใช่เชิงเส้นกับอินพุตหรือไม่ สัญชาตญาณของฉันคือมันไม่จำเป็น: ถ้าอินพุตกับ th เอาต์พุตเซลล์ประสาทคือจุดผลิตภัณฑ์ระหว่างเวกเตอร์ (มาจากเลเยอร์ก่อนหน้า) และน้ำหนักสำหรับเซลล์ประสาทนั้นx T θ ฉัน x θ ฉันผมผมixTθผมxTθผมx^T\theta_ixxxθผมθผม\theta_i และถ้าฉันใช้ฟังก์ชั่นที่ไม่ใช่เชิงเส้นเดียวเช่น sigmoid หรือ ReLU ดังนั้นการเปิดใช้งานเอาต์พุตขนาดใหญ่จะยังคงสอดคล้องกับใหญ่ที่สุดดังนั้นจากมุมมองนี้ฟังก์ชั่นที่ไม่ใช่เชิงเส้นจะไม่เปลี่ยนการทำนายxTθผมxTθผมx^T\theta_i มีอะไรผิดปกติกับการตีความนี้หรือไม่? มีปัจจัยการฝึกอบรมบางอย่างที่ฉันมองเห็นหรือไม่ และถ้าฉันพูดถูกสิ่งใดจะเปลี่ยนไปถ้าแทนที่จะใช้ฟังก์ชั่น sigmoid ฉันใช้ฟังก์ชั่น ReLUซึ่งไม่ใช่ฟังก์ชั่นโมโนโทนิกอย่างแน่นอนสูงสุด( 0 , xTθผม)สูงสุด(0,xTθผม)\max(0,x^T\theta_i) แก้ไข จากการอ้างอิงถึงคำตอบของ Karel ซึ่งคำตอบโดยทั่วไปคือ "ขึ้นอยู่กับ" นี่คือคำอธิบายโดยละเอียดเพิ่มเติมเกี่ยวกับเครือข่ายและข้อสงสัยของฉัน: สมมติว่าฉันมีเลเยอร์ที่ซ่อนอยู่ N ชั้นและชั้นการส่งออกของฉันเป็นเพียงชั้น softmax เหนือชุดของเซลล์ประสาทที่เป็นตัวแทนของคลาส (ดังนั้นผลลัพธ์ที่คาดหวังของฉันคือความน่าจะเป็นที่ข้อมูลอินพุตเป็นของแต่ละชั้นเรียน) สมมติว่าเลเยอร์ N-1 แรกมีเซลล์ประสาทแบบไม่เชิงเส้นอะไรคือความแตกต่างระหว่างการใช้เซลล์ประสาทแบบไม่เชิงเส้นกับเชิงเส้นตรงในเลเยอร์ …

3
วิธีจัดการค่า NA ในวิธีการหดตัว (Lasso) โดยใช้ glmnet
ฉันใช้ "glmnet" สำหรับการถดถอยแบบ lasso ใน GWAS ตัวแปรและบุคคลบางตัวมีค่าหายไปและดูเหมือนว่า glmnet ไม่สามารถจัดการค่าที่ขาดหายไปได้ มีวิธีแก้ไขปัญหานี้หรือไม่? หรือมีแพ็คเกจอื่นที่สามารถจัดการกับค่าที่ขาดหายไปในการถดถอยแบบ lasso ได้หรือไม่? นี่คือสคริปต์ของฉัน > library(glmnet) > geno6<-read.table("c6sigCnt.geno") > geno6[1:10,1:10] #genotype file (0,1,2 for minor allele counts) V1 V2 V3 V4 V5 V6 V7 V8 V9 V10 1 1 1 1 1 1 1 1 1 1 0 2 NA …

1
จะเข้าใจได้อย่างไรว่า MLE of Variance นั้นลำเอียงในการแจกแจงแบบเกาส์เซียน?
ฉันกำลังอ่าน PRML และฉันไม่เข้าใจภาพ คุณกรุณาให้คำแนะนำเพื่อเข้าใจภาพและทำไมความแปรปรวนของ MLE ในการแจกแจงแบบเกาส์ถึงมีอคติ? สูตร 1.55: สูตร 1.56 σ 2 M L E =1μMLE=1N∑n=1NxnμMLE=1N∑n=1Nxn \mu_{MLE}=\frac{1}{N} \sum_{n=1}^N x_n σ2MLE=1N∑n=1N(xn−μMLE)2σMLE2=1N∑n=1N(xn−μMLE)2 \sigma_{MLE}^2=\frac{1}{N}\sum_{n=1}^{N}(x_n-\mu_{MLE})^2

1
ค่าเฉลี่ยความแม่นยำเฉลี่ยเทียบกับค่าเฉลี่ยซึ่งกันและกันอันดับ
ฉันพยายามที่จะเข้าใจเมื่อมันเหมาะสมที่จะใช้แผนที่และควรใช้ MRR เมื่อใด ฉันพบงานนำเสนอนี้ที่ระบุว่า MRR จะใช้ประโยชน์ได้ดีที่สุดเมื่อจำนวนผลลัพธ์ที่เกี่ยวข้องน้อยกว่า 5 และดีที่สุดเมื่อเป็น 1 ในกรณีอื่น ๆ MAP เหมาะสม ฉันมีสองคำถาม: ฉันไม่เข้าใจจริงๆว่าทำไมถึงเป็นเช่นนั้น ฉันไม่พบการอ้างอิงที่อ้างอิงได้สำหรับการอ้างสิทธิ์นี้ โปรดทราบว่าฉันไม่มีภูมิหลังทางสถิติที่แข็งแกร่งมากดังนั้นคำอธิบายของคนธรรมดาจะช่วยได้มาก ขอบคุณ.

1
ทำไมเราต้องการพล็อตการติดตามสำหรับผลลัพธ์ MCMC
ฉันกำลังอ่านรายงานการวิจัยโดยใช้วิธีการ MCMC และฉันเห็นว่าส่วนใหญ่ให้แผนการแปลง เหตุใดเราจึงต้องมีแผนการแปลงร่องรอยใน Monte Carlo Markov Chain พล็อตการติดตามของพารามิเตอร์ระบุอะไร

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.