สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
วิธีการฝึกเลเยอร์การฝังในเลเยอร์ Keras การฝัง
เลเยอร์การฝังได้รับการฝึกฝนในเลเยอร์ Keras อย่างไร (พูดโดยใช้ tensorflow แบ็กเอนด์ความหมายมันคล้ายกับ word2vec, ถุงมือหรือข้อความอย่างรวดเร็ว) สมมติว่าเราไม่ใช้การฝังที่ถูกเตรียมไว้

3
ทฤษฎีการประมาณค่าแบบสากลสำหรับเครือข่ายแบบ Convolutional
ทฤษฎีบทการประมาณแบบสากลเป็นผลลัพธ์ที่มีชื่อเสียงสำหรับเครือข่ายประสาทโดยทั่วไประบุว่าภายใต้สมมติฐานบางฟังก์ชั่นสามารถประมาณได้อย่างสม่ำเสมอโดยเครือข่ายประสาทในความแม่นยำ มีผลลัพธ์ที่คล้ายคลึงกันที่ใช้กับเครือข่ายประสาทเทียมหรือไม่?

4
เข้าใจง่ายถึงความแตกต่างระหว่างความสอดคล้องและไม่เอนเอียง
ฉันพยายามที่จะเข้าใจและรู้สึกถึงความแตกต่างและความแตกต่างระหว่างคำที่สอดคล้องและไม่เอนเอียง ฉันรู้ว่าคำจำกัดความทางคณิตศาสตร์ / สถิติของพวกเขา แต่ฉันกำลังมองหาบางอย่างที่ใช้งานง่าย สำหรับฉันการดูคำจำกัดความของแต่ละคนพวกเขาเกือบจะเหมือนกัน ฉันตระหนักถึงความแตกต่างจะต้องบอบบาง แต่ฉันไม่เห็นมัน ฉันพยายามนึกภาพความแตกต่าง แต่ทำไม่ได้ ใครช่วยได้บ้าง

4
โครงข่ายประสาทเทียมสำหรับการถดถอยแบบหลายเอาต์พุต
ฉันมีชุดข้อมูลที่มีคอลัมน์อินพุต 34 คอลัมน์และ 8 คอลัมน์เอาต์พุต วิธีหนึ่งในการแก้ปัญหาคือใช้อินพุต 34 ตัวและสร้างโมเดลการถดถอยแบบแยกเฉพาะสำหรับแต่ละคอลัมน์เอาต์พุต ฉันสงสัยว่าปัญหานี้สามารถแก้ไขได้โดยใช้เพียงหนึ่งโมเดลโดยเฉพาะอย่างยิ่งการใช้ Neural Network ฉันใช้ตัวรับหลายเลเยอร์ แต่ต้องการโมเดลหลายตัวเช่นเดียวกับการถดถอยเชิงเส้น สามารถเรียงลำดับตามลำดับที่1การเรียนรู้เป็นทางเลือกได้หรือไม่? ฉันลองใช้ TensorFlow ดูเหมือนจะไม่สามารถจัดการค่าลอยได้ ข้อเสนอแนะใด ๆ ที่จะแก้ไขปัญหานี้โดยใช้รูปแบบรวมเป็นหนึ่งเดียวโดยเฉพาะโดยใช้โครงข่ายประสาทเทียมจะได้รับการชื่นชม Ilya Sutskever, Oriol Vinyals, & Quoc V. Le (2014) ลำดับการเรียนรู้ต่อเนื่องกับโครงข่ายประสาทเทียม ความก้าวหน้าในระบบประมวลผลข้อมูลประสาท , 27. ( pdf )

2
การกระจายตัวของตัวอย่างหมายถึงการกระจาย Cauchy คืออะไร?
โดยทั่วไปแล้วเมื่อหนึ่งใช้ค่าเฉลี่ยตัวอย่างแบบสุ่มของการกระจาย (ที่มีขนาดตัวอย่างมากกว่า 30) หนึ่งได้รับการกระจายปกติอยู่ตรงกลางรอบค่าเฉลี่ย อย่างไรก็ตามฉันได้ยินว่าการแจกจ่าย Cauchy นั้นไม่มีคุณค่า การกระจายแบบใดที่ได้รับเมื่อได้รับค่าเฉลี่ยตัวอย่างของการแจกแจงโคชี โดยทั่วไปสำหรับการแจกจ่าย Cauchyไม่ได้ถูกกำหนดดังนั้นคืออะไรและการกระจายของ\ bar {x}คืออะไร?μxμx\mu_xμx¯μx¯\mu_{\bar{x}}x¯x¯\bar{x}
14 cauchy 

1
การตีความเอาต์พุต. L & .Q จาก GLM ทวินามลบที่มีข้อมูลหมวดหมู่
ฉันเพิ่งวิ่ง GLM ลบแบบทวินามและนี่คือผลลัพธ์: Call: glm.nb(formula = small ~ method + site + depth, data = size.dat, init.theta = 1.080668549, link = log) Deviance Residuals: Min 1Q Median 3Q Max -2.2452 -0.9973 -0.3028 0.3864 1.8727 Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 1.6954 0.1152 14.720 < 2e-16 *** method.L -0.6828 …

3
ทำไมอัตราต่อรองจากสูตรและการตกปลาของ R แตกต่างกันอย่างไร ควรเลือกแบบใด
ในตัวอย่างต่อไปนี้ > m = matrix(c(3, 6, 5, 6), nrow=2) > m [,1] [,2] [1,] 3 5 [2,] 6 6 > (OR = (3/6)/(5/6)) #1 [1] 0.6 > fisher.test(m) #2 Fisher's Exact Test for Count Data data: m p-value = 0.6699 alternative hypothesis: true odds ratio is not equal to 1 …

1
การถดถอยโลจิสติกการเพิ่มความเป็นไปได้สูงสุดนั้นจำเป็นต้องเพิ่ม AUC ให้มากกว่าแบบจำลองเชิงเส้นหรือไม่
เมื่อได้รับชุดข้อมูลที่มีผลลัพธ์แบบไบนารีY∈ { 0 , 1 }ny∈{0,1}ny\in\{0,1\}^nและเมทริกซ์ตัวทำนายบางตัวX∈Rn×pX∈Rn×pX\in\mathbb{R}^{n\times p}แบบจำลองการถดถอยแบบโลจิสติกมาตรฐานประมาณค่าสัมประสิทธิ์βMLEβMLE\beta_{MLE}ซึ่งเพิ่มความน่าจะเป็นทวินาม เมื่อXXXอยู่ในอันดับเต็มβMLEβMLE\beta_{MLE}นั้นมีเอกลักษณ์ เมื่อไม่มีการแยกที่สมบูรณ์แบบมันจะ จำกัด ไม่แบบนี้โอกาสสูงสุดยังเพิ่ม ROC AUC (aka ccc -statistic) หรือไม่มีอยู่ประมาณการค่าสัมประสิทธิ์บางβAUC≠βMLEβAUC≠βMLE\beta_{AUC} \neq \beta_{MLE}ซึ่งจะได้รับสูงกว่า ROC AUC? ถ้ามันเป็นความจริงที่ MLE ไม่จำเป็นต้องเพิ่ม ROC AUC ให้มากที่สุดอีกวิธีหนึ่งในการดูคำถามนี้คือ "มีทางเลือกอื่นในการเพิ่มความน่าจะเป็นซึ่งจะเพิ่ม ROC AUC สูงสุดของการถดถอยโลจิสติกเสมอหรือไม่" ฉันสมมติว่าแบบจำลองนั้นเหมือนกัน: เราไม่ได้เพิ่มหรือลบตัวทำนายในXXXหรือเปลี่ยนแปลงข้อกำหนดของแบบจำลองและฉันสมมติว่าแบบจำลองความน่าจะเป็นสูงสุดและ AUC-maximizing model กำลังใช้ฟังก์ชันลิงก์เดียวกัน

3
มีเอกสารที่อ้างถึงอย่างมากเกี่ยวกับสถิติที่แพร่กระจายการปฏิบัติทางสถิติที่ไม่ดีจริง ๆ หรือไม่?
เห็นได้ชัดว่ามีหลายวิธีในการละเมิดวิธีการทางสถิติ คุณรู้จักตัวอย่างของการฝึกฝนทางสถิติที่ไม่ดีซึ่งได้รับการตีพิมพ์เป็นคำแนะนำที่ชัดเจนครั้งแรก (เช่น "คุณควรใช้วิธีการนี้เพื่อ ... ") ในวารสารวิชาการที่มีชื่อเสียงที่ถูกอ้างถึงซ้ำแล้วซ้ำอีก? ตัวอย่างอาจเป็น 10 เหตุการณ์ต่อกฎของตัวทำนายที่มักถูกเรียกใช้สำหรับโลจิสติกหรือโมเดลการถดถอยของ Cox PH ( LINK ) เพื่อความชัดเจนฉันไม่ได้หมายถึงเอกสารที่อ้างถึงอย่างสูงซึ่งเกิดขึ้นกับการใช้วิธีการทางสถิติที่ไม่ดี

1
ปล่อยค่าผิดปกติตาม“ 2.5 เท่า RMSE”
ในKahneman และ Deaton (2010)ผู้แต่งเขียนสิ่งต่อไปนี้:††^\dagger การถดถอยนี้อธิบายถึง 37% ของความแปรปรวนพร้อมกับรูทข้อผิดพลาดกำลังสองเฉลี่ย (RMSE) เท่ากับ 0.67852 ในการกำจัดค่าผิดปกติและรายงานรายได้ที่ไม่น่าเชื่อถือเราได้ลดการสังเกตซึ่งค่าสัมบูรณ์ของความแตกต่างระหว่างรายได้จากบันทึกและการคาดการณ์เกิน 2.5 เท่าของ RMSE นี่คือการปฏิบัติทั่วไปหรือไม่ สัญชาตญาณที่อยู่เบื้องหลังการทำเช่นนั้นคืออะไร? ดูเหมือนจะค่อนข้างแปลกที่จะกำหนดค่าผิดปกติโดยยึดตามแบบจำลองซึ่งอาจไม่ได้ระบุอย่างชัดเจนตั้งแต่แรก การกำหนดค่าผิดปกติไม่ควรอยู่บนพื้นฐานทางทฤษฎีสำหรับสิ่งที่มีค่าที่น่าเชื่อถือมากกว่าแบบจำลองของคุณทำนายค่าจริงได้ดีเพียงใด ††\dagger : Daniel Kahneman, Angus Deaton (2010): รายได้สูงช่วยปรับปรุงการประเมินชีวิต แต่ไม่ใช่ความเป็นอยู่ที่ดีทางอารมณ์ การดำเนินการของ National Academy of Sciences ก.ย. 2010, 107 (38) 16489-16493; DOI: 10.1073 / pnas.1011492107

3
ใช้ความยาวเฉลี่ยและน้ำหนักเฉลี่ยในการคำนวณค่าดัชนีมวลกายหรือไม่
มันถูกต้องหรือไม่ที่จะใช้ความยาวเฉลี่ย ( ) และน้ำหนักเฉลี่ย ( )) จากประชากรที่กำหนดเพื่อคำนวณค่าดัชนี ( ) สำหรับประชากรนั้น?ชั่วโมงhhWwwบีเอ็มผม= wชั่วโมง2BMI=wh2BMI = \frac{w}{h^2}

5
คำถามเชิงปรัชญาเกี่ยวกับการถดถอยโลจิสติก: เหตุใดค่าเกณฑ์ที่เหมาะสมที่สุดจึงไม่ผ่านการฝึกอบรม
โดยปกติแล้วในการถดถอยโลจิสติกเราพอดีแบบและได้รับการคาดการณ์ในชุดการฝึกอบรม จากนั้นเราจะตรวจสอบความถูกต้องของการคาดการณ์การฝึกอบรมเหล่านี้ (บางอย่างเช่นที่นี่ ) และตัดสินใจค่าเกณฑ์ที่เหมาะสมโดยพิจารณาจาก ROC curve ทำไมเราไม่รวมการตรวจสอบข้ามเขตแดนเข้ากับรูปแบบที่แท้จริงและฝึกอบรมทุกสิ่งตั้งแต่ต้นจนจบ

2
เกณฑ์การตัดสินใจเป็นพารามิเตอร์ในการถดถอยโลจิสติกหรือไม่
คลาสที่ถูกทำนายจากการถดถอยโลจิสติก (ไบนารี) ถูกกำหนดโดยใช้ขีด จำกัด บนความน่าจะเป็นสมาชิกคลาสที่สร้างโดยโมเดล ตามที่เข้าใจแล้วปกติแล้ว 0.5 จะถูกใช้เป็นค่าเริ่มต้น แต่การเปลี่ยนเกณฑ์จะเปลี่ยนการจำแนกประเภทที่คาดการณ์ไว้ สิ่งนี้หมายความว่าขีด จำกัด คือพารามิเตอร์มากเกินไปหรือไม่ หากเป็นเช่นนั้นเหตุใดจึงไม่สามารถค้นหากริดเกณฑ์ได้อย่างง่ายดายโดยใช้วิธีการของ scikit-Learn GridSearchCV(เช่นเดียวกับที่คุณทำกับพารามิเตอร์การทำให้เป็นมาตรฐานC)

4
อะไรคือประเด็นของการถดถอยแบบ univariate ก่อนการถดถอยหลายตัวแปร?
ขณะนี้ฉันกำลังทำงานกับปัญหาที่เรามีชุดข้อมูลขนาดเล็กและมีความสนใจในลักษณะพิเศษเวรกรรมของการรักษาผล ที่ปรึกษาของฉันได้สั่งให้ฉันทำการถดถอยแบบไม่มีการเปลี่ยนแปลงบนตัวทำนายแต่ละตัวโดยให้ผลลัพธ์เป็นคำตอบจากนั้นให้การกำหนดการรักษาเป็นการตอบสนอง คือฉันกำลังถูกขอให้พอดีกับการถดถอยกับตัวแปรหนึ่งตัวในแต่ละครั้งและสร้างตารางผลลัพธ์ ฉันถามว่า "ทำไมเราต้องทำสิ่งนี้?" และคำตอบก็คือสิ่งที่เกิดขึ้นจาก "เราสนใจว่าตัวทำนายใดที่เกี่ยวข้องกับการกำหนดการรักษาและผลที่เกิดขึ้น ที่ปรึกษาของฉันเป็นนักสถิติที่ผ่านการฝึกอบรมไม่ใช่นักวิทยาศาสตร์ในสาขาอื่นดังนั้นฉันจึงเชื่อใจพวกเขา สิ่งนี้สมเหตุสมผล แต่ยังไม่ชัดเจนว่าจะใช้ผลลัพธ์ของการวิเคราะห์ที่ไม่แปรปรวนได้อย่างไร จะไม่เลือกตัวเลือกแบบจำลองจากผลลัพธ์นี้ในอคติที่สำคัญของการประมาณการและช่วงความเชื่อมั่นที่แคบลงหรือไม่ ทำไมทุกคนควรทำเช่นนี้? ฉันสับสนและที่ปรึกษาของฉันค่อนข้างทึบแสงในประเด็นเมื่อฉันนำมันมา ใครบ้างมีทรัพยากรเกี่ยวกับเทคนิคนี้ (NB: ที่ปรึกษาของฉันบอกว่าเราไม่ได้ใช้ค่า p เป็นค่าตัด แต่เราต้องการพิจารณา "ทุกอย่าง")

1
เหตุใด MLE จึงสมเหตุสมผลเนื่องจากความน่าจะเป็นของตัวอย่างแต่ละรายการคือ 0
นี่เป็นความคิดแปลก ๆ ที่ฉันมีในขณะที่ตรวจสอบสถิติเก่า ๆ และด้วยเหตุผลบางอย่างที่ฉันไม่สามารถนึกถึงคำตอบได้ PDF แบบต่อเนื่องบอกความหนาแน่นของการสังเกตค่าในช่วงที่กำหนด กล่าวคือถ้ายกตัวอย่างเช่นความน่าจะเป็นที่เกิดขึ้นระหว่างและคือโดยที่คือ ความหนาแน่นของมาตรฐานปกติX∼ N( μ , σ2)X∼N(μ,σ2)X \sim N(\mu,\sigma^2)aaaขbb∫ขaϕ ( x ) dx∫abϕ(x)dx\int_a^{b}\phi(x)dxφϕ\phi เมื่อเราคิดถึงการประมาณค่าพารามิเตอร์ของ MLE ให้พูดถึงเราเขียนความหนาแน่นร่วมของ, พูดว่า , ตัวแปรสุ่มและแยกความแตกต่างของ log-likelihood wrt เป็น , ตั้งค่าเท่ากับ 0 และแก้ สำหรับ\การตีความมักจะได้รับคือ "ให้ข้อมูลซึ่งพารามิเตอร์ที่ทำให้ฟังก์ชั่นความหนาแน่นนี้เป็นไปได้มากที่สุด"μμ\muยังไม่มีข้อความNNX1. . Xยังไม่มีข้อความX1..XNX_1 .. X_Nμμ\muμμ\mu ส่วนที่กำลังดักฟังฉันคือ: เรามีความหนาแน่นของ rv และความน่าจะเป็นที่เราได้รับการกล่าวโดยเฉพาะตัวอย่างของเราคือ 0 อย่างแน่นอนทำไมมันถึงสมเหตุสมผลที่จะเพิ่มความหนาแน่นของข้อต่อให้สูงสุด ตั้งแต่นั้นมาความน่าจะเป็นที่จะสังเกตตัวอย่างจริงของเราคือ 0)?ยังไม่มีข้อความNN การหาเหตุผลเข้าข้างตนเองเดียวที่ฉันสามารถทำได้คือเราต้องการทำให้ PDF เป็นจุดสูงสุดเท่าที่เป็นไปได้รอบตัวอย่างที่เราสังเกตเพื่อให้อินทิกรัลในภูมิภาค (และความน่าจะเป็นของการสังเกตสิ่งในภูมิภาคนี้) …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.