8 การทดสอบอัลกอริธึมการสร้างตัวแปรแบบสุ่ม วิธีใดที่ใช้สำหรับทดสอบอัลกอริธึมการสร้างตัวแปรแบบสุ่ม 12 algorithms hypothesis-testing random-variable random-generation
8 ถ้า p-value เท่ากับ 1 (1.0000000) ขีด จำกัด ของช่วงความมั่นใจควรสนับสนุนสมมุติฐานว่างว่าเป็นจริงได้อย่างไร [ปิด] ปิด คำถามนี้ต้องการรายละเอียดหรือความคมชัด ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ เพิ่มรายละเอียดและชี้แจงปัญหาโดยแก้ไขโพสต์นี้นี้ ปิดให้บริการใน7 เดือนที่ผ่านมา นี่เป็นคำถามสมมุติฐานอย่างหมดจด คำสั่งที่พบบ่อยมากคือH0H0H_0ไม่เป็นความจริง แต่เป็นเรื่องของขนาดตัวอย่าง สมมติว่าจริงไม่มีความแตกต่างที่วัดได้ระหว่างสองวิธี ( ) มาจากประชากรที่กระจายตามปกติ (ทั้งและโดยประมาณ ) เราถือว่าต่อกลุ่มและเราใช้ -test นี้จะหมายความว่า -value เป็นแสดงให้เห็นว่ามีอย่างแตกต่างจากไม่มีH_0นี้จะแสดงให้เห็นว่าสถิติทดสอบคือ0ความแตกต่างค่าเฉลี่ยระหว่างกลุ่มจะเป็น0ข้อ จำกัด ของช่วงความเชื่อมั่นสำหรับความแตกต่างเฉลี่ยในกรณีนี้คืออะไร พวกเขาจะเป็นอย่างไรμ1=μ2μ1=μ2\mu_1=\mu_2μ=0μ=0\mu=0σσ\sigma=1=1=1N=16N=16N=16tttppp1.000001.000001.00000H0H0H_000000095%95%95\%[0.0,0.0][0.0,0.0][0.0, 0.0] ? ประเด็นหลักในคำถามของฉันคือเมื่อใดที่เราสามารถพูดได้ว่าเป็นจริงเช่นในกรณีนี้ หรือเมื่ออยู่ในกรอบบ่อยครั้งเราสามารถพูดว่า "ไม่แตกต่าง" อย่างแท้จริงเมื่อเปรียบเทียบสองวิธี?H0H0H_0μ1=μ2μ1=μ2\mu_1=\mu_2 12 confidence-interval p-value
1 ฉันจะทดสอบได้อย่างไรว่าการประมาณการพารามิเตอร์ทั้งสองในรูปแบบเดียวกันนั้นแตกต่างกันอย่างมีนัยสำคัญหรือไม่ ฉันมีรูปแบบ y=xa×zb+ey=xa×zb+e y=x^a \times z^b + e โดยที่คือตัวแปรที่ขึ้นต่อกันและเป็นตัวแปรอธิบายและเป็นพารามิเตอร์และเป็นคำผิดพลาด ฉันมีการประมาณพารามิเตอร์ของและและเมทริกซ์ความแปรปรวนร่วมของการประมาณเหล่านี้ ฉันจะทดสอบว่าและแตกต่างอย่างมีนัยสำคัญได้อย่างไรyyyxxxzzzaaabbbeeeaaabbbaaabbb 12 statistical-significance nonlinear-regression
11 การแจกแจงนั้นเป็นเรื่องปกติ แต่ก็ถือว่าเบียนเสียนอย่างมากหรือเปล่า? ฉันมีคำถามนี้คุณคิดว่าการกระจายเวลาที่ใช้ไปกับ YouTube ในแต่ละวันเป็นอย่างไร คำตอบของฉันคือมันอาจกระจายตามปกติและเอียงไปทางซ้ายสูง ฉันคาดหวังว่าจะมีโหมดเดียวที่ผู้ใช้ส่วนใหญ่ใช้เวลาเฉลี่ยและจากนั้นก็ใช้เวลานานพอสมควรเนื่องจากผู้ใช้บางคนมีพลังที่ครอบงำ นั่นเป็นคำตอบที่ยุติธรรมหรือไม่? มีคำพูดที่ดีกว่าสำหรับการแจกแจงแบบนั้นหรือไม่? 12 distributions normal-distribution skewness skew-normal
1 วัตถุประสงค์กับกระบวนทัศน์เบย์เซียนแบบอัตนัย อะไรคือความแตกต่างระหว่างวัตถุประสงค์และทัศนะแบบเบย์แบบอัตนัย? วัตถุหรือขั้นตอนใดที่พวกเขานิยามหรือตีความแตกต่างกัน มีวิธีใดบ้างในการเลือกวิธีการของพวกเขา? 12 bayesian methodology
2 ความแตกต่างระหว่าง rungs สองและสามใน Ladder of Causation ใน "หนังสือแห่งเหตุผล" ของจูเดียเพิร์ลเขาพูดถึงสิ่งที่เขาเรียกว่า Ladder of Causation ซึ่งโดยพื้นฐานแล้วเป็นลำดับขั้นประกอบด้วยระดับการใช้เหตุผลเชิงเหตุผลที่แตกต่างกัน ต่ำสุดเกี่ยวข้องกับรูปแบบของการเชื่อมโยงในข้อมูลที่สังเกตได้ (เช่นความสัมพันธ์ความน่าจะเป็นแบบมีเงื่อนไข ฯลฯ ) ถัดไปจะมุ่งเน้นไปที่การแทรกแซง (จะเกิดอะไรขึ้นถ้าเราจงใจเปลี่ยนกระบวนการสร้างข้อมูลด้วยวิธีการ counterfactual (จะเกิดอะไรขึ้นในอีกโลกหนึ่งที่เป็นไปได้ถ้ามีอะไรเกิดขึ้นหรือไม่เกิดขึ้น) สิ่งที่ฉันไม่เข้าใจคือขั้นที่สองและสามต่างกันอย่างไร หากเราถามคำถามต่อต้านเราไม่เพียงถามคำถามเกี่ยวกับการแทรกแซงเพื่อลบล้าง แง่มุมบางส่วนของโลกที่ถูกสังเกต? 12 causality
1 วิธีตัวอย่างอย่างสม่ำเสมอจากพื้นผิวของ hyper-ellipsoid (ระยะทาง Mahalanobis คงที่)? ในกรณีหลายตัวแปรมูลค่าจริงมีวิธีการอย่างสม่ำเสมอตัวอย่างจุดจากพื้นผิวที่ Mahalanobis ระยะห่างจากค่าเฉลี่ยของค่าคงที่หรือไม่ แก้ไข: นี่แค่เดือดลงไปที่จุดสุ่มตัวอย่างอย่างสม่ำเสมอจากพื้นผิวของไฮเปอร์ - อิลลิพอยด์ที่ตรงกับสมการ ( x - μ )TΣ- 1( x - μ ) = d2.(x−μ)TΣ−1(x−μ)=d2.(x-\mu)^T \Sigma^{-1}(x-\mu) = d^2. เพื่อให้แม่นยำยิ่งขึ้นโดย "สม่ำเสมอ" ฉันหมายถึงตัวอย่างที่องค์ประกอบแต่ละพื้นที่dAdAdAของพื้นผิวไฮเปอร์ประกอบด้วยมวลความน่าจะเป็นเดียวกัน 12 random-generation uniform
1 การวิเคราะห์อภิมานของอัตราส่วนราคาต่อรองเป็นสิ่งที่สิ้นหวังหรือไม่? ในบทความล่าสุดของNorton และคณะ (2018)ระบุว่า[1][1]^{[1]} อัตราส่วนของอัตราต่อรองที่แตกต่างจากการศึกษาเดียวกันไม่สามารถเปรียบเทียบได้เมื่อแบบจำลองทางสถิติที่ส่งผลให้การประมาณอัตราต่อรองมีตัวแปรอธิบายที่แตกต่างกัน และขนาดของอัตราต่อรองจากการศึกษาหนึ่งสามารถเปรียบเทียบกับขนาดของอัตราต่อรองได้จากการศึกษาอื่นเพราะตัวอย่างที่แตกต่างกันและข้อกำหนดของแบบจำลองที่แตกต่างกันจะมีปัจจัยการปรับขนาดโดยพลการแตกต่างกัน อีกนัยหนึ่งคือขนาดของอัตราต่อรองของการเชื่อมโยงที่กำหนดในการศึกษาหลาย ๆ ครั้งไม่สามารถสังเคราะห์ได้ในการวิเคราะห์อภิมาน การจำลองขนาดเล็กแสดงให้เห็นถึงนี้ (รหัส R อยู่ที่ด้านล่างของคำถาม) สมมติว่ารูปแบบที่แท้จริงคือ: ลองจินตนาการอีกว่าข้อมูลเดียวกันที่สร้างขึ้นโดยตัวแบบข้างต้นถูกวิเคราะห์โดยนักวิจัยสี่คนโดยใช้การถดถอยโลจิสติกส์ นักวิจัย 1 รวมเป็น covariate เท่านั้นนักวิจัย 2 รวมทั้งและและอื่น ๆ การประมาณการแบบจำลองโดยเฉลี่ยของอัตราต่อรองสำหรับของสี่นักวิจัยคือ:logit(yi)=1+log(2)x1i+log(2.5)x2i+log(3)x3i+0x4ilogit(yi)=1+log(2)x1i+log(2.5)x2i+log(3)x3i+0x4i \mathrm{logit}(y_{i})=1 + \log(2)x_{1i} + \log(2.5)x_{2i} + \log(3)x_{3i} + 0x_{4i} x1x1x_{1}x1x1x_{1}x2x2x_{2}x1x1x_{1} res_1 res_2 res_3 res_4 1.679768 1.776200 2.002157 2.004077 เห็นได้ชัดว่ามีเพียงนักวิจัย 3 และ 4 เท่านั้นที่ได้รับอัตราต่อรองที่ถูกต้องประมาณในขณะที่นักวิจัย 1 และ 2 ไม่ได้ … 12 r logistic meta-analysis odds-ratio adjustment
1 สำหรับแบบจำลองเฉลี่ย GLM เราจะเฉลี่ยการคาดการณ์ในลิงค์หรือระดับการตอบสนองหรือไม่? เพื่อคำนวณการทำนายแบบจำลองโดยเฉลี่ยในระดับการตอบสนองของ GLM ซึ่ง "ถูกต้อง" และเพราะเหตุใด คำนวณตัวแบบโดยเฉลี่ยการทำนายบนสเกลลิงก์แล้วเปลี่ยนกลับเป็นสเกลการตอบสนองหรือ ย้อนกลับเปลี่ยนการทำนายเป็นระดับการตอบกลับแล้วคำนวณค่าเฉลี่ยของแบบจำลอง การคาดคะเนใกล้เคียงกัน แต่ไม่เท่ากันถ้าแบบจำลองเป็น GLM แพ็กเกจ R ที่แตกต่างกันมีตัวเลือกสำหรับทั้งคู่ (ที่มีค่าเริ่มต้นแตกต่างกัน) เพื่อนร่วมงานหลายคนแย้งว่า # 1 ผิดเพราะ "ทุกคนทำอันดับ 2" สัญชาตญาณของฉันบอกว่า # 1 นั้น "ถูกต้อง" เพราะมันเก็บเส้นตรงคณิตศาสตร์เชิงเส้นทั้งหมด (# 2 เฉลี่ยสิ่งที่ไม่ได้อยู่ในระดับเชิงเส้น) การจำลองอย่างง่ายพบว่า # 2 มี MSE น้อยมาก (มาก!) เล็กน้อยกว่า # 1 หาก # 2 ถูกต้องเหตุผลคืออะไร และถ้า # 2 ถูกต้องเหตุใดฉันถึงให้เหตุผลเชิงเส้นตรงเชิงคณิตศาสตร์เหตุผลที่ไม่ดี? แก้ไข 1: การคำนวณส่วนต่างหมายถึงระดับของปัจจัยอื่นใน … 12 generalized-linear-model model-averaging
1 ความหมายของแกนใน t-SNE คืออะไร? ขณะนี้ฉันกำลังพยายามคลุมหัวคณิตศาสตร์t-SNE น่าเสียดายที่ยังมีอีกคำถามหนึ่งที่ฉันไม่สามารถตอบได้อย่างน่าพอใจ: ความหมายที่แท้จริงของแกนในกราฟ t-SNE คืออะไร? ถ้าฉันจะให้งานนำเสนอในหัวข้อนี้หรือรวมไว้ในสิ่งพิมพ์ใด ๆ : ฉันจะติดป้ายแกนอย่างเหมาะสมได้อย่างไร PS: ฉันอ่านคำถาม Reddit นี้แต่คำตอบที่ให้ไว้ที่นั่น (เช่น "ขึ้นอยู่กับการตีความและความรู้เกี่ยวกับโดเมน") ไม่ได้ช่วยให้ฉันเข้าใจสิ่งนี้จริงๆ 12 machine-learning dimensionality-reduction tsne
2 เป็นไปได้หรือไม่ที่ AIC และ BIC ให้การเลือกรุ่นที่แตกต่างกันโดยสิ้นเชิง? ฉันกำลังแสดงแบบจำลองการถดถอยปัวซองด้วย 1 ตัวแปรการตอบสนองและ 6 ตัวแปร การเลือกแบบจำลองโดยใช้ผลลัพธ์ AIC ในแบบจำลองที่มี covariates ทั้งหมดรวมถึง 6 เงื่อนไขการโต้ตอบ อย่างไรก็ตาม BIC ส่งผลให้แบบจำลองมี covariates เพียง 2 ตัวและไม่มีเงื่อนไขการโต้ตอบ เป็นไปได้หรือไม่ที่ทั้งสองเกณฑ์นั้นดูคล้ายกันมากให้ผลการเลือกแบบจำลองต่างกันโดยสิ้นเชิง? 12 model-selection aic poisson-regression bic
3 ทำไมการทดสอบสมมติฐานทางพารามิเตอร์หลายอย่าง (ถ้าไม่ได้ทั้งหมด) จะเป็นการสุ่มตัวอย่างแบบสุ่ม? การทดสอบอย่าง Z, t และอีกหลายคนคิดว่าข้อมูลนั้นมาจากการสุ่มตัวอย่าง ทำไม? สมมติว่าฉันกำลังทำวิจัยเชิงทดลองที่ฉันสนใจเรื่องความถูกต้องภายในมากกว่าสิ่งภายนอก ดังนั้นหากตัวอย่างของฉันอาจมีอคติเล็กน้อยโอเคอย่างที่ฉันยอมรับไม่ได้อนุมานสมมติฐานสำหรับประชากรทั้งหมด และการจัดกลุ่มจะยังคงเป็นแบบสุ่มนั่นคือฉันจะเลือกเพื่อความสะดวกของผู้เข้าร่วมตัวอย่าง แต่ฉันจะสุ่มให้กลุ่มต่าง ๆ ทำไมฉันถึงเพิกเฉยต่อสมมติฐานนี้ไม่ได้? 12 hypothesis-testing sampling parametric randomness
5 การกำหนดขนาดตัวอย่างก่อนเริ่มการทดสอบหรือเรียกใช้การทดสอบอย่างไม่มีกำหนด ฉันศึกษาสถิติเมื่อหลายปีก่อนและลืมไปหมดดังนั้นสิ่งเหล่านี้อาจดูเหมือนคำถามเชิงแนวคิดทั่วไปมากกว่าสิ่งใดโดยเฉพาะ แต่นี่คือปัญหาของฉัน ฉันทำงานให้กับเว็บไซต์อีคอมเมิร์ซในฐานะนักออกแบบ UX เรามีกรอบการทดสอบ A / B ที่สร้างขึ้นเมื่อหลายปีก่อนซึ่งฉันเริ่มสงสัย การวัดที่เราทำการตัดสินใจทั้งหมดของเรานั้นเรียกว่าการแปลงและขึ้นอยู่กับเปอร์เซ็นต์ของผู้ใช้ที่เข้าชมเว็บไซต์และซื้อสิ่งต่างๆ ดังนั้นเราต้องการทดสอบการเปลี่ยนสีของปุ่มซื้อจากสีเขียวเป็นสีน้ำเงิน การควบคุมคือสิ่งที่เรามีอยู่แล้วปุ่มสีเขียวที่เรารู้ว่าอัตราการแปลงโดยเฉลี่ยของเราคืออะไร การทดลองกำลังแทนที่ปุ่มสีเขียวด้วยปุ่มสีฟ้า เราเห็นด้วยอย่างมีนัยสำคัญ 95% คือระดับความมั่นใจที่เรามีความสุขและเราเปิดการทดสอบปล่อยให้มันทำงาน เมื่อผู้ใช้เยี่ยมชมเว็บไซต์เบื้องหลังมีโอกาส 50/50 พวกเขาจะถูกส่งไปยังรุ่นควบคุม (ปุ่มสีเขียว) เทียบกับรุ่นทดสอบ (ปุ่มสีน้ำเงิน) หลังจากดูการทดสอบหลังจาก 7 วันฉันเห็นการแปลงเพิ่มขึ้น 10.2% ตามการทดลองด้วยขนาดตัวอย่าง 3000 (1500 ไปสู่การควบคุม 1500 การทดลอง 1500 และนัยสำคัญทางสถิติที่ 99.2% ยอดเยี่ยมฉันคิดว่า การทดสอบดำเนินต่อไปขนาดของตัวอย่างเพิ่มขึ้นจากนั้นฉันเห็นการแปลงเพิ่มขึ้น + 9% โดยมีนัยสำคัญที่ 98.1% ตกลงให้การทดสอบทำงานต่อไปนานขึ้นและตอนนี้การทดลองแสดงให้เห็นว่าการแปลงเพิ่มขึ้น 5% โดยมีนัยสำคัญทางสถิติเพียง 92% โดยกรอบการทำงานบอกฉันว่าฉันต้องการตัวอย่างเพิ่ม 4600 ก่อนที่จะถึงนัยสำคัญ 95%? การทดสอบสรุปได้ในจุดใด? … 12 hypothesis-testing sample-size sequential-analysis
3 ความคงที่ของภาพคงที่ภายใต้ชุดค่าผสมเชิงเส้นหรือไม่? ลองนึกภาพเรามีสองกระบวนการอนุกรมเวลาที่มีความนิ่ง, การผลิต: x_t,xt,ytxt,ytx_t,y_t คือ ,ยังนิ่ง? ∀ α , β ∈ Rzt=αxt+βytzt=αxt+βytz_t=\alpha x_t +\beta y_t∀α,β∈R∀α,β∈R\forall \alpha, \beta \in \mathbb{R} ความช่วยเหลือใด ๆ ที่จะได้รับการชื่นชม ฉันจะบอกว่าใช่เพราะมันมีตัวแทน MA 12 time-series stochastic-processes stationarity
2 วิธีการปรับอัตราข้อผิดพลาดที่เป็นเท็จบวก / เท็จลบที่เลือกอย่างเข้มงวดและอัตราส่วนต้นทุนต้นแบบ? บริบท กลุ่มนักสังคมศาสตร์และนักสถิติ ( Benjamin et al., 2017 ) ได้แนะนำเมื่อเร็ว ๆ นี้ว่าอัตราการบวกลบ ( = .05) โดยทั่วไปใช้เป็นเกณฑ์ในการกำหนด "นัยสำคัญทางสถิติ" เพื่อปรับเกณฑ์อนุรักษ์ให้มากกว่าเดิม ( = .005) กลุ่มนักวิทยาศาสตร์สังคมศาสตร์และนักสถิติ ( Lakens et al., 2018 ) ได้ทำการแข่งขันโต้เถียงกับการใช้สิ่งนี้หรืออื่น ๆ - เกณฑ์ที่เลือกโดยพลการ ต่อไปนี้เป็นคำพูดจาก Lakens และคณะ (หน้า 16) ที่ช่วยเป็นตัวอย่างของคำถามของฉัน:αα\alphaαα\alpha เป็นการดีที่ระดับอัลฟาจะถูกกำหนดโดยการเปรียบเทียบค่าใช้จ่ายและผลประโยชน์กับฟังก์ชั่นยูทิลิตี้โดยใช้ทฤษฎีการตัดสินใจ การวิเคราะห์ต้นทุน - ผลประโยชน์ (และระดับอัลฟ่า) แตกต่างกันเมื่อทำการวิเคราะห์ชุดข้อมูลที่มีอยู่ขนาดใหญ่เมื่อเปรียบเทียบกับการรวบรวมข้อมูลจากตัวอย่างที่ยากที่จะได้รับ วิทยาศาสตร์นั้นมีความหลากหลายและขึ้นอยู่กับนักวิทยาศาสตร์ที่จะพิสูจน์ระดับอัลฟาที่พวกเขาตัดสินใจใช้ ... การวิจัยควรได้รับการชี้นำโดยหลักการของวิทยาศาสตร์ที่เข้มงวดไม่ใช่ด้วยการวิเคราะห์พฤติกรรมและขีด จำกัด แบบครอบคลุมโดยพลการ คำถาม ฉันสงสัยว่าจะมีความเป็นไปได้อย่างไรในการพิสูจน์ให้เห็นถึงการเลือกอัลฟ่าในแบบที่ … 12 hypothesis-testing p-value power type-i-and-ii-errors