สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

4
Lasso-ing คำสั่งของความล่าช้าหรือไม่?
สมมติว่าฉันมีข้อมูลตามยาวของรูปแบบ (ฉันมีการสังเกตหลายอย่างนี่เป็นเพียงรูปแบบหนึ่งเดียว) ฉันสนใจในข้อ จำกัด ในการ\ไม่ จำกัดเทียบเท่ากับการ กับsigma_j)Y =(Y1, … ,YJ) ∼ N( μ , Σ )Y=(Y1,…,YJ)∼N(μ,Σ)\mathbf Y = (Y_1, \ldots, Y_J) \sim \mathcal N(\mu, \Sigma)ΣΣ\SigmaΣΣ\SigmaYj=αj+∑ℓ=1j−1ϕℓjYj−ℓ+εjYj=αj+∑ℓ=1j−1ϕℓjYj−ℓ+εj Y_j = \alpha_j + \sum_{\ell = 1} ^ {j - 1} \phi_{\ell j} Y_{j-\ell} + \varepsilon_j εj∼N(0,σj)εj∼N(0,σj)\varepsilon_j \sim N(0, \sigma_j) โดยทั่วไปจะไม่ทำเช่นนี้เนื่องจากต้องมีการประมาณค่าพารามิเตอร์ความแปรปรวนแบบจำลองคือ "lag- " ถ้าเราใช้ นั่นคือเราใช้ก่อนหน้านี้คำศัพท์ในการทำนายจากประวัติO(J2)O(J2)O(J^2)kkkYj=αj+∑ℓ=1kϕℓjYj−ℓ+εj,Yj=αj+∑ℓ=1kϕℓjYj−ℓ+εj, …

2
ความแปรปรวนของค่าเฉลี่ยตัวอย่างของตัวอย่างบู๊ตสแตรป
ให้เป็นข้อสังเกตที่ชัดเจน (ไม่มีความสัมพันธ์) ให้แสดงตัวอย่าง bootstrap (ตัวอย่างจาก CDF เชิงประจักษ์) และให้{*} ค้นหาและ{*})X1,...,XnX1,...,XnX_{1},...,X_{n}X∗1,...,X∗nX1∗,...,Xn∗X_{1}^{*},...,X_{n}^{*}X¯* * * *n=1nΣni = 1X* * * *ผมX¯n∗=1n∑i=1nXi∗\bar{X}_{n}^{*}=\frac{1}{n}\sum_{i=1}^{n}X_{i}^{*}E(X¯* * * *n)E(X¯n∗)E(\bar{X}_{n}^{*})V a r (X¯* * * *n)Var(X¯n∗)\mathrm{Var}(\bar{X}_{n}^{*}) สิ่งที่ฉันมีอยู่คือคือแต่ละอันมีความน่าจะเป็นดังนั้น and ซึ่งให้ X* * * *ผมXi∗X_{i}^{*}X1, . . . ,XnX1,...,XnX_{1},...,X_{n}1n1n\frac{1}{n}E(X* * * *ผม) =1nE(X1) + . . . +1nE(Xn) =n μn= μE(Xi∗)=1nE(X1)+...+1nE(Xn)=nμn=μ E(X_{i}^{*})=\frac{1}{n}E(X_{1})+...+\frac{1}{n}E(X_{n})=\frac{n\mu}{n}=\mu …

1
สัมประสิทธิ์สหสัมพันธ์ระหว่างสองอาร์เรย์ของคะแนน 2 มิติ
ฉันมีอาร์เรย์ 2 จุดสองจุดและฉันจำเป็นต้องประเมินความสัมพันธ์ของพวกเขา ฉันควรใช้สูตรอะไร ตัวอย่างของอาร์เรย์: X: ( ( 1 , 5 ) , ( 2 , 5 ) , ( 1 , 7 ) , ( 4 , 1 ) ) ,X:((1,5),(2,5),(1,7),(4,1)),X: ((1,5),(2,5),(1,7),(4,1)), Y: ( ( 3 , 4 ) , ( 1 , 6 ) , ( 4 , …

2
ความคาดหวังของความฉลาดทางของผลรวมของตัวแปรสุ่ม IID (แผ่นงานมหาวิทยาลัยเคมบริดจ์)
ฉันกำลังเตรียมตัวสำหรับการสัมภาษณ์ที่ต้องมีความรู้เกี่ยวกับความน่าจะเป็นพื้นฐาน (อย่างน้อยก็ต้องผ่านการสัมภาษณ์ด้วยตัวเอง) ฉันกำลังทำงานผ่านแผ่นงานด้านล่างจากวันที่นักเรียนของฉันเป็นการแก้ไข ส่วนใหญ่แล้วจะตรงไปตรงมา แต่ฉันก็นิ่งงันกับคำถามที่ 12 http://www.trin.cam.ac.uk/dpk10/IA/exsheet2.pdf ความช่วยเหลือใด ๆ ที่จะได้รับการชื่นชม แก้ไข: คำถามคือ: สมมติว่า X1,X2,...X1,X2,...X_1, X_2, ... เป็นตัวแปรสุ่มที่เป็นค่าบวกเชิงบวกแบบกระจายแบบอิสระ E(X1)=μ&lt;∞E(X1)=μ&lt;∞\mathbb{E}(X_1) = \mu < \infty และ E(X−11)&lt;∞E(X1−1)&lt;∞\mathbb{E}(X_1^{-1}) < \infty. ปล่อยSn=Σni = 1XผมSn=∑i=1nXiS_n = \sum_{i=1}^n X_i. แสดงว่าE (Sม./Sn) = m / nE(Sm/Sn)=m/n\mathbb{E}(S_m/S_n) = m/n เมื่อไหร่ m &lt; = nm&lt;=nm<=nและ E (Sม./Sn) = 1 + …

3
การประเมินพลังของการทดสอบภาวะปกติ (ใน R)
ฉันต้องการประเมินความถูกต้องของการทดสอบภาวะปกติมากกว่าขนาดตัวอย่างที่แตกต่างกันใน R (ฉันรู้ว่าการทดสอบภาวะปกติอาจทำให้เข้าใจผิด ) ตัวอย่างเช่นหากต้องการดูการทดสอบของ Shapiro-Wilk ฉันกำลังทำการจำลองต่อไปนี้ (เช่นเดียวกับการวางแผนผลลัพธ์) และคาดว่าเมื่อขนาดตัวอย่างเพิ่มความน่าจะเป็นที่จะปฏิเสธการปฏิเสธจะลดลง: n &lt;- 1000 pvalue_mat &lt;- matrix(NA, ncol = 1, nrow = n) for(i in 10:n){ x1 &lt;- rnorm(i, mean = 0, sd = 1) pvalue_mat[i,] &lt;- shapiro.test(x1)$p.value } plot(pvalue_mat) ความคิดของฉันน่าจะเป็นว่าเมื่อขนาดของกลุ่มตัวอย่างเพิ่มขึ้นควรมีอัตราการปฏิเสธที่ต่ำกว่า ฉันคิดว่าฉันเข้าใจผิด - ยินดีต้อนรับทุกความคิด

2
ปัญหาปรัชญาแบบเปิดสามประการในสถิติ
ฉันเพิ่งอ่านThe Lady Tasting Teaหนังสือสนุก ๆ เกี่ยวกับประวัติของสถิติ ในตอนท้ายของหนังสือเล่มนี้ผู้เขียนDavid Salsburgเสนอปัญหาเชิงปรัชญาแบบเปิดสามประการในสถิติการแก้ปัญหาที่เขาระบุว่าจะมีผลกระทบมากขึ้นสำหรับการประยุกต์ใช้ทฤษฎีทางสถิติกับวิทยาศาสตร์ ฉันไม่เคยได้ยินปัญหาเหล่านี้มาก่อนดังนั้นฉันจึงสนใจในปฏิกิริยาของคนอื่นต่อพวกเขา ฉันกำลังเข้าสู่ดินแดนที่ฉันมีความรู้เพียงเล็กน้อยดังนั้นฉันจะอธิบายภาพของปัญหาเหล่านี้ของ Salsburg และถามคำถามทั่วไปสองข้อเกี่ยวกับปัญหาเหล่านี้ด้านล่าง ปัญหาปรัชญาของ Salsburg คือ: แบบจำลองทางสถิติสามารถใช้ในการตัดสินใจได้หรือไม่? ความหมายของความน่าจะเป็นเมื่อนำไปใช้กับชีวิตจริงคืออะไร? คนเข้าใจความน่าจะเป็นจริงหรือไม่? สถิติและการตัดสินใจ เป็นตัวอย่างของปัญหาที่นำเสนอในคำถามที่ 1 Salsburg นำเสนอความขัดแย้งดังต่อไปนี้ สมมติว่าเราจัดลอตเตอรีด้วยตั๋ว 10,000 ใบที่ไม่มีหมายเลข หากเราใช้ความน่าจะเป็นในการตัดสินใจว่าตั๋วใด ๆ ที่ได้รับจะถูกลอตเตอรี่โดยการปฏิเสธสมมติฐานนี้สำหรับตั๋วที่มีความน่าจะเป็นด้านล่างกล่าวว่า. 001 เราจะปฏิเสธสมมติฐานของตั๋วที่ชนะสำหรับตั๋วทั้งหมดในลอตเตอรี่! Salsburg ใช้ตัวอย่างนี้เพื่อยืนยันว่าตรรกะนั้นไม่สอดคล้องกับทฤษฎีความน่าจะเป็นเนื่องจากทฤษฎีความน่าจะเป็นที่เข้าใจกันอยู่ในปัจจุบันและดังนั้นในปัจจุบันเราไม่มีวิธีการที่ดีในการบูรณาการสถิติ (ซึ่งในรูปแบบที่ทันสมัย ทฤษฎีความน่าจะเป็น) ด้วยวิธีการเชิงตรรกะในการตัดสินใจ ความหมายของความน่าจะเป็น ในฐานะที่เป็นนามธรรมทางคณิตศาสตร์ Salsburg ให้เหตุผลว่าความน่าจะเป็นไปได้ดี แต่เมื่อเราพยายามนำผลลัพธ์ไปใช้กับชีวิตจริงเราพบปัญหาที่ความน่าจะเป็นไม่มีความหมายที่เป็นรูปธรรมในชีวิตจริง โดยเฉพาะอย่างยิ่งเมื่อเราบอกว่ามีโอกาส 95% ของฝนในวันพรุ่งนี้ก็ไม่มีความชัดเจนในสิ่งที่หน่วยงานที่ใช้ 95% มันใช้กับชุดการทดลองที่เป็นไปได้ที่เราสามารถนำไปใช้เพื่อรับความรู้เกี่ยวกับฝนได้หรือไม่? มันใช้กับกลุ่มคนที่อาจออกไปข้างนอกและเปียกปอนไหม? Salsburg ให้เหตุผลว่าการขาดเครื่องมือในการตีความความน่าจะเป็นทำให้เกิดปัญหาสำหรับแบบจำลองทางสถิติใด ๆ …

1
โครงสร้างของข้อมูลและการเรียกใช้ฟังก์ชันสำหรับข้อมูลเหตุการณ์ที่เกิดซ้ำพร้อมตัวแปรขึ้นอยู่กับเวลา
ฉันกำลังพยายามประเมินผลของยา 2 ชนิด ( drug1, drug2) ต่อโอกาสที่ผู้ป่วยจะตกลงมา ( event) ผู้ป่วยสามารถล้มได้มากกว่าหนึ่งครั้งและสามารถวางหรือถอดออกจากยาเสพติดได้ทุกจุด คำถามของฉันคือวิธีการจัดโครงสร้างข้อมูลโดยคำนึงถึงช่วงเวลา (วัน) โดยเฉพาะอย่างยิ่งว่าต้องมีการทับซ้อนกันระหว่างวันหรือไม่ Nมีสองเหตุผลที่ว่าทำไมผมคิดว่าโครงสร้างของฉันคือผิดเป็นครั้งแรกเป็นที่ไม่ถูกต้องดูเหมือน นอกจากนี้ผมยังได้รับข้อผิดพลาดบางช่วงเวลาที่เป็นวันเดียว (เช่นtime1=4, time2=4) และนไม่แน่ใจว่าวิธีการเหล่านี้ควรได้รับการเข้ารหัส เวลาเริ่มต้นของรายการถัดไปควรเป็นเวลาหยุดของรายการก่อนหน้าหรือไม่ ฉันได้ลองทั้งสองวิธี (โดยมีและไม่มีทับซ้อนกัน) และในขณะที่การทับซ้อนกันได้รับการกำจัดคำเตือนNก็ยังไม่ถูกต้อง Warning message: In Surv(time = c(0, 2, 7, 15, 20, 0, 18, 27, 32, 35, 39, 46, 53, : Stop time must be &gt; start time, NA created …
9 r  survival  cox-model 

3
การถดถอยโลจิสติก: การเพิ่มผลบวกจริง - การบวกเท็จ
ฉันมีโมเดลการถดถอยโลจิสติก (พอดีผ่าน glmnet ใน R พร้อมกับการทำให้เป็นมาตรฐานสุทธิ) และฉันต้องการเพิ่มความแตกต่างระหว่างผลบวกจริงและผลบวกปลอม ในการดำเนินการดังกล่าวขั้นตอนต่อไปนี้อยู่ในใจ: พอดีกับโมเดลการถดถอยโลจิสติกมาตรฐาน ใช้เกณฑ์การทำนายเป็น 0.5 ระบุการคาดการณ์ในเชิงบวกทั้งหมด กำหนดน้ำหนัก 1 สำหรับการสังเกตที่คาดการณ์ไว้ในเชิงบวก 0 สำหรับคนอื่น ๆ ทั้งหมด พอดีกับรูปแบบการถดถอยโลจิสติกถ่วงน้ำหนัก อะไรคือข้อบกพร่องของวิธีนี้? อะไรจะเป็นวิธีที่ถูกต้องในการแก้ไขปัญหานี้ เหตุผลที่ต้องการเพิ่มความแตกต่างระหว่างจำนวนของผลบวกที่แท้จริงและเชิงลบที่ผิดเนื่องจากการออกแบบใบสมัครของฉัน ในฐานะส่วนหนึ่งของโครงงานในชั้นเรียนฉันกำลังสร้างผู้เข้าร่วมอิสระในตลาดออนไลน์ - ถ้าแบบจำลองของฉันทำนายว่าสามารถซื้อบางอย่างและขายในภายหลังด้วยราคาที่สูงกว่า ฉันต้องการยึดติดกับการถดถอยโลจิสติกและผลลัพธ์ไบนารีผลลัพธ์ (ชนะ, แพ้) ตามต้นทุนคงที่และการเพิ่มขึ้นของราคาต่อหน่วย (ฉันได้รับหรือสูญเสียจำนวนเดียวกันในทุกธุรกรรม) คิดบวกทำให้ฉันเจ็บเพราะหมายความว่าฉันซื้ออะไรและไม่สามารถขายได้ในราคาที่สูงขึ้น อย่างไรก็ตามการลบที่ผิดพลาดไม่ได้ทำร้ายฉัน (เฉพาะในแง่ของโอกาสเสียค่าใช้จ่าย) เพราะมันหมายถึงว่าฉันไม่ได้ซื้อ แต่ถ้าฉันมีฉันจะทำเงิน ในทำนองเดียวกัน ฉันยอมรับว่าการตัด 0.5 นั้นเป็นการสุ่มโดยพลการและเมื่อฉันปรับรูปแบบจากขั้นตอนที่ 1 บนขีด จำกัด การทำนายซึ่งให้ผลต่างสูงสุดระหว่างความจริง / เท็จบวกจะกลายเป็นใกล้กว่า 0.4 ฉันคิดว่านี่เป็นเพราะลักษณะที่บิดเบือนของข้อมูลของฉัน - อัตราส่วนระหว่างเชิงลบและบวกเป็นเรื่องเกี่ยวกับ …

1
โมเดล Markov ที่ซ่อนอยู่สำหรับการทำนายเหตุการณ์
คำถาม : การตั้งค่าด้านล่างนี้ใช้งานได้ดีกับโมเดลซ่อนมาร์คอฟหรือไม่? ฉันมีชุดข้อมูลการ108,000สังเกต (ใช้เวลากว่า 100 วัน) และประมาณ2000เหตุการณ์ตลอดช่วงเวลาการสังเกตทั้งหมด ข้อมูลดูเหมือนว่ารูปด้านล่างที่ตัวแปรที่สังเกตสามารถใช้ค่าไม่ต่อเนื่อง 3 ค่าและคอลัมน์สีแดงเน้นเวลาเหตุการณ์เช่น 's:[ 1 , 2 , 3 ][1,2,3][1,2,3]เสื้อEเสื้อEt_E ดังที่แสดงด้วยสี่เหลี่ยมสีแดงในรูปฉันได้ตัด {ถึง } สำหรับแต่ละเหตุการณ์โดยปฏิบัติต่อสิ่งเหล่านี้อย่าง "หน้าต่างก่อนเหตุการณ์" ได้อย่างมีประสิทธิภาพเสื้อEเสื้อEt_Eเสื้อE- 5เสื้อE-5t_{E-5} การฝึกอบรม HMM:ฉันวางแผนที่จะฝึกอบรมโมเดล Markov ที่ซ่อนอยู่ (HMM) โดยอ้างอิงจาก "หน้าต่างก่อนเหตุการณ์ทั้งหมด" โดยใช้วิธีการสังเกตหลายฉากตามที่แนะนำในหน้า Pg 273 ของ Rabiner ของกระดาษ หวังว่านี่จะช่วยให้ฉันฝึก HMM ที่รวบรวมรูปแบบลำดับที่นำไปสู่เหตุการณ์ อืมทำนาย:แล้วฉันวางแผนที่จะใช้ HMM นี้เพื่อทำนาย ในวันที่ใหม่ที่จะเป็นเวกเตอร์หน้าต่างบานเลื่อนการปรับปรุงในเวลาจริงเพื่อให้มีการสังเกตระหว่างเวลาปัจจุบันและเป็นวันที่ไปl o g[ พี(Observations|HMM)]ล.โอก.[P(OขsอีRโวลต์aเสื้อผมโอns|HMM)]log[P(Observations|HMM)]ObservationsOขsอีRโวลต์aเสื้อผมโอnsObservationstเสื้อtt−5เสื้อ-5t-5 ฉันคาดว่าจะเห็นเพิ่มขึ้นสำหรับการที่มีลักษณะคล้ายกับ "หน้าต่างก่อนเหตุการณ์" …

6
วิธีประมาณฟังก์ชั่นการตอบกลับอัตโนมัติของเวกเตอร์ & การตอบสนองต่อแรงกระตุ้นด้วยข้อมูลพาเนล
ฉันกำลังทำงานกับการประมาณเวกเตอร์การถดถอยอัตโนมัติ (VARs) และการประมาณค่าฟังก์ชันตอบสนองต่อแรงกระตุ้น (IRF) ตามข้อมูลพาเนลกับบุคคล 33 คนใน 77 ไตรมาส สถานการณ์ประเภทนี้ควรวิเคราะห์อย่างไร มีอัลกอริทึมอะไรอยู่สำหรับจุดประสงค์นี้ ฉันต้องการดำเนินการวิเคราะห์เหล่านี้ใน R ดังนั้นหากใครคุ้นเคยกับรหัส R หรือแพ็คเกจที่ออกแบบมาเพื่อจุดประสงค์นี้ที่พวกเขาสามารถแนะนำได้นั่นจะเป็นประโยชน์อย่างยิ่ง

3
ทำความเข้าใจเกี่ยวกับการทำนายแบบเบย์
ฉันกำลังเรียนหลักสูตร Intro to Bayes และฉันมีความยากลำบากในการเข้าใจการกระจายการทำนาย ฉันเข้าใจว่าทำไมพวกเขาถึงมีประโยชน์และฉันคุ้นเคยกับคำจำกัดความ แต่มีบางสิ่งที่ฉันไม่ค่อยเข้าใจ 1) วิธีรับการแจกแจงการทำนายที่ถูกต้องสำหรับเวกเตอร์ของการสังเกตใหม่ สมมติว่าเราได้สร้างแบบจำลองตัวอย่าง p(yi|θ)p(yi|θ)p(y_i | \theta) สำหรับข้อมูลและก่อน p(θ)p(θ)p(\theta). สมมติว่าข้อสังเกตyiyiy_i มีความเป็นอิสระตามเงื่อนไข θθ\theta. เราสังเกตข้อมูลบางอย่างแล้ว D={y1,y2,...,yk}D={y1,y2,...,yk}\mathcal{D} = \{y_1, y_2, \, ... \, , y_k\}และเราอัปเดตก่อนหน้าของเรา p(θ)p(θ)p(\theta) เพื่อหลัง p(θ|D)p(θ|D)p(\theta | \mathcal{D}). หากเราต้องการทำนายเวกเตอร์ของการสังเกตใหม่ N={y~1,y~2,...,y~n}N={y~1,y~2,...,y~n}\mathcal{N} = \{\tilde{y}_1, \tilde{y}_2, \, ... \, , \tilde{y}_n\}ฉันคิดว่าเราควรพยายามทำนายการใช้สูตรนี้ p(N|D)=∫p ( θ | D ) p …

4
การสร้างแบบจำลองสำหรับคะแนนฟุตบอล
ใน Dixon, Coles ( 1997 ) พวกเขาใช้การประเมินความเป็นไปได้สูงสุดสำหรับโมเดล Poisson อิสระทั้งสองที่แก้ไขใน (4.3) เพื่อทำแบบจำลองคะแนนในฟุตบอล ฉันพยายามใช้ R เพื่อ "ทำซ้ำ" อัลฟ่าและเบต้ารวมถึงพารามิเตอร์เอฟเฟกต์โฮม (หน้า 274, ตารางที่ 4) โดยไม่ใช้แพ็คเกจใด ๆ (โดยใช้รุ่นปัวซองอิสระทั่วไปก็ดีเช่นกัน) ฉันลองใช้bivpoisแพ็คเกจ แต่ไม่แน่ใจว่าจะแก้ไขพารามิเตอร์ได้อย่างไร ฉันจะขอบคุณเป็นอย่างยิ่งหากใครสามารถช่วยฉันด้วยรหัส R เพื่อสร้างแบบจำลองข้อมูล - คะแนนจากทีมเหย้าและทีมเยือนสำหรับซีซั่น 2012/13 ในพรีเมียร์ลีกอังกฤษ

2
การจำลองข้อมูลให้พอดีกับรูปแบบสื่อกลาง
ฉันสนใจที่จะค้นหาขั้นตอนเพื่อจำลองข้อมูลที่สอดคล้องกับรูปแบบการไกล่เกลี่ยที่ระบุ ตามการเชิงเส้นกรอบโครงสร้างโมเดลสมการทั่วไปสำหรับการทดสอบแบบจำลองการไกล่เกลี่ยที่ระบุไว้เป็นครั้งแรกโดยBarron และเคนนี (1986)และอธิบายอื่น ๆ เช่นจัดด์ Yzerbyt และมุลเลอร์ (2013) , รุ่นไกล่เกลี่ยสำหรับผลคนกลาง\ newcommand {\ med} {\ rm med} \ medและตัวทำนายXและอยู่ภายใต้สมการการถดถอยสามแบบต่อไปนี้: \ start {align} Y &amp; = b_ {11} + b_ {12} X + e_1 \ tag {1} \\ \ med &amp; = b_ {21} + b_ {22} X + e_2 \ …

1
การประเมินประสิทธิภาพการทำนายอนุกรมเวลา
ฉันมี Dynamic Naive Bayes Model ที่ได้รับการฝึกอบรมเกี่ยวกับตัวแปรทางโลกสองสามอย่าง ผลลัพธ์ของตัวแบบคือการทำนายP(Event) @ t+1โดยประมาณที่แต่ละtตัว พล็อตของP(Event)แทนที่จะtimeเป็นได้รับในรูปด้านล่าง ในรูปนี้เส้นสีดำแสดงถึงP(Event)แบบจำลองที่ทำนายไว้ เส้นสีแดงในแนวนอนหมายถึงความน่าจะเป็นสิ่งที่เกิดขึ้นก่อนเหตุการณ์; และเส้นแนวตั้งประเป็นตัวแทนเหตุการณ์ที่เกิดขึ้นห้าเหตุการณ์ในอนุกรมเวลา โดยหลักการแล้วฉันต้องการเห็นP(Event)จุดสูงสุดที่คาดการณ์ไว้ก่อนที่จะสังเกตเหตุการณ์ใด ๆ และอยู่ใกล้กับศูนย์เมื่อไม่มีโอกาสของเหตุการณ์ ฉันต้องการรายงานว่าแบบจำลองของฉัน (เส้นสีดำ) ทำงานได้ดีเพียงใดในการทำนายเหตุการณ์ที่เกิดขึ้น ผู้สมัครที่ชัดเจนที่จะเปรียบเทียบรูปแบบของฉันที่มีคือความน่าจะเป็นของเหตุการณ์ก่อน (เส้นสีแดง) ซึ่งหากใช้เป็น predictor- tจะทำนายค่าความน่าจะเป็นเหมือนกันสำหรับทุก อะไรคือสิ่งที่ดีที่สุดวิธีการอย่างเป็นทางการเพื่อให้บรรลุการเปรียบเทียบนี้? PS:ขณะนี้ฉันกำลังใช้การให้คะแนน (ใช้งานง่าย) ตามรหัสด้านล่างโดยที่คะแนนที่ต่ำกว่าโดยรวมบ่งบอกถึงประสิทธิภาพการทำนายที่ดีกว่า ฉันพบว่าจริง ๆ แล้วมันค่อนข้างยากที่จะเอาชนะก่อนด้วยการให้คะแนนนี้: # Get prediction performance model_score = 0; prior_score=0; for t in range(len(timeSeries)): if(timeSeries[t]== event): # event has happened cur_model_score …

1
โมเดลเพิ่มเติมทั่วไป: ref.df ในเอาต์พุตของ R คืออะไร
สวัสดีฉันพยายามดิ้นรนเพื่อทำความเข้าใจ Ref.df ในหน้าจอแสดงผลใน R: Approximate significance of smooth terms: edf Ref.df F p-value s(meangrain) 1.779 2.209 3.193 0.0451 * s(depth) 2.108 2.697 3.538 0.0254 * มันหมายถึงอะไรและจำเป็นต้องรวมคำนี้เพื่อนำเสนอผลลัพธ์ของ GAM ในกระดาษ? มันให้ข้อมูลที่จำเป็นต่อการทำนายหรือไม่?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.