สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

4
หลักสูตรสถิติใดต่อไปนี้มีความเหมาะสมและมีประโยชน์มากที่สุดในอุตสาหกรรมการเงิน / เทคโนโลยี [ปิด]
ปิด คำถามนี้เป็นคำถามความคิดเห็นตาม ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้สามารถตอบข้อเท็จจริงและการอ้างอิงได้โดยแก้ไขโพสต์นี้ ปิดให้บริการใน3 ปีที่ผ่านมา ฉันอยู่ในขั้นตอนการเลือก 3 วิชาสถิติเพื่อใช้สำหรับกลุ่มหลักสูตรคณิตศาสตร์ประยุกต์ของฉัน (ทำสมาธิในวิทยาศาสตร์คณิตศาสตร์ประกันภัยหรือการวิเคราะห์เชิงสถิติ) คุณคิดว่า 3 คลาสใดต่อไปนี้มีประโยชน์มากที่สุด / ใช้ในด้านการเงิน / เทคโนโลยี / จับคู่กับวิทยาการคอมพิวเตอร์? กระบวนการ Stochastic (การเดินแบบสุ่ม, โซ่มาร์คอฟแบบแยกเวลา, กระบวนการปัวซง) การสร้างแบบจำลองเชิงเส้น: ทฤษฎีและการประยุกต์ รู้เบื้องต้นเกี่ยวกับอนุกรมเวลา การทำนายสถิติสมัยใหม่และการเรียนรู้ของเครื่อง ทฤษฎีเกม การวิเคราะห์เศรษฐมิติเบื้องต้น (การลงทะเบียนข้ามระหว่างสถิติและ Econ)

2
การสร้างตัวแปรสุ่มที่เป็นไปตามข้อ จำกัด
ฉันต้องการสร้างรายการตัวแปรสุ่มภายใต้ข้อ จำกัด ที่สามารถแสดงออกในรูปแบบE x = bโดยที่Eคือเมทริกซ์m × nหากxมีรายการn ในทุกกรณีที่ผมกำลังจัดการกับn > > ม.เช่นnจะอยู่ที่ประมาณ 14,000 ตารางเมตรจะเป็น 50 ผมไม่แน่ใจว่าวิธีการสิ่งที่ฉันจะใช้สำหรับการสุ่มแบบปกติหรือเครื่องแบบก็เป็นได้ ชัดเจนว่าดีที่สุดสำหรับปัญหาที่ฉันพยายามแก้ไข แต่ฉันต้องการให้ตัวแปรทั้งหมดตัวอย่างจากการแจกแจงด้วยค่าเฉลี่ยและช่วง / ความแปรปรวนเดียวกันxx\bf{x}E x=bEx=b\bf{E}x=bEE\bf{E}m × nm×nm \times n xx\bf{x}nnnn>>mn>>mn >> mnnnmmm สิ่งที่ฉันทำเพื่อแก้ปัญหานี้คือการลดลงในแบบฟอร์มแถว - แถวตั้งค่าตัวแปรทั้งหมดที่เกี่ยวข้องกับคอลัมน์ทางด้านขวาของเดือยสุดท้ายให้เป็นค่าสุ่มและจากนั้นจึงแก้สมการเมทริกซ์สี่เหลี่ยมที่เหลือEE\bf{E} อย่างไรก็ตามมีปัญหาในการแก้ปัญหาความเท่าเทียมกันของเมทริกซ์จตุรัสฉันลบค่าที่ตั้งไว้แล้วจากด้านขวามือ น่าเสียดายที่ความแปรปรวนเพิ่มเช่นกันดังนั้นค่า 50 อันสุดท้ายของฉันมีแนวโน้มที่จะแตกต่างกันอย่างมากซึ่งน่าเสียดายที่ไม่สามารถยอมรับได้ในปัญหานี้ มีวิธีที่ดีกว่าในการทำเช่นนี้? ฉันไม่สามารถคิดถึงวิธีการแก้ไขวิธีปัจจุบันที่ฉันใช้อยู่ ฉันใช้อาร์

3
วิธีสร้างไดอะแกรมบาร์พล็อตโดยที่บาร์อยู่เคียงข้างกันใน R
ล็อคแล้ว คำถามและคำตอบของคำถามนี้ถูกล็อคเนื่องจากคำถามอยู่นอกหัวข้อ แต่มีความสำคัญทางประวัติศาสตร์ ขณะนี้ไม่ยอมรับคำตอบหรือการโต้ตอบใหม่ ฉันต้องการสร้าง bardiagram สำหรับข้อมูลเหล่านี้ใน R (อ่านจากไฟล์ CVS): Experiment_Name MetricA MetricB Just_X 2 10 Just_X_and_Y 3 20 ที่จะมีแผนภาพต่อไปนี้: ฉันเป็นผู้เริ่มต้นและฉันไม่รู้ว่าจะเริ่มต้นอย่างไร

2
หมายถึงค่าเบี่ยงเบนสัมบูรณ์ที่น้อยกว่าค่าเบี่ยงเบนมาตรฐานสำหรับ
ฉันต้องการเปรียบเทียบค่าเบี่ยงเบนสัมบูรณ์เฉลี่ยกับส่วนเบี่ยงเบนมาตรฐานในกรณีทั่วไปกับคำจำกัดความนี้: MA D =1n - 1Σ1n|xผม- μ | ,SD =Σn1(xผม- μ)2n - 1-----------√MAD=1n−1∑1n|xi−μ|,SD=∑1n(xi−μ)2n−1MAD = \frac{1}{n-1}\sum_1^n|x_i - \mu|, \qquad SD = \sqrt{\frac{\sum_1^n(x_i-\mu)^2}{n-1}} ที่ไหน μ =1nΣn1xผมμ=1n∑1nxi\mu =\frac{1}{n}\sum_1^n x_i. มันเป็นความจริงหรือเปล่า MA D ≤ SDMAD≤SDMAD \le SD สำหรับทุกคน {xผม}n1{xi}1n\{x_i\}^n_1? มันผิดสำหรับ n = 2n=2n=2, เพราะ x + y≥x2+Y2------√x+y≥x2+y2x+y \ge \sqrt{x^2+y^2}สำหรับทุกคน x , y≥ 0x,y≥0x, y …

3
แบบจำลองเอฟเฟกต์แบบสุ่มที่จัดการความซ้ำซ้อน
ฉันกำลังพยายามจัดการกับการวิเคราะห์แบบเวลาต่อเหตุการณ์โดยใช้ผลลัพธ์ไบนารีซ้ำ ๆ สมมติว่าเวลาต่อเหตุการณ์ถูกวัดเป็นวัน แต่สำหรับช่วงเวลาที่เราแยกเวลาเป็นสัปดาห์ ฉันต้องการประมาณค่าประมาณของ Kaplan-Meier (แต่อนุญาตให้ covariates) โดยใช้ผลลัพธ์ไบนารีซ้ำ นี่จะดูเหมือนเป็นวงเวียนที่จะไป แต่ฉันกำลังสำรวจว่าสิ่งนี้ขยายไปสู่ผลลัพธ์ตามลำดับและเหตุการณ์ที่เกิดขึ้นซ้ำ ๆ หากคุณสร้างลำดับเลขฐานสองที่ดูเหมือนว่า 000 สำหรับคนที่ถูกเซ็นเซอร์ใน 3 สัปดาห์, 0000 สำหรับคนที่ถูกเซ็นเซอร์ที่ 4w และ 0000111111111111 .... สำหรับผู้ที่ล้มเหลวที่ 5w (1s ขยายไปถึงประเด็นที่เรื่องสุดท้ายเป็น ตามมาในการศึกษา) เมื่อคุณคำนวณสัดส่วนเฉพาะสัปดาห์ของ 1s คุณจะได้รับอุบัติการณ์สะสมตามปกติ (จนกว่าคุณจะได้รับเวลาตรวจสอบตัวแปรที่ซึ่งจะประมาณได้เฉพาะ แต่ไม่เท่ากับการประมาณอุบัติการณ์สะสมของ Kaplan-Meier) ฉันสามารถใส่การสังเกตแบบไบนารี่ซ้ำ ๆ กับแบบจำลองโลจิสติกไบนารีโดยใช้ GEE แทนที่จะทำให้เวลาไม่ต่อเนื่องเหมือนด้านบน แต่แทนที่จะใช้ spline ในเวลา ตัวประมาณความแปรปรวนร่วมของคลัสเตอร์แซนด์วิชทำงานได้ดีพอสมควร แต่ฉันต้องการได้ข้อสรุปที่แน่นอนมากขึ้นโดยใช้โมเดลเอฟเฟกต์แบบผสม ปัญหาคือว่า 1 หลังจาก 1 แรกซ้ำซ้อน ไม่มีใครรู้วิธีระบุเอฟเฟกต์แบบสุ่มหรือระบุรุ่นที่คำนึงถึงความซ้ำซ้อนเพื่อให้ข้อผิดพลาดมาตรฐานจะไม่ย่นหรือไม่ …

2
RMSE และ Mae สามารถมีค่าเหมือนกันได้หรือไม่?
ฉันกำลังใช้การตรวจสอบความถูกต้องข้ามและการคำนวณตัวชี้วัดข้อผิดพลาดเช่น RMSE R2R2R^2, Mae, MSE ฯลฯ RMSE และ Mae สามารถมีค่าเหมือนกันได้หรือไม่?

1
ในการถดถอยเชิงเส้นเหตุใดการทำให้เป็นมาตรฐานจึงลงโทษค่าพารามิเตอร์ด้วย
ขณะนี้การเรียนรู้การถดถอยสันเขาและฉันสับสนเล็กน้อยเกี่ยวกับการลงโทษของแบบจำลองที่ซับซ้อนมากขึ้น (หรือคำจำกัดความของแบบจำลองที่ซับซ้อนมากขึ้น) จากสิ่งที่ฉันเข้าใจความซับซ้อนของโมเดลไม่จำเป็นต้องสัมพันธ์กับลำดับพหุนาม ดังนั้น:2 + 3 + 4x2+ 5x3+ 6x42+3+4x2+5x3+6x4 2 + 3+ 4x^2 + 5x^3 + 6x^4 เป็นรูปแบบที่ซับซ้อนกว่า: 5x55x5 5x^5 และฉันรู้ว่าจุดของการทำให้เป็นมาตรฐานคือการทำให้ความซับซ้อนของโมเดลต่ำดังนั้นตัวอย่างเช่นเรามีพหุนามลำดับที่ 5 ฉ( x ; w ) =W0+W1x +W2x2+W3x3+W4x4+W5x5f(x;w)=w0+w1x+w2x2+w3x3+w4x4+w5x5 f(x; w) = w_0 + w_1x + w_2x^2 + w_3x^3 + w_4x^4 + w_5x^5 พารามิเตอร์เพิ่มเติมที่เป็น 0 จะดีกว่า แต่สิ่งที่ฉันไม่เข้าใจคือถ้าเป็นพหุนามคำสั่งเดียวกันทำไมค่าพารามิเตอร์ที่ต่ำกว่าจึงถูกลงโทษน้อยกว่า ดังนั้นจะ: 2 …

1
หากสแควร์ของซีรีย์เวลาหยุดนิ่งอนุกรมเวลาดั้งเดิมจะอยู่กับที่หรือไม่?
ฉันพบวิธีแก้ปัญหาที่ระบุว่าหากตารางเวลาของอนุกรมเวลาคงที่ดังนั้นอนุกรมเวลาเดิมและในทางกลับกัน อย่างไรก็ตามฉันดูเหมือนจะไม่สามารถพิสูจน์ได้ว่าใครมีความคิดว่านี่เป็นเรื่องจริงและถ้ามันเป็นวิธีการที่จะได้รับมัน?

2
จะทดสอบอย่างไรว่า
สมมติว่าฉันมีสามกลุ่มอิสระด้วยค่าเฉลี่ย μ1, μ2, μ3μ1, μ2, μ3\mu_1,~ \mu_2,~\mu_3 ตามลำดับ ฉันจะทดสอบได้อย่างไร μ1&lt;μ2&lt;μ3μ1&lt;μ2&lt;μ3\mu_1 < \mu_2 <\mu_3 หรือไม่ใช้ n1, n2, n3n1, n2, n3n_1,~n_2,~n_3 ตัวอย่างจากแต่ละกลุ่ม? ฉันต้องการทราบวิธีการทั่วไปบางอย่างไม่ใช่การคำนวณแบบละเอียด ฉันไม่สามารถหาวิธีตั้งสมมติฐานได้H0H0H_0 และ H1H1H_1.

2
วิธีการค้นหาเมทริกซ์ความแปรปรวนร่วมของรูปหลายเหลี่ยม?
ลองนึกภาพคุณมีรูปหลายเหลี่ยมที่กำหนดโดยชุดพิกัด (x1,y1)...(xn,yn)(x1,y1)...(xn,yn)(x_1,y_1)...(x_n,y_n) และศูนย์กลางของมวลอยู่ที่ (0,0)(0,0)(0,0). คุณสามารถถือว่ารูปหลายเหลี่ยมเป็นการกระจายแบบสม่ำเสมอด้วยขอบเขตรูปหลายเหลี่ยม ฉันหลังจากวิธีการที่จะได้พบกับการเมทริกซ์ความแปรปรวนของรูปหลายเหลี่ยม ฉันสงสัยว่าเมทริกซ์ความแปรปรวนร่วมของรูปหลายเหลี่ยมนั้นเกี่ยวข้องอย่างใกล้ชิดกับช่วงเวลาที่สองของพื้นที่แต่ไม่ว่าพวกมันจะเท่ากันหรือไม่ฉันไม่แน่ใจ สูตรที่พบในบทความวิกิพีเดียที่ฉันเชื่อมโยงดูเหมือน (คาดเดาที่นี่มันไม่ชัดเจนโดยเฉพาะอย่างยิ่งกับฉันจากบทความ) เพื่ออ้างถึงความเฉื่อยหมุนรอบแกน x, y และ z มากกว่าแกนหลักของรูปหลายเหลี่ยม (บังเอิญถ้าใครสามารถชี้ให้ฉันถึงวิธีการคำนวณแกนหลักของรูปหลายเหลี่ยมนั้นจะเป็นประโยชน์กับฉันด้วย) เป็นที่น่าดึงดูดใจที่จะเพียงแค่ทำการ PCA บนพิกัดแต่การทำเช่นนี้จะทำให้เกิดปัญหาที่พิกัดไม่จำเป็นต้องกระจายทั่วรูปหลายเหลี่ยมอย่างสม่ำเสมอและดังนั้นจึงไม่ได้เป็นตัวแทนของความหนาแน่นของรูปหลายเหลี่ยม ตัวอย่างสุดขั้วคือโครงร่างของนอร์ทดาโคตาซึ่งรูปหลายเหลี่ยมถูกกำหนดโดยจุดจำนวนมากที่ตามแม่น้ำแดงรวมทั้งอีกสองจุดที่กำหนดขอบตะวันตกของรัฐ

3
วิธีลดตัวทำนายวิธีที่ถูกต้องสำหรับตัวแบบการถดถอยโลจิสติก
ดังนั้นฉันจึงได้อ่านหนังสือบางเล่ม (หรือบางส่วนของพวกเขา) เกี่ยวกับการสร้างแบบจำลอง (กลยุทธ์การสร้างแบบจำลองการถดถอยของเอฟแฮร์เรลล์ในกลุ่มอื่น ๆ ) เนื่องจากสถานการณ์ปัจจุบันของฉันตอนนี้คือฉันต้องทำแบบจำลองโลจิสติกส์ ฉันมีทั้งข้อมูลอย่างต่อเนื่องหมวดหมู่และไบนารี (ตัวทำนาย) ในชุดข้อมูลของฉัน โดยพื้นฐานแล้วฉันมีผู้ทำนายประมาณ 100 คนในตอนนี้ซึ่งเห็นได้ชัดว่ามากเกินไปสำหรับแบบจำลองที่ดี นอกจากนี้ตัวทำนายหลายตัวเหล่านี้มีความสัมพันธ์กันเนื่องจากพวกเขามักจะอยู่บนพื้นฐานของตัวชี้วัดเดียวกันแม้ว่าจะแตกต่างกันเล็กน้อย อย่างไรก็ตามสิ่งที่ฉันได้อ่านโดยใช้เทคนิคการถดถอยแบบไม่รวมตัวแปรและขั้นตอนที่ชาญฉลาดเป็นสิ่งที่แย่ที่สุดที่คุณสามารถทำได้เพื่อลดจำนวนผู้ทำนาย ฉันคิดว่าเทคนิค LASSO นั้นค่อนข้างโอเค (ถ้าฉันเข้าใจถูกต้อง) แต่เห็นได้ชัดว่าคุณไม่สามารถใช้สิ่งนี้กับผู้ทำนาย 100 คนและคิดว่าจะมีประโยชน์อะไรเกิดขึ้น ดังนั้นสิ่งที่ตัวเลือกของฉันอยู่ที่นี่? ฉันต้องนั่งคุยกับหัวหน้างานของฉันและคนฉลาดในที่ทำงานจริง ๆ หรือไม่และคิดว่าตัวพยากรณ์ที่ดีที่สุด 5 อันดับแรกควรเป็น / หรือ (เราอาจจะผิด) หรือฉันควรจะใช้วิธีใด พิจารณาแทนไหม และใช่ฉันยังรู้ว่าหัวข้อนี้มีการกล่าวถึงอย่างมาก (ออนไลน์และในหนังสือ) แต่บางครั้งดูเหมือนว่าจะค่อนข้างล้นหลามเมื่อคุณเป็นคนใหม่ในสาขาการสร้างแบบจำลองนี้ แก้ไข: ก่อนอื่นขนาดตัวอย่างของฉันคือ +1000 ผู้ป่วย (ซึ่งมีจำนวนมากในสาขาของฉัน) และจากจำนวนที่มีการตอบรับในเชิงบวกระหว่าง 70-170 (เช่น 170 ใช่การตอบสนองเทียบกับประมาณ 900 ไม่มีการตอบสนองในกรณีใดกรณีหนึ่ง) . โดยพื้นฐานแล้วแนวคิดคือการทำนายความเป็นพิษหลังการรักษาด้วยรังสี …

2
ความน่าจะเป็นของ
สมมติว่าและมีความเป็นอิสระตัวแปรสุ่มเรขาคณิตกับพารามิเตอร์พีความน่าจะเป็นที่คืออะไร?X1X1X_1X2X2X_2pppX1≥X2X1≥X2X_1 \geq X_2 ฉันสับสนเกี่ยวกับคำถามนี้เพราะเราไม่ได้บอกอะไรเกี่ยวกับและนอกเหนือจากพวกเขาเป็นรูปทรงเรขาคณิต สิ่งนี้จะไม่เป็นเพราะและสามารถเป็นอะไรก็ได้ในช่วงนี้X1X1X_1X2X2X_250%50%50\%X1X1X_1X2X2X_2 แก้ไข: ความพยายามใหม่ P(X1≥X2)=P(X1&gt;X2)+P(X1=X2)P(X1≥X2)=P(X1&gt;X2)+P(X1=X2)P(X1 ≥ X2) = P(X1 > X2) + P(X1 = X2) P(X1=X2)P(X1=X2)P(X1 = X2) = =∑x∑x\sum_{x} (1−p)x−1p(1−p)x−1p(1−p)x−1p(1−p)x−1p(1-p)^{x-1}p(1-p)^{x-1}pp2−pp2−p\frac{p}{2-p} P(X1&gt;X2)P(X1&gt;X2)P(X1 > X2) = และP(X1&lt;X2)P(X1&lt;X2)P(X1 < X2)P(X1&lt;X2)+P(X1&gt;X2)+P(X1=X2)=1P(X1&lt;X2)+P(X1&gt;X2)+P(X1=X2)=1P(X1 < X2) + P(X1 > X2) + P(X1 = X2) = 1 ดังนั้น = =เพิ่มถึงฉันจะได้ =P(X1&gt;X2)P(X1&gt;X2)P(X1 > X2)1−P(X1=X2)21−P(X1=X2)2\frac{1-P(X1 = …

2
การประมาณความไม่แน่นอนในปัญหาการอนุมานมิติสูงโดยไม่มีการสุ่มตัวอย่าง?
ฉันกำลังทำงานกับปัญหาการอนุมานมิติสูง (ประมาณพารามิเตอร์โมเดลปี 2000) ซึ่งเราสามารถทำการประมาณค่า MAP ได้อย่างมีประสิทธิภาพโดยการหาค่าสูงสุดของผู้บันทึกล็อกระดับโลกโดยใช้การเพิ่มประสิทธิภาพการไล่ระดับสีและอัลกอริทึมทางพันธุกรรม ฉันอยากจะประเมินความไม่แน่นอนเกี่ยวกับพารามิเตอร์ของแบบจำลองเพิ่มเติมนอกเหนือจากการค้นหาการประมาณค่า MAP เราสามารถคำนวณการไล่ระดับสีของ log-posterior ได้อย่างมีประสิทธิภาพเกี่ยวกับพารามิเตอร์ดังนั้นในระยะยาวเรามีเป้าหมายที่จะใช้ Hamiltonian MCMC ทำการสุ่มตัวอย่าง แต่ตอนนี้ฉันสนใจการประมาณการแบบไม่สุ่มตัวอย่าง วิธีเดียวที่ฉันรู้ก็คือการคำนวณค่าผกผันของ Hessian ในโหมดเพื่อประมาณหลังเป็นหลายตัวแปรปกติ แต่แม้มันจะดูเป็นไปไม่ได้สำหรับระบบขนาดใหญ่เช่นนี้เพราะแม้ว่าเราจะคำนวณ ∼4×106∼4×106\sim 4\times10^{6} องค์ประกอบของ Hessian ฉันแน่ใจว่าเราไม่พบสิ่งที่ตรงกันข้าม ใครช่วยแนะนำวิธีการแบบใดที่มักใช้ในกรณีเช่นนี้? ขอบคุณ! แก้ไข - ข้อมูลเพิ่มเติมเกี่ยวกับปัญหา ความเป็นมา นี้เป็นปัญหาผกผันที่เกี่ยวข้องกับการทดลองฟิสิกส์ขนาดใหญ่ เรามีตาข่ายสามเหลี่ยมสองมิติซึ่งอธิบายถึงเขตข้อมูลทางกายภาพบางส่วนและพารามิเตอร์แบบจำลองของเราคือค่าทางกายภาพของเขตข้อมูลเหล่านั้นในแต่ละจุดยอดของตาข่าย ตาข่ายมีประมาณ 650 จุดยอดและเราสร้างแบบจำลอง 3 เขตข้อมูลดังนั้นนั่นคือที่มาของพารามิเตอร์แบบจำลอง 2000 ของเรา ข้อมูลการทดลองของเรานั้นมาจากเครื่องมือที่ไม่ได้วัดเขตข้อมูลเหล่านี้โดยตรง แต่ปริมาณที่มีฟังก์ชั่นที่ไม่ใช่เชิงเส้นที่ซับซ้อนของเขตข้อมูล สำหรับเครื่องมือที่แตกต่างกันเรามีตัวแบบไปข้างหน้าซึ่งจะจับคู่พารามิเตอร์ของแบบจำลองกับการทำนายข้อมูลการทดลองและการเปรียบเทียบระหว่างการทำนายและการวัดทำให้เกิดความน่าจะเป็นบันทึก จากนั้นเราจะสรุปความเป็นไปได้ของการบันทึกจากเครื่องมือที่แตกต่างกันเหล่านี้และยังเพิ่มค่าบางอย่างก่อนบันทึกซึ่งใช้ข้อ จำกัด ทางกายภาพบางอย่างกับเขตข้อมูล ดังนั้นฉันจึงสงสัยว่า 'แบบจำลอง' นี้จัดอยู่ในหมวดหมู่อย่างเรียบร้อย - เราไม่มีทางเลือกว่าแบบจำลองคืออะไรมันถูกกำหนดโดยวิธีการใช้งานจริงของเครื่องมือที่รวบรวมข้อมูลการทดลองของเรา …

1
ทำไมคนหลัง Bayesian จึงมุ่งไปที่ตัวย่อของ KL divergence?
พิจารณาคชกรรมหลังX asymptotically, สูงสุดเกิดขึ้นใน MLE ประมาณการที่เพิ่งเพิ่มโอกาส(X)θ ∣ Xθ|X\theta\mid Xθ^θ^\hat \thetaargminθฉθ( X)argminθฉθ(X)\operatorname{argmin}_\theta\, f_\theta(X) แนวคิดทั้งหมดเหล่านี้ - นักบวชชาว Bayesian, เพิ่มความเป็นไปได้สูงสุด - ให้เสียงที่ดีเลิศและไม่เป็นไปตามอำเภอใจ ไม่มีการลงชื่อเข้าใช้ แต่ MLE จะลดความแตกต่างของ KL ให้น้อยที่สุดระหว่างการกระจายจริงและเช่นจะย่อเล็กสุดฉ~ฉ~\tilde fฉθ( x )ฉθ(x)f_\theta(x) KL (ฉ~∥ฉθ) =∫+ ∞- ∞ฉ~( x ) [บันทึกฉ~( x ) - บันทึกฉθ( x ) ]dxKL(ฉ~∥ฉθ)=∫-∞+∞ฉ~(x)[เข้าสู่ระบบ⁡ฉ~(x)-เข้าสู่ระบบ⁡ฉθ(x)]dx KL(\tilde f \parallel f_\theta) = \int_{-\infty}^{+\infty} \tilde f(x) …

2
เหตุใดการถดถอยของโลจิสติกจึงถูกสอบเทียบอย่างดีและจะทำลายการสอบเทียบได้อย่างไร
ใน Scikit เรียนรู้เอกสารเกี่ยวกับการสอบเทียบความน่าจะเป็นพวกเขาเปรียบเทียบการถดถอยโลจิสติกกับวิธีการอื่นและสังเกตว่าป่าสุ่มมีการสอบเทียบน้อยกว่าการถดถอยโลจิสติก เหตุใดการปรับเทียบการถดถอยโลจิสติกจึงดี หนึ่งจะทำลายการสอบเทียบของการถดถอยโลจิสติกได้อย่างไร (ไม่ใช่ว่าจะต้องการ - เหมือนการออกกำลังกาย)

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.