สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
การอ้างอิงสำหรับการทดสอบทางสถิติสำหรับความแตกต่างระหว่างสองอัตราเดิมพัน?
ในความคิดเห็นที่นี่ @gung เขียน ฉันเชื่อว่าพวกเขาสามารถทับซ้อนกันเล็กน้อย (อาจ ~ 25%) และยังคงมีนัยสำคัญในระดับ 5% โปรดจำไว้ว่า 95% CI ที่คุณเห็นนั้นสำหรับแต่ละคนหรือ แต่การทดสอบ 2 ORs นั้นเกี่ยวกับความแตกต่างระหว่างพวกเขา อย่างไรก็ตามหากพวกเขาไม่ทับซ้อนกันเลยพวกเขาแตกต่างกันอย่างมีนัยสำคัญอย่างแน่นอน & ถ้า 95% CI ทับซ้อนกับค่าคาดคะเน OR อื่น ๆ พวกเขาจะไม่แน่นอน ไม่มีใครมีการอ้างอิงสำหรับคำสั่งดังกล่าวหรือไม่ ผู้ตรวจทานต้องการให้ฉันคำนวณว่าสองอัตราต่อรองแตกต่างกันหรือไม่

1
อัลกอริทึม EM ประมาณการพารามิเตอร์ในแบบจำลองผสมแบบเกาส์หรือไม่
ฉันกำลังศึกษารูปแบบส่วนผสมของเกาส์เซียนและเกิดขึ้นกับคำถามนี้ด้วยตัวเอง สมมติว่าข้อมูลพื้นฐานถูกสร้างขึ้นจากการผสมผสานของการแจกแจงแบบเกาส์กันและแต่ละคนมีค่าเฉลี่ยของเวกเตอร์โดยที่และแต่ละคนมีค่าเดียวกัน เมทริกซ์ความแปรปรวนและถือว่านี้เป็นเมทริกซ์แนวทแยง และสมมติว่าอัตราส่วนการผสมคือกล่าวคือแต่ละกลุ่มมีน้ำหนักเท่ากันKKKμk∈Rpμk∈Rp\mu_k\in\mathbb{R}^p1≤k≤K1≤k≤K1\leq k\leq KΣΣ\SigmaΣΣ\Sigma1/K1/K1/K ดังนั้นในตัวอย่างนี้เหมาะที่งานเพียงอย่างเดียวคือการประมาณพาหะเฉลี่ยที่และเมทริกซ์ร่วมแปรปรวน\KKKμk∈Rpμk∈Rp\mu_k\in\mathbb{R}^p1≤k≤K1≤k≤K1\leq k\leq KΣΣ\Sigma คำถามของฉันคือ: ถ้าเราใช้อัลกอริทึม EM เราจะสามารถประมาณและอย่างต่อเนื่องเช่นเมื่อขนาดตัวอย่างตัวประมาณที่อัลกอริทึม EM จะสร้างให้ได้ค่าที่แท้จริงของและ ?μkμk\mu_kΣΣ\Sigman→∞n→∞n\rightarrow\inftyμkμk\mu_kΣΣ\Sigma

6
อะไรเป็นตัวอย่างที่ดีในการแสดงให้กับนักศึกษาระดับปริญญาตรี
ฉันจะสอนสถิติในฐานะผู้ช่วยสอนในครึ่งหลังของภาคการศึกษานี้ให้กับนักศึกษาระดับปริญญาตรี CS นักเรียนส่วนใหญ่เข้าชั้นเรียนไม่มีแรงจูงใจที่จะเรียนวิชานี้และรับเฉพาะวิชาที่จำเป็นเท่านั้น ฉันต้องการทำให้เรื่องน่าสนใจและมีประโยชน์ไม่ใช่แค่ชั้นเรียนที่พวกเขาเรียนรู้เพื่อรับ B + เพื่อผ่าน ในฐานะนักเรียนปริญญาเอกคณิตศาสตร์ที่บริสุทธิ์ฉันรู้เพียงเล็กน้อยเกี่ยวกับการประยุกต์ใช้ในชีวิตจริง ฉันต้องการขอใบสมัครเกี่ยวกับสถิติระดับปริญญาตรีในชีวิตจริง ตัวอย่างฉันกำลังมองหาเป็นคน (ในจิตวิญญาณ) เช่น: 1) การแสดงทฤษฎีขีด จำกัด กลางมีประโยชน์สำหรับข้อมูลตัวอย่างขนาดใหญ่บางอย่าง 2) จัดทำตัวอย่างโต้ตอบที่ทฤษฎีบทขีด จำกัด กลางใช้ไม่ได้ (กล่าวถึงทฤษฎีที่ตามหลังการแจกแจงโคชี) 3) แสดงให้เห็นว่าการทดสอบสมมติฐานทำงานอย่างไรในตัวอย่างชีวิตจริงที่มีชื่อเสียงโดยใช้ Z-test, t-test หรือบางอย่าง 4) แสดงให้เห็นว่าสมมติฐานเบื้องต้นที่เกินความจริงหรือผิดสามารถให้ผลลัพธ์ที่ผิดได้อย่างไร 5) แสดงให้เห็นว่า p-value และช่วงเวลาความเชื่อมั่นทำงานอย่างไรในกรณีที่รู้จักกันดีในชีวิตจริง 6) ทำนองเดียวกันประเภท I, ข้อผิดพลาดประเภท II, กำลังสถิติ, ระดับการปฏิเสธ , ฯลฯαα\alpha ปัญหาของฉันคือว่าในขณะที่ฉันมีตัวอย่างมากมายเกี่ยวกับความน่าจะเป็น (ทอยเหรียญ, ทอยลูกเต๋า, ทำลายนักการพนัน, martingales, สุ่มเดิน, เส้นขนานของนักโทษสามคน, ปัญหามอนตี้ฮอลล์, วิธีน่าจะเป็นในการออกแบบอัลกอริทึม …

2
ผลการถดถอยมีขอบเขตบนที่ไม่คาดคิด
ฉันพยายามทำนายคะแนนสมดุลและลองวิธีการถดถอยที่แตกต่างกันหลายวิธี สิ่งหนึ่งที่ฉันสังเกตเห็นคือค่าคาดการณ์ดูเหมือนจะมีขอบเขตบนบางอย่าง นั่นคือความสมดุลที่เกิดขึ้นจริงในแต่คาดการณ์ของฉันที่ด้านบนสุดที่ประมาณ0.8พล็อตต่อไปนี้แสดงยอดคงเหลือตามจริงกับยอดคงเหลือที่คาดการณ์ไว้ (ทำนายด้วยการถดถอยเชิงเส้น):[ 0.0 , 1.0 )[0.0,1.0)[0.0, 1.0)0.80.80.8 และนี่คือแผนการแจกแจงสองข้อมูลเดียวกัน: เนื่องจากตัวทำนายของฉันเบ้มาก (ข้อมูลผู้ใช้ที่มีการแจกแจงกฎหมายพลังงาน) ฉันจึงใช้การแปลงแบบบ็อกซ์ค็อกซ์ซึ่งเปลี่ยนผลลัพธ์เป็นต่อไปนี้: แม้ว่ามันจะเปลี่ยนการกระจายตัวของการทำนาย แต่ก็ยังคงมีขอบเขตบน ดังนั้นคำถามของฉันคือ: อะไรคือเหตุผลที่เป็นไปได้สำหรับขอบเขตบนดังกล่าวในผลการทำนาย? ฉันจะแก้ไขการคาดการณ์เพื่อให้สอดคล้องกับการแจกแจงของค่าจริงได้อย่างไร โบนัส:เนื่องจากการกระจายหลังจากแปลงบ็อกซ์ค็อกซ์ดูเหมือนว่าจะเป็นไปตามการกระจายตัวของตัวทำนายที่ถูกแปลงเป็นไปได้หรือไม่ว่ามันเชื่อมโยงโดยตรงหรือไม่ ถ้าเป็นเช่นนั้นจะมีการเปลี่ยนแปลงที่ฉันสามารถนำไปใช้เพื่อให้เหมาะสมกับการกระจายตัวกับค่าจริงหรือไม่? แก้ไข:ฉันใช้การถดถอยเชิงเส้นอย่างง่ายพร้อมตัวทำนาย 5 ตัว

1
ถ้า
นี่คือปัญหาที่เกิดขึ้นในการสอบภาคการศึกษาในมหาวิทยาลัยของเราไม่กี่ปีหลังซึ่งฉันพยายามที่จะแก้ปัญหา ถ้า X1,X2X1,X2X_1,X_2 มีความเป็นอิสระ ββ\beta ตัวแปรสุ่มที่มีความหนาแน่น β(n1,n2)β(n1,n2)\beta(n_1,n_2) และ β(n1+12,n2)β(n1+12,n2)\beta(n_1+\dfrac{1}{2},n_2) ตามลำดับแล้วแสดงว่า X1X2-----√X1X2\sqrt{X_1X_2} ดังต่อไปนี้ β( 2)n1, 2n2)β(2n1,2n2)\beta(2n_1,2n_2). ฉันใช้วิธีจาโคเบียนเพื่อรับความหนาแน่นของ Y=X1X2-----√Y=X1X2Y=\sqrt{X_1X_2} มีดังนี้: ฉY( y) =4Y2n1B (n1,n2) B (n1+12,n2)∫1Y1x2( 1 -x2)n2- 1( 1 -Y2x2)n2- 1dxfY(y)=4y2n1B(n1,n2)B(n1+12,n2)∫y11x2(1−x2)n2−1(1−y2x2)n2−1dxf_Y(y)=\dfrac{4y^{2n_1}}{B(n_1,n_2)B(n_1+\dfrac{1}{2},n_2)}\int_y^1\dfrac{1}{x^2}(1-x^2)^{n_2-1}(1-\dfrac{y^2}{x^2})^{n_2-1}dx ตอนนี้ฉันหลงทางไปแล้ว ตอนนี้ในบทความหลักฉันพบว่ามีการให้คำใบ้ ฉันพยายามใช้คำใบ้ แต่ไม่สามารถรับการแสดงออกที่ต้องการ คำใบ้คือคำต่อคำดังนี้ คำแนะนำ: หาสูตรสำหรับความหนาแน่นของ Y=X1X2-----√Y=X1X2Y=\sqrt{X_1X_2} ในแง่ของความหนาแน่นที่กำหนดของ X1X1X_1 และ X2X2X_2 และลองใช้การเปลี่ยนแปลงของตัวแปรด้วย Z=Y2xz=y2xz=\dfrac{y^2}{x}. ดังนั้น ณ จุดนี้ฉันพยายามใช้ประโยชน์จากคำใบ้นี้โดยพิจารณาการเปลี่ยนแปลงของตัวแปรนี้ ดังนั้นฉันได้รับฉY( y) =4Y2n1B …

2
สนามเซลล์ประสาทสัมผัสใน LeNet
ฉันพยายามที่จะเข้าใจทุ่งเปิดกว้างของซีเอ็นเอ็นให้ดีขึ้น ในการทำเช่นนั้นฉันต้องการคำนวณเขตข้อมูลที่เปิดกว้างของแต่ละเซลล์ประสาทใน LeNet สำหรับ MLP ปกติมันค่อนข้างง่าย (ดูhttp://deeplearning.net/tutorial/lenet.html#sparse-connectivity ) แต่มันยากกว่าในการคำนวณเขตข้อมูลที่เปิดกว้างของเซลล์ประสาทในเลเยอร์ต่อไปนี้หนึ่งชั้นหรือมากกว่านั้นและ รวมชั้น เซลล์รับแสงของเซลล์ประสาทในชั้นที่ 2 คืออะไร? มันมีขนาดใหญ่กว่ามากในชั้นย่อยย่อย / รวมกำไรต่อไปนี้? และสูตรการคำนวณเหล่านี้คืออะไร?

1
การบรรจบกันของอัลกอริทึม EM ที่มีการกระจายตัวแบบผสมไบวาเรีย
ผมมีรูปแบบผสมซึ่งผมต้องการที่จะหาประมาณค่าความน่าจะเป็นสูงสุดของการได้รับชุดของข้อมูลและชุดของข้อมูลบางส่วนที่สังเกตZฉันได้ดำเนินการทั้ง E-ขั้นตอน (คำนวณความคาดหวังของให้และพารามิเตอร์ปัจจุบัน ) และขั้นตอนเอ็มเพื่อลดเชิงลบเข้าสู่ระบบได้รับโอกาสที่คาดว่าจะZxxxzzzzzzxxxθkθk\theta^kzzz ตามที่ฉันได้เข้าใจแล้วโอกาสสูงสุดที่เพิ่มขึ้นสำหรับการทำซ้ำทุกครั้งซึ่งหมายความว่าโอกาสในการลบเชิงลบจะต้องลดลงสำหรับการทำซ้ำทุกครั้งหรือไม่ อย่างไรก็ตามในขณะที่ฉันทำซ้ำอัลกอริทึมไม่ได้สร้างมูลค่าลดลงของความน่าจะเป็นบันทึกเชิงลบ แต่อาจลดลงและเพิ่มขึ้นได้ ตัวอย่างเช่นนี่คือค่าของความน่าจะเป็นบันทึกเชิงลบจนกระทั่งการลู่เข้า: ที่นี่ฉันเข้าใจผิดไหม? นอกจากนี้สำหรับข้อมูลจำลองเมื่อฉันดำเนินการความเป็นส่วนตัวสูงสุดสำหรับตัวแปรแฝงที่แท้จริง (ไม่มีการตรวจสอบ) ฉันมีความใกล้เคียงกับความสมบูรณ์แบบมากแสดงว่าไม่มีข้อผิดพลาดในการเขียนโปรแกรม สำหรับอัลกอริทึม EM นั้นมักจะรวมตัวกันเป็นโซลูชั่นย่อยที่ชัดเจนโดยเฉพาะอย่างยิ่งสำหรับชุดย่อยเฉพาะของพารามิเตอร์ (เช่นสัดส่วนของตัวแปรการจำแนกประเภท) เป็นที่ทราบกันดีว่าอัลกอริทึมอาจมาบรรจบกันเพื่อท้องถิ่นน้อยหรือจุดหยุดนิ่งจะมีการแก้ปัญหาการค้นหาธรรมดาหรือเช่นเดียวกันเพื่อเพิ่มโอกาสในการหาขั้นต่ำทั่วโลก (หรือสูงสุด) สำหรับปัญหานี้โดยเฉพาะฉันเชื่อว่ามีการจำแนกประเภทมิสจำนวนมากเนื่องจากการผสมสองตัวแปรหนึ่งในสองการแจกแจงใช้ค่าที่มีความน่าจะเป็นที่หนึ่ง (มันคือการผสมผสานของอายุการใช้งานT=zT0+(1−z)∞T=zT0+(1−z)∞T=z T_0 + (1-z)\inftyโดยที่หมายถึงส่วนที่เป็นของการแจกแจงอย่างใดอย่างหนึ่ง ตัวบ่งชี้ถูกตรวจสอบแน่นอนในชุดข้อมูล zzzzzz ฉันเพิ่มตัวเลขที่สองสำหรับเมื่อฉันเริ่มต้นด้วยวิธีแก้ปัญหาเชิงทฤษฎี (ซึ่งควรใกล้เคียงที่สุด) อย่างไรก็ตามตามที่สามารถเห็นได้ถึงความน่าจะเป็นและพารามิเตอร์ที่เบี่ยงเบนจากการแก้ปัญหานี้ไปสู่สิ่งที่ด้อยกว่าอย่างชัดเจน แก้ไข: ข้อมูลทั้งหมดอยู่ในรูปแบบโดยที่เป็นเวลาที่สังเกตสำหรับหัวเรื่อง ,ระบุว่าเวลาเกี่ยวข้องกับเหตุการณ์จริงหรือไม่ หรือถ้ามันถูกเซ็นเซอร์อย่างถูกต้อง (1 หมายถึงเหตุการณ์และ 0 หมายถึงการเซ็นเซอร์ที่ถูกต้อง),คือเวลาตัดปลายของการสังเกต (อาจเป็น 0) ด้วยตัวบ่งชี้การตัดและในที่สุดเป็นตัวบ่งชี้ว่า bivariate มันเราแค่ต้องพิจารณา 0 และ 1)xi=(ti,δi,Li,τi,zi)xi=(ti,δi,Li,τi,zi)\mathbf{x_i}=(t_i,\delta_i,L_i,\tau_i,z_i)titit_iiiiδiδi\delta_iLiLiL_iτiτi\tau_iziziz_i สำหรับเรามีฟังก์ชั่นความหนาแน่นในทำนองเดียวกันก็มีความเกี่ยวข้องกับฟังก์ชันการกระจายหาง1) สำหรับเหตุการณ์ที่น่าสนใจจะไม่เกิดขึ้น แม้ว่าจะไม่มีที่เกี่ยวข้องกับการกระจายนี้เรากำหนดให้เป็นจึงและ 1 สิ่งนี้ยังให้การกระจายแบบเต็มต่อไปนี้:z=1z=1z=1fz(t)=f(t|z=1)fz(t)=f(t|z=1)f_z(t)=f(t|z=1)Sz(t)=S(t|z=1)Sz(t)=S(t|z=1)S_z(t)=S(t|z=1)z=0z=0z=0tttinfinf\inff(t|z=0)=0f(t|z=0)=0f(t|z=0)=0S(t|z=0)=1S(t|z=0)=1S(t|z=0)=1 …

1
อะไรจะเป็นตัวอย่างของเมื่อ L2 เป็นฟังก์ชั่นการสูญเสียที่ดีสำหรับการคำนวณการสูญเสียหลัง?
การสูญเสีย L2 พร้อมกับการสูญเสีย L0 และ L1 เป็นฟังก์ชั่นการสูญเสีย "เริ่มต้น" ที่ใช้กันโดยทั่วไปสามฟังก์ชั่นเมื่อใช้การสรุปหลังโดยการสูญเสียหลังขั้นต่ำที่คาดไว้ เหตุผลหนึ่งสำหรับเรื่องนี้อาจเป็นเพราะพวกเขาค่อนข้างง่ายต่อการคำนวณ (อย่างน้อยสำหรับการแจกแจงแบบ 1d), L0 ให้ผลลัพธ์ในโหมด, L1 ในค่ามัธยฐานและ L2 ให้ค่าเฉลี่ย เมื่อสอนฉันสามารถสร้างสถานการณ์ที่ L0 และ L1 เป็นฟังก์ชั่นการสูญเสียที่สมเหตุสมผล (ไม่ใช่แค่ "ค่าเริ่มต้น") แต่ฉันกำลังดิ้นรนกับสถานการณ์ที่ L2 จะเป็นฟังก์ชันการสูญเสียที่สมเหตุสมผล ดังนั้นคำถามของฉัน: เพื่อจุดประสงค์ในการสอนสิ่งที่จะเป็นตัวอย่างของเมื่อ L2 เป็นฟังก์ชั่นการสูญเสียที่ดีสำหรับการคำนวณการสูญเสียหลังขั้นต่ำ? สำหรับ L0 มันง่ายที่จะเกิดขึ้นกับสถานการณ์จากการเดิมพัน สมมติว่าคุณได้คำนวณส่วนหลังของจำนวนประตูทั้งหมดในเกมฟุตบอลที่กำลังจะมาถึงและคุณจะทำการเดิมพันที่คุณชนะ $$$ หากคุณเดาจำนวนประตูอย่างแม่นยำและแพ้อย่างอื่น จากนั้น L0 คือฟังก์ชันการสูญเสียที่สมเหตุสมผล ตัวอย่าง L1 ของฉันมีการวางแผนเล็กน้อย คุณกำลังพบเพื่อนที่จะมาถึงหนึ่งในสนามบินหลายแห่งและจากนั้นเดินทางโดยรถยนต์ปัญหาคือคุณไม่รู้ว่าสนามบินใด (และไม่สามารถโทรหาเพื่อนของคุณได้เพราะเธออยู่ในอากาศ) เมื่อพิจารณาถึงสนามบินที่เธออาจจะลงจอดแล้วเป็นสถานที่ที่ดีที่จะวางตำแหน่งตัวเองเพื่อให้ระยะห่างระหว่างเธอกับคุณจะน้อยเมื่อเธอไปถึง ที่นี่จุดที่ลดการสูญเสีย L1 ที่คาดไว้ให้น้อยที่สุดนั้นสมเหตุสมผลถ้าทำการสันนิษฐานอย่างง่าย …

1
คำถามเกี่ยวกับสมมติฐานทั่วไปของ t-test
สำหรับการทดสอบ t ตามข้อความส่วนใหญ่มีข้อสันนิษฐานว่าโดยทั่วไปข้อมูลประชากรจะถูกกระจายออกไป ฉันไม่เห็นว่าทำไม t-test ไม่เพียงต้องการให้การกระจายตัวตัวอย่างของค่าเฉลี่ยตัวอย่างแจกจ่ายตามปกติไม่ใช่ประชากรใช่หรือไม่ หากเป็นกรณีที่การทดสอบ t ในที่สุดต้องการความเป็นมาตรฐานในการแจกแจงตัวอย่างประชากรก็จะมีลักษณะเหมือนการกระจายตัวใช่ไหม? ตราบใดที่มีขนาดตัวอย่างที่เหมาะสม นั่นไม่ใช่ทฤษฎีบทขีด จำกัด กลางหรือไม่? (ฉันหมายถึงที่นี่เพื่อทดสอบตัวอย่างหนึ่งตัวอย่างหรือเป็นอิสระ)

4
พัฒนาการทดสอบทางสถิติเพื่อแยกความแตกต่างของสองผลิตภัณฑ์
ฉันมีชุดข้อมูลจากแบบสำรวจลูกค้าฉันต้องการปรับใช้การทดสอบทางสถิติเพื่อดูว่ามีความแตกต่างอย่างมีนัยสำคัญระหว่างผลิตภัณฑ์ 1 และผลิตภัณฑ์ 2 หรือไม่ นี่คือชุดข้อมูลของความคิดเห็นของลูกค้า อัตรานี้แย่มากแย่มากโอเคดีถึงดีมาก customer product1 product2 1 very good very bad 2 good bad 3 okay bad 4 very good okay 5 bad very good 6 okay good 7 bad okay 8 very good very bad 9 good good 10 good very good 11 okay okay …

3
อนุกรมเวลาตามฤดูกาล
ฉันใช้decomposeฟังก์ชั่นRและคิดส่วนประกอบ 3 อย่างของอนุกรมเวลารายเดือนของฉัน (แนวโน้มฤดูกาลและการสุ่ม) ถ้าฉันพล็อตแผนภูมิหรือดูที่ตารางฉันสามารถเห็นได้อย่างชัดเจนว่าอนุกรมเวลาได้รับผลกระทบตามฤดูกาล อย่างไรก็ตามเมื่อฉันถอยหลังอนุกรมเวลาลงในตัวแปรจำลองตามฤดูกาล 11 ค่าสัมประสิทธิ์ทั้งหมดไม่มีนัยสำคัญทางสถิติซึ่งบอกว่าไม่มีฤดูกาล ฉันไม่เข้าใจว่าทำไมฉันถึงได้ผลลัพธ์ที่แตกต่างกันสองอย่าง สิ่งนี้เกิดขึ้นกับใคร? ฉันกำลังทำอะไรผิดหรือเปล่า? ฉันจะเพิ่มรายละเอียดที่เป็นประโยชน์ที่นี่ นี่คืออนุกรมเวลาของฉันและการเปลี่ยนแปลงรายเดือนที่สอดคล้องกัน ในแผนภูมิทั้งสองคุณสามารถเห็นว่ามีฤดูกาล (หรือนี่คือสิ่งที่ฉันต้องการประเมิน) โดยเฉพาะในแผนภูมิที่สอง (ซึ่งเป็นการเปลี่ยนแปลงรายเดือนของซีรี่ส์) ฉันสามารถเห็นรูปแบบที่เกิดซ้ำ (คะแนนสูงและคะแนนต่ำในเดือนเดียวกันของปี) ด้านล่างเป็นผลลัพธ์ของdecomposeฟังก์ชั่น ฉันขอขอบคุณที่ @RichardHardy กล่าวว่าฟังก์ชั่นไม่ได้ทดสอบว่ามีฤดูกาลจริงหรือไม่ แต่การสลายตัวดูเหมือนจะยืนยันสิ่งที่ฉันคิด อย่างไรก็ตามเมื่อฉันถอยหลังอนุกรมเวลาของตัวแปรตัวประกอบตามฤดูกาล 11 ตัว (มกราคมถึงพฤศจิกายนไม่รวมธันวาคม) ฉันพบสิ่งต่อไปนี้: Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 5144454056 372840549 13.798 <2e-16 *** Jan -616669492 527276161 -1.170 0.248 Feb -586884419 527276161 …

1
ความแตกต่างระหว่างตัวกรองที่เรียนรู้ใน autoencoder และเครือข่ายประสาทเทียมคืออะไร?
ในซีเอ็นเอ็นเราจะได้เรียนรู้ตัวกรองเพื่อสร้างแผนที่คุณลักษณะในเลเยอร์ convolutional ใน Autoencoder หน่วยที่ซ่อนอยู่ของแต่ละเลเยอร์ถือเป็นตัวกรองได้ ความแตกต่างระหว่างตัวกรองที่เรียนในเครือข่ายทั้งสองนี้คืออะไร

2
บันทึก (p (x, y)) ทำข้อมูลร่วมกันให้เป็นจุดปกติได้อย่างไร
ฉันกำลังพยายามที่จะเข้าใจรูปแบบของข้อมูลร่วมกันแบบจุดตามปกติ npmi=pmi(x,y)log(p(x,y))npmi=pmi(x,y)log(p(x,y))npmi = \frac{pmi(x,y)}{log(p(x,y))} เหตุใดความน่าจะเป็นร่วมของบันทึกจึงทำให้ข้อมูลร่วมกันที่เป็นจุดเป็นปกติอยู่ระหว่าง [-1, 1]? ข้อมูลร่วมกันที่ชาญฉลาดคือ: pmi=log(p(x,y)p(x)p(y))pmi=log(p(x,y)p(x)p(y))pmi = log(\frac{p(x,y)}{p(x)p(y)}) p (x, y) ถูกล้อมรอบด้วย [0, 1] ดังนั้นล็อก (p (x, y)) ถูกล้อมรอบด้วย (, 0] ดูเหมือนว่าบันทึก (p (x, y)) ควรเปลี่ยนแปลงสมดุลใน ตัวเศษ แต่ฉันไม่เข้าใจอย่างชัดเจนว่ามันทำให้ฉันนึกถึงเอนโทรปีh=−log(p(x))h=−log(p(x))h=-log(p(x))แต่อีกครั้งฉันไม่เข้าใจความสัมพันธ์ที่แน่นอน

1
การประมาณแบบเบย์ที่มี "แบนก่อน" เหมือนกับการประเมินความเป็นไปได้สูงสุดหรือไม่?
ในสายวิวัฒนาการต้นไม้ phylogenetic มักถูกสร้างขึ้นโดยใช้ MLE หรือการวิเคราะห์แบบเบย์ อาจเกิดการแบนก่อนใช้ในการประเมินแบบเบย์ ตามที่ฉันเข้าใจแล้วการประมาณการแบบเบย์เป็นการประมาณการความเป็นไปได้ที่จะรวมเอาการประเมินก่อนหน้านี้ คำถามของฉันคือถ้าคุณใช้ความคิดก่อนหน้านี้มันแตกต่างจากการวิเคราะห์ความน่าจะเป็นหรือไม่?

1
อะไรคือความแตกต่างระหว่าง "การทดสอบสมมติฐานทางสถิติที่ไม่มีสมมติฐาน" และแบบทดสอบอื่น ๆ
หัวข้อร้อนแรงล่าสุดของการอภิปรายเกี่ยวข้องกับวารสารห้ามการใช้ "ขั้นตอนการทดสอบทางสถิติสมมติฐานว่าง (NHSTPs)" จากบทความที่ส่งไปยังวารสาร ฉันเห็นคำนี้ที่นักเขียนบางคนใช้ แต่ฉันไม่เข้าใจว่าพวกเขากำลังพยายามสร้างความแตกต่างอะไร NHSTP นั้นแตกต่างจาก "การทดสอบสมมติฐาน" หรือ "การทดสอบนัยสำคัญ" หรือไม่?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.