สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
วิธีที่ง่ายกว่าในการค้นหา
พิจารณา 3 ตัวอย่าง iid ที่ดึงมาจากการแจกแจงแบบเดียวกัน โดยที่คือพารามิเตอร์ ฉันต้องการหา ที่เป็นคำสั่งสถิติฉันu(θ,2θ)u(θ,2θ)u(\theta, 2\theta)θθ\thetaE[X(2)|X(1),X(3)]E[X(2)|X(1),X(3)] \mathbb{E}\left[X_{(2)}| X_{(1)}, X_{(3)}\right] X(i)X(i)X_{(i)}iii ฉันคาดว่าผลลัพธ์จะเป็น แต่วิธีเดียวที่ฉันสามารถแสดงผลลัพธ์นี้ดูเหมือนจะเกินไป ยาวฉันไม่สามารถหาวิธีแก้ปัญหาอย่างง่ายได้หรือไม่ฉันขาดอะไรมีทางลัดบ้างไหม?E[X(2)|X(1),X(3)]=X(1)+X(3)2E[X(2)|X(1),X(3)]=X(1)+X(3)2 \mathbb{E}\left[X_{(2)}| X_{(1)}, X_{(3)}\right] = \frac{X_{(1)}+ X_{(3)}}{2} สิ่งที่ฉันทำมีดังต่อไปนี้: ฉันพบความหนาแน่นแบบมีเงื่อนไข f(x(2)|x(1),x(3))=f(x(1),x(2),x(3))f(x(1),x(3))f(x(2)|x(1),x(3))=f(x(1),x(2),x(3))f(x(1),x(3)) f(x_{(2)}| x_{(1)}, x_{(3)}) = \frac{ f(x_{(1)}, x_{(2)}, x_{(3)})}{f(x_{(1)}, x_{(3)})} ฉันรวม E[X(2)|X(1),X(3)]=∫xf(x|x(1),x(3))dxE[X(2)|X(1),X(3)]=∫xf(x|x(1),x(3))dx \mathbb{E}\left[X_{(2)}| X_{(1)}, X_{(3)}\right] = \int x f(x| x_{(1)}, x_{(3)}) dx รายละเอียด: ฉันใช้สูตรทั่วไปสำหรับความหนาแน่นของสถิติการสั่งซื้อ (ด้วยตัวบ่งชี้ของชุด )I{A}I{A}\mathbb{I}_{\{A\}}AAA …

1
ผู้เรียนพื้นฐานเชิงเส้นทำงานอย่างไรในการส่งเสริม และมันทำงานอย่างไรในห้องสมุด xgboost
ฉันรู้วิธีการใช้ฟังก์ชันวัตถุประสงค์เชิงเส้นตรงและการเพิ่มประสิทธิภาพเชิงเส้นใน XGBoost คำถามที่เป็นรูปธรรมของฉันคือ: เมื่ออัลกอริธึมที่เหมาะกับส่วนที่เหลือ (หรือการไล่ระดับสีลบ) คือการใช้คุณลักษณะหนึ่งอย่างในแต่ละขั้นตอน (เช่นรุ่น univariate) หรือคุณลักษณะทั้งหมด การอ้างอิงใด ๆ กับเอกสารเกี่ยวกับการเพิ่มประสิทธิภาพเชิงเส้นใน XGBoost จะได้รับการชื่นชม แก้ไข: เพิ่มการเชิงเส้นสามารถนำมาใช้ใน XGBoost โดยการตั้งค่าพารามิเตอร์ 'บูสเตอร์' เป็น 'gblinear' ดู: http://www.ncbi.nlm.nih.gov/pmc/articles/PMC3885826/สำหรับข้อมูลที่เป็นประโยชน์เกี่ยวกับการเพิ่มประสิทธิภาพเชิงเส้น โปรดทราบว่าฉันไม่ได้พูดเกี่ยวกับฟังก์ชั่นวัตถุประสงค์ (ซึ่งอาจเป็นเชิงเส้น) แต่เกี่ยวกับการเพิ่มพวกเขาเอง ขอบคุณ!

1
กีฬาโอลิมปิก - ฮังการีมีตัวเลขสองหลักเป็นทองคำหรือไม่? (ญาติประชากร)
ฉันสร้างเว็บเพจที่ดึงผลลัพธ์ของเหรียญโอลิมปิกสดจาก Thompson Reuters และจำนวนประชากรทั่วโลกจาก CIA ผลลัพธ์น่าสนใจสำหรับฉัน - ฮังการีมีคะแนนนำสองหลักในเหรียญทองทั่วโลก นอกจากนี้สหรัฐอเมริกาและจีนก็อยู่ใกล้จุดต่ำสุดในเกือบทุกหมวดหมู่ คำถามของฉันคือ - ฉันกำลังนำเสนอข้อมูลอย่างเป็นธรรมหรือไม่? ฉันเอาประชากรที่มีขนาดใหญ่ที่สุดจากนั้นสร้างปัจจัยสำหรับแต่ละประเทศจากนั้น คอลัมน์การนับเหรียญสัมพันธ์จะขึ้นอยู่กับปัจจัยนั้น ฉันสามารถเพิ่มคอลัมน์ใดได้บ้าง ปัจจัยอื่นใดที่ฉันสามารถเพิ่มเพื่อนำเสนอมุมมองที่ยุติธรรม? มุมมองแบบสัมบูรณ์นั้นง่าย - รอยเตอร์ทำเช่นนั้น วิธีการสร้างมุมมองที่เป็นธรรม? https://rack.pub/rio

3
เมื่อใด (และทำไม) Bayesians ปฏิเสธวิธีการ Bayesian ที่ถูกต้อง? [ปิด]
ปิด คำถามนี้ต้องการรายละเอียดหรือความคมชัด ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ เพิ่มรายละเอียดและชี้แจงปัญหาโดยแก้ไขโพสต์นี้ ปิดให้บริการใน3 ปีที่ผ่านมา จากสิ่งที่ฉันได้อ่านและจากคำตอบของคำถามอื่น ๆ ที่ฉันถามที่นี่วิธีการที่ใช้กันบ่อย ๆ นั้นเรียกว่าคณิตศาสตร์เป็นประจำ ( ฉันไม่สนใจว่าพวกเขาสอดคล้องกับปรัชญาหรือไม่ฉันแค่สนใจว่ามันสอดคล้องกับคณิตศาสตร์) หรือไม่ วิธีการแบบเบย์ (สำหรับผู้ที่คัดค้านเรื่องนี้ให้ดูหมายเหตุที่ด้านล่างของคำถามนี้) คำตอบสำหรับคำถามที่เกี่ยวข้อง (ไม่ใช่ของฉัน) นี้สนับสนุนข้อสรุปนี้: วิธีการของผู้ใช้บ่อย ๆ ส่วนใหญ่มีความเท่าเทียมกันแบบเบย์ซึ่งในกรณีส่วนใหญ่จะให้ผลลัพธ์ที่เหมือนกัน โปรดทราบว่าในสิ่งต่อไปนี้การมีความหมายทางคณิตศาสตร์เหมือนกันจะให้ผลลัพธ์เดียวกัน หากคุณกำหนดลักษณะสองวิธีที่สามารถพิสูจน์ได้ว่าให้ผลลัพธ์ที่เหมือนกันว่า "แตกต่าง" อยู่เสมอนั่นคือสิ่งที่ถูกต้องของคุณ แต่นั่นเป็นการตัดสินเชิงปรัชญาไม่ใช่เชิงคณิตศาสตร์หรือวิธีปฏิบัติ หลายคนที่อธิบายตนเองว่า "Bayesians" แต่ดูเหมือนว่าจะปฏิเสธโดยใช้การประเมินความเป็นไปได้สูงสุดภายใต้สถานการณ์ใด ๆ แม้ว่ามันจะเป็นกรณีพิเศษของวิธีการแบบเบส์( ทางคณิตศาสตร์ ) เพราะมันเป็น "วิธีการประจำ" เห็นได้ชัดว่า Bayesians ยังใช้การแจกแจงแบบ จำกัด / จำกัด เมื่อเปรียบเทียบกับผู้ใช้บ่อยแม้ว่าการแจกแจงแบบนั้นจะถูกต้องทางคณิตศาสตร์จากมุมมองแบบเบย์ คำถาม: Bayesians ปฏิเสธและวิธีการที่ถูกต้องทางคณิตศาสตร์จากมุมมองของ Bayesian เมื่อใดและเพราะเหตุใด มีเหตุผลสำหรับสิ่งนี้ซึ่งไม่ใช่ …


2
การสร้างแบบจำลองคริกเก็ตเลอร์สรับ batsmen ออก
ฉันมีชุดข้อมูลที่มีรายละเอียดของเกมคริกเกตจำนวนมาก (ไม่กี่พันรายการ) ในคริกเก็ต "เลอร์ส" โยนลูกบอลซ้ำ ๆ อย่างต่อเนื่องของ "batsmen" คนขว้างลูกพยายามเอาลูกบอลออกไป ในแง่นี้มันค่อนข้างคล้ายกับเหยือกและแป้งในเบสบอล ถ้าฉันใช้ชุดข้อมูลทั้งหมดและหารจำนวนลูกบอลที่ได้ลูกบอลออกมาด้วยจำนวนลูกบอลทั้งหมดที่กลิ้งไปฉันจะเห็นว่าฉันมีความน่าจะเป็นเฉลี่ยที่นักขว้างลูกบอลจะได้ประมาณ 0.03 ( หวังว่าฉันจะไม่ผิดพลาดไปแล้ว?) สิ่งที่ฉันสนใจคือสิ่งที่ฉันสามารถทำได้เพื่อลองและคำนวณความน่าจะเป็นของผู้ตีลูกที่เฉพาะเจาะจงที่ถูกโยนออกโดยผู้เล่นลูกที่เฉพาะเจาะจงในลูกบอลหน้า ชุดข้อมูลมีขนาดใหญ่พอที่ผู้ขว้างลูกใดก็ตามจะมีลูกบอลหลายพันลูกไปยังลูกบอลหลากหลายรูปแบบ ดังนั้นฉันเชื่อว่าฉันสามารถแบ่งจำนวนของนักเล่นโบว์ลิ่งที่ทำได้สำเร็จตามจำนวนลูกบอลที่เขาได้คลำเพื่อคำนวณความน่าจะเป็นใหม่สำหรับผู้เล่นที่เฉพาะเจาะจงนั้นที่ได้ออกมาจากลูกบอลถัดไป ปัญหาของฉันคือชุดข้อมูลไม่ใหญ่พอที่จะรับประกันได้ว่าคนขว้างลูกที่ได้รับมีจำนวนลูกบอลที่มีนัยสำคัญทางสถิติที่ลูกบอลใดก็ตาม ดังนั้นหากฉันสนใจที่จะคำนวณความน่าจะเป็นของผู้ขว้างลูกที่เฉพาะเจาะจงหันหน้าไปทางลูกบอลที่เฉพาะเจาะจงฉันไม่คิดว่ามันจะไม่สามารถทำได้ในลักษณะที่เรียบง่ายแบบเดียวกัน คำถามของฉันคือว่าวิธีการต่อไปนี้ถูกต้องหรือไม่: ทั่วทั้งชุดข้อมูลความน่าจะเป็นของลูกบอลที่จะออกมาเป็น 0.03 หากฉันคำนวณว่าโดยเฉลี่ยคนขว้างลูก A มีความน่าจะเป็นที่จะออกจาก 0.06 (เช่นสองเท่าน่าจะเป็นกะลาเฉลี่ย) และโดยเฉลี่ยแล้วลูก B มีความน่าจะเป็นที่จะออกจาก 0.01 (หนึ่งในสามที่น่าจะเป็นลูกบอลเฉลี่ย) ถ้าเช่นนั้นถูกต้องหรือไม่ที่จะบอกว่าความน่าจะเป็นของลูกบอลที่เฉพาะเจาะจงนั้นออกไปในลูกบอลลูกถัดไปที่ลูกโบว์ลิ่งนั้นจะเท่ากับ 0.06 * (0.01 / 0.03) = 0.02?

2
การลดขนาดที่ปรับขนาดได้
พิจารณาจำนวนของคุณสมบัติคงที่บาร์นส์ฮัทเสื้อ SNEมีความซับซ้อนของ , ประมาณการสุ่มและ PCA มีความซับซ้อนของทำให้พวกเขา "แพง" สำหรับชุดข้อมูลขนาดใหญ่มากO ( n บันทึกn )O(nเข้าสู่ระบบ⁡n)O(n\log n)O ( n )O(n)O(n) ในทางกลับกันวิธีการที่ใช้การวัดหลายมิติมีความซับซ้อนโอ (n2)O(n2)O(n^2) มีเทคนิคการลดขนาดอื่น ๆ (นอกเหนือจากสิ่งเล็กน้อยเช่นการดูคอลัมน์แรก) ซึ่งมีความซับซ้อนต่ำกว่าหรือไม่kkkO ( n บันทึกn )O(nเข้าสู่ระบบ⁡n)O(n\log n)

1
ฉันแค่วิ่งถอยหลังสองล้านถอยหลัง - ความน่าจะเป็นแบบบูรณาการ
ขณะนี้ฉันกำลังพยายามใช้วิธีการที่ใช้ในเอกสารยอดนิยมที่มีชื่อว่า "ฉันเพิ่งผ่านการถดถอยสองล้านครั้ง" แนวคิดพื้นฐานที่อยู่เบื้องหลังคือมีบางกรณีที่ไม่ชัดเจนว่าควรรวมตัวควบคุมในแบบจำลองใด สิ่งหนึ่งที่คุณสามารถทำได้ในกรณีเช่นนี้คือการวาดตัวควบคุมสุ่มเรียกใช้การถดถอยต่าง ๆ นับล้านจากนั้นดูว่าตัวแปรที่คุณสนใจมีปฏิกิริยาอย่างไร หากโดยทั่วไปมีเครื่องหมายเดียวกันในข้อกำหนดทั้งหมดเราสามารถพิจารณาได้ว่ามีความแข็งแกร่งมากกว่าตัวแปรที่มีการเปลี่ยนแปลงของสัญญาณเสมอ กระดาษส่วนใหญ่มีความชัดเจนมาก อย่างไรก็ตามกระดาษน้ำหนักการถดถอยที่แตกต่างกันเหล่านั้นทั้งหมดในลักษณะดังต่อไปนี้: ความน่าจะเป็นแบบบูรณาการของข้อกำหนดที่กำหนดจะถูกหารด้วยผลรวมของความน่าจะเป็นแบบบูรณาการทั้งหมดสำหรับข้อกำหนดทั้งหมด ปัญหาที่ฉันมีคือฉันไม่แน่ใจว่าความเป็นไปได้แบบบูรณาการเกี่ยวข้องกับการถดถอยแบบ OLS ที่ฉันต้องการเรียกใช้ (ใน Stata) Googling หัวข้อต่าง ๆ เช่น "ความน่าจะเป็นแบบบูรณาการ stata" นั้นเป็นจุดจบที่ฉันยังคงทำงานในสิ่งต่าง ๆ เช่นการถดถอยแบบโลจิสติกส์ ฉันยอมรับว่าแบบจำลองเหล่านี้ซับซ้อนเกินกว่าที่ฉันจะเข้าใจได้ งานปัจจุบันของฉันคือการที่มีรูปแบบการถ่วงน้ำหนักที่แตกต่างกันที่ใช้ในวรรณกรรมที่ฉันทำ (ชนิด) เข้าใจ ตัวอย่างเช่นเป็นไปได้ที่จะถ่วงน้ำหนักแต่ละการถดถอยตามดัชนีอัตราส่วนความน่าจะเป็น มีแม้แต่แพ็คเกจ R ที่ใช้ lri เป็นตุ้มน้ำหนัก แม้ว่าโดยธรรมชาติแล้วฉันต้องการที่จะใช้ต้นฉบับ คำแนะนำใด ๆ? ลิงค์กระดาษ: http://down.cenet.org.cn/upfile/34/2009112141315158.pdf

1
“ การสูญเสียบันทึก” หมายถึงการสูญเสียลอการิทึมหรือการสูญเสียโลจิสติกส์หรือไม่?
ฉันรู้ว่าฉันเห็นมันทั้งสองวิธีดังนั้นจึงมีความแตกต่างระหว่างทั้งสองและที่หนึ่งที่ถูกเรียกโดยทั่วไปมากกว่า?

1
ช่วงการคาดการณ์สำหรับสัดส่วนความสำเร็จในอนาคตภายใต้การตั้งค่าแบบทวินาม
สมมติว่าฉันพอดีกับการถดถอยแบบทวินามและได้รับการประเมินจุดและเมทริกซ์ความแปรปรวนร่วม - ความแปรปรวนร่วมของสัมประสิทธิ์การถดถอย นั่นจะทำให้ฉันได้ CI สำหรับสัดส่วนที่คาดหวังของความสำเร็จในการทดลองในอนาคต, , แต่ฉันต้องการ CI สำหรับสัดส่วนที่สังเกตได้ มีคำตอบที่เกี่ยวข้องสองสามข้อที่โพสต์รวมถึงการจำลอง (สมมติว่าฉันไม่ต้องการทำเช่นนั้น) และลิงก์ไปยัง Krishnamoorthya et al (ซึ่งไม่ค่อยตอบคำถามของฉัน)ppp เหตุผลของฉันมีดังนี้: ถ้าเราใช้แค่แบบจำลอง Binomial เราถูกบังคับให้สมมติว่าถูกสุ่มตัวอย่างจากการแจกแจงแบบปกติ (ด้วย Wald CI ที่สอดคล้องกัน) และดังนั้นจึงเป็นไปไม่ได้ที่จะได้รับ CI สำหรับสัดส่วนที่สังเกตได้ในรูปแบบปิด หากเราสมมติว่าถูกสุ่มตัวอย่างจากการแจกแจงแบบเบต้าแล้วสิ่งต่างๆนั้นง่ายกว่ามากเนื่องจากการนับความสำเร็จจะเป็นไปตามการกระจายแบบเบต้า - ทวินาม เราก็จะต้องคิดว่ามีความไม่แน่นอนในพารามิเตอร์เบต้าประมาณไม่มีและ\ppppppαα\alphaββ\beta มีสามคำถาม: 1) ทฤษฎีหนึ่ง: คุณสามารถใช้การประมาณค่าพารามิเตอร์เบต้าหรือไม่ ฉันรู้ว่าการสร้าง CI สำหรับการสังเกตในอนาคตในการถดถอยเชิงเส้นหลาย Y=x′β+ϵ,ϵ∼N(0,σ2)Y=x′β+ϵ,ϵ∼N(0,σ2)Y = x'\beta + \epsilon, \epsilon \sim N(0, \sigma^2) พวกเขาทำอย่างนั้นแปรปรวนระยะผิดพลาด WRT, …

2
“ เสียง Laplace” มีความหมายว่าอะไร?
ฉันกำลังเขียนอัลกอริทึมสำหรับความเป็นส่วนตัวที่ต่างกันโดยใช้กลไก Laplace น่าเสียดายที่ฉันไม่มีพื้นฐานด้านสถิติดังนั้นจึงไม่เป็นที่รู้จักกันมากนัก ดังนั้นตอนนี้ฉันสะดุดมากกว่าคำว่า: เสียง Laplace หากต้องการสร้างชุดข้อมูลส่วนบุคคลให้เป็นเอกสารทั้งหมดเพียงแค่พูดถึงการเพิ่มเสียง Laplace ตามการกระจาย Laplace ให้กับค่าฟังก์ชัน k ( X) = f( X) + Y( X)k(X)=ฉ(X)+Y(X)k(X) = f(X) + Y(X) (k คือค่าส่วนต่างที่แตกต่างกัน f คือค่าที่ส่งคืนโดยฟังก์ชั่นการประเมินและ Y the Laplace noise นี่หมายความว่าฉันสร้างตัวแปรสุ่มจากการแจกแจง Laplace ตามฟังก์ชั่นนี้ที่ฉันได้รับจาก wikipedia https://en.wikipedia.org/wiki/Laplace_distribution ? Y= μ - b sgn ( U ) ln( 1 - 2 …

1
สามารถสร้างมาตรฐาน
ฉันพยายามตีความผลลัพธ์ของบทความที่พวกเขาใช้การถดถอยหลายครั้งเพื่อทำนายผลลัพธ์ต่าง ๆ อย่างไรก็ตาม 's (ค่าสัมประสิทธิ์ B มาตรฐานกำหนดเป็นโดยที่นั้นขึ้นอยู่กับ ตัวแปรและเป็นตัวทำนาย) ที่รายงานดูเหมือนจะไม่ตรงกับที่รายงาน :ββ\betaβx1=Bx1⋅S Dx1S DYβx1=Bx1⋅SDx1SDy\beta_{x_1} = B_{x_1} \cdot \frac{\mathrm{SD}_{x_1}}{\mathrm{SD}_y}Yyyx1x1x_1R2R2R^2 แม้จะมีของ -0.83, -0.29, -0.16, -0.43, 0.25 และ -0.29 แต่รายงานมีค่าเพียง 0.20ββ\betaR2R2R^2 นอกจากนี้ผู้ทำนายทั้งสาม: น้ำหนักค่าดัชนีมวลกายและ% ไขมันเป็นหลายคอลลิแนร์มีความสัมพันธ์รอบ r = 0.8-0.9 ซึ่งกันและกันในเพศเดียวกัน เป็นค่าเป็นไปได้กับเหล่านี้หรือไม่มีความสัมพันธ์แบบตรงระหว่าง 's และหรือไม่?R2R2R^2ββ\betaββ\betaR2R2R^2 นอกจากนี้ปัญหาของตัวทำนายหลายค่าอาจส่งผลต่อของตัวทำนายที่สี่ (VO2max) ซึ่งสัมพันธ์กับ r = 0.4 ด้วยตัวแปรสามตัวดังกล่าวข้างต้นหรือไม่ββ\beta

1
เครือข่ายประสาทเทียมใช้การเข้ารหัสที่มีประสิทธิภาพหรือไม่
คำถามของฉันเกี่ยวข้องกับความสัมพันธ์ระหว่างสมมติฐานการเข้ารหัสที่มีประสิทธิภาพซึ่งแสดงไว้ในหน้า Wikipedia เกี่ยวกับการเข้ารหัสที่มีประสิทธิภาพและอัลกอริทึมการเรียนรู้เครือข่ายประสาท ความสัมพันธ์ระหว่างสมมติฐานการเข้ารหัสที่มีประสิทธิภาพกับเครือข่ายประสาทเทียมคืออะไร มีโครงข่ายประสาทเทียมใดที่ได้รับแรงบันดาลใจจากสมมติฐานการเข้ารหัสที่มีประสิทธิภาพหรือไม่ หรือมันจะยุติธรรมกว่าที่จะบอกว่าอัลกอริธึมการเรียนรู้โครงข่ายประสาททั้งหมดอย่างน้อยที่สุดก็ขึ้นอยู่กับการเข้ารหัสที่มีประสิทธิภาพ?

2
จะคำนวณช่วงความมั่นใจของการสกัดกั้น x ในการถดถอยเชิงเส้นได้อย่างไร?
เนื่องจากข้อผิดพลาดมาตรฐานของการถดถอยเชิงเส้นมักจะได้รับสำหรับตัวแปรตอบสนองฉันสงสัยว่าจะได้รับช่วงความมั่นใจในทิศทางอื่นได้อย่างไร - เช่นการสกัดกั้น x ฉันสามารถเห็นภาพว่ามันอาจจะเป็นอะไร แต่ฉันแน่ใจว่าต้องมีวิธีที่ตรงไปตรงมาในการทำเช่นนี้ ด้านล่างเป็นตัวอย่างใน R ของวิธีการเห็นภาพนี้: set.seed(1) x <- 1:10 a <- 20 b <- -2 y <- a + b*x + rnorm(length(x), mean=0, sd=1) fit <- lm(y ~ x) XINT <- -coef(fit)[1]/coef(fit)[2] plot(y ~ x, xlim=c(0, XINT*1.1), ylim=c(-2,max(y))) abline(h=0, lty=2, col=8); abline(fit, col=2) points(XINT, 0, col=4, …

1
Q-learning มีประสิทธิภาพเพียงใดเมื่อใช้ Neural Networks เมื่อมีเอาต์พุตหนึ่งหน่วยต่อการกระทำ
ข้อมูลประกอบ: ฉันใช้การประมาณค่า Q ของโครงข่ายใยประสาทเทียมในงานการเรียนรู้การเสริมแรงของฉัน วิธีการนั้นเหมือนกับที่อธิบายไว้ในคำถามนี้แต่คำถามนั้นแตกต่างกัน ในแนวทางนี้จำนวนผลลัพธ์คือจำนวนการกระทำที่เราสามารถทำได้ และในคำง่ายขั้นตอนต่อไปนี้: กระทำ A, สำรวจรางวัลขอ NN ที่จะคาดการณ์ค่า Q สำหรับการกระทำที่เป็นไปได้ทั้งหมดให้เลือกค่า Q สูงสุดคำนวณ Q R + max(new_state_Q)สำหรับการดำเนินการโดยเฉพาะอย่างยิ่ง รุ่น Fit บนคาดการณ์ค่า Q R + max(new_state_Q)ที่มีเพียงหนึ่งของพวกเขาถูกแทนที่ด้วย คำถาม:วิธีการนี้มีประสิทธิภาพเพียงใดหากจำนวนผลผลิตมีขนาดใหญ่ ความพยายาม:สมมติว่ามี 10 การกระทำที่เราสามารถทำได้ ในแต่ละขั้นตอนเราขอให้แบบจำลองทำนายค่า 10 ค่าตั้งแต่อายุยังน้อยของแบบจำลองการทำนายนี้เป็นความยุ่งเหยิงโดยรวม จากนั้นเราปรับเปลี่ยนค่า 1 ของผลลัพธ์และปรับโมเดลให้เหมาะสมกับค่าเหล่านี้ ฉันมีความคิดที่ตรงกันข้ามสองประการเกี่ยวกับวิธีการที่ดี \ เลวคือวิธีการนี้และไม่สามารถตัดสินใจได้ว่าวิธีใดที่ถูกต้อง: จากมุมมองหนึ่งเรากำลังฝึกอบรมแต่ละเซลล์ประสาท 9 ครั้งในข้อมูลสุ่มและเพียงครั้งเดียวในข้อมูลที่ใกล้เคียงกับมูลค่าที่แท้จริง หาก NN ทำนายค่า 5 สำหรับการดำเนินการ A ในสถานะ …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.