6
Prisoner's Dilemma v.2 - แบทเทิลรอยัล
ในคำถามนี้มีการคิดค้นเกมที่ผู้เล่นจะต้องเผชิญหน้ากันในแต่ละคู่ใน Dilemma ของ Prisoner's เพื่อกำหนดกลยุทธ์การทำซ้ำที่ทำคะแนนสูงสุดต่อผู้อื่น ในคำถามนี้ฉันคิดวิธีสำหรับหลาย ๆ คนในการเล่น Dilemma ของนักโทษต่อกันในเวลาเดียวกัน ในรูปแบบนี้เมทริกซ์ผลตอบแทนไม่จำเป็นโดยแต่ละผลลัพธ์ระหว่างผู้เล่นสองคู่แต่ละคนเป็นผลรวมของการตัดสินใจอิสระสองหน้าที่ งานของคุณคือสร้าง AI เพื่อเล่นเกม Dilemma ของผู้เล่นหลายคนที่สมมาตรซึ่งเป็นสมมาตรทั่วไปซึ่งจะได้คะแนนสูงสุดเท่าที่จะเป็นไปได้ กฎของเกม ในแต่ละรอบของการเล่นหลายคนนี้ Dilemma หลายรอบนักโทษผู้เล่นAสามารถเลือกที่จะ "ใช้เวลา 1" Bจากบางส่วนผู้เล่นคนอื่น ในกรณีนี้Aคะแนนเพิ่มขึ้น 1 ขณะที่Bคะแนนลดลง 2 การตัดสินใจนี้เกิดขึ้นระหว่างผู้เล่นแต่ละคู่ที่ได้รับคำสั่ง นี่คือการตัดสินใจเพียงอย่างเดียวสำหรับผู้เล่นแต่ละคน - ที่จะ "รับ 1" หรือไม่ "รับ 1" จากผู้เล่นแต่ละคนซึ่งมีลักษณะคล้ายคลึงกับการละทิ้งและความร่วมมือตามลำดับ เมทริกซ์ผลตอบแทนที่มีประสิทธิภาพระหว่างผู้เล่นสองคนP1และP2มีลักษณะดังนี้: P1/P2 P1 Take1 P1 Don't P2 Take1 -1/-1 -2/+1 P2 Don't +1/-2 …