
Quelle (Daten, Methoden und Infos): Dilemma.critique-lab.ai
verwendete Werkzeuge: Python
Ich lief einen Benchmark, bei dem mehr als 100 große Sprachmodelle gegenseitig in einer Gesprächsformulierung des Dilemmas des Gefangenen (100 Spiele pro Modell, Round-Robin) gespielt wurden.
Interessanterweise verlieren sie unabhängig von der Modellreihe, wenn sie größer werden, ihre Tendenz zum Defekt (wählen Sie die Option, sich auf Kosten ihres Gegenstücks zu sparen) und werden anschließend auch schlechter.
Daten & Methode:
- 100 Spiele pro Modell, ~ 10k Spiele Gesamtspiel
- Auszahlungsmatrix ist das Standard -PD -Setup
- Gleiche Eingabeaufforderung + Abtastparameter für jedes Modell
Von parthh-01
![Das Dilemma des LLM -Spiels für Gefangene: Kleinere Modelle erreichen eine höhere Bewertung [OC] Das Dilemma des LLM -Spiels für Gefangene: Kleinere Modelle erreichen eine höhere Bewertung [OC]](https://www.bytesde.com/wp-content/uploads/2025/08/mcqrskosr7if1-1536x603.png)
1 Kommentar
Do you have any insight into why smaller models might perform better in this test?