Quelle (Daten, Methoden und Infos): Dilemma.critique-lab.ai

    verwendete Werkzeuge: Python

    Ich lief einen Benchmark, bei dem mehr als 100 große Sprachmodelle gegenseitig in einer Gesprächsformulierung des Dilemmas des Gefangenen (100 Spiele pro Modell, Round-Robin) gespielt wurden.

    Interessanterweise verlieren sie unabhängig von der Modellreihe, wenn sie größer werden, ihre Tendenz zum Defekt (wählen Sie die Option, sich auf Kosten ihres Gegenstücks zu sparen) und werden anschließend auch schlechter.

    Daten & Methode:

    • 100 Spiele pro Modell, ~ 10k Spiele Gesamtspiel
    • Auszahlungsmatrix ist das Standard -PD -Setup
    • Gleiche Eingabeaufforderung + Abtastparameter für jedes Modell

    Von parthh-01

    Share.

    1 Kommentar

    1. highlyeducated_idiot on

      Do you have any insight into why smaller models might perform better in this test?

    Leave A Reply