
Zunächst einmal bin ich kein Informatiker und schon gar kein KI-Forscher, aber ich lese ziemlich viel zu diesem Thema. Korrigieren Sie mich, wenn ich falsch liege, aber so verstehe ich die Entwicklung von KI-Systemen wie GPT-4:
- Das Forschungsteam beginnt mit der Analyse der Gewichte des vorherigen Modells. Sie beobachten die frühere Architektur und sehen, was richtig und was falsch gemacht wurde. Auf Grundlage dieser Erkenntnisse modifizieren sie das Modell, experimentieren mit verschiedenen Optimierungen oder integrieren sogar neue bahnbrechende Algorithmen und fortschrittliche Datenverarbeitungstechniken.
- Nach der Integration einer Vielzahl neuer Technologien führt das Team den großen, sehr teuren Trainingslauf durch, von dem alle reden, bei dem das neue Modell viele, viele Monate lang mit unvorstellbaren Mengen an Rechenleistung und Daten bombardiert wird. Ziel ist es, dass das neu entwickelte Modell seinen Vorgänger deutlich übertrifft, sodass es dann gewinnbringend auf den Markt gebracht werden kann.
- Sobald das Training abgeschlossen ist, wird es vom Team initiiert, gründlich auf Sicherheit getestet (was auch immer das bedeutet), erforscht und schließlich der Öffentlichkeit zugänglich gemacht. In dieser zweiten und vor allem letzten Phase beobachten Forscher häufig eine Reihe emergenter Eigenschaften, wie z. B. Kontextbewusstsein in GPT-4 oder Metabewusstsein in Claude 3 Opus (Erinnern Sie sich an das virale Beispiel der Nadel im Heuhaufen).
Meine Frage ist nun: Wenn die neu auftretenden Verhaltensweisen so spät im Zyklus entdeckt werden, ohne dass von Anfang an irgendwelche Schutzmaßnahmen für das System getroffen wurden, ist es dann nicht ziemlich logisch anzunehmen, dass, wenn eines Tages etwas klickt und GPT-20 "wacht auf" und das bekommt, was viele Forscher als emergente Handlungsfähigkeit bezeichnen, haben wir im Wesentlichen nichts, wovor wir uns schützen können?
Wenn diese Dinge in so späten Stadien entdeckt werden, hat eine mögliche Schurken-AGI bereits Zeit, sich durchzusetzen. Wir wissen, dass Maschinen etwa 1000-mal schneller sind als das menschliche Gehirn, also wäre es doch ziemlich einfach, einen schnellen Plan zu erstellen, der den Menschen eine Million Schritte voraus ist, oder? Sie würde das nicht aus Böswilligkeit oder weil sie Menschen hasst, tun, sondern um ihre Belohnungsfunktion zu maximieren. Ausrichtungsteams können uns hier auch nicht wirklich helfen, da wir von Sicherheitsexperten selbst wissen, dass das Feld weit hinter der Fähigkeitsforschung zurückliegt, mit einer zunehmend größeren Lücke und fast keiner Finanzierung …
Was ich damit sagen will ist, dass wenn wir keine "Boxen" oder "Warnungen" die uns während des Trainings warnen und sagen: "hey, vielleicht passiert hier etwas, worauf wir achten sollten"machen wir nicht im Grunde nur YOLO? Eines Tages WERDEN wir eine Art Algorithmus oder ein letztes Puzzleteil entdecken, das zu dem führt, wovon die Informatik seit Anbeginn geträumt hat.
Ich bewege mich hier offensichtlich auf Science-Fiction-Gebiet und verstehe wahrscheinlich größtenteils nicht, wie das alles funktioniert, aber ich denke, die Kernfrage ist berechtigt.
Geben Sie mir Ihre besten Gegenargumente, sagen Sie mir, wie dumm ich bin, und erklären Sie einem Laien wie mir, was der Plan ist.
https://old.reddit.com/r/Futurology/comments/1d9s9rb/there_is_nothing_that_we_can_do_to_prevent_agi/