



Was ist das?
Dies ist ein Spielzeugdatensatz mit fünf unabhängigen linearen Beziehungen – z = ax. Der Natur dieser Beziehung, also der Steigung aist abhängig von ein anderer Variable y.
Oder einfach gesagt, dies ist ein minimales Beispiel für viele lokale Beziehungen, die über den Raum verteilt sind – a "kompositorisch" Beziehung.
Wie könnten neuronale Netze dies modellieren?
- Feed-Forward-Netzwerke mit "nichtlinear" Aktivierungen
- Jede Einheit ist typischerweise eine "linear" Funktion mit a "nichtlinear" Aktivierung —
z = w₁x₁ + w₂x₂ ..& wenn ReLU verwendet wird,y = max(z, 0) - Nachfolgende Einheiten verwenden diese als Eingaben und wiederholen den Vorgang – nur zur Erfassung "Zusatzstoff" Wechselwirkungen zwischen den ursprünglichen Eingaben.
- Beispiel: für eine Einheit in der 2. Schicht,
f(.) = w₂₁ * max(w₁x₁ + w₂x₂ .., 0)… – Beachten Sie, dass Sie keine multiplikativen Interaktionen wie x₁ * x₂ finden - Ergebnis ist ein "Stückweise" Zusammensetzung – Die Visualisierung zeigt alle beobachteten Datenpunkte, die durch eine Kombination von Ebenen abgedeckt werden (linear aufgrund von ReLU).
- Jede Einheit ist typischerweise eine "linear" Funktion mit a "nichtlinear" Aktivierung —
- Neuronale Netze mit einem "Aufmerksamkeit" Schicht
- Im einfachsten Fall "linear" Funktion bleibt wie sie ist, ist aber multipliziert von "Aufmerksamkeitsgewichte" dh
z = w₁x₁ + w₂x₂Undy = α * z - Da diese "Aufmerksamkeitsgewichte"
αsind selbst Funktionen der Eingabe, die Sie jetzt erfassen "multiplikative Interaktionen" zwischen ihnen, d.hsoftmax(wₐ₁x₁ + wₐ₂x₂..) * (w₁x₁ + ..)– ein Polynom höherer Ordnung - Da außerdem Aufmerksamkeitsgewichte durch a geleitet werden "Soft-Max"die Gewichte weisen a auf "pflücken" oder wenn weicher, "mischen" Verhalten – wenige gegenüber vielen bevorzugen.
- Dadurch entsteht ein "Arbeitsteilung" und lässt die linearen Funktionen unverändert bleiben, während die Aufmerksamkeitsebene mithilfe der Variablen höherer Ordnung zwischen ihnen umschaltet
y - Ergebnis ist ein externes "Kontrolle" das zugrunde liegende verlassen "WAHR" Beziehung wie sie ist.
- Im einfachsten Fall "linear" Funktion bleibt wie sie ist, ist aber multipliziert von "Aufmerksamkeitsgewichte" dh
Dies ist ein Auszug aus meinem längeren Blogbeitrag – Aufmerksamkeit in neuronalen Netzen von Grund auf wo ich ein intuitiveres Beispiel wie das Kochen von Reis verwende, um die dahinter stehenden Intuitionen zu erklären Aufmerksamkeit und andere grundlegende ML-Konzepte, die dazu führen.
Dies sind Screenshots, die vollständige Visualisierung ist handlungsinteraktiv. x-Beitrag aus r/learnmaschinelles Lernen
Haftungsausschluss: Ich bin mir nicht sicher, ob dies zu diesem Sub passt, da dies der Fall ist keine echten Daten. Mods, wenn nicht, könnt ihr es gerne entfernen.
Von hayAbhay