[OC] Dieses Diagramm ist die lexikalische Vielfalt von Eminems Texten, die als Verhältnis einzigartiger Wörter zu den Gesamtwörtern berechnet werden, gegen die Gesamtwortzahl jedes Songs. Jeder Punkt repräsentiert einen Track aus seinem Katalog (ohne Sketche), und die Blasengröße spiegelt geniale Seitenaufrufe wider.

    Die schattierten horizontalen und vertikalen Bänder markieren die mittleren 50% der Werte entlang jeder Achse:

    • Lexikalischer Reichtum von 0,395 bis 0,462
    • Wortanzahl von 696 bis 952

    Nur eine Untergruppe von Songs ist direkt in der Tabelle gekennzeichnet. Für den Rest enthält die interaktive Version Tooltips mit vollständigen Metadaten, die Spaß gemacht haben.

    Die vier gekennzeichneten Quadranten wurden hinzugefügt, um eine gewisse Struktur bereitzustellen, indem sie Songs gruppieren, ob sie in der Regel länger, sich wiederholender oder im Wortschatz unterschiedlicher sind.

    Die Texte wurden aus Genius abgerufen und in R. Plot wurde in DataWrapper erstellt. 341 Nicht-Skit-Songs werden gezeigt; 23 Sketche wurden von der Analyse ausgeschlossen.

    Link zum interaktiven Diagramm ist hier.

    Von TreeFruitSpecialist

    Share.

    7 Kommentare

    1. TreeFruitSpecialist on

      [OC]

      Source: Lyrics were scraped from Genius using the `{geniusr}` package and cleaned/tokenized in R with `{tidytext}`. Lexical diversity was calculated as the ratio of unique tokens to total words.

      Tool: Visualization was made in Datawrapper.

    2. shred-i-knight on

      should make a version where you can compare different artists overlayed with eachother, would make it more useful to compare because it’s difficult to determine what the baseline is for an average rapper

    3. My first reaction is a method error. Rap god should(*) be very diverse, but it necessarily says „i, you“ a lot.

      Would a one-word song be perfectly diverse and longer songs necessarily repeat simple words?

      Unique words per song (absolute)? Commenting for updates

    4. Type token ratio as a measure of lexical diversity is sensitive to sample size. The general trend you see of a negative correlation is not a property of eminem’s music but a property of the bias in the lexical measure you are using. If you took the longer songs and took a subsample of them they would have higher lexical diversity.

    5. Someone did exactly this about 15 years ago with various artists. The conclusion was „WuTang Clan ain’t nothin‘ to fuck wit‘.“ They were like 6 of the top 10 in breadth of vocab.

    Leave A Reply