Kommentar zur Methodik:

    Montagne Parfums ist ein Klondufthaus (inspiriert von Versionen von Designerdüften – nicht verbunden). Ich kaufte immer wieder solche, die zu sehr nach Sachen rochen, die ich bereits besaß, also habe ich eines Wochenendes alle 4.782 Kundenrezensionen zu ihren 167 Produkten durchgesehen und versucht, den Katalog anhand der Art und Weise abzubilden, wie die Leute die Düfte beschreiben.

    Der größte Teil der Arbeit bestand darin, brauchbaren Text zu erhalten. Bewertungen sind voll von Versandbeschwerden, Preisgesprächen usw "Ich liebe es!"also habe ich jeden durch ein LLM laufen lassen, um nur den geruchsbezogenen Inhalt beizubehalten, und Duftnamen entfernt, damit das Modell nicht schummeln konnte, indem es sie gruppierte. Übrig blieben 2.834 Beschreibungen. Alles mit weniger als 4 Bewertungen wurde gestrichen, wodurch 167 Düfte auf 117 reduziert wurden.

    Für Einbettungen habe ich Qwen3-embedding-8B (4096 Dimensionen) verwendet. Die groben Ähnlichkeiten waren zunächst nutzlos, alles sah zu etwa 50 % ähnlich aus, was der Fluch der Dimensionalität ist. Durch die Reduzierung der PCA auf 50 Dimensionen wird der Bereich auf -49 % bis 100 % ausgeweitet, was zum Trennen ausreicht "diese riechen gleich" aus "diese teilen nichts."

    Die Plausibilitätsprüfungen werden meistens bestanden. Buko und Buko Intense (gleicher Duft, unterschiedliche Konzentration) kommen auf 88 %. Die Tabakdüfte bilden das dichteste Cluster. Am meisten "zentral" Der Duft, der im Durchschnitt allem am ähnlichsten ist, ist Pineapple Royale.

    Der große (und vielleicht offensichtliche) Vorbehalt besteht darin, dass hier die Art und Weise gemessen wird, wie Rezensenten sprechen, und nicht die Duftchemie. Die Rezensenten stimmen den auf der Produktseite aufgeführten Anmerkungen zu, und bei Düften mit schlechten Bewertungen besteht weitaus mehr Unsicherheit "am einzigartigsten" teilweise nur Mittel "am wenigsten beschrieben." Das Projekt hat mich wirklich überzeugt: Wir haben kein Vokabular für Gerüche. Menschen beschreiben keine Düfte, sie beschreiben Erinnerungen und Charaktere. Zwei echte Bewertungen aus dem Datensatz: "Ich komme mir vor wie ein Bibliothekar, der nach der Arbeit in eine schicke Bar geht, um ein Manhattan on the rocks zu genießen" Und "Ich fühle mich wie ein knallharter Piratenkapitän, der gerade die Taverne betreten hat." Einbettungsmodelle verarbeiten diese Art von Text überraschend gut, und das ist sozusagen der Sinn der ganzen Übung.

    Tools: Python, PaCMAP für die Projektion, Scipy für hierarchisches Clustering, Plotly für die interaktive Heatmap. Der Quellcode und eine interaktive Version sind auf GitHub verfügbar. Wer darin stöbern möchte, beantwortet gerne Fragen zur Pipeline.

    Von betwatch_io

    Share.

    9 Kommentare

    1. betwatch_io on
    2. number2-daffodil on

      this is cool! do you think trained perfumers would do a more consistent job of describing them? i wonder why avg people are so bad at it–we’ve all smelled the same things more or less in the course of being alive.

    3. I wonder how wines and perfumes compare with regard to the validity of the descriptions

    4. International-War-73 on

      How do I interpret the heat map ? like how is it supposed to look if, say, humans were asked to grade colors ? also how does one get from the heat map to the clustering ?

    5. MostPush3622 on

      it’s sort of confusing how the names are displayed on the heat map, i’m not sure if this is a common display pattern, but it’s hard for me to a) have no axis labels and b) have to figure out myself that every fragrance is on both axes since the names skip a line and then repeat on the adjacent axis. i’m unfamiliar with this graph type so i think it might lend easier to someone that’s used to reading these, but approaching it for the first time is weird.

      i also wonder if sorting the list differently (grouping by the scent clusters identified by your bubble map?) might produce a more interesting pattern to the heat map.

      cool data/idea tho, i think fragrances are really interesting!

    6. The conclusion is that a large group of people can’t collectively describe a smell, not „no one can describe a smell“

      This is why statistics literacy is important.

    7. RideWithMeTomorrow on

      I will say that those two reviews you cited verbatim would make me want to buy those fragrances!

    8. I am not that suprised for some reasons.

      First, perfumes are rarely one dimensional in scent, because we would perceive this as too intense and wrong. Try, for instance, L- and D-limonene, the chemical that lets lemons smell like lemons and limes like limes (it is the same molecule but mirrored). The pure form smells too intense and you will lot associate it with limes or lemons. You have to dilute it. Food chemistry worsened it with artifical flavors, that are derived from nature but do not have the whole composition of flavors added. Remember the flavors strawberry, raspberry, bananna and alike? Yeah, they smell/taste similar but nit identical.

      Second, people are cooking less and less food from basic ingredients for decades. Most people lost the clear knowledge how basic things smell, thus, the lost the ability to describe the scents. Take bitter almond, because all people working even remotely in chemistry environments are/were warned whenever they smell bitter almond, they should immediately leave the room and get fresh air, because of the thread of cyanide poisoning. How many people know by heart how bitter almond smell? (probably everyone smelled it since it is common in christmas food without knowing, bitter almond, not cyanide)

    9. You chose perhaps the must subjective sense we have and tired to tame it. lol. no. The data is beautiful though.

    Leave A Reply