Wie misst man semantische Ähnlichkeit beim Topic Clustering?
Autor: Yılmaz Saraçtopic-clusteringembeddingserp-ortusmesiicerik-mimarisi
Kurze Antwort: Drei Messungen zusammen: Kosinusähnlichkeit zwischen Embedding-Vektoren, SERP-Überlappung der Suchanfragen und Query-Familien, die in der Search Console auf dieselbe Seite laufen. Wer sich auf eine Methode verlässt, produziert falsche Cluster.
Praktische Messmethode
- Embedding-Basis: Queries und Seitentitel mit einem Embedding-Modell vektorisieren, Kandidatencluster über Kosinusähnlichkeit bilden; Algorithmen wie k-means oder HDBSCAN skalieren die Arbeit.
- SERP-Überlappungstest: Zeigen zwei Queries weitgehend dieselbe erste Ergebnisseite, genügt eine Seite; unterscheiden sie sich, braucht es getrennte Seiten. Intentionsunterschiede erkennt dieser Test am besten.
- GSC-Validierung: Queries, die bereits auf derselben URL Impressionen sammeln, sind natürliche Clusterbeweise.
- Redaktionelle Kontrolle: Algorithmische Cluster werden von Menschen bestätigt; kommerzielle Intentionsunterschiede sind im Vektor oft unsichtbar.
Berichtet wird pro Cluster: Impressionen, Klicks und Query-Abdeckung je Cluster in einer Zeile, abweichende Seiten werden neu bewertet.