Erkennung von Duplikaten in Big Data am Fallbeispiel der digitalen Musiknutzung = Detection of duplicates in big data in the use case of digital music usage

Die Beschreibung von Musikwerken ist heute nicht international genormt und daher kommt es vor allem in der Online-Musiknutzung häufig vor, dass Musikwerke in Online-Plattformen wie Spotify und Apple Music unterschiedlich gespeichert sind. Die Abrechnung von Musiknutzungen ist bei den zuständigen Ver...

Ausführliche Beschreibung

Gespeichert in:
Bibliographische Detailangaben
Veröffentlicht in:HMD
1. Verfasser: Lindner, Tobias (VerfasserIn)
Weitere Verfasser: Mandl, Peter (VerfasserIn), Bauer, Nikolai (VerfasserIn), Grimm, Markus (VerfasserIn)
Format: UnknownFormat
Sprache:ger
Veröffentlicht: 2018
Schlagworte:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
Beschreibung
Zusammenfassung:Die Beschreibung von Musikwerken ist heute nicht international genormt und daher kommt es vor allem in der Online-Musiknutzung häufig vor, dass Musikwerke in Online-Plattformen wie Spotify und Apple Music unterschiedlich gespeichert sind. Die Abrechnung von Musiknutzungen ist bei den zuständigen Verwertungsgesellschaften zwar schon seit längerem digitalisiert, aber die Feststellung der Eindeutigkeit von Musikwerken ist nicht ohne weiteres möglich. Dazu bedarf es effizienter Algorithmen zur Objektidentifikation. In dieser Arbeit wird ein Vergleich verschiedener Algorithmen wie Damerau-Levenshtein, Jaro-Winkler, Smith-Waterman u.a. zur Objektindentifikation bei Musikwerken durchgeführt. Da es sich um sehr rechenintensive Algorithmen handelt, haben wir die Algorithmen für eine Massenverarbeitung in einem Apache Hadoop-Cluster unter Nutzung von MapReduce adaptiert. Über einen umfangreichen Vergleichsdatensatz, der mit Apache HBase verteilt gespeichert wurde, haben wir die wichtigsten Algorithmen auf die Qualität der Duplikatserkennung und auf ihre Leistung hin untersucht. Es hat sich gezeigt, dass die sehr häufig verwendete Levenshtein-Distanz nicht am besten abschneidet. Durch den Einsatz anderer Algorithmen, beispielsweise der Jaro-Winkler-Distanz sind bessere Ergebnisse erzielbar und zwar sowohl bei der Zuordnungsqualität als auch bei der Verarbeitungsgeschwindigkeit.
Beschreibung:Literaturangaben
ISSN:1436-3011