Daten, Datenarten und Merkmale
Beim maschinellen Lernen und in der Data Science wird mit Daten gearbeitet. Hierbei kommen verschiedene Arten von Daten vor. Die folgende Tabelle zeigt einige Zeilen eines Beispieldatensatzes mit Merkmalen von Frosch-Lauten unterschiedlicher Froscharten. Jede Zeile der Tabelle repräsentiert einen Datenpunkt des Datensatzes. Zu jeder Zeile gibt es einen Button, mit dem man das passende Froschlautsegment anhören kann.
| Art | Qualitaet | Dauer (s) | Dominante Frequenz (Hz) | Spektraler Schwerpunkt (Hz) | Onsets | Ton |
|---|---|---|---|---|---|---|
| Sphaenorhynchus surdus | M | 0.441 | 2535.5 | 1981.2 | 4 | |
| Boana bischoffi | M | 0.580 | 1862.6 | 2287.8 | 3 | |
| Pithecopus azureus | L | 0.186 | 4247.4 | 3336.6 | 2 | |
| Leptodactylus latrans | M | 0.534 | 2088.7 | 2292.1 | 5 | |
| Physalaemus albonotatus | L | 0.232 | 1991.8 | 2289.5 | 2 | |
| Dendropsophus minutus | L | 0.191 | 4968.8 | 3866.9 | 3 |
Aktuelles Hoerbeispiel:Noch kein Beispiel ausgewaehlt.
Die Spalten der Tabelle zeigen die Merkmale, die zu einem Datenpunkt jeweils gehören. Hier wurden folgende Merkmale dargestellt: Art, Qualität, Dauer (s), Dominante Frequenz (Hz), Spektraler Schwerpunkt (Hz), Onsets.
Merkmal und Merkmalsausprägung
In der Statistik und in Data Science werden die Wörter Merkmal und statistische Variable oft fast gleich benutzt.
- Ein Merkmal (englisch: Feature) oder eine statistische Variable ist eine Eigenschaft, die bei jeder Beobachtung erfasst wird.
- Eine Merkmalsausprägung ist der konkrete Wert dieses Merkmals in einer bestimmten Zeile.
Beispiele aus dem Datensatz:
- Das Merkmal
species(Art) hat als Ausprägung zum BeispielBoana bischoffi. - Das Merkmal
quality(Qualität) hat als Ausprägung zum BeispielModerL. - Das Merkmal
duration_s(Dauer in s) hat als Auspraegung zum Beispiel0.580.
Qualitative und quantitative Merkmale
Man kann Merkmale grob in zwei Gruppen einteilen:
Qualitative Merkmale
Qualitative Merkmale beschreiben Kategorien oder Bezeichnungen. Sie sagen, was für eine Art von Wert vorliegt, nicht wie viel davon vorhanden ist.
Beispiele in diesem Datensatz:
species(Art)quality(Qualität)recording_id(Aufnahme-ID)annotation_source(Quelle der Annotation)
Quantitative Merkmale
Quantitative Merkmale sind messbare Zahlenwerte. Mit ihnen kann man rechnen, Mittelwerte bilden oder Verteilungen vergleichen.
Beispiele in diesem Datensatz:
duration_s(Dauer in s)rms_energy(Signalenergie)zero_crossing_rate(Nulldurchgangsrate)spectral_centroid_hz(Spektraler Schwerpunkt in Hz)spectral_bandwidth_hz(Spektrale Bandbreite in Hz)dominant_frequency_hz(Dominante Frequenz in Hz)onset_count(Anzahl der Einsätze)
Eine feinere Einteilung von Merkmalen
Die Einteilung in qualitative und quantitative Merkmale ist eine erste grobe Einteilung. Man kann Merkmale aber auch noch genauer beschreiben. Dabei verwendet man oft die Begriffe kategorial, ordinal und kardinal.
Diese feinere Einteilung passt zur vorherigen Unterscheidung:
- kategoriale und ordinale Merkmale gehören meist zu den qualitativen Merkmalen,
- kardinale Merkmale gehören zu den quantitativen Merkmalen.
Kategoriale Merkmale
Kategoriale Merkmale ordnen einen Datenpunkt einer Kategorie zu. Die verschiedenen Werte sind also Bezeichnungen oder Klassen. Zwischen ihnen gibt es keine natuerliche Reihenfolge.
Beispiele in diesem Datensatz:
species(Art)annotation_source(Quelle der Annotation)
Auch recording_id ist ein kategoriales Merkmal, weil verschiedene Aufnahmen unterschieden werden. Es dient aber vor allem zur Identifikation.
Ordinale Merkmale
Ordinale Merkmale haben eine natürliche Reihenfolge. Man kann also sagen, dass eine Ausprägung höher, niedriger, besser oder schlechter ist als eine andere. Die Abstände zwischen den Stufen sind dabei aber nicht als genaue Zahlenabstände zu verstehen.
Ein moegliches Beispiel in diesem Datensatz ist:
quality(Qualität)
Dieses Merkmal kann als ordinal aufgefasst werden, wenn die Werte eine Rangfolge der Aufnahmequalität ausdrücken, zum Beispiel von niedrigerer zu höherer Qualität.
Kardinale Merkmale
Kardinale Merkmale sind Zahlenwerte, bei denen nicht nur eine Reihenfolge, sondern auch zahlenmäßige Abstände sinnvoll sind. Mit solchen Werten kann man rechnen, Mittelwerte bilden oder Unterschiede messen.
Beispiele in diesem Datensatz:
duration_srms_energyzero_crossing_ratespectral_centroid_hzspectral_bandwidth_hzdominant_frequency_hzonset_count
Man kann sich die beiden Einteilungen also so merken:
- qualitativ ist die grobe Obergruppe für nicht direkt messende Kategorien,
- quantitativ ist die grobe Obergruppe für messbare Zahlenwerte,
- kategorial und ordinal verfeinern die qualitativen Merkmale,
- kardinal beschreibt die quantitative Seite genauer.
Der Datensatz im Ueberblick
| Aspekt | Bedeutung |
|---|---|
| Datensatz | CSV-Datei mit allen 4218 Audiosegmenten und ihren Merkmalen |
| Beobachtungseinheit | ein einzelnes Audiosegment eines Froschrufs |
| Anzahl Zeilen | 4218 |
| Anzahl Arten | 6 |
| Anzahl Merkmale / Spalten | 26 |
| Zielmerkmal für Klassifikation | species (Art) |
| Audiodateien | zu jedem Segment gibt es eine passende WAV-Datei mit dem Hörbeispiel |
Verteilung der Arten
| Art | Anzahl Segmente |
|---|---|
| Sphaenorhynchus surdus | 1066 |
| Boana bischoffi | 862 |
| Pithecopus azureus | 729 |
| Leptodactylus latrans | 710 |
| Physalaemus albonotatus | 456 |
| Dendropsophus minutus | 395 |
So liest man eine Zeile
Eine einzelne Zeile im Datensatz kann man so verstehen:
sample_id(Segment-ID) identifiziert das Segment eindeutig.species(Art) gibt die Froschart an.quality(Qualität) beschreibt die Aufnahmequalität.start_s(Startzeit in s) undend_s(Endzeit in s) zeigen, wo das Segment in der Aufnahme liegt.- Die restlichen numerischen Spalten beschreiben akustische Eigenschaften des Segments.
Damit ist jede Zeile eine Kombination aus:
- einer Klasse oder Kategorie, nämlich der Art,
- einigen qualitativen Informationen,
- mehreren quantitativen Features,
- einem zugehörigen Hörbeispiel.
Warum ist dieser Datensatz für KI interessant?
Dieser Datensatz ist ein gutes Beispiel für maschinelles Lernen, weil:
- die Rohdaten aus echten Naturaufnahmen stammen,
- jede Zeile eine klar definierte Beobachtung darstellt,
- es qualitative und quantitative Merkmale zugleich gibt,
- und die Art (
species, Art) als Zielvariable für eine Klassifikation genutzt werden kann.
Eine KI könnte also lernen, aus den extrahierten Merkmalen vorherzusagen, zu welcher Froschart ein neues Audiosegment gehört.
