Meta tags:
description= K-Means-Clustering in Python mit scikit-learn: Algorithmus, Feature-Skalierung, K-Wahl, Silhouette-Score und häufige Fehler.;
Headings (most frequently used words):
means, clustering, die, cluster, vorteile, einschränkungen, was, ist, funktionsweise, des, algorithmus, feature, skalierung, vor, dem, mit, scikit, learn, implementieren, richtige, anzahl, von, clustern, wählen, visualisieren, und, häufige, fallstricke, vs, hierarchisches, praktische, checkliste, verwandte, kapitel, initialisierung, zugehörigkeit, für, neue, daten, vorhersagen, elbow, methode, der, silhouette, score,
Text of the page (most frequently used words):
python (58), #cluster (46), means (37), die (36), und (30), der (30), sie (26), mit (22), kmeans (18), import (18), ist (17), matplotlib (17), clustering (16), daten (16), auf (16), scaler (16), plt (16), lernen (15), das (15), silhouette (15), from (15), von (14), eine (14), sklearn (14), für (13), feature (13), standardscaler (13), mysql (13), oder (12), x_scaled (12), mongodb (12), score (11), anzahl (10), den (10), kopieren (10), features (9), labels (9), n_init (9), verwenden (9), random_state (9), zentroid (9), dem (8), wenn (8), nicht (8), sind (8), methoden (8), make_blobs (8), inertia (8), wcss (8), listen (8), html (7), hierarchisches (7), scikit (7), skalierung (7), ein (7), werte (7), als (7), clusters (7), punkte (7), centers (7), bis (7), strings (7), elemente (7), clustern (6), learn (6), algorithmus (6), distanz (6), elbow (6), zentroide (6), entfernen (6), zum (6), fit_transform (6), print (6), wird (6), string (6), w3docs (5), tools (5), kapitel (5), vor (5), was (5), kategoriale (5), scale (5), einen (5), datensatz (5), werden (5), standard (5), man (5), 300 (5), preprocessing (5), zwei (5), wie (5), schritte (5), erstellen (5), tutorial (5), tuples (5), formatter (5), color (5), alle (4), über (4), json (4), generator (4), visualisieren (4), scatter (4), ohne (4), methode (4), voraus (4), ausreißer (4), initialisierung (4), variablen (4), nach (4), beispiel (4), neue (4), transform (4), mehr (4), bei (4), punkt (4), gut (4), n_clusters (4), n_samples (4), datasets (4), for (4), hinzufügen (4), jeden (4), dateien (4), erste (4), regression (4), dictionaries (4), set (4), listenelemente (4), durchlaufen (4), code (3), encoder (3), editor (3), quizze (3), übungen (3), php (3), javascript (3), css (3), checkliste (3), häufige (3), fallstricke (3), vorteile (3), einschränkungen (3), richtige (3), machine (3), learning (3), erfordert (3), setzen (3), init (3), neuen (3), modell (3), verschiedenen (3), kugelförmige (3), vollständig (3), skaliert (3), kann (3), zur (3), distanzberechnung (3), dann (3), anpassen (3), großen (3), keine (3), jedes (3), iterationen (3), marker (3), pyplot (3), dass (3), range (3), inertia_ (3), fit (3), predict (3), the (3), points (3), numpy (3), 100 (3), mittelwert (3), zahlen (3), wählt (3), nächsten (3), zuweisen (3), zwischen (3), ändern (3), gruppieren (3), sets (3), zugreifen (3), italiano (2), português (2), español (2), français (2), русский (2), deutsch (2), english (2), beautifier (2), diff (2), password (2), java (2), git (2), bücher (2), snippets (2), verwandte (2), praktische (2), wählen (2), implementieren (2), funktionsweise (2), des (2), this (2), page (2), bootstrap (2), aggregation (2), plot (2), train (2), test (2), überwachte (2), nearest (2), neighbors (2), kein (2), einem (2), streudiagramm (2), pca (2), sehr (2), größen (2), können (2), bincount (2), vergleichen (2), diagramm (2), minmaxscaler (2), skalieren (2), numerische (2), kodieren (2), begrenzen (2), anwenden (2), groß (2), bereits (2), mehrere (2), neu (2), kugelförmig (2), dendrogramm (2), zuweisungen (2), ausgabe (2), besten (2), formen (2), zufällig (2), zeilen (2), millionen (2), ausführung (2), muss (2), angeben (2), zuerst (2), euklidische (2), noch (2), siehe (2), numerischen (2), ids (2), größer (2), passen (2), ihre (2), trainingsdaten (2), aufrufen (2), erneut (2), immer (2), initialisierungen (2), dies (2), fehler (2), kleinerem (2), wertebereich (2), ignoriert (2), weit (2), empfindlich (2), gegenüber (2), gleich (2), schlechte (2), reduzieren (2), aber (2), zielvariable (2), funktioniert (2), farbe (2), aller (2), diesem (2), show (2), tight_layout (2), scaled (2), ylabel (2), xlabel (2), title (2), cluster_centers_ (2), fit_predict (2), 848 (2), bestätigt (2), diese (2), vergleich (2), silhouette_score (2), passt (2), ellbogen (2), sich (2), weiteren (2), predictions (2), new_scaled (2), new_points (2), with (2), training (2), konvergenz (2), n_iter_ (2), labels_ (2), point (2), ihn (2), standardabweichung (2), gemessen (2), verteilt (2), räumlich (2), sum (2), wechselt (2), ihm (2), zugewiesenen (2), aktualisieren (2), datenpunkt (2), vermeiden (2), jedem (2), indem (2), durch (2), unüberwachter (2), möglichst (2), and (2), handling (2), klassen (2), limit (2), update (2), drop (2), collection (2), delete (2), insert (2), datenbank (2), grid (2), einführung (2), schleifen (2), verbinden (2), hash (2), 2026, rechte, vorbehalten, entwickler, gemacht, sprache, datenschutzrichtlinie, kontakt, uns, unternehmen, probier, üben, kostenlose, tutorials, beispiele, web, seit, 2014, next, previous, yes, helpful, modelle, evaluieren, split, klassifikation, distanzannahmen, decision, tree, ebenfalls, verwendet, alternative, standardisieren, projektion, hochdimensionale, ungleiche, schlechtes, kontaminierung, hinweisen, überprüfen, robuste, spezifische, quantitativ, kandidatenwerte, einzugrenzen, verteilung, begrenzt, eingaben, extreme, verzerren, folgen, dieser, ihr, gute, schätzung, haben, erkunden, möchten, anzupassen, möglicherweise, baum, merge, historie, flache, flexibel, linkage, deterministisch, reproduzierbarkeit, determinismus, speicher, unpraktisch, 000, skalierbarkeit, gewählt, inspizieren, merkmal, benötigt, one, hot, encoding, überlegen, ihren, anwendungsfall, sinnvoll, willkürliche, bezeichnungen, vergeben, ordinal, wichtiger, anhand, ihrer, mitgliederzahlen, bedeutungsvolle, reihenfolge, behandeln, einmal, rufen, erneute, ändert, macht, inkonsistent, älteren, versionen, war, warnung, ausgab, setzte, zufälligen, auszuführen, beste, ergebnis, behalten, warn, weitem, häufigste, dominieren, wertebereichen, überspringen, unterschiedlichen, skalen, müssen, standardisiert, skalierungsempfindlich, einzelner, extremer, vom, tatsächlichen, zentrum, wegziehen, ausreißern, hat, schwierigkeiten, länglichen, halbmondförmigen, ungleich, dbscan, setzt, große, startkonfiguration, lokalen, optimum, konvergieren, mehrfache, neustarts, dieses, risiko, nutzen, orientierung, gibt, eindeutige, antwort, mehrdeutige, angegeben, unüberwacht, nötig, beschriftung, erforderlich, ungefähr, liefern, konkrete, zusammenfassung, typischen, leicht, interpretieren, wobei, datenpunkten, minibatchkmeans, einfach, schnell, jede, repräsentiert, rote, kreuze, markieren, durchschnittliche, position, legend, centroids, label, zorder, 200, red, alpha, viridis, cmap, streudiagramme, zeigen, voneinander, getrennt, datensätzen, würde, zunächst, dimensionsreduktion, bevor, darstellt, erzeugt, höchsten, drei, beschreiben, beide, zusammen, zeigt, verbesserung, stagniert, liefert, einzelne, zahl, verschiedener, 371, 357, 522, 679, 688, metrics, misst, jeder, seinem, eigenen, nächstgelegenen, benachbarten, reicht, falscher, perfekt, getrennter, allgemeinen, stark, natürliche, fällt, steil, flacht, tatsächliche, method, number, append, tragen, gegen, desto, geringer, verbesserungsrate, verlangsamt, eines, nur, geringe, verbesserungen, bringt, oft, schwierigste, teil, komplementäre, techniken, helfen, dabei, predicted, membership, same, used, during, array, two, new, unseen, original, nachdem, angepasst, wurden, bestehenden, zuzuweisen, niemals, zugehörigkeit, vorhersagen, gesamtes, niedriger, besser, koordinaten, form, n_features, trainingspunkt, beschreibung, attribut, wichtige, attribute, iterations, converge, round, sizes, first, assignment, every, indexed, always, required, before, y_true, generate, natural, folgende, generiert, synthetischen, untersucht, ergebnisse, zentriert, alternativen, finden, basiert, euklidischen, tausend, jahreseinkommen, anderes, einstelligen, bewertung, dominiert, werten, effektiv, daher, learns, ersten, aus, einer, wahrscheinlichkeit, proportional, quadrierten, gewählten, anfänglichen, findet, typischerweise, bessere, schneller, rein, zufällige, niedrigere, bedeutet, engere, kompaktere, over, all, distance, its, centroid, minimierende, größe, heißt, auch, within, squares, bezeichnet, maximale, erreicht, wiederholen, berechnen, wodurch, entstehen, anfängliche, startpunkte, auswählen, strategie, initialisieren, schritten, entfernt, sein, anomalieerkennung, nachrichtenartikel, support, tickets, thema, dokumenten, farben, pixel, seines, zentroids, ersetzt, bildkomprimierung, kunden, kaufverhalten, demografischen, merkmalen, kundensegmentierung, typische, anwendungsfälle, praxis, rohen, distanzwerten, arbeitet, entdeckt, strukturen, unbeschrifteten, benötigen, gruppiert, datenpunkte, innerhalb, desselben, ähnlich, während, unterschiedlich, ähnlichkeit, geraden, abstand, punkten, raum, aufteilt, gesamte, quadrierte, minimiert, seite, erklärt, implementiert, welche, wichtigen, gilt, überlappende, wahl, http, anfragen, pytest, pakete, virtuelle, umgebungen, tooling, best, practices, threading, asyncio, concurrency, csv, random, sys, itertools, collections, ausnahmen, auslösen, error, library, addieren, umkehren, duplikate, how, enums, abstrakte, kapselung, polymorphismus, dataclasses, static, classmethod, property, magic, methods, advanced, oop, match, anweisung, enumerate, zip, map, comprehensions, kontextmanager, rekursion, closures, generatoren, decorators, args, kwargs, type, hints, intermediate, sort, query, find, join, table, order, where, select, tabelle, einstieg, auc, roc, kurve, cross, validation, search, logistische, konfusionsmatrix, entscheidungsbaum, multiple, polynomiale, lineare, normalverteilung, datenverteilung, perzentil, median, modus, kreisdiagramme, histogramme, balken, subplot, beschriftungen, linie, plotting, django, scipy, pandas, modules, löschen, schreiben, lesen, dateiverarbeitung, file, formatierung, benutzereingabe, try, except, pip, regex, math, datumsangaben, module, scope, iteratoren, vererbung, objekte, arrays, lambda, funktionen, while, else, tupeln, operatoren, booleans, casting, datentypen, kommentare, syntax, variablennamen, tupel, entpacken, tuple, sortieren, slicen, home, ausgabevariablen, verschachtelte, modifizieren, list, comprehension, zusammenführen, globale, format, escape, zeichen, dictionary, verketten, anmelden, durchsuchen, formatters, url, reverse, sha256, md5, length, calculator, colors, hsl, hex, mixer, converter, picker, general, kurse, vollständiger, leitfaden,
Text of the page (random words):
gramm lineare regression polynomiale regression multiple regression skalierung train test entscheidungsbaum konfusionsmatrix hierarchisches clustering logistische regression grid search kategoriale daten k means bootstrap aggregation cross validation auc roc kurve k nearest neighbors python mysql mysql einstieg mysql datenbank erstellen mysql tabelle erstellen mysql insert mysql select mysql where mysql order by mysql delete mysql drop table mysql update mysql limit mysql join python mongodb mongodb erste schritte mongodb datenbank erstellen mongodb collection erstellen mongodb insert mongodb find mongodb query mongodb sort mongodb delete mongodb drop collection mongodb update mongodb limit intermediate python f strings type hints args kwargs decorators generatoren closures rekursion kontextmanager comprehensions enumerate zip map match anweisung advanced oop magic methods property static classmethod dataclasses polymorphismus kapselung abstrakte klassen enums python how to listen duplikate entfernen string umkehren zwei zahlen addieren error handling and the standard library ausnahmen auslösen collections itertools os sys random csv dateien concurrency in python asyncio threading python tooling and best practices virtuelle umgebungen pakete pytest http anfragen k means k means clustering in python mit scikit learn algorithmus feature skalierung k wahl silhouette score und häufige fehler k means ist ein unüberwachter machine learning algorithmus der einen datensatz in k nicht überlappende cluster aufteilt indem er die gesamte quadrierte distanz zwischen jedem datenpunkt und dem ihm zugewiesenen cluster zentroid minimiert diese seite erklärt wie der algorithmus funktioniert wie man ihn in python mit scikit learn implementiert wie man die richtige anzahl von clustern wählt und welche wichtigen fallstricke es zu vermeiden gilt was ist k means clustering k means gruppiert datenpunkte so dass punkte innerhalb desselben clusters möglichst ähnlich sind während punkte in verschiedenen clustern möglichst unterschiedlich sind ähnlichkeit wird durch die euklidische distanz gemessen den geraden abstand zwischen zwei punkten im feature raum da k means mit rohen distanzwerten arbeitet ist es ein unüberwachter algorithmus er entdeckt strukturen in unbeschrifteten daten ohne eine zielvariable zu benötigen typische anwendungsfälle in der praxis kundensegmentierung kunden nach kaufverhalten und demografischen merkmalen gruppieren bildkomprimierung farben reduzieren indem jedes pixel durch die farbe seines nächsten zentroids ersetzt wird dokumenten clustering nachrichtenartikel oder support tickets nach thema gruppieren anomalieerkennung punkte die weit von jedem zentroid entfernt sind können ausreißer sein funktionsweise des algorithmus k means wechselt zwischen zwei schritten bis sich die cluster zuweisungen nicht mehr ändern konvergenz initialisieren k anfängliche zentroide startpunkte auswählen die standard strategie k means verteilt sie räumlich um schlechte initialisierungen zu vermeiden zuweisen jeden datenpunkt dem nächsten zentroid zuweisen wodurch k cluster entstehen aktualisieren jeden zentroid als den mittelwert aller ihm zugewiesenen punkte neu berechnen wiederholen der schritte 2 3 bis kein punkt mehr den cluster wechselt oder eine maximale anzahl von iterationen erreicht ist die zu minimierende größe heißt inertia auch als wcss within cluster sum of squares bezeichnet inertia sum over all points of distance from point to its centroid ² kopieren niedrigere inertia bedeutet engere kompaktere cluster k means initialisierung das standard init k means scikit learns standard wählt den ersten zentroid zufällig aus und wählt dann jeden weiteren zentroid mit einer wahrscheinlichkeit proportional zur quadrierten distanz zum nächsten bereits gewählten zentroid dies verteilt die anfänglichen zentroide räumlich und findet typischerweise bessere cluster schneller als eine rein zufällige initialisierung feature skalierung vor dem clustering k means basiert vollständig auf der euklidischen distanz wenn ein feature in tausend gemessen wird zum beispiel jahreseinkommen und ein anderes in einstelligen zahlen zum beispiel eine bewertung von 1 bis 5 dominiert das feature mit großen werten die distanzberechnung und das feature mit kleinerem wertebereich wird effektiv ignoriert skalieren sie ihre features daher immer zuerst from sklearn preprocessing import standardscaler scaler standardscaler x_scaled scaler fit_transform x kopieren standardscaler zentriert jedes feature auf mittelwert 0 und standardabweichung 1 alternativen wie minmaxscaler finden sie im scale kapitel k means mit scikit learn implementieren das folgende beispiel generiert einen synthetischen datensatz skaliert ihn passt k means an und untersucht die ergebnisse from sklearn cluster import kmeans from sklearn datasets import make_blobs from sklearn preprocessing import standardscaler import numpy as np generate 300 points in 3 natural clusters x y_true make_blobs n_samples 300 centers 3 random_state 42 scale the features always required before k means scaler standardscaler x_scaled scaler fit_transform x fit k means with 3 clusters kmeans kmeans n_clusters 3 init k means n_init 10 random_state 42 kmeans fit x_scaled cluster assignment for every training point 0 indexed labels kmeans labels_ print cluster labels first 10 labels 10 e g 2 2 0 1 0 1 2 2 0 1 print cluster sizes np bincount labels e g 100 100 100 print inertia wcss round kmeans inertia_ 2 e g 18 26 print iterations to converge kmeans n_iter_ e g 2 kopieren wichtige attribute nach dem anpassen attribut beschreibung labels_ cluster id 0 bis k 1 für jeden trainingspunkt cluster_centers_ koordinaten der k zentroide form k n_features inertia_ gesamtes wcss niedriger ist besser n_iter_ anzahl der em iterationen bis zur konvergenz cluster zugehörigkeit für neue daten vorhersagen nachdem der scaler und das modell auf trainingsdaten angepasst wurden verwenden sie scaler transform kmeans predict um neue punkte bestehenden clustern zuzuweisen passen sie den scaler niemals erneut an neue daten an import numpy as np two new unseen points original feature scale new_points np array 0 5 0 5 1 0 2 0 transform with the same scaler used during training new_scaled scaler transform new_points predict cluster membership predictions kmeans predict new_scaled print predicted clusters predictions e g 2 0 kopieren die richtige anzahl von clustern wählen k k means erfordert dass sie k im voraus angeben was oft der schwierigste teil ist zwei komplementäre techniken helfen dabei die elbow methode und der silhouette score die elbow methode tragen sie die inertia wcss gegen k auf je größer k wird desto geringer wird die inertia aber die verbesserungsrate verlangsamt sich der ellbogen ist der punkt an dem das hinzufügen eines weiteren clusters nur noch geringe verbesserungen bringt from sklearn cluster import kmeans from sklearn datasets import make_blobs from sklearn preprocessing import standardscaler import matplotlib pyplot as plt x _ make_blobs n_samples 300 centers 3 random_state 42 scaler standardscaler x_scaled scaler fit_transform x wcss for k in range 1 11 km kmeans n_clusters k n_init 10 random_state 42 km fit x_scaled wcss append km inertia_ plt plot range 1 11 wcss marker o plt xlabel number of clusters k plt ylabel inertia wcss plt title elbow method plt tight_layout plt show kopieren bei diesem datensatz 3 natürliche cluster fällt die inertia von k 1 bis k 3 steil ab und flacht dann ab der ellbogen bei k 3 bestätigt die tatsächliche anzahl der cluster der silhouette score der silhouette score misst wie gut jeder punkt zu seinem eigenen cluster passt im vergleich zum nächstgelegenen benachbarten cluster er reicht von 1 falscher cluster bis 1 perfekt getrennter cluster ein score über 0 5 ist im allgemeinen gut über 0 7 ist stark from sklearn cluster import kmeans from sklearn datasets import make_blobs from sklearn preprocessing import standardscaler from sklearn metrics import silhouette_score x _ make_blobs n_samples 300 centers 3 random_state 42 scaler standardscaler x_scaled scaler fit_transform x for k in range 2 8 km kmeans n_clusters k n_init 10 random_state 42 labels km fit_predict x_scaled score silhouette_score x_scaled labels print f k k silhouette score 3f kopieren ausgabe k 2 silhouette 0 688 k 3 silhouette 0 848 k 4 silhouette 0 679 k 5 silhouette 0 522 k 6 silhouette 0 357 k 7 silhouette 0 371 kopieren k 3 erzeugt den höchsten silhouette score 0 848 und bestätigt dass drei cluster diese daten am besten beschreiben verwenden sie beide methoden zusammen das elbow diagramm zeigt wo die verbesserung stagniert der silhouette score liefert eine einzelne zahl zum vergleich verschiedener k werte k means cluster visualisieren streudiagramme zeigen ob die cluster gut voneinander getrennt sind bei datensätzen mit mehr als zwei features würde man zunächst eine dimensionsreduktion z b pca anwenden bevor man sie darstellt from sklearn cluster import kmeans from sklearn datasets import make_blobs from sklearn preprocessing import standardscaler import matplotlib pyplot as plt x _ make_blobs n_samples 300 centers 3 random_state 42 scaler standardscaler x_scaled scaler fit_transform x kmeans kmeans n_clusters 3 n_init 10 random_state 42 labels kmeans fit_predict x_scaled centers kmeans cluster_centers_ plt scatter x_scaled 0 x_scaled 1 c labels cmap viridis s 40 alpha 0 7 plt scatter centers 0 centers 1 c red marker x s 200 zorder 5 label centroids plt legend plt title k means clustering k 3 plt xlabel feature 1 scaled plt ylabel feature 2 scaled plt tight_layout plt show kopieren jede farbe repräsentiert einen cluster rote kreuze markieren die zentroide die durchschnittliche position aller punkte in diesem cluster vorteile und einschränkungen vorteile einfach und schnell k means ist o n k i wobei n die anzahl der punkte k die anzahl der cluster und i die anzahl der iterationen ist mit minibatchkmeans skaliert er auf millionen von datenpunkten leicht zu interpretieren zentroide liefern eine konkrete zusammenfassung der typischen werte jedes clusters funktioniert gut wenn cluster ungefähr kugelförmig und gleich groß sind keine beschriftung der daten erforderlich vollständig unüberwacht keine zielvariable nötig einschränkungen k muss im voraus angegeben werden nutzen sie die elbow methode und den silhouette score als orientierung aber keine der methoden gibt eine eindeutige antwort für mehrdeutige daten empfindlich gegenüber der initialisierung eine schlechte startkonfiguration kann zu einem lokalen optimum konvergieren k means und mehrfache neustarts n_init 10 reduzieren dieses risiko setzt kugelförmige gleich große cluster voraus k means hat schwierigkeiten mit länglichen halbmondförmigen oder sehr ungleich großen clustern verwenden sie hierarchisches clustering oder dbscan für nicht kugelförmige formen empfindlich gegenüber ausreißern ein einzelner extremer punkt kann einen zentroid weit vom tatsächlichen cluster zentrum wegziehen entfernen oder begrenzen sie ausreißer vor dem anpassen skalierungsempfindlich features mit unterschiedlichen skalen müssen standardisiert werden siehe das scale kapitel häufige fallstricke feature skalierung überspringen dies ist der bei weitem häufigste fehler ohne skalierung dominieren features mit großen numerischen wertebereichen die distanzberechnung und features mit kleinerem wertebereich werden ignoriert n_init 1 setzen der standard in älteren scikit learn versionen war n_init warn was eine warnung ausgab wenn man es nicht setzte setzen sie immer n_init 10 oder mehr um k means mit 10 verschiedenen zufälligen initialisierungen auszuführen und das beste ergebnis zu behalten den scaler auf neuen daten erneut anpassen passen sie den standardscaler einmal auf ihre trainingsdaten an und rufen sie dann transform für neue daten auf das erneute aufrufen von fit_transform auf neuen daten ändert die skalierung und macht das modell inkonsistent cluster ids als bedeutungsvolle reihenfolge behandeln die cluster ids 0 1 2 sind willkürliche bezeichnungen die von scikit learn vergeben werden sie sind nicht ordinal cluster 2 ist nicht größer oder wichtiger als cluster 0 vergleichen sie cluster anhand ihrer zentroid werte und mitgliederzahlen k means auf nicht numerischen daten verwenden k means benötigt numerische features zur distanzberechnung kodieren sie kategoriale daten zuerst zum beispiel mit one hot encoding und überlegen sie ob die euklidische distanz für ihren anwendungsfall noch sinnvoll ist siehe das kapitel über kategoriale daten k means vs hierarchisches clustering merkmal k means hierarchisches clustering anzahl der cluster muss k vor der ausführung angeben kann nach der ausführung gewählt werden dendrogramm inspizieren skalierbarkeit skaliert auf millionen von zeilen o n² speicher unpraktisch ab 10 000 zeilen determinismus zufällig verwenden sie random_state für reproduzierbarkeit vollständig deterministisch cluster formen am besten für kugelförmige cluster flexibel mit verschiedenen linkage methoden ausgabe flache cluster zuweisungen baum dendrogramm mit der merge historie verwenden sie k means wenn ihr datensatz groß ist und sie bereits eine gute schätzung von k haben verwenden sie hierarchisches clustering wenn sie mehrere k werte erkunden möchten ohne das modell neu anzupassen oder wenn cluster möglicherweise nicht kugelförmig sind praktische checkliste folgen sie dieser checkliste wenn sie k means auf einen neuen datensatz anwenden ausreißer entfernen oder begrenzen extreme werte verzerren zentroide kategoriale variablen kodieren k means erfordert numerische eingaben features skalieren mit standardscaler oder minmaxscaler wenn die feature verteilung begrenzt ist das elbow diagramm verwenden um kandidatenwerte für k einzugrenzen den silhouette score verwenden um spezifische k werte quantitativ zu vergleichen n_init 10 und init k means für eine robuste initialisierung setzen cluster größen überprüfen mit np bincount labels sehr ungleiche größen können auf ein schlechtes k oder ausreißer kontaminierung hinweisen visualisieren mit einem streudiagramm oder pca projektion für hochdimensionale daten verwandte kapitel scale features vor dem clustering standardisieren hierarchisches clustering eine alternative die kein k im voraus erfordert k nearest neighbors eine überwachte methode die ebenfalls distanz verwendet decision tree überwachte klassifikation ohne distanzannahmen train test split machine learning modelle evaluieren scatter plot cluster mit matplotlib visualisieren was this page helpful yes no previous kategoriale daten next bootstrap aggregation on this page was ist k means clustering funktionsweise des algorithmus feature skalierung vor dem clustering k means mit scikit learn implementieren die richtige anzahl von clustern wählen k k means cluster visualisieren vorteile und einschränkungen häufige fallstricke k means vs hierarchisches clustering praktische checkliste verwandte kapitel w3do...
|