Meta tags:
description= Kategoriale Daten in Python kodieren mit Label Encoding, Ordinal Encoding, One-Hot Encoding und pd.get_dummies – mit scikit-learn-Beispielen.;
Headings (most frequently used words):
encoding, vermeiden, kategoriale, daten, warum, wichtig, ist, einen, beispieldatensatz, vorbereiten, label, ordinal, one, hot, pd, get_dummies, die, schnelle, pandas, alternative, datenlecks, pipeline, zur, kombination, von, und, modell, verwenden, das, richtige, wählen, verwandte, kapitel, eine, spalte, weglassen, um, multikollinearität, zu,
Text of the page (most frequently used words):
python (58), #encoding (32), die (29), kopieren (18), eine (17), color (17), ist (16), lernen (15), und (15), für (14), matplotlib (14), mysql (13), das (12), der (12), import (12), mongodb (12), mit (11), from (11), green (11), red (11), pipeline (10), daten (10), onehotencoder (10), print (10), sklearn (10), size (9), von (8), einen (8), reihenfolge (8), auf (8), handle_unknown (8), ohe (8), spalte (8), blue (8), listen (8), html (7), get_dummies (7), pandas (7), bei (7), false (7), ausgabe (7), string (7), strings (7), elemente (7), alle (6), encoder (6), verwenden (6), one (6), hot (6), label (6), dataframe (6), tutorial (6), wenn (6), werden (6), spalten (6), fit (6), scikit (6), transform (6), set (6), nicht (6), true (6), kategoriale (6), w3docs (5), tools (5), zur (5), modell (5), ordinal (5), regression (5), test (5), kategorie (5), den (5), kardinalität (5), einer (5), ignore (5), preprocessing (5), learn (5), dass (5), fit_transform (5), dem (5), variablen (5), color_encoded (5), zahlen (5), erstellen (5), tuples (5), methoden (5), formatter (5), json (4), generator (4), kapitel (4), datenlecks (4), modelle (4), sie (4), ein (4), korrekt (4), oder (4), columntransformer (4), ordinalencoder (4), natürliche (4), labelencoder (4), train_test_split (4), price (4), wird (4), training (4), data (4), kann (4), drop (4), kategorien (4), wie (4), dateien (4), entfernen (4), erste (4), schritte (4), dictionaries (4), listenelemente (4), durchlaufen (4), code (3), editor (3), quizze (3), übungen (3), php (3), javascript (3), css (3), richtige (3), vermeiden (3), grid (3), was (3), vor (3), train (3), zielvariable (3), aber (3), merkmal (3), categories (3), machine (3), learning (3), pipe (3), preprocessor (3), numeric_cols (3), categorical_cols (3), in_stock (3), trainings (3), x_train (3), sparse_output (3), testset (3), aus (3), color_green (3), color_red (3), int (3), dtype (3), kodieren (3), dummy (3), weglassen (3), ohe_nodrop (3), man (3), the (3), oe_safe (3), size_encoded (3), werte (3), sets (3), hinzufügen (3), zugreifen (3), italiano (2), português (2), español (2), français (2), русский (2), deutsch (2), english (2), beautifier (2), diff (2), password (2), java (2), git (2), bücher (2), beispiele (2), snippets (2), verwandte (2), wählen (2), kombination (2), schnelle (2), alternative (2), beispieldatensatz (2), vorbereiten (2), warum (2), wichtig (2), this (2), page (2), means (2), search (2), pipelines (2), cross (2), validation (2), aufteilen (2), split (2), numerische (2), merkmale (2), ersetzt (2), jede (2), durch (2), mittelwert (2), diese (2), hohe (2), immer (2), anwenden (2), dies (2), target (2), innerhalb (2), produktions (2), nominales (2), vorhanden (2), verschiedene (2), x_te (2), x_tr (2), y_tr (2), linearregression (2), random_state (2), test_size (2), x_full (2), y_full (2), model_selection (2), transformer (2), schätzer (2), trainingsdaten (2), auch (2), x_test (2), informationen (2), kein (2), sollte (2), color_blue (2), dummies (2), baumbasierte (2), random (2), sind (2), falle (2), daher (2), get_feature_names_out (2), columns (2), reduced (2), first (2), drei (2), binäre (2), anderen (2), linearen (2), modellen (2), vorhersagezeit (2), color_df (2), col_names (2), numpy (2), nominale (2), unknown_value (2), use_encoded_value (2), ableiten (2), order (2), decoded (2), ganzzahlen (2), lineare (2), wann (2), classes (2), list (2), als (2), haben (2), zwei (2), beziehung (2), small (2), large (2), medium (2), and (2), handling (2), klassen (2), limit (2), update (2), collection (2), delete (2), insert (2), datenbank (2), einführung (2), schleifen (2), verbinden (2), ändern (2), hash (2), 2026, rechte, vorbehalten, entwickler, gemacht, sprache, datenschutzrichtlinie, kontakt, über, uns, unternehmen, probier, üben, kostenlose, tutorials, web, seit, 2014, next, previous, yes, helpful, grundlagen, einschließlich, erstellung, manipulation, klassifikationsmodell, performance, nach, kodierung, zielvariablen, messen, confusion, matrix, zuverlässig, evaluieren, kombiniert, korrektem, kategorialem, profitiert, linear, jedem, vorverarbeitungsschritt, modellierung, normalisieren, standardisieren, scale, bewältigt, gut, besonders, anfällig, kreuzvalidierungs, folds, bibliotheksimplementierung, automatisch, handhabt, category_encoders, targetencoder, frequency, siehe, hinweis, unten, erkundung, niedrige, expliziten, ordinales, empfohlenes, situation, wendet, einem, durchgang, unterschiedliche, vorverarbeitungsschritte, empfohlene, muster, produktionsreifen, workflows, predict, predictions, model, steps, passthrough, pass, transformers, y_te, compose, linear_model, verkettet, dadurch, sichergestellt, nur, trainiert, kreuzvalidierung, weitere, details, testaufteilung, finden, sich, using, x_test_enc, x_train_enc, only, y_train, y_test, jeden, trainingsset, trainieren, ausschließlich, zunächst, testsets, korrekte, vorgehen, leakage, entstehen, vorbereitung, beeinflussen, ergebnis, übermäßig, optimistischer, evaluierungswert, reale, leistung, widerspiegelt, trainierter, garantieren, zwischen, testaufteilungen, dieselbe, spaltenstruktur, entsteht, unterstützt, bevorzugt, einschränkung, size_l, size_m, size_s, explorative, arbeit, schnellste, weg, per, entscheidungsbäume, forests, gradient, boosting, gegen, immun, ihnen, optional, weggelassen, erhält, dritte, beiden, vollständig, vorhersagbar, problemen, führen, multikollinearität, füllt, unbekannte, lauter, nullen, anstatt, neuen, fehler, auszulösen, build, labelled, result, erzeugt, pro, bedeutet, zeile, dieser, gehört, erhalten, wert, standardwahl, ungeordnete, svms, neuronalen, netzen, übergeben, use, with, umgang, unbekannten, nun, gilt, define, explicitly, ähnelt, erlaubt, genaue, angabe, merkmalen, denen, bedeutsam, inverse_transform, rückgängig, machen, vorgesehen, eingabemerkmale, merkmalsspalte, angewendet, implizieren, kodierten, ordnung, existiert, irre, führt, schädlich, alphabetische, classes_, ganze, zahl, learns, weist, alphabetisch, folgenden, kleinen, kleidungsdatensatz, sodass, genau, nachvollzogen, hoher, hunderte, einzigartiger, städte, produkt, ids, können, beim, tausende, erzeugen, sowohl, speicherbedarf, modellleistung, beeinträchtigt, viele, hat, farben, keine, nominal, shirt, größen, bewahrt, ignoriert, gibt, wahl, des, encodings, hängt, fragen, rohe, übergibt, ausgelöst, selbst, bereits, enthält, algorithmus, merkmalswerte, kontinuierliche, behandelt, falsche, dreimal, groß, ermöglicht, tatsächliche, darzustellen, valueerror, dieses, erläutert, wichtigsten, strategien, welche, eingesetzt, anwendet, ohne, dabei, einfließen, lassen, begrenzte, feste, menge, werten, annehmen, zum, beispiel, farbspalte, schweregradskala, meisten, algorithmen, arbeiten, müssen, darstellung, umgewandelt, high, low, beispielen, http, anfragen, pytest, pakete, virtuelle, umgebungen, tooling, best, practices, threading, asyncio, concurrency, csv, sys, itertools, collections, ausnahmen, auslösen, error, standard, library, addieren, umkehren, duplikate, how, enums, abstrakte, kapselung, polymorphismus, dataclasses, static, classmethod, property, magic, methods, advanced, oop, match, anweisung, enumerate, zip, map, comprehensions, kontextmanager, rekursion, closures, generatoren, decorators, args, kwargs, type, hints, intermediate, sort, query, find, join, table, where, select, tabelle, einstieg, nearest, neighbors, auc, roc, kurve, bootstrap, aggregation, logistische, hierarchisches, clustering, konfusionsmatrix, entscheidungsbaum, skalierung, multiple, polynomiale, streudiagramm, normalverteilung, datenverteilung, perzentil, standardabweichung, median, modus, kreisdiagramme, histogramme, balken, scatter, subplot, beschriftungen, linie, marker, plotting, pyplot, django, scipy, modules, löschen, schreiben, lesen, dateiverarbeitung, file, formatierung, benutzereingabe, try, except, pip, regex, math, datumsangaben, module, scope, iteratoren, vererbung, objekte, arrays, lambda, funktionen, for, while, else, tupeln, gruppieren, operatoren, booleans, casting, datentypen, kommentare, syntax, variablennamen, aktualisieren, tupel, entpacken, tuple, sortieren, slicen, home, ausgabevariablen, verschachtelte, modifizieren, comprehension, zusammenführen, globale, format, escape, zeichen, dictionary, verketten, mehrere, zuweisen, aufrufen, anmelden, durchsuchen, formatters, url, reverse, sha256, md5, length, calculator, colors, hsl, hex, mixer, converter, picker, general, kurse, leitfaden,
Text of the page (random words):
kategoriale daten in python kodieren encoding leitfaden w3docs w3docs bücher html lernen css lernen javascript lernen git lernen java lernen php lernen python lernen kurse quizze übungen snippets tools general tools html editor password generator html encoder code diff json beautifier alle 13 color tools color picker color converter color mixer color hex colors hsl alle 10 string tools string length calculator md5 hash generator sha256 hash generator string reverse url encoder alle 19 code formatters javascript formatter css formatter html formatter json formatter php formatter w3docs durchsuchen k de english en deutsch de русский ru français fr español es português pt italiano it anmelden python lernen python tutorial auf elemente zugreifen auf listenelemente zugreifen auf set elemente zugreifen tuples aufrufen elemente hinzufügen listenelemente hinzufügen set elemente hinzufügen mehrere werte zuweisen elemente ändern listenelemente ändern strings verketten dictionaries kopieren listen kopieren dictionary methoden escape zeichen format strings globale variablen listen verbinden sets zusammenführen tuples verbinden list comprehension listen methoden dictionaries durchlaufen listen durchlaufen sets durchlaufen tuples durchlaufen strings modifizieren verschachtelte dictionaries ausgabevariablen python home python listen python sets python strings python tuples python variablen elemente entfernen listenelemente entfernen set elemente entfernen set methoden strings slicen listen sortieren string methoden tuple methoden tupel entpacken tuples aktualisieren variablennamen python einführung python erste schritte python syntax python kommentare python variablen python datentypen python zahlen python casting python strings python booleans python operatoren python listen python tupeln gruppieren python dictionaries python if else python while schleifen python for schleifen python funktionen python lambda python arrays python klassen objekte python vererbung python iteratoren python scope python module python datumsangaben python math python json python regex python pip python try except python benutzereingabe python string formatierung file handling python dateiverarbeitung python dateien lesen python dateien schreiben erstellen python dateien löschen python modules numpy tutorial pandas tutorial scipy tutorial django tutorial python matplotlib matplotlib einführung matplotlib erste schritte matplotlib pyplot matplotlib plotting matplotlib marker matplotlib linie matplotlib beschriftungen matplotlib grid matplotlib subplot matplotlib scatter matplotlib balken matplotlib histogramme matplotlib kreisdiagramme machine learning erste schritte mittelwert median modus standardabweichung perzentil datenverteilung normalverteilung von daten streudiagramm lineare regression polynomiale regression multiple regression skalierung train test entscheidungsbaum konfusionsmatrix hierarchisches clustering logistische regression grid search kategoriale daten k means bootstrap aggregation cross validation auc roc kurve k nearest neighbors python mysql mysql einstieg mysql datenbank erstellen mysql tabelle erstellen mysql insert mysql select mysql where mysql order by mysql delete mysql drop table mysql update mysql limit mysql join python mongodb mongodb erste schritte mongodb datenbank erstellen mongodb collection erstellen mongodb insert mongodb find mongodb query mongodb sort mongodb delete mongodb drop collection mongodb update mongodb limit intermediate python f strings type hints args kwargs decorators generatoren closures rekursion kontextmanager comprehensions enumerate zip map match anweisung advanced oop magic methods property static classmethod dataclasses polymorphismus kapselung abstrakte klassen enums python how to listen duplikate entfernen string umkehren zwei zahlen addieren error handling and the standard library ausnahmen auslösen collections itertools os sys random csv dateien concurrency in python asyncio threading python tooling and best practices virtuelle umgebungen pakete pytest http anfragen kategoriale daten kategoriale daten in python kodieren mit label encoding ordinal encoding one hot encoding und pd get_dummies mit scikit learn beispielen kategoriale daten sind daten die eine begrenzte feste menge von werten annehmen zum beispiel red blue green in einer farbspalte oder low medium high für eine schweregradskala die meisten machine learning algorithmen arbeiten mit zahlen daher müssen kategoriale spalten vor dem training in eine numerische darstellung umgewandelt werden dieses kapitel erläutert die wichtigsten encoding strategien wann welche eingesetzt werden sollte und wie man sie in python mit pandas und scikit learn korrekt anwendet ohne dabei informationen aus dem testset in das modell einfließen zu lassen warum encoding wichtig ist wenn man rohe string werte an einen scikit learn schätzer übergibt wird ein valueerror ausgelöst selbst wenn eine spalte bereits zahlen enthält wie 1 2 3 für small medium large wird ein algorithmus der merkmalswerte als kontinuierliche zahlen behandelt eine falsche beziehung ableiten z b dass large dreimal so groß wie small ist encoding ermöglicht es die tatsächliche beziehung korrekt darzustellen die wahl des encodings hängt von zwei fragen ab gibt es eine natürliche reihenfolge farben haben keine natürliche reihenfolge nominal t shirt größen haben eine natürliche reihenfolge ordinal das richtige encoding bewahrt die reihenfolge wenn sie vorhanden ist und ignoriert sie wenn nicht wie viele verschiedene werte kardinalität hat die spalte spalten mit hoher kardinalität hunderte einzigartiger städte produkt ids können beim one hot encoding tausende von dummy spalten erzeugen was sowohl den speicherbedarf als auch die modellleistung beeinträchtigt einen beispieldatensatz vorbereiten die folgenden beispiele verwenden einen kleinen kleidungsdatensatz sodass die ausgabe genau nachvollzogen werden kann import pandas as pd data color red green blue green red size s m l s m price 10 20 30 10 20 in_stock true true false true false df pd dataframe data print df kopieren ausgabe color size price in_stock 0 red s 10 true 1 green m 20 true 2 blue l 30 false 3 green s 10 true 4 red m 20 false kopieren label encoding label encoding ersetzt jede kategorie durch eine ganze zahl scikit learns labelencoder weist die ganzzahlen alphabetisch zu from sklearn preprocessing import labelencoder le labelencoder df color_encoded le fit_transform df color print df color color_encoded print classes list le classes_ kopieren ausgabe color color_encoded 0 red 2 1 green 1 2 blue 0 3 green 1 4 red 2 classes blue green red kopieren blue 0 green 1 red 2 alphabetische reihenfolge wann verwenden label encoding ist für die zielvariable y vorgesehen nicht für eingabemerkmale auf eine nominale merkmalsspalte angewendet implizieren die kodierten ganzzahlen eine ordnung die nicht existiert was baumbasierte modelle in die irre führt und für lineare modelle schädlich ist encoding rückgängig machen decoded le inverse_transform 0 1 2 print decoded blue green red kopieren ordinal encoding ordinal encoding ähnelt dem label encoding erlaubt aber die genaue angabe der reihenfolge der kategorien zu verwenden bei merkmalen bei denen die reihenfolge bedeutsam ist from sklearn preprocessing import ordinalencoder define the order explicitly s m l oe ordinalencoder categories s m l df size_encoded oe fit_transform df size print df size size_encoded kopieren ausgabe size size_encoded 0 s 0 0 1 m 1 0 2 l 2 0 3 s 0 0 4 m 1 0 kopieren das modell kann nun korrekt ableiten dass l 2 m 1 s 0 gilt umgang mit unbekannten kategorien zur vorhersagezeit use handle_unknown use_encoded_value with unknown_value 1 oe_safe ordinalencoder categories s m l handle_unknown use_encoded_value unknown_value 1 oe_safe fit df size print oe_safe transform xl 1 kopieren one hot encoding one hot encoding erzeugt eine binäre spalte pro kategorie eine 1 in einer spalte bedeutet dass die zeile zu dieser kategorie gehört alle anderen spalten erhalten den wert 0 dies ist die standardwahl für nominale ungeordnete merkmale die linearen modellen svms und neuronalen netzen übergeben werden from sklearn preprocessing import onehotencoder import numpy as np ohe onehotencoder sparse_output false handle_unknown ignore color_encoded ohe fit_transform df color build a labelled dataframe from the result col_names ohe get_feature_names_out color color_df pd dataframe color_encoded columns col_names dtype int print color_df kopieren ausgabe color_blue color_green color_red 0 0 0 1 1 0 1 0 2 1 0 0 3 0 1 0 4 0 0 1 kopieren handle_unknown ignore füllt unbekannte kategorien mit lauter nullen anstatt bei neuen daten zur vorhersagezeit einen fehler auszulösen eine spalte weglassen um multikollinearität zu vermeiden bei drei kategorien erhält man drei binäre spalten aber die dritte ist aus den anderen beiden vollständig vorhersagbar blue 1 green red diese dummy variablen falle kann bei linearen modellen zu problemen führen eine spalte mit drop first weglassen ohe_nodrop onehotencoder sparse_output false drop first handle_unknown ignore reduced ohe_nodrop fit_transform df color print pd dataframe reduced columns ohe_nodrop get_feature_names_out color dtype int kopieren ausgabe eine spalte weggelassen color_green color_red 0 0 1 1 1 0 2 0 0 3 1 0 4 0 1 kopieren baumbasierte modelle entscheidungsbäume random forests gradient boosting sind gegen die dummy variablen falle immun daher ist das weglassen einer spalte bei ihnen optional pd get_dummies die schnelle pandas alternative für explorative arbeit ist pd get_dummies der schnellste weg einen dataframe per one hot zu kodieren dummies pd get_dummies df color size dtype int print dummies kopieren ausgabe color_blue color_green color_red size_l size_m size_s 0 0 0 1 0 0 1 1 0 1 0 0 1 0 2 1 0 0 1 0 0 3 0 1 0 0 0 1 4 0 0 1 0 1 0 kopieren einschränkung pd get_dummies ist kein trainierter transformer es kann nicht garantieren dass zwischen trainings und testaufteilungen dieselbe spaltenstruktur entsteht und es unterstützt kein handle_unknown für produktions pipelines sollte onehotencoder innerhalb einer scikit learn pipeline bevorzugt werden datenlecks vermeiden datenlecks data leakage entstehen wenn informationen aus dem testset die vorbereitung der trainingsdaten beeinflussen das ergebnis ist ein übermäßig optimistischer evaluierungswert der die reale leistung nicht widerspiegelt das korrekte vorgehen ist die daten zunächst in trainings und testsets aufteilen jeden encoder ausschließlich auf dem trainingsset trainieren fit transform nicht fit_transform auf das testset anwenden from sklearn model_selection import train_test_split from sklearn preprocessing import onehotencoder x df color size y df price x_train x_test y_train y_test train_test_split x y test_size 0 4 random_state 42 ohe onehotencoder sparse_output false handle_unknown ignore ohe fit x_train fit on training data only x_train_enc ohe transform x_train transform training set x_test_enc ohe transform x_test transform test set using training fit encoder kopieren weitere details zur trainings testaufteilung finden sich im kapitel train test split pipeline zur kombination von encoding und modell verwenden eine scikit learn pipeline verkettet einen transformer und einen schätzer dadurch wird sichergestellt dass der encoder immer nur auf den trainingsdaten trainiert wird auch bei der kreuzvalidierung from sklearn pipeline import pipeline from sklearn preprocessing import onehotencoder from sklearn linear_model import linearregression from sklearn compose import columntransformer from sklearn model_selection import train_test_split categorical_cols color size numeric_cols in_stock x_full df categorical_cols numeric_cols y_full df price x_tr x_te y_tr y_te train_test_split x_full y_full test_size 0 4 random_state 42 preprocessor columntransformer transformers ohe onehotencoder handle_unknown ignore categorical_cols pass passthrough numeric_cols pipe pipeline steps preprocessor preprocessor model linearregression pipe fit x_tr y_tr print test predictions pipe predict x_te kopieren der columntransformer wendet in einem durchgang unterschiedliche vorverarbeitungsschritte auf verschiedene spalten an die pipeline ist das empfohlene muster für alle produktionsreifen machine learning workflows das richtige encoding wählen situation empfohlenes encoding zielvariable y labelencoder ordinales merkmal natürliche reihenfolge vorhanden ordinalencoder mit expliziten categories nominales merkmal niedrige kardinalität onehotencoder oder pd get_dummies für erkundung nominales merkmal hohe kardinalität target encoding oder frequency encoding siehe hinweis unten produktions pipeline onehotencoder innerhalb einer pipeline columntransformer target encoding ersetzt jede kategorie durch den mittelwert der zielvariable für diese kategorie es bewältigt hohe kardinalität gut ist aber besonders anfällig für datenlecks immer mit kreuzvalidierungs folds anwenden oder eine bibliotheksimplementierung verwenden z b category_encoders targetencoder die dies automatisch handhabt verwandte kapitel scale numerische merkmale vor der modellierung normalisieren und standardisieren train test split daten vor jedem vorverarbeitungsschritt korrekt aufteilen linear regression ein modell das von korrektem kategorialem encoding profitiert cross validation modelle zuverlässig evaluieren wenn sie mit encoding pipelines kombiniert werden confusion matrix klassifikationsmodell performance nach der kodierung von zielvariablen messen pandas tutorial pandas grundlagen einschließlich dataframe erstellung und manipulation was this page helpful yes no previous grid search next k means on this page warum encoding wichtig ist einen beispieldatensatz vorbereiten label encoding ordinal encoding one hot encoding pd get_dummies die schnelle pandas alternative datenlecks vermeiden pipeline zur kombination von encoding und modell verwenden das richtige encoding wählen verwandte kapitel w3docs kostenlose tutorials beispiele übungen snippets und quizze für das web seit 2014 bücher html lernen css lernen javascript lernen git lernen java lernen php lernen python lernen üben übungen quizze probier editor tools html editor password generator html encoder code diff json beautifier unternehmen über uns kontakt datenschutzrichtlinie sprache english deutsch русский français español português italiano 2026 w3docs alle rechte vorbehalten für entwickler gemacht
|