Case Study

MLOps auf AWS: ein Modell zur Produktklassifizierung trainieren und ausliefern

Ein großer Onlinehändler, ein Katalog mit Millionen Produkten und ein Modell, das rohe Produktdaten in einheitliche, strukturierte Informationen verwandelt.

Branche
E-Commerce
Meine Rolle
Aufbau der Trainings- und Inferenzpipelines
Schwerpunkt
MLOps, Modelltraining
Ergebnisse
Traffic
Mehr Traffic durch bessere Auffindbarkeit

Einheitlich klassifizierte Produkte sind in Suche und Navigation leichter zu finden.

Umsatz
Mehr Umsatz durch bessere Produktdaten

Produkte, die häufiger gefunden werden, verkaufen sich häufiger.

Die Geschichte

In einem Katalog mit Millionen Produkten kommen Produktdaten unvollständig und uneinheitlich an. Von Hand zu klassifizieren skaliert nicht, das Ziel war also ein trainiertes Modell, das es automatisch tut, auf Basis unterschiedlicher Arten von Produktdaten.

Ich habe die Trainingspipeline gebaut. Python-Jobs lesen Produktdaten aus DynamoDB und RDS, bereiten Features auf, erzeugen Text-Embeddings mit Amazon Bedrock und trainieren das Modell. Daten und versionierte Modellartefakte liegen in S3.

Ich habe auch die Inferenzpipeline gebaut, einen Python-Service auf ECS, der neue und geänderte Produkte klassifiziert und die Ergebnisse zurück in den Katalog schreibt. Überwacht wird er in CloudWatch, ausgeliefert über GitHub CI/CD.

Trainingspipeline: von Produktdaten zu einem versionierten Modell
Die Trainingspipeline.
Inferenzpipeline: von rohen Produktdaten zu strukturierten Ergebnissen
Die Inferenzpipeline.

Technologie

AWS
Amazon Bedrock
Amazon Bedrock
Text-Embeddings für Produktdaten
Amazon ECS
Amazon ECS
Feature-Jobs, Inferenz-Service
Amazon EC2
Amazon EC2
Modelltraining
Amazon S3
Amazon S3
Trainingsdaten, Modellartefakte
Amazon DynamoDB
Amazon DynamoDB
Produktdaten
Amazon RDS
Amazon RDS
relationale Produktdaten
Amazon CloudWatch
Amazon CloudWatch
Metriken, Logs, Alarme
Machine Learning
Python
Python
Pipelines und Service
PyTorch
PyTorch
Modelltraining
scikit-learn
scikit-learn
Baselines und Evaluation
pandas, NumPy
pandas, NumPy
pandas, NumPy
Feature-Aufbereitung
Delivery
GitHub Actions
GitHub Actions
CI/CD für Pipelines und Service
Docker
Docker
Container
Kern-Stack

Steht bei Ihnen etwas Ähnliches an?

Erzählen Sie mir, was Sie heute betreiben und wo es hakt. Ich melde mich mit einem Vorschlag, wie ich es bauen würde und was ich so lassen würde.

Projekt besprechen