KI-Entwicklung: API, RAG und Agenten
Artikel für alle, die KI in eigene Anwendungen einbauen: Einstieg in die APIs, Function Calling, strukturierte Ausgaben, RAG-Pipelines, Agenten, Tests, Sicherheit und Kostenkontrolle.
Neu
Zuletzt erschienen
- Sprachassistent mit KI bauen: Von der Spracheingabe zur gesprochenen AntwortSprachassistent mit KI bauen: Spracherkennung, Sprachmodell und Sprachausgabe verbinden oder Echtzeit-Modelle nutzen. Tipps zu Latenz, Kosten und Datenschutz.
- Mehrsprachige KI-Anwendungen: Chatbots und Tools für viele SprachenMehrsprachige KI-Anwendungen: Antwortsprache steuern, Prompts und Wissensbasis über Sprachen hinweg nutzen, Tokenkosten je Sprache beachten und Qualität testen.
- Modell-Routing: Anfragen automatisch auf passende KI-Modelle verteilenModell-Routing erklärt: einfache Anfragen an günstige, schwierige an starke KI-Modelle schicken. Welche Router-Arten es gibt und wie Sie die Qualität sichern.
- Semantisches Caching: Ähnliche KI-Anfragen nur einmal bezahlenSemantisches Caching erklärt: wie ein Cache über Embeddings ähnliche Fragen erkennt, wann das Kosten und Wartezeit spart und welche Risiken es birgt.
44 Artikel
Alle Artikel: Entwicklung
API, JSON, Sicherheit und Geschwindigkeit
- RAG einfach erklärt: KI mit eigenen Dokumenten nutzenRAG einfach erklärt: wie Retrieval-Augmented Generation funktioniert, wofür man Embeddings und Vektordatenbanken braucht und was ein RAG-System kostet.
- Structured Outputs: Zuverlässig JSON von KI-ModellenStructured Outputs erklärt: Wie Sie mit JSON-Schema garantiert gültiges JSON von OpenAI, Claude und Gemini bekommen, statt kaputte Antworten nachträglich zu reparieren.
- Prompt Injection: Wie Angriffe auf KI-Systeme funktionierenPrompt Injection erklärt: wie versteckte Anweisungen in E-Mails, Dokumenten und Websites KI-Assistenten und Agenten manipulieren und welche Schutzmaßnahmen wirken.
- Latenz von KI-Anwendungen: So antworten Modelle schnellerLatenz von KI-Anwendungen verringern: Woraus sich die Antwortzeit zusammensetzt und mit welchen Mitteln wie Streaming, kleineren Modellen und Caching sie spürbar sinkt.
- JSON-Fehler in KI-Antworten: Ursachen und LösungenJSON-Fehler in KI-Antworten: Warum Sprachmodelle ungültiges JSON liefern, welche Fehler typisch sind und wie Sie sie mit Schema, Prompt und Reparatur zuverlässig vermeiden.
- max_tokens erklärt: Antwortlänge richtig begrenzenmax_tokens erklärt: Was das Ausgabelimit bei OpenAI, Claude und Gemini bewirkt, wie Sie den richtigen Wert finden und warum abgeschnittene Antworten teurer sind als ein Puffer.
- KI lokal ausführen: Sprachmodelle auf dem eigenen RechnerKI lokal ausführen ohne Cloud: welche Hardware Sie brauchen, wie viel Speicher ein Modell belegt, welche Programme es gibt und wann es sich lohnt.
- Model Context Protocol (MCP) einfach erklärtMCP einfach erklärt: Das Model Context Protocol verbindet KI-Assistenten mit Werkzeugen und Daten. So funktionieren MCP-Server, Clients und Sicherheit.
- KI-Agenten absichern: Rechte, Freigaben und ProtokolleKI-Agenten absichern: Mit minimalen Rechten, Freigaben durch Menschen, Schutz vor Prompt Injection und lückenlosen Protokollen bleiben Agenten kontrollierbar.
- Texte mit KI klassifizieren: E-Mails, Tickets und Feedback sortierenTexte mit KI klassifizieren: E-Mails, Tickets und Feedback automatisch sortieren, mit festen Kategorien, JSON-Ausgabe, kleinen Modellen und Qualitätskontrolle.
- Fine-Tuning oder RAG? So wählen Sie den richtigen WegFine-Tuning oder RAG? Wann Sie ein Modell nachtrainieren und wann Sie Dokumente per Suche einbinden. Vergleich nach Wissen, Aktualität, Kosten und Aufwand.
- Function Calling erklärt: Wie KI-Modelle Werkzeuge nutzenFunction Calling erklärt: Wie Sprachmodelle eigene Funktionen aufrufen, wie Sie Werkzeuge beschreiben und worauf es bei der Sicherheit ankommt.
- Regex mit KI erstellen: Reguläre Ausdrücke schreiben lassen und testenRegex mit KI erstellen: Wie Sie ChatGPT oder Claude reguläre Ausdrücke schreiben lassen, mit Beispielen für Treffer und Nicht-Treffer, und sie sicher testen.
- llms.txt erklärt: Die Visitenkarte Ihrer Website für KIllms.txt erklärt: Was die Datei ist, wie sie aufgebaut wird, wer sie nutzt und ob sich der Aufwand lohnt. Mit Beispiel und Generator zum Erstellen.
- Bilder an die KI-API senden: Base64, URLs und KostenBilder an die KI-API senden: Base64 oder URL, Formate, Größenlimits und Bild-Tokens bei OpenAI, Claude und Gemini. Mit Tipps zum Verkleinern und Sparen.
- Streaming bei KI-APIs erklärt: Antworten Wort für Wort anzeigenStreaming bei KI-APIs erklärt: Warum Antworten Wort für Wort schneller wirken, wie Server-Sent Events funktionieren und wann Sie besser ohne Streaming arbeiten.
- API-Fehler bei KI-Diensten behandeln: 429, 500 und ZeitüberschreitungenAPI-Fehler bei KI-Diensten behandeln: Rate Limits (429), Überlastung, Zeitüberschreitungen. Mit Wiederholungsstrategie und Ausweichmodellen.
- KI-Chatbot für die Website: Planung, Kosten und PflichtenKI-Chatbot für die Website: Fertiglösung oder selbst gebaut, was ein Chatbot pro Gespräch kostet, wie er Ihr Wissen nutzt und welche Hinweise Pflicht sind.
- Vektordatenbanken erklärt: Das Gedächtnis von RAG-AnwendungenVektordatenbanken erklärt: Wie sie Texte nach Bedeutung statt Stichworten finden, welche es gibt, wann normale Datenbanken reichen und was sie kosten.
- OpenAI-API Einstieg: Vom Schlüssel zur ersten AntwortOpenAI-API Einstieg: API-Schlüssel anlegen, erste Anfrage mit Python oder curl senden, Kosten begrenzen und typische Anfängerfehler vermeiden.
- Claude-API Einstieg: Erste Schritte mit der Anthropic-SchnittstelleClaude-API Einstieg: Konto in der Anthropic Console anlegen, API-Schlüssel erzeugen, erste Nachricht per Python senden und Kosten mit Caching senken.
- Gemini-API Einstieg: Google-Modelle in eigene Anwendungen holenGemini-API Einstieg: API-Schlüssel im Google AI Studio holen, das Google-GenAI-SDK nutzen, erste Anfrage senden und Unterschiede zu Vertex AI verstehen.
- KI mit Python nutzen: Werkzeuge, Muster und ein sauberes GrundgerüstKI mit Python nutzen: welche Bibliotheken Sie brauchen, wie ein sauberes Grundgerüst für API-Aufrufe aussieht und wie Sie Fehler, Kosten und JSON beherrschen.
- KI mit JavaScript und Node.js: Sprachmodelle in Web-Apps einbauenKI mit JavaScript und Node.js: Anbieter-SDKs nutzen, Antworten streamen, API-Schlüssel nie im Browser ausliefern und typische Architekturfehler vermeiden.
- KI-Agenten programmieren: Die Werkzeugschleife Schritt für SchrittKI-Agenten programmieren ohne Framework: wie die Werkzeugschleife funktioniert, wie Sie Tools definieren, Schleifen begrenzen und Agenten sicher machen.
- Agenten-Frameworks im Überblick: Wann sich welches Werkzeug lohntAgenten-Frameworks im Überblick: welche Arten es gibt, was sie abnehmen, wo sie stören und nach welchen Kriterien Sie für Ihr KI-Projekt das passende auswählen.
- Eigenen MCP-Server bauen: Werkzeuge für KI-Assistenten bereitstellenMCP-Server bauen: wie Sie mit dem offiziellen SDK eigene Werkzeuge und Daten für Claude, Copilot und andere Clients bereitstellen und dabei sicher bleiben.
- RAG-Pipeline bauen: Von den Dokumenten zur belegten AntwortRAG-Pipeline bauen: Dokumente aufbereiten, zerlegen, als Embeddings speichern, passende Stellen finden und Antworten mit Quellen erzeugen. Mit Prüfliste.
- Chunking-Strategien für RAG: Texte sinnvoll zerlegenChunking-Strategien für RAG: feste Größe, Absätze, Überschriften oder Bedeutung. Wie groß Abschnitte sein sollten, wann Überlappung hilft und wie Sie testen.
- Hybride Suche: Stichwort- und Vektorsuche für RAG kombinierenHybride Suche erklärt: warum Vektorsuche allein bei Namen, Nummern und Fachbegriffen scheitert und wie Sie Stichwort- und Vektortreffer für RAG zusammenführen.
- Reranking erklärt: Wie ein zweiter Durchgang RAG-Treffer verbessertReranking erklärt: wie ein Reranker Suchtreffer nach Relevanz neu sortiert, wann sich das für RAG lohnt, was es kostet und wie viele Treffer sinnvoll sind.
- LLM-Anwendungen testen: Evals, Testdaten und RegressionenLLM-Anwendungen testen: wie Sie Testdatensätze anlegen, Antworten automatisch und per Bewertungsraster prüfen und Verschlechterungen nach Änderungen erkennen.
- LLM-Observability und Logging: KI-Anwendungen im Betrieb beobachtenLLM-Observability und Logging: was Sie bei KI-Anwendungen protokollieren, wie Sie Kosten, Latenz und Qualität überwachen und was der Datenschutz verlangt.
- Guardrails für LLM-Anwendungen: Ein- und Ausgaben absichernGuardrails für LLM-Anwendungen: Eingaben prüfen, Prompt Injection erschweren, Ausgaben validieren und Themen begrenzen. Mit Schichtenmodell und Beispielen.
- KI-Code-Assistenten im Vergleich: Welche Art passt zu welcher Arbeit?KI-Code-Assistenten im Vergleich der Arten: Autovervollständigung, Chat in der IDE, Agenten im Terminal und Cloud-Agenten. Stärken, Grenzen, Sicherheit.
- Code-Review mit KI: Mehr Fehler finden, ohne das Team zu ersetzenCode-Review mit KI: wie Sie Sprachmodelle Pull Requests prüfen lassen, welche Fehler sie gut finden, welche nicht, und wie Sie Prompts und Abläufe aufsetzen.
- Tests mit KI schreiben: Unit-Tests schneller und gründlicherTests mit KI schreiben: wie Sprachmodelle Unit-Tests, Randfälle und Testdaten erzeugen, welche Prompts funktionieren und warum Sie jeden Test selbst prüfen.
- API-Schlüssel sicher speichern: So schützen Sie Ihre KI-ZugängeAPI-Schlüssel sicher speichern: Umgebungsvariablen, Secret Manager, getrennte Schlüssel je Projekt und was Sie tun, wenn ein KI-Schlüssel doch öffentlich wurde.
- Ollama Einstieg: Lokale KI-Modelle auf dem eigenen RechnerOllama Einstieg: Installation, erstes Modell laden, Hardware-Anforderungen, lokale API mit OpenAI-kompatibler Schnittstelle und Grenzen lokaler Sprachmodelle.
- Kontext komprimieren: Lange KI-Gespräche schlank haltenKontext komprimieren in langen Gesprächen: mit Zusammenfassungen, gekürzten Werkzeugergebnissen und Gedächtnisdateien Kosten senken und Qualität halten.
- Semantisches Caching: Ähnliche KI-Anfragen nur einmal bezahlenSemantisches Caching erklärt: wie ein Cache über Embeddings ähnliche Fragen erkennt, wann das Kosten und Wartezeit spart und welche Risiken es birgt.
- Modell-Routing: Anfragen automatisch auf passende KI-Modelle verteilenModell-Routing erklärt: einfache Anfragen an günstige, schwierige an starke KI-Modelle schicken. Welche Router-Arten es gibt und wie Sie die Qualität sichern.
- Mehrsprachige KI-Anwendungen: Chatbots und Tools für viele SprachenMehrsprachige KI-Anwendungen: Antwortsprache steuern, Prompts und Wissensbasis über Sprachen hinweg nutzen, Tokenkosten je Sprache beachten und Qualität testen.
- Sprachassistent mit KI bauen: Von der Spracheingabe zur gesprochenen AntwortSprachassistent mit KI bauen: Spracherkennung, Sprachmodell und Sprachausgabe verbinden oder Echtzeit-Modelle nutzen. Tipps zu Latenz, Kosten und Datenschutz.
Werkzeuge
Alle 115 Werkzeuge Passende Werkzeuge
JSON formatieren
JSON formatieren, prüfen und minifizieren, mit Fehlerstelle und Tokenzahl.
ÖffnenJSON reparieren
Kaputtes JSON aus KI-Antworten reparieren: Codeblöcke, Kommas, Anführungszeichen.
ÖffnenBatch-Datei-Generator
Aus einer Vorlage und einer Liste viele Prompts erzeugen, als JSONL für die Batch-APIs.
ÖffnenAPI-Anfrage-Generator
Fertige cURL-Anfragen für die APIs von OpenAI, Anthropic und Google erzeugen.
ÖffnenPrompt-Injection-Prüfer
Fremde Texte vor der KI-Verarbeitung auf versteckte Anweisungen und Tricks prüfen.
ÖffnenJSON-Schema-Generator
Aus einem JSON-Beispiel ein JSON Schema für strukturierte Ausgaben von KI-Modellen erzeugen.
Öffnen