Fine-Tuning-JSONL erstellen

Fine-Tuning-JSONL erstellen: Wandeln Sie Frage-Antwort-Beispiele in Trainingsdaten im Chat-Format messages, als Prompt/Completion oder im ShareGPT-Format um.

–

 

Prüfhinweise
    JSONL

    Alles läuft in Ihrem Browser. Eingaben verlassen Ihr Gerät nicht.

    Trainingsdaten für Fine-Tuning vorbereiten

    Mit diesem Werkzeug können Sie eine Fine-Tuning-JSONL erstellen, also die Datei mit Trainingsdaten, die Anbieter und Trainingsprogramme für das Nachtrainieren eines Sprachmodells erwarten. JSONL bedeutet: ein JSON-Objekt je Zeile, jede Zeile ist ein Trainingsbeispiel. Im verbreiteten Chat-Format messages enthält jedes Beispiel eine Liste von Nachrichten mit den Rollen system, user und assistant; das Modell lernt, die Assistent-Antworten zu erzeugen. Diese Trainingsdaten JSONL nutzt etwa das Fine-Tuning von OpenAI.

    Ihre Trainingsbeispiele schreiben Sie als einfache Blöcke: Zeilen mit F: (oder Nutzer:) für die Frage, A: (oder Assistent:) für die Antwort, Blöcke durch eine Leerzeile getrennt. Ein Block darf mehrere Wechsel enthalten und wird dann zu einem mehrstufigen Gespräch. Alternativ fügen Sie eine CSV mit zwei Spalten ein. Neben dem Chat-Format gibt das Werkzeug das ältere Prompt-Completion-Format und das ShareGPT-Format aus, das viele Open-Source-Werkzeuge für einen Fine-Tuning Datensatz verwenden.

    Vor dem Herunterladen prüft das Werkzeug die Daten: leere Antworten, doppelte Beispiele, Beispiele ohne abschließende Antwort und auffällig lange Einträge. Die Tokenzahl wird grob geschätzt oder auf Wunsch mit dem Tokenizer o200k genau gezählt. Was das Training kostet, berechnet der Fine-Tuning-Kostenrechner, eine fertige Datei prüfen Sie mit JSONL prüfen. Wichtig: Trainingsdaten sollten keine personenbezogenen Daten enthalten, die Sie nicht weitergeben dürfen.

    Anleitung: Fine-Tuning-JSONL erstellen in 4 Schritten

    1. Unter „Eingabeformat“ wählen, ob Ihre Beispiele als Blöcke mit F: und A: oder als CSV vorliegen.
    2. Die Beispiele einfügen; Blöcke werden durch eine Leerzeile getrennt, ein Block darf mehrere Wechsel enthalten.
    3. Optional einen Systemprompt eintragen, der jedem Beispiel vorangestellt wird.
    4. Unter „Ausgabeformat“ das Zielformat wählen, die Prüfhinweise lesen und die Datei herunterladen.

    Typische Anwendungsfälle

    • Gesammelte Support-Antworten in einen Trainingsdatensatz für ein feinabgestimmtes Modell bringen.
    • Eine Tabelle mit Fragen und Musterantworten aus der Fachabteilung in JSONL umwandeln.
    • Einen Datensatz für ein Open-Source-Trainingswerkzeug im ShareGPT-Format vorbereiten.
    • Eine kleine Validierungsdatei getrennt von den Trainingsdaten erzeugen.
    Fragen

    Häufige Fragen

    Welches Format brauche ich für OpenAI?

    Das Chat-Format mit messages. Jede Zeile enthält ein Objekt {"messages": […]} mit mindestens einer Nutzer- und einer Assistent-Nachricht.

    Muss jedes Beispiel denselben Systemprompt haben?

    Nein, aber es ist üblich. Verwenden Sie beim späteren Einsatz denselben Systemprompt wie im Training, damit das Modell das gelernte Verhalten zeigt.

    Wie trenne ich Trainings- und Validierungsdaten?

    Erstellen Sie zwei Dateien: Kopieren Sie etwa jedes zehnte Beispiel in eine eigene Eingabe und laden Sie diese als Validierungsdatei herunter.

    Wird mein Datensatz hochgeladen?

    Nein. Die Datei entsteht im Browser und wird direkt heruntergeladen. Den Upload zum Anbieter erledigen Sie selbst.

    Wie viele Beispiele brauche ich?

    OpenAI verlangt mindestens 10 Beispiele und nennt einige Dutzend gut gewählte Beispiele als sinnvollen Start. Mehr Beispiele helfen meist, wenn sie vielfältig und sauber sind.

    Was prüft das Werkzeug an meinen Daten?

    Es meldet leere Antworten, doppelte Beispiele, Beispiele, die nicht mit einer Assistent-Antwort enden, und sehr lange Beispiele. Die Tokenzahl wird grob mit vier Zeichen je Token geschätzt.

    Ratgeber

    Zum Weiterlesen

    Alle Artikel
    1. RAG einfach erklärt: KI mit eigenen Dokumenten nutzenRAG einfach erklärt: wie Retrieval-Augmented Generation funktioniert, wofür man Embeddings und Vektordatenbanken braucht und was ein RAG-System kostet.
    2. Structured Outputs: Zuverlässig JSON von KI-ModellenStructured Outputs erklärt: Wie Sie mit JSON-Schema garantiert gültiges JSON von OpenAI, Claude und Gemini bekommen, statt kaputte Antworten nachträglich zu reparieren.
    3. Prompt Injection: Wie Angriffe auf KI-Systeme funktionierenPrompt Injection erklärt: wie versteckte Anweisungen in E-Mails, Dokumenten und Websites KI-Assistenten und Agenten manipulieren und welche Schutzmaßnahmen wirken.
    Weitere Werkzeuge

    Das könnte auch helfen

    Alle 558 Werkzeuge