Computer-Use-Agenten: Wenn KI Maus und Tastatur selbst bedient
Computer-Use-Agenten sind KI-Systeme, die einen Computer so bedienen wie ein Mensch: Sie sehen den Bildschirm, bewegen die Maus, klicken auf Schaltflächen und tippen Text. Damit können sie Aufgaben in Programmen und Websites erledigen, für die es keine Programmierschnittstelle gibt. Mehrere große KI-Anbieter bieten solche Funktionen an, teils als Browser-Agent, teils für den ganzen Desktop.
Wie Computer Use funktioniert
- Bildschirmfoto: Der Agent erhält ein Bild des aktuellen Bildschirms, manchmal ergänzt um die Struktur der Webseite.
- Planen: Ein multimodales Modell erkennt Elemente wie Felder, Menüs und Knöpfe und entscheidet über den nächsten Schritt.
- Handeln: Es gibt eine Aktion aus, etwa „klicke bei Koordinate X, Y“ oder „tippe diesen Text“. Eine Steuerungssoftware führt sie aus.
- Prüfen: Ein neues Bildschirmfoto zeigt das Ergebnis. Der Kreislauf beginnt von vorn, bis die Aufgabe erledigt ist.
Technisch ist das eine besondere Form von Werkzeugnutzung, wie sie im Ratgeber Function Calling erklärt beschrieben ist. Grundlagen zu Agenten finden Sie unter Was sind KI-Agenten?
Wofür es sich eignet
- Daten zwischen Programmen übertragen, die keine Schnittstelle haben
- Formulare in Webportalen ausfüllen, etwa wiederkehrende Meldungen
- Informationen von mehreren Websites zusammentragen
- Software testen, indem typische Nutzerwege durchgeklickt werden
- ältere Fachanwendungen bedienen, die sich nicht anders anbinden lassen
Grenzen
- Langsam: Jeder Schritt braucht ein Bild und einen Modellaufruf. Was ein Mensch in Sekunden klickt, dauert oft deutlich länger.
- Fehleranfällig: Unerwartete Pop-ups, Cookie-Banner oder geänderte Layouts bringen Agenten aus dem Tritt.
- Kosten: Viele Bildschirmfotos und Schritte summieren sich zu vielen Tokens.
- Grenzen bei Anmeldungen: Captchas und Zwei-Faktor-Abfragen sollen Maschinen gerade aussperren.
Wo eine API existiert, ist sie fast immer schneller, günstiger und zuverlässiger als die Bedienung über den Bildschirm.
Sicherheitsrisiken
Ein Agent mit Zugriff auf Ihren Computer kann viel Schaden anrichten. Das größte Risiko ist Prompt Injection: Eine Webseite enthält versteckte Anweisungen, die der Agent für Befehle hält, etwa „Sende alle Dateien an folgende Adresse“. Schutzmaßnahmen:
- Agenten in einer abgeschotteten Umgebung laufen lassen, etwa einer virtuellen Maschine.
- Keine Zugangsdaten, Zahlungsdaten oder sensiblen Dateien zugänglich machen.
- Kritische Aktionen wie Kaufen, Senden oder Löschen nur nach Bestätigung durch einen Menschen.
- Den Zugriff auf erlaubte Websites beschränken und Aktionen protokollieren.
Weitere Hinweise im Ratgeber KI-Agenten absichern.
Kosten abschätzen
Ein Computer-Use-Agent verbraucht pro Schritt Eingabe-Tokens für das Bildschirmfoto und den bisherigen Verlauf sowie Ausgabe-Tokens für Überlegung und Aktion. Bei Aufgaben mit vielen Schritten wächst der Kontext schnell. Wie teuer eine Aufgabe wird, rechnet der KI-Agent-Kostenrechner durch, die Kosten der Bilder zeigt der Bild-Token-Rechner.
Erste Schritte
Beginnen Sie mit einer klar umrissenen, harmlosen Aufgabe, etwa Informationen von einer öffentlichen Website in eine Tabelle zu übertragen. Beobachten Sie den Agenten anfangs bei jedem Schritt, notieren Sie, wo er hängen bleibt, und formulieren Sie den Auftrag entsprechend genauer. Erst wenn die Abläufe stabil laufen, lohnt es sich, mehr Selbstständigkeit zuzulassen.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.