Blog · Computer Use · 08.10.2026
Blog
Computer Use

KI-Agent mit Computer Use:Was er bedient,was er darf

Ein Agent, der klickt, erreicht auch Programme ohne Schnittstelle. Welche Arbeiten sich eignen, welche Rechte er bekommt und wo ein Mensch zustimmen muss.

Direkt zur Anfrage
Anfrage
Nikolai Schöbel und Jeremias Burger, Co-Founder Scalableloops

Sprechen wir über Ihr Projekt.

Erst prüfen wir, ob das Vorhaben zu Ihrem Geschäftsmodell passt. Dann folgt ein Vorschlag mit Phasen und Aufwand.

Erste Aufgabe prüfen lassen oder anrufen: +49 151 1576 5566
Blog · Computer Use

Computer Use heißt, dass ein KI-Agent ein Programm über die Oberfläche bedient. Er sieht ein Bildschirmfoto, entscheidet den nächsten Klick oder Tastendruck, führt ihn aus und sieht danach das nächste Bildschirmfoto. Weil er dabei Maus und Tastatur benutzt, braucht die Software keine Schnittstelle. Genau das macht die Sache für den Mittelstand interessant, denn eine ältere Warenwirtschaft, ein Lieferantenportal oder eine Behördenmaske lassen sich damit erstmals ohne Programmierarbeit am Fremdsystem bedienen. OpenAI hat die Funktion am 29. September 2026 in die Agents API aufgenommen, bei Microsoft und Anthropic ist sie bereits allgemein verfügbar. Und in den Anleitungen aller drei steht am Ende dasselbe. Der Agent gehört auf einen eigenen, abgeschotteten Rechner, er bekommt nur die Rechte, die die Aufgabe verlangt, und ein Mensch muss freigeben, was sich nicht zurücknehmen lässt.

In Kürze
  • Computer Use bedeutet Maus und Tastatur statt Schnittstelle: Bildschirmfoto ansehen, klicken oder tippen, Ergebnis prüfen, von vorn. Der Agent sieht dieselbe Oberfläche wie Ihre Mitarbeiter.
  • Der Nutzen liegt bei Programmen ohne Schnittstelle. Microsoft formuliert es in der eigenen Dokumentation so: Was ein Mensch in einer App oder auf einer Website kann, kann Computer Use auch.
  • Über das Risiko entscheiden die Rechte, nicht das Modell. OpenAI, Microsoft und Anthropic verlangen in ihren Anleitungen übereinstimmend einen eigenen Rechner, eine Freigabeliste erlaubter Seiten und Programme sowie wenige Rechte.
  • Die eingebaute Rückfrage an den Menschen ist keine Sicherung. Microsoft schreibt ausdrücklich, man dürfe sich nicht darauf verlassen, dass das System vor dem Weitermachen nachfragt.
Veröffentlicht 08.10.2026Nikolai Schöbel und Jeremias BurgerLesezeit 9 min
Nikolai SchöbelJeremias Burger

Nikolai Schöbel und Jeremias Burger

Co-Founder der Scalableloops GmbH. Nikolai Schöbel verantwortet Online-Marketing und KI-Strategie, Jeremias Burger die KI-Architektur. Beide bauen und schulen KI-Systeme im eigenen Agenturalltag.

Auf dieser Seite
  1. Was ist Computer Use bei einem KI-Agenten?
  2. Was sich mit Computer Use bei OpenAI, Claude und Copilot Studio ändert
  3. Welche Bildschirmarbeiten ein KI-Agent mit Computer Use übernimmt
  4. Welche Rechte ein KI-Agent mit Computer Use wirklich braucht
  5. Wo ein Mensch zustimmen muss, bevor der Computer-Use-Agent etwas abschickt
  6. Wann sich ein KI-Agent mit Computer Use für den Mittelstand lohnt
  7. Wo Computer Use an seine Grenzen stößt, von Prompt Injection bis Citrix
  8. Häufige Fragen
  9. So prüfen Sie einen KI-Agenten mit Computer Use für eine erste Aufgabe
  10. Woher die Angaben auf dieser Seite stammen
Grundlagen

Was ist Computer Use bei einem KI-Agenten?

Ein KI-Agent mit Computer Use arbeitet in einer Schleife, die sich eigentlich leicht nachvollziehen lässt. Er bekommt eine Aufgabe in normaler Sprache, etwa die Rechnungsdaten aus einem PDF in eine Eingabemaske zu übertragen, dann sieht er ein Bildschirmfoto des Rechners, wählt daraus die nächste Handlung, führt sie aus und lässt sich das Ergebnis als neues Bildschirmfoto zeigen. OpenAI beschreibt diesen Ablauf in der eigenen Anleitung als Aufgabe senden, zurückgegebene Handlungen ausführen, Bildschirmfoto zurückgeben.

Die Handlungen selbst sind genau die, die ein Mensch mit Maus und Tastatur ausführt. In der OpenAI-Dokumentation stehen Klicken, Doppelklicken, Ziehen, Bewegen, Scrollen, Tastendruck, Tippen, Warten und Bildschirmfoto. Bei Anthropic ist die Liste mit siebzehn Einzelwerkzeugen länger (dort kommen Rechtsklick, Dreifachklick, Vergrößern eines Bildbereichs und das Halten einer Taste dazu), aber mehr als das ist es eben nicht. Und genau darin liegt der Reiz. Ein Programm, das sich von Hand bedienen lässt, lässt sich auch so bedienen.

Der Unterschied zur üblichen Automatisierung ist damit klar umrissen. Eine Schnittstelle tauscht Daten in einem festen Format aus, sie ist schnell und verlässlich, muss aber vom Hersteller der Software angeboten werden. Computer Use geht den Weg über die Oberfläche und braucht deshalb nichts vom Hersteller, ist dafür aber langsamer und weniger verlässlich. Wo eine Schnittstelle vorhanden ist, bleibt sie also die bessere Wahl. Was ein Agent im Allgemeinen ist und was ihn vom Chatbot trennt, haben wir im Beitrag zum KI-Agenten aufgeschrieben.

Neuerung

Was sich mit Computer Use bei OpenAI, Claude und Copilot Studio ändert

Computer Use ist seit dem 29. September 2026 Teil der Agents API von OpenAI, angekündigt auf der Entwicklerkonferenz des Unternehmens. Im OpenAI-Entwicklerforum steht der Satz, Computer Use in der Agents API lasse Agenten Software über deren Oberfläche bedienen. InfoQ fasst es am 2. Oktober 2026 so zusammen, dass Anwendungen nun Software über grafische Oberflächen bedienen können und die Funktion über die API sowie in Codex und ChatGPT Work für ausgewählte Tarife bereitsteht.

Dazu kam ein neues Modell. GPT-6.1 Sol legt nach beiden Quellen bei Programmierarbeit und bei Computer Use zu, und seine Standardpreise je Token liegen bei einem Fünftel derer von GPT-6 Astra. In der OpenAI-Anleitung zum Computer-Werkzeug ist genau dieses Modell als das vorgesehene genannt. Beim Verfügbarkeitsstand gehen die beiden Quellen allerdings auseinander: Die Forums-Zusammenfassung spricht davon, das Modell komme in Kürze, während InfoQ es als über die API nutzbar beschreibt. Welche der beiden Angaben an Ihrem Stichtag gilt, lässt sich von außen schlecht sagen (solche Zeilen altern bei OpenAI schnell), deshalb nennen wir kein Startdatum und halten nur fest, was in der Anleitung steht.

Allein steht OpenAI damit ohnehin nicht. Über die Claude API und Google Cloud ist Computer Use bei Anthropic bereits allgemein verfügbar, und in Microsoft Copilot Studio lässt sich das Werkzeug ohne eine Zeile Code einrichten, wahlweise mit dem Modell von OpenAI oder mit Claude Sonnet 4.5. Wichtiger als das Modell ist aber die Verlagerung. Bisher musste man die Schleife aus Bildschirmfoto, Handlung und Kontrolle selbst bauen oder eine fertige Plattform mieten, jetzt steckt sie in Werkzeugen, mit denen ohnehin gearbeitet wird. Dass die Preise fallen, hilft zusätzlich, denn eine Bildschirmarbeit kostet viele kleine Schritte, und jeder davon trägt ein Bildschirmfoto im Gepäck.

29.09.

hat OpenAI Computer Use in die Agents API aufgenommen. GPT-6.1 Sol kostet je Token ein Fünftel von GPT-6 Astra.

OpenAI Developer Community; InfoQ, 02.10.2026
Eignung

Welche Bildschirmarbeiten ein KI-Agent mit Computer Use übernimmt

Wofür sich ein KI-Agent mit Computer Use eignet, lässt sich an den Beispielen ablesen, die die Anbieter selbst verwenden, und die ähneln einander auffallend. In der Microsoft-Dokumentation stehen automatische Datenerfassung, Rechnungsbearbeitung und Datenauslesen, dazu drei Musteranweisungen. Rechnungsdaten aus einem PDF in ein Formular übertragen. Mehrere Artikel in eine Bestandsverwaltung eintragen. Zwei Werte aus einer Tabelle als Text zurückgeben. Das sind keine Zukunftsvisionen, sondern die Fälle, mit denen die Hersteller vorführen (was man ihnen anmerkt, denn alle drei sind brav und gutmütig gewählt).

Daran lässt sich ablesen, was eine geeignete Aufgabe auszeichnet. Sie wiederholt sich, läuft immer durch dieselben Masken, hat ein prüfbares Ergebnis und wäre im Fehlerfall ohne großen Aufwand zu korrigieren. Umgekehrt eignet sich alles schlecht, was Einzelfallurteil verlangt, mit Geld oder Verträgen zu tun hat oder sich nach dem Absenden nicht mehr zurücknehmen lässt. Am besten funktioniere Computer Use ohnehin bei eigenständig laufenden Agenten, die im Hintergrund arbeiten, heißt es bei Microsoft.

Ein Hinweis, der sich aus derselben Dokumentation ergibt. Das Auslesen von Daten ist ein guter Einstieg, denn es verändert im Fremdsystem nichts, das Ergebnis lässt sich gegen die Quelle halten, und ein Fehlgriff kostet nur einen zweiten Durchlauf. Wer klein anfangen will, fängt also beim Lesen an und nicht beim Schreiben.

Art der ArbeitEignungWarum
Werte aus einem Portal auslesen und weitergebenGuter EinstiegVerändert im Fremdsystem nichts, Ergebnis gegen die Quelle prüfbar
Daten aus PDF in eine Maske übertragenGeeignetWiederholt sich, feste Felder, Fehler vor dem Absenden sichtbar
Stammdaten in einer älteren Warenwirtschaft pflegenGeeignet mit FreigabeImmer dieselbe Maske, aber Schreibzugriff auf echte Daten
Bestellungen absenden oder Zahlungen auslösenNur mit Zustimmung im EinzelfallAnbieter verlangen hier ausdrücklich eine menschliche Bestätigung
Entscheidungen mit Ermessen, etwa Reklamationen beurteilenNicht geeignetVerlangt Urteil und Verantwortung, nicht Klickarbeit
Rechte

Welche Rechte ein KI-Agent mit Computer Use wirklich braucht

Die Rechte eines KI-Agenten sind bei Computer Use der Teil, den man nicht an die Technik abgeben kann. Ein Agent, der klickt, handelt mit den Rechten des Kontos, in dem er läuft, und er kann deshalb genau das anrichten, was dieses Konto anrichten darf. Alle drei Anbieter kommen in ihren Anleitungen unabhängig voneinander zur selben Empfehlung, was für sich genommen schon ein Hinweis ist. Ein abgeschotteter Browser oder eine virtuelle Maschine, dazu eine Freigabeliste erlaubter Seiten und Handlungen, so steht es bei OpenAI. Eine eigene virtuelle Maschine oder ein Container mit möglichst geringen Rechten, so bei Anthropic. Und in der Microsoft-Dokumentation sind es eigene, isolierte Rechner und ein Konto nach dem Grundsatz der geringsten Rechte.

Bei den Zugangsdaten wird es konkret. Zwei Wege bietet Microsoft an, einen internen verschlüsselten Speicher und einen eigenen Azure Key Vault, und warnt an derselben Stelle vor einer Einstellung, die man leicht übersieht. Nutzt das Werkzeug die Zugangsdaten seines Erstellers und wird der Agent dann im Team geteilt, kann jeder, der ihn benutzt, mit den Rechten dieses Erstellers auf dem eingerichteten Rechner handeln. Wer einen Agenten freigibt, prüft also zuerst, auf wessen Konto er eigentlich läuft (in größeren Häusern ist das erfahrungsgemäß nicht die Person, die ihn später bedient).

Eine Einschränkung der Freigabeliste gehört ebenfalls auf den Tisch, weil sie leicht falsch verstanden wird. Die Zugriffssteuerung verhindere nur Handlungen auf Seiten und in Programmen, die nicht auf der Liste stehen, nicht aber deren Öffnen, heißt es dazu bei Microsoft. Steht also nur eine Seite auf der Liste, kann der Agent eine andere durchaus aufrufen, und erst der Versuch, dort etwas zu tun, scheitert. Das ist ein wirksamer Schutz, nur eben kein Zaun um den Rechner.

BausteinWas er bewirktWo er dokumentiert ist
Eigener, abgeschotteter RechnerEin Fehlgriff bleibt in der Umgebung und erreicht keine anderen SystemeOpenAI, Anthropic und Microsoft
Konto mit geringen RechtenDer Agent kann nur, was die Aufgabe verlangtAnthropic und Microsoft
Freigabeliste erlaubter Seiten und ProgrammeHandlungen außerhalb der Liste scheiternOpenAI, Anthropic und Microsoft
Zugangsdaten im SchlüsselspeicherPasswörter stehen nicht in der Anweisung an den AgentenMicrosoft, interner Speicher oder Azure Key Vault
Nur verschlüsselte Verbindungen zulassenDer Agent arbeitet nicht auf unverschlüsselten SeitenMicrosoft, Einstellung HTTPS erzwingen
Grenzen für Schritte, Zeit und KostenEin Durchlauf, der sich verrennt, endet von selbstOpenAI
Freigabe

Wo ein Mensch zustimmen muss, bevor der Computer-Use-Agent etwas abschickt

Beim Thema Zustimmung sind die Anbieter von KI-Agenten mit Computer Use ungewöhnlich deutlich. Folgenschwere Handlungen seien zu bestätigen und Nutzer bei Käufen, bei der Übertragung von Daten und bei zerstörenden Änderungen in der Kontrolle zu halten, schreibt OpenAI, und zwar an der Stelle, an der das Risiko entsteht. Anthropic wird noch konkreter und zählt auf, wofür ein Mensch zustimmen soll. Entscheidungen mit spürbaren Folgen in der Wirklichkeit, dazu alles, was eine ausdrückliche Einwilligung braucht, also etwa das Annehmen von Cookies, Finanzgeschäfte oder die Zustimmung zu Nutzungsbedingungen.

Für den Ernstfall gibt es bei Microsoft eine eingebaute Mechanik. Braucht der Agent eine Bestätigung oder fehlt ihm eine Angabe, schickt er eine Prüfanfrage per E-Mail an eine vorher benannte Person, mit Namen des Agenten, Verweis auf den Vorgang und einem Feld für die Antwort. Der Vorgang bleibt angehalten, und läuft die genannte Frist ab, ohne dass jemand antwortet, endet er. Lesenswert ist auch der Hinweis, dass das Abschalten dieser Aufsicht den Agenten nicht eigenständig macht. Er halte weiterhin an, wenn er eine Bestätigung braucht, und ohne benannten Prüfer scheitere dann die Sitzung.

Und jetzt der Satz, auf den es ankommt. In derselben Dokumentation steht, das Verhalten der Modelle sei wahrscheinlichkeitsbasiert, die Rückfragen kommen also nicht zwangsläufig in jeder Lage, in der ein Mensch eine Pause wünscht, und manchmal auch dann, wenn keine nötig ist. Dazu die klare Warnung, man solle sich auf diese Rückfragen nicht als Sicherheitsmaßnahme verlassen und nicht darauf, dass das System immer nachfragt, bevor es weitermacht. Wir halten das für die wichtigste Zeile der ganzen Dokumentation, denn sie verschiebt die Sicherung dorthin, wo sie verlässlich ist, nämlich in die Rechte und in die Freigabeliste. Ein Agent, der eine Bestellung technisch gar nicht absenden kann, braucht über sie keine Rückfrage.

Keine Garantie

Microsoft warnt ausdrücklich davor, die eingebaute Rückfrage an den Menschen als Sicherheitsmaßnahme zu verstehen.

Microsoft Learn, Menschliche Überwachung der Computernutzung
Entscheidung

Wann sich ein KI-Agent mit Computer Use für den Mittelstand lohnt

Ob sich ein KI-Agent mit Computer Use lohnt, hängt an einer einzigen Vorfrage, und die hat mit KI nichts zu tun: Gibt es eine Schnittstelle? Wenn ja, ist sie der ruhigere Weg, und der Agent wäre der Umweg über die Oberfläche. Interessant wird die Technik genau dort, wo es keine Schnittstelle gibt und wohl auch keine zu erwarten ist, also bei älterer Branchensoftware, bei Portalen von Lieferanten und Behörden und bei Programmen, die ein kleiner Anbieter pflegt (gerade dort ist eine Anbindung meistens nicht einmal geplant).

Der zweite Punkt ist die Menge. Jeder Durchlauf besteht aus vielen kleinen Schritten, und die kosten. Fünf Copilot-Credits je Schritt rechnet Microsoft, fünfzehn bei einem Premium-Modell, und zeigt dazu ein Beispiel. Ein Stundenzettel, der aus Browser öffnen, Formular anlegen, Felder füllen und Absenden besteht, kommt auf vier Schritte und damit auf zwanzig Credits. Bei Anthropic kostet allein ein Bildschirmfoto etwa eintausend bis eintausendachthundert Token. Eine Arbeit, die zweimal im Monat anfällt, rechnet sich damit eher nicht. Eine, die täglich vierzig Mal anfällt, sehr wohl.

  1. 01

    Software ohne Schnittstelle, Arbeit täglich

    Prüfen lohnt sich

    Hier spielt Computer Use seine Stärke aus. Fangen Sie mit einem lesenden Fall an, messen Sie die Trefferquote eine Woche lang und erweitern Sie erst danach auf schreibende Schritte.

  2. 02

    Schnittstelle vorhanden

    Erst die Schnittstelle

    Schneller, günstiger und verlässlicher. Computer Use bleibt der Weg für die Reste, die die Schnittstelle nicht abdeckt.

  3. 03

    Arbeit selten, mit Geld oder Verträgen verbunden

    Niedrige Priorität

    Der Aufwand für Rechner, Rechte und Freigaben bleibt gleich, der Nutzen ist klein. Diese Fälle bleiben vorerst beim Menschen.

Grenzen

Wo Computer Use an seine Grenzen stößt, von Prompt Injection bis Citrix

Die erste Grenze von Computer Use ist ein Angriffsweg mit eigenem Namen. Prompt Injection bedeutet, dass versteckte Anweisungen in einer Webseite, in einem Bild oder in einem Bildschirmfoto den Agenten zu etwas anderem bewegen. Unter Umständen befolge das Modell Anweisungen aus Inhalten, selbst wenn sie dem Auftrag widersprechen, beschreibt Anthropic, und setzt deshalb Prüfprogramme ein, die Bildschirmfotos auf solche Einschleusungen durchsehen und den Agenten im Verdachtsfall zurückfragen lassen. Dieselbe Warnung steht bei Microsoft, dort verbunden mit der Empfehlung vertrauenswürdiger, abgeschotteter Umgebungen. Am kürzesten fasst es OpenAI. Bildschirminhalte seien als nicht vertrauenswürdig zu behandeln, ein Text auf einer Seite könne keine Erlaubnis erteilen.

Die zweite Grenze ist technischer Art und trifft den Mittelstand härter, als man zunächst denkt. Passwortfelder funktionieren laut Microsoft auf Websites und in den meisten Windows-Anwendungen, ausdrücklich genannt sind aber Programmarten, bei denen das möglicherweise nicht gilt. Electron, Java, Unity, Spiele, Eingabeaufforderungen, Citrix und andere virtualisierte Umgebungen. Wer seine Branchensoftware über Citrix bereitstellt (und das sind in Deutschland nicht wenige), prüft diesen Punkt also vor allem anderen. Dazu kommt der Hinweis aus der Anthropic-Dokumentation, dass kleine Bedienelemente schwierig zu treffen sind und starkes Verkleinern hochauflösender Bildschirme die Klickgenauigkeit beeinträchtigt.

Die dritte Grenze ist die Erwartung. Ein Agent, der eine Oberfläche bedient, arbeitet langsamer als eine Schnittstelle und macht Fehler, die eine Schnittstelle nicht macht, weil er ein Bild deutet statt ein Datenfeld zu lesen. Wie hoch die Trefferquote in Ihrem Haus ausfällt, dürfte sich vorab kaum schätzen lassen, weil sie an Ihren Masken hängt. Zu jedem Einsatz gehört deshalb eine Kontrolle des Ergebnisses, und genau das steht bei OpenAI auch so drin. Grenzen für Schritte, Zeit und Kosten setzen, Abbruch ermöglichen, das tatsächliche Ergebnis prüfen. Wer das mitplant, bekommt ein brauchbares Werkzeug. Und wer darauf verzichtet, bekommt eine Fehlerquelle, die niemand bemerkt, weil ein falsch übertragener Wert in einer Maske eben aussieht wie ein richtig übertragener.

Wenn Sie an dieser Stelle überlegen, wo Ihr Betrieb anfangen soll, hilft ein Blick auf das größere Bild: Welche Aufgaben überhaupt an eine KI gehen, haben wir unter KI im Mittelstand sortiert, die Abgrenzung zwischen zielgerichteten Systemen und einfachen Helfern unter Agentic AI, und was ein Assistent im Büro heute leistet, unter KI-Assistent im Unternehmen. Wer die Einschätzung im eigenen Team aufbauen will, findet den Weg dorthin in unserer KI-Schulung.

Häufige Fragen

Häufige Fragen

Was ist Computer-Use?

Computer Use ist die Fähigkeit eines KI-Agenten, ein Programm über die Oberfläche zu bedienen, also mit Maus und Tastatur zu klicken und zu tippen. Der Agent sieht ein Bildschirmfoto, wählt die nächste Handlung und prüft danach am nächsten Bildschirmfoto, was passiert ist. Eine Schnittstelle braucht er dazu nicht.

Was unterscheidet Computer Use von klassischer Prozessautomatisierung?

Herkömmliche Automatisierung folgt einem festgelegten Weg: dieser Knopf an dieser Stelle. Ändert sich die Oberfläche, bricht der Ablauf. Computer Use deutet stattdessen das Bild, weshalb Microsoft in der eigenen Dokumentation schreibt, das Werkzeug passe sich Veränderungen der Oberfläche an und arbeite weiter, wenn sich Knöpfe oder Masken ändern. Dafür ist es langsamer und sein Ergebnis weniger vorhersehbar.

Kann ein KI-Agent jede Software bedienen?

Im Grundsatz jede, die ein Mensch bedienen kann, also Websites und Windows-Programme. Microsoft nennt allerdings Programmarten, bei denen Passwortfelder möglicherweise nicht funktionieren, darunter Electron, Java, Unity, Eingabeaufforderungen und Citrix sowie andere virtualisierte Umgebungen. Wenn Ihre Branchensoftware über Citrix läuft, prüfen Sie das vor der Planung.

Lässt sich Software automatisieren ohne Schnittstelle?

Genau dafür ist Computer Use gedacht. Weil der Agent über Maus und Tastatur arbeitet, braucht er keine Programmierschnittstelle, sondern nur eine Oberfläche, die ein Mensch bedienen könnte. Microsoft nennt als Einsatzfälle ausdrücklich Programme, zu denen es keine direkte Anbindung gibt. Wo eine Schnittstelle vorhanden ist, bleibt sie trotzdem der schnellere und verlässlichere Weg.

Was kostet Computer Use?

Das hängt am Weg. Microsoft rechnet in Copilot-Credits ab, fünf je Schritt und fünfzehn bei einem Premium-Modell, und nennt als Beispiel einen Stundenzettel mit vier Schritten und damit zwanzig Credits. Über die OpenAI-Schnittstelle zahlen Sie Token, wobei GPT-6.1 Sol nach Angaben vom DevDay bei einem Fünftel der Standardpreise von GPT-6 Astra liegt. Teuer wird es durch die Menge der Bildschirmfotos, nicht durch den einzelnen Klick.

Kann ein Agent mit Computer Use Schaden anrichten?

Er kann alles, was sein Konto darf. Deshalb verlangen OpenAI, Microsoft und Anthropic in ihren Anleitungen übereinstimmend einen eigenen, abgeschotteten Rechner, ein Konto mit geringen Rechten und eine Freigabeliste erlaubter Seiten und Programme. Die Sicherung liegt in diesen drei Punkten, nicht im guten Willen des Modells.

Braucht der Agent die Passwörter meiner Mitarbeiter?

Nein, und er sollte sie auch nicht in der Anweisung bekommen. Microsoft legt Zugangsdaten entweder in einem internen verschlüsselten Speicher oder in einem Azure Key Vault ab und setzt sie bei einer Anmeldemaske selbst ein. Anthropic empfiehlt darüber hinaus, dem Modell gar keinen Zugang zu sensiblen Daten wie Anmeldedaten zu geben.

Verlässt sich der Agent von selbst auf eine Rückfrage, bevor er etwas Wichtiges tut?

Darauf dürfen Sie sich nicht verlassen. Microsoft schreibt, das Verhalten der Modelle sei wahrscheinlichkeitsbasiert, Rückfragen kommen deshalb nicht in jeder Lage und manchmal auch ohne Not, und warnt ausdrücklich davor, diese Rückfragen als Sicherheitsmaßnahme zu verstehen. Was nicht passieren soll, wird deshalb über Rechte verhindert und nicht über eine Frage.

Was jetzt

So prüfen Sie einen KI-Agenten mit Computer Use für eine erste Aufgabe

  1. 01

    Schnittstelle ausschließen

    Fragen Sie beim Hersteller der betroffenen Software nach einer Schnittstelle. Gibt es eine, ist sie der schnellere und verlässlichere Weg, und die Frage nach Computer Use erledigt sich.

  2. 02

    Eine lesende Aufgabe auswählen

    Suchen Sie eine wiederkehrende Arbeit, die nur Daten ausliest und nichts verändert. Das Ergebnis lässt sich gegen die Quelle prüfen, und ein Fehlgriff kostet nur einen zweiten Durchlauf.

  3. 03

    Rechner und Rechte vorher festlegen

    Richten Sie einen eigenen, abgeschotteten Rechner ein, geben Sie dem Konto nur die nötigen Rechte, tragen Sie die erlaubten Seiten und Programme in die Freigabeliste und legen Sie Zugangsdaten in einen Schlüsselspeicher.

  4. 04

    Trefferquote eine Woche messen

    Lassen Sie den Agenten mitlaufen, während ein Mensch dieselbe Arbeit weiter erledigt, und vergleichen Sie die Ergebnisse. Erst wenn die Quote stimmt, übernehmen Sie, und schreibende Schritte bekommen weiterhin eine Freigabe.

Ein Agent, der klickt, öffnet Ihnen die Programme, für die es nie eine Schnittstelle gab. Was er dort anrichten kann, entscheiden Sie vorher über die Rechte, nicht hinterher über eine Rückfrage.

oder anrufen: +49 151 1576 5566

Weiterlesen

Projekt-Detail

    Eigenes Projekt im Kopf?

    Wir antworten persönlich. Erst Use-Case-Prüfung, dann Architektur-Vorschlag.

    Eigene Anfrage starten