Symptom: Ihr Agent führt im Demo-Lauf Code aus, aber niemand kann belegen, welche Dateien, Schlüssel, Netzwerke und Wiederholungen im Fehlerfall betroffen sind.
Schnellste Lösung: Verwenden Sie die OpenAI Hosted Sandboxes zunächst als Prüf- und Graustufenumgebung und erteilen Sie erst nach einer dokumentierten Abnahme produktive Rechte. Die Abnahme-Checkliste für OpenAI Hosted Sandboxes muss Berechtigungen, Abhängigkeiten, Dateipersistenz, Netzwerk, Wiederanlauf, Protokolle und Kostenobergrenzen abdecken.
Diese Anleitung richtet sich an drei Gruppen: Agent-Entwickler, die Code sicher ausführen und Dateien verarbeiten müssen; Plattformingenieure, die Sandbox, Zugangsdaten, Netzwerk und Protokollierung verantworten; sowie technische Leiter, die den dauerhaften Einsatz eines Cloud-Agenten bewerten. Wenn Sie nur einen kurzen Code-Demolauf benötigen, reicht eine kleinere Prüfung. Sobald sensible Daten, externe Systeme oder wiederkehrende Aufgaben beteiligt sind, sollten Sie die vollständige Abnahme durchführen.
Zuletzt aktualisiert am 22.09.2026; die fachlichen Angaben wurden anhand der offiziellen OpenAI-Produktinformationen, der Agents-SDK-Dokumentation und der dort verlinkten Aktualisierungen geprüft.
Einsatzgrenzen vor dem Start
Hosted Sandboxes können für einen Agenten sinnvoll sein, der Code ausführt, Dateien erzeugt, Daten transformiert oder ein Ergebnis als Download-Artefakt bereitstellt. OpenAI beschreibt die Agents API als Grundlage für Agenten mit Werkzeugen, Zuständen und mehrstufigen Abläufen; die konkrete Ausführungsumgebung muss dennoch separat hinsichtlich ihrer Grenzen geprüft werden. Eine Einführung in die Agents API finden Sie in der offiziellen Produktbeschreibung von OpenAI.
Die entscheidende Abgrenzung lautet nicht „Kann das Modell ein Werkzeug aufrufen?“, sondern „Welche Folgen hat dieser Werkzeugaufruf?“. Ein Agent, der eine CSV-Datei bereinigt und eine neue Datei erzeugt, hat ein anderes Risikoprofil als ein Agent, der direkt in ein Kundensystem schreibt, Rechnungen verändert oder Produktionsdaten löscht.
Sind OpenAI Hosted Sandboxes für den Produktionsbetrieb geeignet?
Für schnelle Validierung und kontrollierte Graustufenläufe können sie geeignet sein. Sie sollten sie jedoch nicht automatisch als vollständige Produktionsumgebung behandeln. Offizielle Dokumentation und SDK-Beispiele zeigen, wie Agenten, Werkzeuge und Ausführungen zusammenspielen; daraus folgt noch keine pauschale Zusicherung für Ihre gewünschte Isolation, Datenhaltung, Netzwerktopologie oder Verfügbarkeit. Diese Punkte müssen Sie mit der jeweils aktuellen Sandbox-Dokumentation des Agents SDK und Ihren eigenen Tests abgleichen.
Geeignete Aufgaben
- Berechnung, Konvertierung oder Validierung von Daten innerhalb eines klar abgegrenzten Arbeitsverzeichnisses.
- Erzeugung von Berichten, Zwischenartefakten oder Dateien, die nach einer Prüfung heruntergeladen werden.
- Testläufe mit synthetischen oder bereits anonymisierten Daten.
- Agenten-Workflows, bei denen externe Änderungen zunächst als Vorschlag ausgegeben werden.
- Wiederholbare Prüfaufgaben, deren Eingaben, Ausgaben und Fehlerzustände nachvollziehbar bleiben.
Aufgaben mit erhöhter Vorsicht
- Verarbeitung personenbezogener Daten ohne vorherige Prüfung der DSGVO-Anforderungen.
- Zugriff auf Produktionsdatenbanken oder interne Dateifreigaben.
- Direkte Schreibrechte in CRM-, Finanz-, Identitäts- oder Deployment-Systemen.
- Aufgaben, die auf spezielle Netzwerkpfade, private Endpunkte oder eine festgelegte Region angewiesen sind.
- Lang laufende Abläufe, deren Zwischenstand nach einem Abbruch zwingend erhalten bleiben muss.
Nicht ungeprüft in die Sandbox
Wenn Ihre Anwendung eine private Netzwerktopologie, verbindliche Datenresidenz, physische Geräte, streng kontrollierte Ausführungshosts oder ununterbrochene Prozesszustände erfordert, sollten Sie eine eigene Sandbox, eine VPC-Architektur oder eine kontrollierte Cloud-Mac-Umgebung als Alternative bewerten. Die Hosted Sandbox kann dabei weiterhin für Vorabtests dienen, ist aber nicht automatisch der richtige dauerhafte Ort für jede Aufgabe.
Berechtigungen und Datenfluss
Vor dem ersten echten Lauf erstellen Sie eine einfache Datenflusskarte. Sie sollte zeigen, welche Eingabe den Agenten erreicht, welche Werkzeuge aufgerufen werden, welche Dateien entstehen, wohin Ergebnisse übertragen werden und welche Identität einen externen Dienst aufruft. Diese Karte ist wichtiger als eine lange Liste von API-Parametern, weil sie die tatsächlichen Auswirkungen eines Werkzeugaufrufs sichtbar macht.
Wie lassen sich Datei- und Netzwerkrechte bei einer Agents-API-Sandbox begrenzen?
Beginnen Sie mit einem Entzug aller Rechte, die der konkrete Test nicht benötigt. Erlauben Sie nur die vorgesehenen Arbeitsverzeichnisse, legen Sie Eingabe- und Ausgabeordner getrennt an und behandeln Sie jedes externe Ziel als ausdrücklich freizugebende Ausnahme. Ein Modell kann ein Werkzeug technisch aufrufen, ohne deshalb die Berechtigung für das vollständige Dateisystem oder das gesamte Netzwerk erhalten zu müssen.
Prüfen Sie die folgenden Punkte vor der Freigabe:
- Identität: Verwenden Sie für den Agenten eine eigene technische Identität mit minimalen Rechten.
- Schlüssel: Injizieren Sie Zugangsdaten nur zur Laufzeit und niemals als fest eingebetteten Bestandteil von Code, Prompt oder Artefakt.
- Dateien: Legen Sie fest, welche Dateien gelesen, überschrieben, neu erzeugt und heruntergeladen werden dürfen.
- Geheimnisse: Entfernen oder maskieren Sie Tokens, Kundennummern, personenbezogene Inhalte und interne Hostnamen aus Testdaten.
- Werkzeuge: Trennen Sie lesende Werkzeuge von schreibenden Werkzeugen. Ein Schreibvorgang sollte möglichst eine menschliche Bestätigung oder eine nachgelagerte Prüfung benötigen.
- Netzwerk: Dokumentieren Sie erlaubte Ziele, DNS-Annahmen, ausgehende Verbindungen und das Verhalten bei vollständig fehlendem Netzwerk.
- Aufbewahrung: Definieren Sie, wie lange Eingaben, Zwischenstände, Logs und erzeugte Dateien benötigt werden.
Für die DSGVO-Prüfung sollten Sie insbesondere Zweckbindung, Datenminimierung, Löschfristen und den Umgang mit Auftragsverarbeitung klären. Ergänzend können Sie die Datenschutzinformationen von Kvmzen als Ausgangspunkt für die Prüfung Ihrer eigenen Betriebs- und Mietumgebung heranziehen. Sie ersetzen keine organisationsinterne Datenschutzbewertung.
Abnahme-Matrix für die erste Freigabe
| Prüfbereich | Nachweis vor Go | No-Go-Signal |
|---|---|---|
| Zugangsdaten | Testlauf mit absichtlich ungültigem oder eingeschränktem Schlüssel | Schlüssel erscheint in Ausgabe, Datei oder Protokoll |
| Dateisystem | Positiv- und Negativtest für erlaubte und verbotene Pfade | Agent liest oder verändert nicht vorgesehene Dateien |
| Netzwerk | Lauf mit erlaubtem Ziel und Lauf ohne Netzfreigabe | Fehler bleibt unklar oder Verbindung wird unerwartet aufgebaut |
| Werkzeugrechte | Getrennte Prüfung für Lesen, Schreiben und externe Aktionen | Ein Werkzeug besitzt pauschale Systemrechte |
| Sensible Daten | Synthetische oder anonymisierte Eingaben | Produktive Personen- oder Geheimdaten werden zum Test verwendet |
| Löschung | Nachweis, dass temporäre Artefakte entfernt oder korrekt verwaltet werden | Unklarer Speicherort oder unklare Aufbewahrung |
Die offizielle Beschreibung von Computer-Umgebungen durch OpenAI ist für die begriffliche Einordnung hilfreich, ersetzt aber nicht diese anwendungsbezogene Abnahme. Prüfen Sie deshalb die aktuellen Hinweise zu Computer-Umgebungen gegen Ihre konkrete Implementierung.
Wiederholbarer Erstlauf
Ein einzelner erfolgreicher Demo-Lauf ist kein Abnahmenachweis. Er kann durch einen bereits installierten Paketstand, ein vorhandenes Arbeitsverzeichnis oder eine zufällig verfügbare Netzwerkverbindung begünstigt worden sein. Für die erste Prüfung benötigen Sie ein kleines, reproduzierbares Testpaket mit festgelegter Eingabe, erwarteter Ausgabe und absichtlich eingebauten Fehlersituationen.
Wie behandelt man Abhängigkeiten und persistente Dateien in OpenAI Hosted Sandboxes?
Behandeln Sie jede Ausführung zunächst so, als könne die Umgebung leer, neu gestartet oder verändert worden sein. Ermitteln Sie, welche Abhängigkeiten beim Start installiert werden müssen, wie lange diese Installation dauert, aus welcher Quelle sie stammt und ob die Installation nach einem Neustart erneut erforderlich ist. Speichern Sie wichtige Ergebnisse nicht nur in einem flüchtigen Arbeitsverzeichnis. Prüfen Sie ausdrücklich, wie Artefakte exportiert, erneut geladen und einem Auftrag eindeutig zugeordnet werden.
Führen Sie den Erstlauf in dieser Reihenfolge durch:
- Eingang festlegen: Verwenden Sie eine unveränderliche Testdatei und notieren Sie deren Prüfsumme oder eine andere eindeutige Kennung.
- Umgebung leeren: Starten Sie den Test ohne stillschweigend vorausgesetzte Dateien, Pakete oder Umgebungsvariablen.
- Abhängigkeiten installieren: Protokollieren Sie Paketquellen, Versionsauflösung, Installationsfehler und die Reaktion auf eine nicht erreichbare Quelle.
- Einstiegspunkt aufrufen: Starten Sie das Skript oder den Agenten über denselben definierten Einstiegspunkt, den später die Plattform verwendet.
- Zwischenergebnisse erzeugen: Lassen Sie mindestens ein Zwischenartefakt und ein endgültiges Ergebnis entstehen. Beide müssen einem Auftrag zugeordnet werden können.
- Negativfall auslösen: Verwenden Sie eine beschädigte Datei, ein fehlendes Paket oder eine ungültige Eingabe und prüfen Sie, ob der Fehler verständlich endet.
- Neustart wiederholen: Unterbrechen Sie den Ablauf und starten Sie ihn erneut. Entscheiden Sie, ob der Auftrag von vorn beginnt, sicher fortgesetzt oder als unvollständig markiert wird.
- Download prüfen: Laden Sie das Ergebnis außerhalb der Sandbox herunter und kontrollieren Sie Dateiname, Inhalt, Vollständigkeit und Zugriffsberechtigung.
Die Agents-SDK-Dokumentation beschreibt Ausführung und Laufzeitkonfiguration; für die operative Prüfung sollten Sie zusätzlich die Dokumentation zum Ausführen von Agents heranziehen. Entscheidend ist der beobachtbare Nachweis: Sie müssen nach dem Test sagen können, welche Eingabe verarbeitet wurde, welcher Werkzeugaufruf erfolgte und welches Artefakt daraus entstanden ist.
Graustufenbetrieb und Fehlerwiederherstellung
In der Graustufe sollte der Agent echte Abläufe durchlaufen, aber noch keine irreversiblen externen Änderungen ausführen. Lassen Sie ihn beispielsweise einen Schreibvorgang vorbereiten, validieren und als kontrolliertes Ergebnis ausgeben. Erst nachdem die Prüfungen bestanden sind, darf ein separates, eng begrenztes Werkzeug die Änderung durchführen.
Prüfen Sie drei Netzwerksituationen:
- Kein Netzwerk: Der Agent muss mit einer klaren Fehlermeldung abbrechen, ohne endlos zu wiederholen.
- Begrenztes Netzwerk: Nur definierte Ziele sind erreichbar; unerlaubte Ziele müssen erkennbar abgewiesen werden.
- Externer Dienst verfügbar: Timeout, ungültige Antwort, langsame Antwort und vorübergehender Fehler werden getrennt getestet.
Danach testen Sie die Lebenszyklusfehler. Dazu gehören ein abgelaufener Auftrag, ein Prozessabbruch, eine doppelte Übermittlung, ein unvollständiges Artefakt und ein Fehler nach erfolgreicher Teilverarbeitung. Für jeden Fall brauchen Sie eine Entscheidung: sicher wiederholen, manuell prüfen, von einem gespeicherten Zwischenstand fortsetzen oder den Auftrag endgültig abbrechen.
Woran erkennt man, dass ein Cloud-Agent die Produktionsreife für Codeausführung noch nicht erreicht hat?
Wenn ein Fehler zwar technisch auftritt, aber weder Auftrag, Eingabe, Werkzeugaufruf noch Zwischenprodukt eindeutig zugeordnet werden können, ist die Abnahme nicht bestanden. Gleiches gilt, wenn ein erneuter Versuch doppelte externe Änderungen erzeugen kann oder wenn niemand feststellen kann, ob eine Datei vollständig geschrieben wurde.
Protokolle und Kostenkontrollen
Vor dem produktiven Start definieren Sie ein Mindestformat für Ereignisse. Ein brauchbares Protokoll enthält mindestens eine Auftragskennung, Agenten- oder Workflow-Version, Zeitpunkte, Werkzeugname, Eingabe- und Ausgabestatus, Fehlerklasse, Wiederholungsstatus und Verweise auf erzeugte Artefakte. Speichern Sie keine geheimen Schlüssel und nicht mehr personenbezogene Inhalte als für Fehleranalyse und Nachweis erforderlich sind.
OpenAI stellt für das Agents SDK Tracing- und Nutzungsfunktionen bereit. Die offizielle Tracing-Dokumentation und die Dokumentation zur Nutzungserfassung sollten Sie mit Ihrer eigenen Protokollarchitektur abgleichen. Tracing ist kein Ersatz für Ihre Geschäfts- und Sicherheitslogs: Sie müssen zusätzlich festlegen, welche Ereignisse für Freigabe, Revision, Datenschutz und Incident Response benötigt werden.
Legen Sie vor der Freigabe harte Grenzen fest:
- maximale Laufzeit je Auftrag;
- maximale Zahl paralleler Aufträge;
- erlaubte Wiederholungen pro Werkzeug;
- Begrenzung für Eingabe-, Zwischen- und Ausgabedateien;
- Abbruch bei fehlender Aktivität;
- Alarm bei ungewöhnlicher Fehlerrate;
- Budget- und Verbrauchsgrenzen nach den aktuell gültigen OpenAI-Preisangaben.
Da Preise, Ressourcen, Regionen und Schnittstellen sich ändern können, sollten Sie für Ihre Abnahme keine statischen Beträge aus einem Blogartikel übernehmen. Prüfen Sie die jeweils aktuelle Produkt-, Preis- und SDK-Dokumentation und speichern Sie den Prüfzeitpunkt in Ihrem internen Abnahmeprotokoll. Ein Kostenalarm ohne automatische Begrenzung ist dabei nur eine Beobachtung, keine Schutzmaßnahme.
Produktionsentscheidung nach dem Graustufenlauf
| Entscheidung | Weiter mit Hosted Sandbox | Eigene Sandbox oder VPC prüfen | Cloud-Mac-Umgebung prüfen |
|---|---|---|---|
| Daten | Synthetisch, anonymisiert oder klar begrenzt | Sensible Daten mit strengen Isolationsvorgaben | Dateien benötigen eine kontrollierte Entwicklungsumgebung |
| Netzwerk | Wenige definierte externe Ziele | Private Endpunkte oder komplexe Routingregeln | Zugriff auf macOS-spezifische Entwicklungs- und Testabläufe |
| Prozess | Wiederholbar und kurzlebig | Lang laufende, zustandsbehaftete Prozesse | Interaktive oder systemnahe Arbeitsschritte |
| Schreibrechte | Vorschläge und kontrollierte Artefakte | Direkte Änderungen in kritischen Systemen | Entwicklung, Build und Tests mit macOS-Abhängigkeiten |
| Nachweis | Logs und Artefakte eindeutig zuordenbar | Erweiterte Audit- und Compliance-Anforderungen | Zusätzliche Trennung von Benutzern, Dateien und Zugangsdaten |
| Betrieb | Schnelle Validierung oder begrenzte Graustufe | Feste Infrastruktur- und Netzwerkverantwortung | Remote-Entwicklung mit physisch oder systemseitig gebundenen Werkzeugen |
Wenn Sie für eine kontrollierte Entwicklungsumgebung einen Mac benötigen, können Sie die verfügbaren Mac-mini-Mietoptionen von Kvmzen mit Ihrer eigenen Sandbox-Planung vergleichen. Der Vergleich ist besonders relevant, wenn Ihr Agent nicht nur isolierten Code ausführen, sondern macOS-spezifische Build-, Test- oder Entwicklungsabläufe abdecken soll.
Go-/No-Go-Abnahme
Markieren Sie einen Punkt erst dann als bestanden, wenn ein beobachtbarer Nachweis vorhanden ist. „Im Demo-Lauf funktioniert“ genügt nicht.
- [ ] Die Aufgabe ist als Codeausführung, Dateiverarbeitung, Datenaufbereitung oder externe Systemaktion klassifiziert.
- [ ] Für die Aufgabe ist dokumentiert, warum eine Hosted Sandbox genügt oder warum eine andere Umgebung erforderlich ist.
- [ ] Jede technische Identität besitzt nur die für den Test notwendigen Rechte.
- [ ] Schlüssel werden nicht im Quelltext, Prompt, Artefakt oder Log gespeichert.
- [ ] Erlaubte Verzeichnisse sowie verbotene Pfade wurden mit Positiv- und Negativtests geprüft.
- [ ] Sensible Testdaten wurden entfernt, anonymisiert oder durch synthetische Daten ersetzt.
- [ ] Abhängigkeiten lassen sich aus einer dokumentierten Quelle reproduzierbar installieren.
- [ ] Ein leerer Start ohne vorausgesetzte Dateien wurde erfolgreich geprüft.
- [ ] Eingabe, Zwischenartefakt und endgültige Ausgabe sind einem Auftrag zugeordnet.
- [ ] Download, Neustart und unvollständige Ausgabe wurden getestet.
- [ ] Kein Netzwerk, begrenztes Netzwerk und erlaubter externer Zugriff haben unterschiedliche Testergebnisse erzeugt.
- [ ] Timeout, Abbruch, Wiederholung und doppelte Übermittlung sind definiert.
- [ ] Logs enthalten die für Betrieb und Audit notwendigen Ereignisse, ohne Geheimnisse zu verraten.
- [ ] Laufzeit, Parallelität, Wiederholungen, Speicherverbrauch und Kosten werden begrenzt oder überwacht.
- [ ] Es gibt eine Rückfallentscheidung für eigene Sandbox, VPC oder Cloud-Mac-Umgebung.
- [ ] Eine verantwortliche Person hat die Freigabe mit Datum, Version und Testnachweisen dokumentiert.
Bestehen kritische Punkte nicht, lautet die Entscheidung No-Go. Dann sollten Sie nicht einfach weitere Modellanweisungen ausprobieren. Begrenzen Sie zuerst Rechte, Eingaben und Netzwerk, wiederholen Sie den Test mit einem reproduzierbaren Fall und entscheiden Sie anschließend, ob die Hosted Sandbox die Aufgabe weiterhin tragen kann.
Für Teams, die ihre Agenten nicht nur testen, sondern dauerhaft betreiben, lohnt sich außerdem eine getrennte Prüfung von Agent-Berechtigungen und Produktionsabläufen auf Cloud-Mac-Umgebungen. Dabei sollten Sie nicht nur die Rechenumgebung, sondern auch Schlüsselverwaltung, Dateitrennung, Sitzungsende und Protokollzugriff vergleichen.
Wenn Sie derzeit eine unkontrollierte lokale Umgebung, einen gemeinsam genutzten Server oder eine allgemeine Cloud-Ausführung einsetzen, liegen die Schwächen häufig bei fehlender Rechteisolierung, unklarer Dateipersistenz, schwer nachvollziehbaren Wiederholungen und uneinheitlichen Logs. Eine gemietete Mac-Umgebung von Kvmzen kann für zeitlich begrenzte Tests, reproduzierbare Entwicklungsaufgaben und kontrollierte Agent-Läufe die passendere Option sein, wenn Sie macOS-spezifische Abläufe benötigen. Für dauerhaft hohe Last, besondere Netzwerkvorgaben oder zwingende physische Schnittstellen sollten Sie dagegen eine eigene Infrastruktur weiter prüfen.
Laden Sie sich die Abnahmepunkte nicht nur als Dokument herunter, sondern führen Sie den kleinsten realistischen Agentenlauf vollständig durch: mit eingeschränkten Rechten, absichtlich fehlendem Netzwerk, einem fehlerhaften Artefakt und einem simulierten Neustart. Erst wenn jeder Zustand nachvollziehbar bleibt, können Sie entscheiden, ob OpenAI Hosted Sandboxes für Ihre nächste Graustufe genügen oder ob eine eigene Sandbox, VPC oder Cloud-Mac-Umgebung die verlässlichere Betriebsgrundlage ist.
