Agentic AI im Unternehmen: Chancen, Grenzen und Einführung
Agentic AI bezeichnet KI-Systeme, die nicht nur einzelne Anfragen beantworten, sondern eigenständig planen, Werkzeuge aufrufen, Zwischenergebnisse bewerten und mehrere Schritte hintereinander ausführen, um ein Ziel zu erreichen, mit weniger menschlicher Steuerung pro Einzelschritt als bei einem festen Workflow. Ein Agent reagiert dynamisch auf das, was er unterwegs vorfindet, statt einem starren Ablauf zu folgen. Für Unternehmen zählt deshalb nicht das Etikett agentisch, sondern wie viel Autonomie ein System in welchem Rahmen tatsächlich bekommt.
Das Wichtigste in Kürze:
- Agentic AI heißt: Ein System plant und führt mehrere Schritte selbst aus.
- Geeignet sind Aufgaben mit prüfbarem Ergebnis, echten Zwischenschritten und tolerierbarem Fehlerfall.
- Autonomie steuerst du über 4 Hebel: Werkzeuge, Freigaben, Datenreichweite, Auftragsschärfe.
- Ohne benannte Verantwortung, Berechtigungspflege und Monitoring bleibt jeder Agent ein Experiment.
Ein Kundenservice-Postfach, das Anfragen nicht nur kategorisiert: Es schlägt selbstständig im CRM nach, erstellt einen Entwurf und sucht bei Unklarheit in der Wissensdatenbank weiter. Erst dann schlägt es eine Antwort vor. Um diesen Unterschied geht es in diesem Artikel. Nicht ein cleverer Chatbot, sondern ein System, das mehrere Schritte selbst plant und ausführt, um zu einem Ergebnis zu kommen.
Genau das macht Agentic AI für Geschäftsführung, Operations, IT und Fachbereiche in KMU interessant und unbequem zugleich. Interessant, weil Aufgaben automatisierbar werden, die bisher zu variabel für starre Workflows waren; unbequem, weil mit mehr Autonomie auch mehr Unsicherheit kommt. Was tut das System, wenn es auf einen Fall trifft, den niemand vorgesehen hat? Und wer trägt die Verantwortung, wenn ein Agent eine falsche Aktion ausführt, statt nur einen falschen Text zu schreiben? Beides gehört auf den Tisch.
Dieser Artikel ordnet Agentic AI ein. Er zeigt, welche Aufgaben sich eignen, welche Architektur und Organisation es braucht und wo die Grenzen liegen.
Begriffe: Agent, Workflow, Autonomie
Diese 3 Begriffe werden in der Praxis oft vermischt.
-
Workflow-Automatisierung folgt einem festen, vorher definierten Ablauf: wenn A, dann B, dann C. Der Ablauf ändert sich nicht, egal was im Detail passiert; lediglich Verzweigungen sind vorgesehen.
-
Ein KI-Agent setzt an bestimmten Stellen Urteilsvermögen ein. Er entscheidet, welches Werkzeug er als Nächstes braucht, bewertet ein Zwischenergebnis und passt seinen nächsten Schritt daran an. Das Ziel ist vorgegeben, der Weg dorthin nicht vollständig.
-
Autonomie ist keine Eigenschaft, die ein System hat oder nicht hat, sondern eine Stufe: Wie viele Schritte darf ein Agent ohne Rückfrage ausführen, bevor ein Mensch eingreift? Das ist die entscheidende Stellschraube für dieses ganze Thema.
Die genaue Abgrenzung zwischen Agent, Workflow und klassischem Chatbot vertiefen weitere Artikel in unserem Themen-Cluster KI-Agenten. Hier bleibt es beim Vorgehen für den konkreten Unternehmenseinsatz.
Was bedeutet Agentic AI?
Agentic AI beschreibt keine neue Modellgeneration, sondern eine Betriebsart. Ein Sprachmodell bekommt Werkzeuge und ein Gedächtnis für Zwischenschritte. Damit arbeitet es in einer Schleife aus Wahrnehmung, Planung und Handlung. Es beobachtet den aktuellen Zustand, plant den nächsten Schritt, führt ihn aus und bewertet das Ergebnis, bevor es weitermacht. Genau das unterscheidet einen Agenten von einem klassischen Workflow, der einer vorher festgelegten Kette von Schritten folgt. Auch das Bitkom-Whitepaper zur Sicherheit von KI-Agenten (Dezember 2025) beschreibt Agenten über ihre Autonomiegrade, nicht über eine neue Technologiekategorie.
Wichtig für die Einordnung im Unternehmenskontext: Agentic AI ist eine Verstärkung bestehender Risiken, keine grundsätzlich neue Kategorie. Ein Agent mit Werkzeugen und eigener Handlungsfähigkeit hat einen eigenen Aktionsradius; er kann lesend und schreibend auf Systeme zugreifen, nicht nur Text erzeugen. Fehler eines Agenten sind deshalb potenziell wirkungsvoller als Fehler eines reinen Textgenerators. Sie schlagen sich in einer tatsächlichen Aktion nieder, nicht nur in einer falschen Formulierung.
Für die praktische Einordnung reicht ein einfaches Kriterium. Plant ein System mehr als einen Schritt selbst, wählt es Werkzeuge selbst aus und arbeitet es auf Basis von Zwischenergebnissen weiter? Dann sprechen wir von einem Agenten, unabhängig vom Marketingbegriff, den ein Anbieter dafür verwendet. Mehr braucht es nicht.
Welche Aufgaben sind geeignet?
Nicht jede Aufgabe profitiert von zusätzlicher Autonomie. Ich prüfe Kandidaten in meiner Arbeit anhand von 3 Fragen, bevor ich über Architektur spreche.
Ist das Ergebnis prüfbar? Aufgaben mit eindeutig prüfbarem Ergebnis eignen sich deutlich besser als Aufgaben mit unklaren Erfolgskriterien. Prüfen kann ein Mensch oder ein automatisierter Test. „Finde alle offenen Rechnungen über 90 Tage und erstelle eine Zusammenfassung“ ist prüfbar. „Verbessere unsere Kundenkommunikation“ ist es nicht.
Wie teuer ist ein Fehler? Ein Agent, der eine interne Recherche falsch zusammenfasst, kostet Nacharbeit; ein Agent, der eine falsche Bestellung auslöst oder eine fehlerhafte E-Mail an Kund:innen verschickt, kostet mehr. Je höher der potenzielle Schaden, desto enger muss die Freigabe gestaltet sein. Im Extremfall bleibt nur eine reine Vorschlagsfunktion ohne eigenständige Ausführung.
Braucht die Aufgabe echte Zwischenentscheidungen? Ist eine Aufgabe in Wahrheit ein linearer Ablauf (erst A, dann B, dann C), ist ein deterministischer Workflow oft die bessere, wartungsärmere Lösung. Agenten lohnen sich dort, wo der Weg zum Ziel vorher nicht vollständig feststeht: Recherche über mehrere Quellen, Abgleich zwischen Systemen mit uneinheitlicher Datenlage, mehrstufige Bearbeitung variabler Anfragen.
Typische Einstiegskandidaten in KMU sind interne Fälle wie diese:
- Interne Recherche und Zusammenfassung über mehrere Dokumente oder Systeme hinweg.
- Abgleich und Anreicherung von Datensätzen aus verschiedenen Quellen.
- Mehrstufige Vorprüfung eingehender Anfragen (Kategorisierung, Prioritätseinschätzung, Entwurf) vor menschlicher Freigabe.
Gemeinsam ist diesen Fällen: internes Wirkungsfeld, prüfbares Ergebnis, und ein Mensch prüft vor jeder Wirkung nach außen.
Welche Architektur ist nötig?
Ein Agentensystem im Unternehmenseinsatz besteht aus 4 Bausteinen. Jeder wird getrennt betrachtet und getrennt abgesichert.
-
Planungsinstanz: das Sprachmodell, das den nächsten Schritt bestimmt. Es braucht einen klaren Systemauftrag, der Ziel und Grenzen definiert.
-
Werkzeuge: definierte Schnittstellen zu Systemen wie Datenbank, CRM, E-Mail oder Suche. Jedes Werkzeug wird einzeln berechtigt; ein pauschaler Vollzugriff ist tabu.
-
Gedächtnis: der Zwischenspeicher für Kontext und bisherige Schritte innerhalb eines Auftrags. Die Reichweite bleibt begrenzt, ohne unkontrollierte Anreicherung mit sensiblen Daten.
-
Ausführungs- und Kontrollschicht: das Protokoll, das festhält, was ausgeführt wurde, und Freigaben erzwingt. Dazu gehören Nachvollziehbarkeit im Nachhinein sowie definierte Stopp- und Eskalationspunkte.
Eigene Architekturübersicht Philogic Labs, abgeleitet aus Umsetzungsprojekten. Kein vollständiges technisches Referenzmodell, sondern die 4 Punkte, an denen in der Praxis am häufigsten etwas übersehen wird.
Der in der Praxis am meisten unterschätzte Baustein ist die Kontrollschicht. Ohne sie fliegst du blind. Ein Agent, dessen Aktionen im Nachhinein nicht nachvollziehbar sind, ist im Unternehmenseinsatz nicht seriös betreibbar; das gilt unabhängig davon, wie gut das zugrundeliegende Modell rechnet. Bitkom benennt in seinem Whitepaper zur Sicherheit von KI-Agenten genau diesen Punkt. Granulare, rollenbasierte Zugriffskontrolle und transparente Dokumentation des Systemverhaltens gehören zu den zentralen Schutzmaßnahmen, nicht zu optionalen Extras.
Praktisch heißt das für den Einstieg: Kein Agent bekommt mehr Werkzeugzugriff, als die konkrete Aufgabe erfordert. Ein Recherche-Agent braucht keinen Schreibzugriff auf ein CRM; ein Kategorisierungs-Agent für eingehende Anfragen braucht keinen Zugriff auf Personalakten. Diese Trennung klingt banal, wird aber regelmäßig übersprungen. „Einmal alles anbinden“ wirkt kurzfristig bequemer als saubere Abgrenzung pro Anwendungsfall.
Wie begrenzt man Autonomie?
Autonomie ist der zentrale Hebel, über den du Nutzen und Risiko eines Agenten steuerst. Es gibt 4 Stellschrauben, die sich unabhängig voneinander justieren lassen.
-
Werkzeugumfang. Welche Systeme darf der Agent überhaupt ansprechen: lesend, schreibend, beides? Je enger, desto geringer der maximale Schaden im Fehlerfall.
-
Freigabepunkte. Bei welchen Aktionen ist eine menschliche Bestätigung zwingend, bevor etwas wirkt? Typische Beispiele sind der Versand einer E-Mail, das Anlegen eines Datensatzes und finanzielle Transaktionen. Human-in-the-loop an den kritischen Stellen ist der wirksamste einzelne Hebel, den du hast.
-
Datenreichweite. Auf welche Datenbereiche darf der Agent zugreifen, und wie lange behält er Informationen im Kontext eines Auftrags? Sensible oder personenbezogene Daten gehören nur dort hinein, wo es für die Aufgabe zwingend nötig ist.
-
Auftragsschärfe. Wie eng ist das Ziel formuliert? „Beantworte Kundenanfragen selbstständig“ lässt viel Interpretationsspielraum. „Erstelle einen Antwortentwurf für Anfragen zu Lieferzeiten und markiere alles andere zur manuellen Bearbeitung“ lässt wenig.
Diese 4 Hebel lassen sich zu einer einfachen Stufenlogik kombinieren, die sich für die interne Abstimmung eignet:
-
Stufe 1, Vorschlag: nur lesender Werkzeugzugriff, Freigabe immer und für jede Ausgabe. Typisch für Entwürfe, Zusammenfassungen und Klassifizierung.
-
Stufe 2, begrenzt autonom: lesend plus eng begrenzt schreibend, Freigabe bei definierten kritischen Aktionen. Typisch für interne Datenpflege und Vorsortierung mit Ausnahmefällen.
-
Stufe 3, weitgehend autonom: lesend und schreibend in klar abgegrenztem Bereich, Freigabe nur bei Eskalation oder Ausnahmefall. Typisch für interne Workflows mit geringem Einzelschaden und guter Beobachtbarkeit.
Eigene Stufenlogik Philogic Labs. Für die meisten KMU-Einstiegsfälle ist Stufe 1 oder 2 der richtige Startpunkt; Stufe 3 gehört an den Anfang eines Projekts fast nie.
Das BSI ordnet diese Vorsicht in seiner Einschätzung zu generativen KI-Modellen grundsätzlich ein. Die Modelle bringen neue IT-Sicherheitsrisiken mit sich und können bekannte Bedrohungen verstärken. Eine systematische Risikoanalyse vor dem produktiven Einsatz ist entsprechend keine Formalität, sondern die Grundlage für einen vertretbaren Betrieb.
Welche Organisation braucht es?
Technik allein macht einen Agenten nicht kontrollierbar. Aus meiner Erfahrung sind 3 organisatorische Elemente nicht verhandelbar, bevor ein Agent produktiv geht.
Benannte Verantwortung pro Agent. Jeder produktive Agent braucht eine Person, die für sein Verhalten geradesteht. Nicht abstrakt „die IT“, sondern ein konkreter Name, der Freigaben erteilt, Auffälligkeiten meldet und über Anpassungen entscheidet. Ohne diese Zuordnung verwässert Verantwortung genau in dem Moment, in dem sie gebraucht wird: wenn etwas schiefläuft.
Geklärte Berechtigungsvergabe. Wer entscheidet, welches Werkzeug ein Agent bekommt, und wer prüft das regelmäßig nach? Berechtigungen, die einmal vergeben und nie wieder geprüft werden, sind ein wachsendes Risiko. Das gilt besonders, wenn sich Aufgaben und Systemlandschaft über die Zeit verändern.
Monitoring und Eskalationsprozess. Wer sieht, was ein Agent tatsächlich tut, und was passiert, wenn er wiederholt falsch oder ungewöhnlich handelt? Ein Protokoll, das niemand ansieht, ist keine Kontrolle. Für den Einstieg reicht eine einfache, aber verbindliche Regel. Stichproben der Agenten-Aktionen in festem Rhythmus, dazu ein klarer Ansprechpartner für Auffälligkeiten.
Diese 3 Punkte gelten bewusst unabhängig von der Unternehmensgröße. Ein KMU braucht kein KI-Ethikboard, um einen Agenten verantwortungsvoll zu betreiben. Es braucht diese 3 Grundlagen; sonst bleibt jeder Agent ein unkontrolliertes Experiment, egal wie leistungsfähig das zugrundeliegende Modell ist.
Umsetzung: wie man einsteigt
Der Einstieg gelingt am ehesten klein und mit engem Rahmen. Der ambitionierteste Anwendungsfall kommt bewusst nicht zuerst. Klein schlägt spektakulär.
-
Einen Aufgabenkandidaten anhand der 3 Eignungsfragen prüfen: prüfbares Ergebnis, tolerierbarer Fehlerfall, echte Mehrschrittigkeit. Siehe Abschnitt „Welche Aufgaben sind geeignet?“.
-
Autonomiestufe 1 oder 2 wählen. Explizit festlegen, welche Werkzeuge der Agent bekommt und wo eine Freigabe zwingend ist.
-
Verantwortliche Person benennen, bevor der Agent das erste Mal produktiv läuft, nicht danach.
-
Testphase mit engem Scope fahren: eng beobachtet, mit klaren Kriterien, wann die Stufe erhöht oder das Projekt gestoppt wird.
-
Erst nach stabiler Testphase erweitern: mehr Werkzeuge, höhere Autonomiestufe, weitere Anwendungsfälle, jeweils einzeln geprüft statt als Paket.
Zur Werkzeugfrage noch ein Punkt, der in Projekten oft zu früh entschieden wird. Low-Code-Automatisierung mit Agenten-Funktionen oder individuell integrierte Lösung? Das entscheidet sich nicht am Hype, sondern am konkreten Fall. Low-Code eignet sich, wenn Standardanbindungen an gängige Systeme reichen und das Team selbst weiterentwickeln soll.
Eine individuelle Integration lohnt sich dagegen in 2 Situationen: wenn bestehende Systeme keine passenden Standardschnittstellen bieten, oder wenn Nachvollziehbarkeit und Berechtigungssteuerung über das hinausgehen, was ein Standardwerkzeug mitbringt. Beides sind legitime Wege. Die Entscheidung gehört an den Anfang der Umsetzungsphase, nicht ans Ende, weil sie Aufwand und Betriebsverantwortung erheblich beeinflusst.
Wer unsicher ist, ob ein Anwendungsfall für einen Agenten taugt oder besser als klassischer Workflow gelöst gehört: Genau diese Einschätzung ist Teil unseres Beratungsangebots. Ein kostenloses Erstgespräch klärt in kurzer Zeit, ob und wo sich der Einstieg lohnt.
Risiken & Grenzen
Zur ehrlichen Einordnung gehört, wo Agentic AI (noch) nicht die richtige Antwort ist. Diese 4 Punkte sind die häufigsten.
-
Unklare Erfolgskriterien. Wenn niemand im Vorfeld sagen kann, wann ein Ergebnis richtig ist, kann auch niemand prüfen, ob der Agent gut arbeitet. Das ist kein Autonomieproblem, sondern ein vorgelagertes Klärungsproblem.
-
Hoher Schaden bei Fehlern ohne Prüfschritt. Aufgaben mit direkter Wirkung nach außen gehören nicht in hohe Autonomiestufen, solange kein verlässlicher Freigabeschritt existiert. Dazu zählen Kundenkommunikation, finanzielle Transaktionen und rechtlich bindende Erklärungen.
-
Fehlende Beobachtbarkeit. Wenn ein System nicht protokolliert, was es tut und warum, ist nachträgliche Kontrolle unmöglich. Dann ist die Lösung noch nicht einsatzbereit, unabhängig von ihrer fachlichen Qualität.
-
Datenschutz und regulatorischer Rahmen. Sobald ein Agent mit personenbezogenen Daten arbeitet, gelten die üblichen DSGVO-Anforderungen zusätzlich zur technischen Absicherung. Agentensysteme mit hoher Entscheidungswirkung, etwa im Personalwesen, fallen zudem tendenziell in höhere Risikoklassen des EU AI Act.
Zum EU AI Act gilt (Stand Juli 2026, keine Rechtsberatung): Die Verordnung ist seit Februar 2025 gestuft in Kraft. Seit August 2025 gelten Regeln für Modelle mit allgemeinem Verwendungszweck; ab August 2026 wird sie weitgehend anwendbar. Verbindliche Einordnung liefert nur die Europäische Kommission oder rechtliche Beratung im Einzelfall.
Und eine Grenze, die selten ausgesprochen wird: Nicht jede Aufgabe, die ein Agent übernehmen könnte, sollte er auch übernehmen. Ein sauberer, deterministischer Workflow ist oft billiger im Betrieb, leichter zu prüfen und weniger fehleranfällig als ein Agent. Wo der Ablauf tatsächlich feststeht, ist Autonomie ein unnötiges Risiko statt ein Vorteil. Wo genau die Grenze zwischen beiden Ansätzen verläuft, behandeln weitere Artikel in unserem Themen-Cluster KI-Agenten vertiefend.
Checkliste: Agentic AI einführen
Diese 11 Punkte gehören vor den Produktivstart.
-
Der Anwendungsfall hat ein prüfbares Ergebnis, mehrere echte Zwischenschritte und einen tolerierbaren Fehlerfall.
-
Wir haben geprüft, ob ein klassischer, deterministischer Workflow nicht die einfachere und wartungsärmere Lösung wäre.
-
Der Werkzeugzugriff des Agenten ist auf das für die Aufgabe zwingend nötige Minimum begrenzt.
-
Es gibt definierte Freigabepunkte für jede Aktion mit Wirkung nach außen oder mit finanzieller Relevanz.
-
Die Autonomiestufe (1, 2 oder 3) ist bewusst gewählt, nicht die höchste technisch mögliche.
-
Es gibt eine benannte, verantwortliche Person für jeden produktiven Agenten.
-
Jede Aktion des Agenten wird protokolliert und ist im Nachhinein nachvollziehbar.
-
Es gibt einen Rhythmus für Stichprobenprüfung und einen klaren Eskalationsweg bei Auffälligkeiten.
-
Datenschutzrelevante Fragen (personenbezogene Daten, Auftragsverarbeitung) sind vor dem produktiven Start geklärt.
-
Die Einordnung in den EU-AI-Act-Rahmen wurde geprüft, insbesondere bei Entscheidungswirkung auf Menschen.
-
Die Testphase hat klare Kriterien, wann die Autonomiestufe erhöht, unverändert beibehalten oder das Projekt gestoppt wird.
Für die Grundlagen von KI-Agenten und die Abgrenzung zu Workflows und Chatbots lohnt sich der Blick in unser Themen-Cluster KI-Agenten. Wer Teams auf den Umgang mit solchen Systemen vorbereiten will, findet dazu Schulungen.
Häufige Fragen
5 Fragen, kurz beantwortet.
Was bedeutet Agentic AI?
Agentic AI bezeichnet KI-Systeme, die selbstständig planen, Werkzeuge aufrufen, Zwischenergebnisse bewerten und mehrere Schritte ausführen, um ein Ziel zu erreichen, statt nur eine einzelne Anfrage zu beantworten oder einen starren Ablauf abzuarbeiten. Der Unterschied zu klassischer Automatisierung liegt im Grad der Autonomie, nicht in einer neuen Technologiekategorie.
Welche Aufgaben sind für KI-Agenten geeignet?
Am besten geeignet sind Aufgaben mit klar prüfbarem Ergebnis, mehreren Zwischenschritten und tolerierbarem Fehlerfall, etwa Recherche, Datenabgleich oder mehrstufige Bearbeitung interner Anfragen. Ungeeignet sind Aufgaben mit hohem Schaden bei Fehlern, unklaren Erfolgskriterien oder ohne Möglichkeit zur Prüfung vor Wirkung nach außen.
Welche Architektur braucht ein KI-Agent im Unternehmen?
Im Kern: ein Sprachmodell als Planungsinstanz, definierte Werkzeuge mit klaren Schnittstellen, ein Gedächtnis für Zwischenschritte und ein Protokoll für Ausführung und Kontrolle. Wichtig sind außerdem Berechtigungsgrenzen pro Werkzeug und eine Protokollierung, die im Nachhinein nachvollziehbar macht, welcher Schritt warum ausgeführt wurde.
Wie begrenzt man die Autonomie eines KI-Agenten?
Über vier Hebel: welche Werkzeuge ein Agent überhaupt aufrufen darf, welche Aktionen eine menschliche Freigabe brauchen, welche Datenbereiche zugänglich sind und wie eng der Auftrag formuliert ist. Autonomie ist keine Ein-Aus-Entscheidung, sondern eine Stufe, die du pro Anwendungsfall bewusst wählst.
Welche Organisation braucht ein Unternehmen für KI-Agenten?
Mindestens eine benannte Verantwortung pro Agent, eine geklärte Berechtigungsvergabe und einen Prozess für Monitoring und Eskalation, wenn ein Agent falsch handelt. Ohne diese drei Elemente bleibt ein Agent ein unkontrolliertes Experiment, unabhängig davon, wie gut das zugrundeliegende Modell ist.
Quellen
Weiterlesen
2 passende Artikel aus dem Wissen-Bereich.