

Leitplanken statt Spielereien: Warum Assurance-Aufträge kontrollierte KI statt universeller Sprachmodelle brauchen
Eine universell einsetzbare KI kann Examensfragen beantworten. Sie kann Ihnen jedoch nicht sagen, ob Ihre Prüfungsakte zur Freigabe bereit ist. Und erst recht kann sie nicht als verlässlicher Bestandteil Ihrer Prüfungsnachweiskette dienen. Deshalb ist der Unterschied dieser beiden Tools in der Praxis weitaus wichtiger als eine beeindruckende Demo.
Irgendwo in Ihrer Kanzlei hat gerade ein Associate im zweiten Berufsjahr einen generischen KI-Chatbot in einem Browser-Tab geöffnet.
Das ist nicht leichtsinnig, sondern effizient gedacht. Ein Leasingvertrag muss zusammengefasst, eine Angabe im Abschluss eingeordnet und bis zur Mittagspause ein erster Entwurf für den Manager erstellt werden. Das Tool ist schnell, formuliert überzeugend und ist kostenlos.
Es weiß allerdings nicht, an welchem Prüfungsauftrag der Associate arbeitet. Es kennt weder die Wesentlichkeitsgrenze noch die Risiken, die das Team vor drei Wochen dokumentiert hat. Es hat keinen Einblick in das Kontrollumfeld des Vorjahres und ist vor allem nicht dazu verpflichtet, darauf hinzuweisen, wenn es lediglich Vermutungen anstellt. Was auch immer das Tool produziert, landet möglicherweise ohne Quelle, ohne nachvollziehbare Historie und ohne Dokumentation der erfolgten Prüfung in einem Arbeitspapier.
Genau darin liegt das eigentliche KI-Risiko im Assurance-Bereich: in der Governance, nicht in den Fähigkeiten der Technologie.
Leistungsfähigkeit war nie der Engpass
Verabschieden wir uns von der Vorstellung, moderne KI-Modelle seien für professionelle Aufgaben nicht leistungsfähig genug. Sie bestehen Tests auf Hochschulniveau und lösen mehrstufige Problemstellungen. Wenn es allein um ihre grundlegenden Fähigkeiten geht, ist diese Diskussion längst beendet.
Einen Benchmark zu bestehen, ist jedoch etwas anderes, als eine professionelle Beurteilung verlässlich zu unterstützen. Genau in dieser Lücke scheitert der Einsatz von KI in der Abschlussprüfung häufig – und oft unbemerkt. Der Jason Bradley, Vice President für AI and Methodology bei Caseware, selbst ehemaliger Standardsetter, Regulator und Inspektor, bringt es auf den Punkt: Ein Basismodell ohne gezielte Anpassung liefert manchmal akzeptable, manchmal hervorragende und manchmal ausgesprochen schlechte Ergebnisse. Das eigentliche Problem ist nicht die Qualität einer einzelnen Antwort, sondern die fehlende Verlässlichkeit und Konsistenz.
Prüferinnen und Prüfer lernen vom ersten Tag an, kritisch zu hinterfragen. Ein Review-Prozess kann nicht auf gelegentlichen Glanzleistungen beruhen. Er benötigt Ergebnisse, deren Zuverlässigkeit sich verlässlich einschätzen lässt.
Fünf Dinge, die ein generisches LLM grundsätzlich nicht bieten kann
Dies ist keine Kritik an der Leistungsfähigkeit universeller Modelle, sondern eine Beschreibung ihres Konstruktionsprinzips. Ein universeller KI-Assistent arbeitet außerhalb des jeweiligen Prüfungsauftrags. Aus dieser architektonischen Trennung entstehen fünf Lücken, die sich auch durch noch so gutes Prompt Engineering nicht schließen lassen.
- Der Kontext des Prüfungsauftrags fehlt.
Bitten Sie ein generisches Modell, anhand einer Summen- und Saldenliste Risiken zu identifizieren, erhalten Sie vermutlich ein plausibles Ergebnis: Die Vorräte sind um elf Prozent gestiegen, während sich die Margen verschlechtert haben. Beides kann stimmen, ist für sich genommen jedoch wenig aussagekräftig. Dem Modell fehlt die Verknüpfung, die eine erfahrene Prüferin oder ein erfahrener Prüfer beinahe automatisch herstellt: die Verbindung dieser Entwicklung mit den Sitzungsprotokollen, dem Kontrollumfeld des Vorjahres und dem konkreten Risikoprofil dieses Mandanten zum aktuellen Zeitpunkt. Caseware Verity, eine in Caseware Cloud integrierte agentenbasierte KI-Ebene, berücksichtigt den tatsächlichen Kontext des Auftrags, bevor sie eine Aussage trifft: Summen- und Saldenlisten, Jahresabschlüsse, dokumentierte Risiken, Kontrollen, Wesentlichkeit, Auftragsdokumente, Checklisten und die firmeneigenen Wissensdatenbanken.
- Das Modell versteht nicht zuverlässig, wie Standards zusammenwirken.
Öffentlich verfügbare Trainingsdaten enthalten zahlreiche Informationen über Prüfungsstandards. Was darin jedoch nicht zuverlässig abgebildet ist, ist die fachliche Beurteilung der Zusammenhänge zwischen diesen Standards. SAS 145 ist ein gutes Beispiel: ein komplexes Geflecht aus Anforderungen, die fortlaufend aufeinander verweisen. Nur wenige Standards funktionieren isoliert. Diese Wechselwirkungen bleiben im Training eines Basismodells häufig unsichtbar. Die Fachintelligenz von Caseware Verity wird deshalb gezielt durch strukturierte Methodiken und Anweisungen bereitgestellt. So werden sowohl die Zusammenhänge zwischen den Standards als auch die kanzleispezifische Prüfungsmethodik direkt in der Plattform verankert.
- Das Modell kann seine Aussagen nicht zuverlässig belegen.
Für alle, die bereits einen Peer-Review erlebt haben, dürfte spätestens dieser Punkt die Diskussion beenden. Jede KI-gestützte Ausgabe in Caseware Verity ist mit Quellen belegt und nachvollziehbar, bevor sie in die Prüfungsakte übernommen wird. Sie können erkennen, welche Auftragsdaten, Standards oder kanzleiinternen Vorgaben in das Ergebnis eingeflossen sind, und die Quellen prüfen, bevor Sie darauf aufbauen. Ein überzeugend formulierter Absatz eines Chatbots verfügt dagegen mitunter über keinerlei belegbare Herkunft. Eine unbelegte Aussage ist kein Prüfungsnachweis, sondern eine fremde Meinung, die Sie übernommen haben.
- Das Modell kennt Ihr Berechtigungskonzept nicht.
Ihre Prüfungsakte enthält aus gutem Grund klar definierte Rollen, Zugriffsbeschränkungen und Funktionstrennungen. Caseware Verity arbeitet innerhalb der von Ihrer Kanzlei konfigurierten Berechtigungen und Kontrollen. Die Daten der einzelnen Prüfungsaufträge bleiben dabei voneinander isoliert. Ein frei zugänglicher Chatbot in einem Browser-Tab berücksichtigt diese Regeln nicht – weil er nicht einmal weiß, dass sie existieren.
- Das Modell verändert sich, ohne Sie darüber zu informieren.
Öffentlich verfügbare Modelle werden regelmäßig und oft unbemerkt aktualisiert. Ihr Verhalten verändert sich. Ein Prompt, der im März zuverlässig funktioniert hat, kann im Juli ein anderes Ergebnis liefern. Caseware nutzt deshalb ein kontinuierliches Evaluierungsverfahren. Bei jeder Veröffentlichung eines neuen Modells werden Prüfungen als Regressionstests erneut durchgeführt, Veränderungen gemessen und entsprechende Anpassungen vorgenommen. Nur so können Kanzleien darauf einen verlässlichen Review-Prozess aufbauen. In der Beta-Phase erreichte Caseware Verity eine Genauigkeit von 94 Prozent gegenüber einem Goldstandard-Datensatz, der aus realen Nutzungsszenarien entwickelt wurde. Manuelle Abläufe, die zuvor etwa 15 bis 20 Minuten beanspruchten, konnten auf weniger als zwei Minuten reduziert werden.
Die wichtigste Leitplanke: Der Mensch bleibt von Anfang an eingebunden
Ein Gestaltungsprinzip sollte alle Partnerinnen und Partner beruhigen, die mit ihrem Namen für ein Prüfungsurteil einstehen:
Nichts wird in die Prüfungsakte übernommen, bevor es von einem Menschen geprüft und akzeptiert wurde. Dieser Kontrollschritt ist direkt im Produkt verankert und keine Verhaltensrichtlinie, an die sich Mitarbeitende eigenständig erinnern müssen. Caseware Verity stellt Kontext bereit, schlägt Risiken vor, formuliert Entwürfe, weist auf Lücken hin und liefert die zugehörigen Quellen. Die prüfende Person entscheidet, überarbeitet, akzeptiert oder verwirft das Ergebnis. „Die menschliche Urteilsfähigkeit ist unantastbar“, erklärte das Caseware-Team auf der CwX Germany 2026.
Nach dem von Caseware formulierten Maßstab muss vertretbare KI in einem regulierten Umfeld vier Anforderungen erfüllen: Ihre Ergebnisse müssen autorisiert, klar begrenzt, nachvollziehbar und erklärbar sein. Es lohnt sich, den aktuellen KI-Einsatz Ihrer Kanzlei anhand dieser vier Kriterien zu bewerten:
- Autorisiert: Arbeitet das Tool innerhalb der Berechtigungen, die Ihre Kanzlei tatsächlich festgelegt hat?
- Begrenzt: Erfüllt es eine klar definierte Aufgabe innerhalb einer festgelegten Methodik oder kann es sich beliebig in jede Richtung bewegen?
- Nachvollziehbar: Können Sie auch Monate später gegenüber einer kritischen dritten Person belegen, wie ein Ergebnis zustande gekommen ist?
- Erklärbar: Kann die prüfende Person die Herleitung ausreichend verstehen, um die Verantwortung für das Ergebnis zu übernehmen?
Ein universeller Chatbot kann jedes dieser vier Kriterien verfehlen – mitunter deutlich.
Aus diesem Grund bestehen die agentenbasierten Suites aus spezialisierten Agenten und nicht aus einem einzigen vermeintlich allwissenden System: Ein Disclosure Checklist Agent erstellt quellenbasierte Vorschläge, die Sie direkt im Workflow prüfen, überarbeiten, akzeptieren oder verwerfen können. Ein Document Intelligence Agent überträgt Informationen aus Quelldokumenten in Arbeitspapiere. Ein Risk Suggestion Agent schlägt auftragsspezifische Risiken einschließlich der dazugehörigen Begründung vor.
Der klar begrenzte Aufgabenbereich ist kein Nachteil, sondern ein entscheidendes Qualitätsmerkmal. Erst er macht die Ergebnisse wirklich prüfbar.
Sicherheit und Vertraulichkeit: Worauf es Ihren Mandanten ankommt
Vertrauliche Finanzinformationen Ihrer Mandanten gehören nicht in das Eingabefeld eines frei zugänglichen Chatbots. Ihre berufliche Verschwiegenheitspflicht gilt uneingeschränkt, auch wenn sich Aufgaben auf diesem Weg vermeintlich schneller erledigen lassen.
Caseware Verity ist direkt in Caseware Cloud integriert und übernimmt damit deren Sicherheitsarchitektur, anstatt Sicherheit nachträglich als Zusatzfunktion anzubauen. Dazu gehören eine SOC-2-Type-II- und ISO-27001-Zertifizierung, AES-256-Verschlüsselung gespeicherter Daten, TLS-Verschlüsselung bei der Übertragung, eine zentral verwaltete Rotation der Schlüssel, Multi-Faktor-Authentifizierung und rollenbasierte Zugriffskontrollen. Hinzu kommen die Isolation der Daten auf Auftragsebene, die logische Trennung von Mandantendaten, festgelegte Regionen für die Datenhaltung, kontinuierliches Monitoring mit Endpunkterkennung und zentraler Protokollierung, jährliche unabhängige Audits, Penetrationstests sowie ein doppeltes Peer-Review von Codeänderungen. Prompts, Dokumente und Mandantendaten werden nicht für das Training der zugrunde liegenden Large Language Models verwendet.
Vergleichen Sie das mit der ehrlichen Antwort, die viele Kanzleien einem Mandanten auf die Frage geben müssten, was während der letzten Busy Season mit seinen Daten geschehen ist: Wir wissen es nicht genau.
Dahinter steht ein grundsätzlicher Gedanke: Wenn Sie Ihren Mitarbeitenden ein sicheres, freigegebenes und auftragsbezogenes Tool zur Verfügung stellen, ist das eine der wirksamsten Maßnahmen gegen Schatten-KI. Beschäftigte greifen nicht aus Leichtsinn auf nicht genehmigte Tools zurück. Sie tun es, weil die freigegebenen Alternativen ihre Anforderungen bislang nicht ausreichend erfüllen. Lösen Sie dieses zweite Problem, verschwindet das erste weitgehend von selbst.
Die unbequeme Frage
Aktuelle Forschungsergebnisse zeigen, dass KI für US-amerikanische Kanzleien inzwischen zu einer zentralen Technologie geworden ist. Damit verlagert sich die Diskussion von der Frage ihrer Einführung hin zu ihrem verantwortungsvollen und kontrollierten Einsatz. Genau dieser Perspektivwechsel ist entscheidend.
Die Frage ist nicht, ob Ihre Kanzlei KI einsetzt. Sie tut es bereits – unabhängig davon, ob Sie den Einsatz offiziell genehmigt haben.
Die entscheidende Frage lautet: Erfolgt dieser Einsatz kontrolliert, dokumentiert und fachlich vertretbar? Oder erfahren Sie erst beim nächsten Peer-Review, auf welche Weise KI tatsächlich genutzt wurde?
Caseware Verity wurde entwickelt, weil die Antwort auf diese Frage weder dem Zufall noch dem gerade geöffneten Browser-Tab überlassen werden sollte.
Erleben Sie, wie kontrollierte KI innerhalb eines Prüfungsauftrags funktioniert. Demo zu Caseware Verity anfordern →
Frequently Asked Questions
Why isn't a general-purpose AI tool sufficient for audit and assurance work?
General-purpose AI has no access to your engagement context, no knowledge of your materiality threshold or prior-year control environment, and no obligation to disclose when it is guessing. These are structural gaps that prompt engineering cannot close.
What makes Caseware Verity different from a generic chatbot?
Caseware Verity is an agentic AI layer built into Caseware Cloud that reasons across actual engagement data, including trial balances, logged risks, controls, financial statements, and firm methodology, before producing any output. Every output is citation-backed and traceable so reviewers can verify the source before acting on it.
Does AI replace auditor judgment in Caseware Verity?
No. Nothing is written into the engagement file without a human reviewing and accepting it, which is built into the product itself rather than left to policy. Caseware Verity surfaces context, proposes risks, and drafts suggestions, but the reviewer decides, refines, accepts, or overrides every output.
How does Caseware Verity protect client confidentiality?
Caseware Verity is built into Caseware Cloud and includes SOC 2 Type II and ISO 27001 certification, AES-256 encryption, engagement-level data isolation, and defined data-residency regions. Prompts, documents, and client data are not used to train the underlying large language models.
How does Caseware ensure AI outputs remain consistent over time?
Caseware runs a continuous evaluation framework that re-runs assessments as a regression test each time a new model is released, measures what changed, and adjusts accordingly. This allows firms to build a dependable review process rather than relying on outputs that may drift between updates.
Why is shadow AI a risk for audit firms, and how does governed AI address it?
Staff reach for unsanctioned tools not out of carelessness but because no approved alternative is good enough yet. Providing a secure, engagement-aware tool like Caseware Verity eliminates the gap that drives shadow AI use in the first place.









