Die Rechnung kommt später

Shownotes

Lange fühlte sich AI kostenlos an. Zwanzig Euro im Monat, unbegrenzt denken lassen. Dieses Modell kippt gerade. Patrick und Jonas erklären, wie Token-Kosten entstehen, warum die Rechnungen in Unternehmen aus dem Ruder laufen, was der Fall um Claude Fable 5 über die neue Preislogik verrät, und warum Abhängigkeit hier kein Nebeneffekt ist, sondern Geschäftsmodell.

Themen dieser Folge: · Token als Abrechnungseinheit: warum Output vier bis sechs Mal teurer ist als Input · Die aktuelle Preislage 2026 im Vergleich, von Premium bis Budget · Wo Kosten wirklich explodieren: Kontext, agentische Loops, Reasoning-Modelle · Der Fable-Fall: ein Tagesbudget in unter neun Minuten, 1,3 Millionen Token in sieben Minuten · 73 Prozent Kostenüberschreitung, 13-facher Token-Verbrauch seit Anfang 2025 · Tokenmaxxing und warum nur 43 Prozent der Firmen überhaupt AI-Governance haben · Erster Schuss günstig: Abhängigkeit als Geschäftsmodell, nicht als Nebeneffekt · Was Berater damit machen: Kostenoptimierung als eigenes Beratungsprodukt

Quellen und weiterführende Lektüre

Preisangaben ändern sich schnell. Vor jeder Verwendung im Mandantenkontext auf den offiziellen Preisseiten der Anbieter gegenprüfen. Stand: Juli 2026.

· CloudZero: LLM API Pricing Comparison 2026 Laufend aktualisierter Preisvergleich aller großen Modelle. https://www.cloudzero.com/blog/llm-api-pricing-comparison/

· Morph: LLM API Providers 2026, 12 APIs verglichen Preis pro Million Token, Rate Limits und Kontextfenster im Direktvergleich. https://www.morphllm.com/llm-api

· Decrypt: The Internet Is Furious at Anthropic After Claude Fable 5 Release Zusammenfassung der Kritik am Token-Verbrauch von Fable 5. https://decrypt.co/370688/internet-furious-anthropic-claude-mythos-fable-5

· MindStudio: Claude Fable 5 Pricing, Access, and Usage Limits Sachliche Aufstellung der Preisstruktur und der Umstellung auf Usage Credits. https://www.mindstudio.ai/blog/claude-fable-5-pricing-access-usage-limits

· KAIDATA: Enterprise AI Budget Burnout in 2026, Tokenmaxxing Quelle für den Begriff Tokenmaxxing und die Governance-Lücken. https://kaidatagroup.com/insights/enterprises-burned-their-ai-budgets-by-april-now-what

· Correlation One: How to Manage AI Token Costs in the Enterprise, 2026 Playbook Praktische Steuerungsmechanismen: Modell-Routing, Caching, Budget-Guardrails. https://www.correlation-one.com/blog/how-to-manage-ai-token-costs-in-the-enterprise-the-2026-playbook

· MIT: The GenAI Divide, State of AI in Business 2025 Die vielzitierte Studie mit dem 95-Prozent-Befund. https://fortune.com/2025/08/18/mit-report-95-percent-generative-ai-pilots-at-companies-failing-cfo/

· Ciente: AI Cost Management in 2026 Übersicht über versteckte Kostenblöcke jenseits der Token-Rechnung. https://ciente.io/blogs/ai-cost-management

· Let's Data Science: Consulting Firms Shift Toward Outcome-Based AI Fees Marktbefund zu McKinsey, Bain und BCG. https://letsdatascience.com/news/consulting-firms-shift-toward-outcome-based-ai-fees-d0707ad1

Feedback, Widerspruch, eigene Erfahrungen? Schreibt uns. Wir lesen alles und nehmen Themen für spätere Folgen mit.

Transkript anzeigen

00:00:13: Herzlich willkommen bei der neue Berater.

00:00:14: Folge Fünf.

00:00:15: Heute reden wir über Geld, genauer darüber was AI eigentlich kostet und zwar nicht in dem Sinne indem wir das in Folge Einschuhe gemacht haben.

00:00:23: also was passiert jetzt mit unseren Tages setzen?

00:00:26: Und wie können wir überhaupt noch Geld verdienen als Berater?

00:00:28: sondern ganz konkret was steht jetzt auf der Rechnung wenn jemand AI im Unternehmen ernsthaft einsetzt?

00:00:37: ein Thema geworden, das war lange kein Thema.

00:00:39: Also alle die vorher ChatGPT benutzt haben irgendwie als Assistenten kostenlos vielleicht sogar oder mit dem kleinsten Abo und der hatte das Gefühl dass es eine Flatrate.

00:00:50: also man hat so viel das Ding denken lassen für einen wie man wollte und auch für allen möglichen Quatsch benutzen für den es nicht da ist.

00:00:58: aber das ändert sich jetzt gerade so ein bisschen seit einigen Monaten und das schneller als die meisten Unternehmen ihre Budgets anpassen können und auch schneller als wir das gewohnt sind.

00:01:06: Das heißt, wir müssen uns plötzlich disziplinieren!

00:01:09: Aber bevor wir jetzt zu tief einsteigen schon im Intro möchte ich erstmal dich begrüßen.

00:01:13: Hi Jonas und ich bin ganz gespannt was dein Take heute auf das Thema ist.

00:01:17: Ja hi Patrick vielen Dank für das nette Intro.

00:01:19: Es ist genauso wie du sagst also seit ein paar Monaten hat man tatsächlich das Gefühl dass sich hier gerade ein bisschen etwas ändert an der ganzen Sache.

00:01:25: deswegen zur Struktur der Folge heute, was wir machen werden.

00:01:30: Wir werden erst über die Mechanik sprechen.

00:01:31: also wie entstehen diese Kosten überhaupt für Tokens?

00:01:35: Was sind überhaupt Tokens?

00:01:36: ganz wichtig und ich glaube das ist eben ein Fall über dem wir über den wir ganze Branche oder generell einfach jeder der benutzt gerade diskutiert ja und danach werden wir müssen über die Unternebens eben ne Sprechen so und inwiefern wird dieser Ja, wie diese Kostenanpassung eben oder welchen Impact hat diese Kostenantpassung auf Unternehmen?

00:01:59: Die AI schon benutzen.

00:02:00: Diese Enterprise Solutions?

00:02:02: Und zum Schluss die Frage, die uns als Berater am meisten interessiert gerade was machen wir mit dieser Kostenanassung?

00:02:08: Ich möchte noch vorwegschicken bevor wir gleich ins Thema einsteigen das ist jetzt nicht eine Folge gegen AI in der wir sagen Das dicke Ende kommt noch und jetzt ist alles noch so billig Wir werden von einem Drogen dealer abhängig gemacht.

00:02:20: Es ist eine Folge über Kostentransparenz Und das fehlt jetzt gerade an ziemlich vielen Stellen.

00:02:25: Da sieht man auch, wenn man sich anschaut wie in einigen Unternehmen die Kosten für AI explodieren weil offensichtlich nicht genug darüber nachgedacht und nicht genug drüber in den Unternehmen gesprochen wird.

00:02:36: Genau!

00:02:36: Und vielleicht auch nicht genug Safeguards eingebaut wurden um dafür zu sorgen dass eben die Leute nicht mit Fable eine Google Suche machen.

00:02:45: Ja können wir eigentlich loslegen.

00:02:47: Vielleicht gehen wir erstmal ins erste Dass wir über die gleichen Sachen sprechen, denn die meisten Leute sagen immer so Token.

00:02:53: Das stinkt mal klug aber was ist dann eigentlich ein Token genau?

00:02:57: Ja genau also.

00:02:58: das führt uns eben zu dieser ersten These, die wir haben, die eben sagt dass wer diese diese Tokenmechanik eben nicht versteht kann die AI-Kosten überhaupt nicht steuern.

00:03:07: Also weder persönlich noch in seinem Unternehmen.

00:03:10: eben So und ich würde vorschlagen Patrick, dass wir wirklich bei Null anfangen ja Erst mal über Token sprechen.

00:03:17: Was sind Token?

00:03:18: Also im Grunde Token ist eine Abrechnungseinheit, diese Abrechnungseinheit heißt eben Token.

00:03:25: Ein Token isst ein Textbaustein der ist circa vier Zeichen lang und manche kurze Wörter sind ein einziges Token.

00:03:36: Auto zum Beispiel.

00:03:38: Längere Wörther werden dementsprechend in mehrere Wörters zerlegt Ist ein bisschen theoretisch.

00:03:44: jetzt, aber die brauchbarste Faustregel im Grunde für den Alltag lautet eben dass ca.

00:03:48: hundert Token, ca.

00:03:50: seventy-fünf englische Wörter sind.

00:03:52: oder vielleicht noch praktischer für den Zuhörer weil wir alle in Seiten denken eine normale Textseite sind grob sechs bis achthundert Token.

00:04:02: Okay Aber das ist in beide Richtungen.

00:04:05: also das gilt nicht nur von dem Output was ich daraus bekomme Das ist ein Token sondern auch was ich reinschicke.

00:04:11: Das ist eine gute Frage und das führt uns zu einem weiteren grundlegenden Konzept, damit wir das korrekt definieren.

00:04:19: Und zwar ist genau das unterschiedlich teuer was du eben rein schickst.

00:04:23: also was du abschickst wenn man das Chatfenster schreibt sind eben Input Tokens und was hinterher von dem LLM Modell zurückkommt sind eben Output Token.

00:04:34: Du kannst dir vorstellen dass Output-Token deutlich teurer sind.

00:04:38: Typischerweise vier bis sechs Mal so teuer wie der Input.

00:04:42: Ja gut, das ist ja auch klar!

00:04:44: Wenn ich als Berater um wohin gehe und mich quatschen man dann voll, dann kostet es solange, wie ich da sitze.

00:04:49: wenn ich dem aber eine Antwort geben soll und wenn ich wieder wieder komme habe ich ein paar Stunden dran gesessen.

00:04:52: Das ist teurer.

00:04:53: Genau, richtig.

00:04:56: Die Mechanik ist die gleiche.

00:04:57: ... genauso simpel Text erzeugen ist eben rechnintensiver.

00:05:01: So, ob es jetzt dein Gehirn ist oder das Gehirntest des LLMs als eben Text verarbeiten so und... ...das ist auch genau der Hebel den die meisten hier übersehen.

00:05:10: wenn du eben Cloud or OpenAI oder whatever bittest die eben statt fünfzehn Seiten eine Seite zu schreiben spaßst du dir auf der eben auf der toren Seite der Rechnung?

00:05:22: Aber eine Sache die mir auffällt ist natürlich wenn du schon mal... also ich pumpte viel auf Deutsch ist einfach so weil es mir leichter fällt, dass der dann in diesem grau hinterliegten Mitteilung was er so macht das ist häufig auf Englisch Fetching irgendwas keine Ahnung.

00:05:40: Und

00:05:41: ist

00:05:41: das so?

00:05:41: oder ist der das noch übersetzt?

00:05:43: Oder ist das teurer auf Deutsch?

00:05:45: Auf Deutsch brauchst du grundsätzlich mehr Token für denselben Inhalt die Token-Eiser.

00:05:50: und genau der Grund warum dir das aufgefallen ist Bereich eben auf Englisch ist, diese Tokenizer sind eben auf englischen Text trainiert.

00:06:02: Ein Wort wie, weiß ich nicht jetzt so Beispiel Wirtschaftsprüfungsgesellschaft wird eben nicht als Einturken erkannt sondern in vier oder fünf Stücke zerlegt.

00:06:12: Praktisch heißt das derselbe Sachverhalt kostet dich auf Deutsch etwa zwanzig bis dreißig Prozent mehr als auf Englicch bei wenn du jetzt nur einen einzelnen Prompt hast.

00:06:21: es ist relativ egal.

00:06:23: Bei einem Prompt mit tausenden Dokumenten wird daraus wirklich ja, ein wirklicher Unterschied.

00:06:29: Ja

00:06:30: gut wir sehen das auch wenn wir die Aufgabe bekommen die leidige Aufgabe bekommen ach mach mal das Deck dann jetzt nicht auf Englisch sondern wir wollen es auf Deutsch haben weil das mittelständischer Kunde ist und der mag das nicht und sitzt du da und versuchst irgendwie so coole, kleine englische Wörter in die deutsche Monster-Wortsprache zu übersetzen und kommst dann hinten und vorne nicht aus.

00:06:51: Und es ist da plötzlich so eine Riesenübung rausgeworden.

00:06:53: Ja also das spielt auch noch eine Rolle.

00:06:55: Die deutsche Sprache ist einfach ein bisschen sperriger als die Englische.

00:07:00: Damit man mal so einen Gefühl bekommt... Also wir reden hier so von Tokens und Vier Tokens sind ein Wort und sechshundert bis achthundert.

00:07:07: Wie kann man Gefühle bekommen?

00:07:08: über wie viel Geld sprechen wir denn?

00:07:10: Was kostet das?

00:07:12: Was kostet ein Token?

00:07:13: oder was kosten zehn Token?

00:07:16: Lass uns das schnell machen, weil es sind gute Zahlen die doch relativ schnell wieder vergisst.

00:07:19: Weil die extrem modellabhängig sind und die Modelle verändern sich momentan rasend schnell.

00:07:26: Nichtsdestotrotz also der Stand jetzt ist von Mitte-Zwei-Tausend-Sächsenzwanzig.

00:07:30: Und folgend das sind die Listenpreise eben pro Million Token jeweils der Input wir erinnern uns der input ist das was ich reinschreibe und Output ist dass was zurückkommt.

00:07:40: zum Beispiel Cloud Sonnet, Fünf liegt bei drei und fünfzehn Dollar.

00:07:47: Input und Output.

00:07:48: Cloud Opus vier Punkt acht bei fünf für den input und fünfundzwanzig für den output pro Million Token.

00:07:55: wichtig.

00:07:56: GP Team fünf Punkt vier bei zwei ... bei zwei Dollar fünfzig und fünfzehn Dollar.

00:08:05: Und GPT-Fünf Punkt Fünf, bei fünf Dollar Input und dreißig Output.

00:08:10: So am unteren Ende dieser ganzen Tabelle wird es eben dramatisch günstiger.

00:08:14: so das ist so.

00:08:15: JammyNight zwei Punkt Null.

00:08:16: ich glaube Flash liegt bei zehn Cent input und vierzig Cent output.

00:08:20: Das ist aber

00:08:21: auch richtig dumm das Ding oder?

00:08:23: Weiss ich nicht ob's dummes Ich benutze es wirklich relativ wenig Aber definitiv ist es nicht so.

00:08:28: Ich finde, das ist nicht so powerful wie zum Beispiel Opus Fünf.

00:08:33: Also so viel ist sicher.

00:08:34: Also gerade bei dem letzten ist ein Faktor von über hundert zwischen dem teuersten und dem günstigeren Modell.

00:08:38: Wir haben ja grad schon gesagt, wie viele ungefähr token es damit ihr euch vorstellen könnt was eine Million Token ungefähr ausmacht.

00:08:44: Das sind so im Bereich fünfhundert bis zweitausend Buchseiten.

00:08:47: Das heißt wir reden hier von einem richtigen Blauwahl.

00:08:50: Wenn ihr mal einen Buch vor der Brust hattet wo ihr sagt boah tausend Seiten irgendwie Die sollen die Erde keine Ahnung sowas in der Art da seid ihr in den Bereich Du

00:08:58: beziehst dich jetzt auf Bücher.

00:08:59: Das ist halt wichtig, wenn du freie Pons eben schreibst.

00:09:01: aber denk mal bitte an den Fall gerade für Programmierer die Cloud oder AI-Modelle zum Code Review benutzen.

00:09:11: also dann kommst du mal ganz schnell an diese Anzahl an die Token Input Anzahl.

00:09:16: Was heißt das jetzt für unsere typischen Beratungsaufgaben?

00:09:20: Wenn wir jetzt wissen dass theoretisch Tausend Seiten da rausgespuckt werden für zehn Euro.

00:09:25: Lass uns doch mal weiter dein oder das Beispiel mit dem mit den Dokumenten nehmen und lasst du uns exemplarisch einfach mal einen Fall aufhören, wir finden ein Dokument mit fünfzig Seiten so dass sind dann grob dreißig bis vierzig tausend token inputs wenn du das einmal.

00:09:43: Ja, genau.

00:09:44: Wenn du das allerdings nur einmal analysieren lässt und eine zweiseitige Zusammenfassung bekommst kostet dich das bei einem Premium-Modell wie weiß ich nicht Opus vier Punkt acht, Opus fünf vielleicht fünfzehn bis zwanzig Cent.

00:09:57: Das klingt erstmal nach nichts so extrem effizient und relativ günstig.

00:10:03: Das Problem hier wird eben an drei anderen Stellen entstehen.

00:10:07: Erstens, der Kontext wird eben bei jedem Folge prompt wieder mitgeschickt.

00:10:12: Das ist wichtig so das zu verstehen.

00:10:14: Der Kontext und genau der Output von dem vorherigen Input wird bei jedem folge prompt wieder Mitgeschickt.

00:10:21: Bei einer längeren Analyse Session mit zum Beispiel zwanzig Rückfragen bezahlt du diese vierzigtausend Tokens eben zwanziger mal.

00:10:30: Der zweite Punkt sind im Grunde die agentialen Systeme, über die wir auch schon in den vorherigen Folgen gesprochen haben.

00:10:37: Gerade wenn du einen Agent Loop benutzt ist jeder Schritt im Loop sozusagen ein eigener Call mit eigenem Kontext.

00:10:46: Das erzeugt auch noch mal zusätzlichen Output.

00:10:48: Drittens sind eben gerade diese Reasoning-Modelle also Modelle, die intern denken bevor sie antworten und dieses Denken sind eben auch Outboard Talkings, die du bezahlst.

00:10:59: Auch wenn du sie im Grunde nie zu sehen bekommst?

00:11:02: Vielleicht versteht man dann das dieses Loomen und immer wieder neu denken, dass es jedes Mal wieder gelb kostet.

00:11:09: Größer das Modell ist, dass es auch noch teurer wird.

00:11:11: Das hat man vielleicht ganz gut gesehen am Fall von Fable-Fünf... Auch ich glaube das hieß vorher Mythos-Five aber das durften sie dann irgendwie nicht benutzen.

00:11:20: und dann haben Sie's einfach Fable Five getauft und veröffentlicht.

00:11:23: Anthropic hat das ja veröffentlicht!

00:11:25: Und das war zunächst auch für so die normalen User zugänglich für eine Zeit lang kostenlos und jetzt zeigt man das wirklich extra.

00:11:35: also wenn du Fable five nutzen willst zeigst du das außerhalb deines Abos.

00:11:40: Und dann ist aber auch ganz Interessantes passiert, das haben einige vielleicht mitbekommen oder die meisten.

00:11:46: Vielleicht könntest du auch noch mal erklären warum sich denn aus Deiner Sicht dieses Fable-Fünf... Warum ist der so nach hinten losgegangen plötzlich?

00:11:55: Also Antropik hat im Grunde im Sommer zwanzigzehnt sechsundzwanzig eben Fable Five veröffentlicht und das ist wie Du gerade schon gesagt hast ein sehr starkes Modell.

00:12:03: Es gab eben sofort massive Kritik an dem Verbrauch also Torkenverbrauch Bleeping Computer hat es getestet und die kamen eben zu dem Ergebnis, dass das Tagesbudget eines hundert Dollar Cloud Max Abos in unter neun Minuten aufgebraucht war.

00:12:21: Das ist ungefähr doppelt so schnell wie beim Vorgängermodell Opus vier Punkt acht.

00:12:25: So...

00:12:26: Das ist schon nicht schlecht!

00:12:29: Also es gab auch Leute berichtet haben, dass eine Sitzung zum Beispiel von eins Komma drei Millionen Token in weniger als sieben Minuten verbrannt wurden, ja.

00:12:38: Umgerechnet rund hundertsechzig Dollar pro Stunde.

00:12:42: oder muss man sich einfach mal vorstellen?

00:12:45: Hundertsechszig Dollar die Stunde das ist schon so.

00:12:48: in einem Bereich wo man sagen könnte kann ich eigentlich auch wieder einen Menschen für einstellen.

00:12:54: Paus ganz gut also dafür kriegt man in einigen Beratungen Junior Berater zur Seite gestellt.

00:13:01: Ja!

00:13:01: Ist doch jetzt.

00:13:02: in letzter Zeit sieht man ja auch immer wieder so Artikel eher so fannen und klickt clickbaiting, glaube ich.

00:13:09: Aber trotzdem dass man eben sieht, dass die teuersten Modelle mittlerweile so teuer sind... ...dass man dazu übergegangen ist doch wieder Junior Entwickler und so einzustellen.

00:13:21: Ich fand das ganz lustig weil dann Leute sagen ja da sieht man den Clown Circle der ist jetzt... Der Clown Cycle ist jetzt irgendwie komplett... Jetzt sind wir wieder am Anfang.

00:13:30: Ja!

00:13:30: Ich habe das irgendwie ganz anders gesehen.

00:13:32: Ich hab zuerst gedacht So naja is es nicht eher so Dass du jetzt einen Punkt angelangt bist, wo die AI nicht mehr diese stumpfen Sachen macht.

00:13:40: Sondern wo die schon zu gut geworden ist und man dir es bereits schon für bessere Sachen benutzt, die halt auch teurer sind.

00:13:47: Und die wurde quasi promoted ein oder zweimal.

00:13:50: Und rum werden jetzt wieder Leute eingestellt um der AI zu arbeiten.

00:13:54: So sehe ich das eher.

00:13:55: Das ist also fast bisschen dystopischer.

00:13:57: Nicht vom Wegen.

00:13:58: Ja ja lohnt sich alles gar nicht.

00:13:59: wir können wieder zurück zu dem geben was wir vorher gemacht haben.

00:14:03: Versuchen ein bisschen anders die ganze Sache anzugehen also anstelle irgendwie immer das neuste modell für die simpelsten aufgaben zu benutzen.

00:14:11: Dann vielleicht auch wieder so eine modell zurückgehen dass wir von einem jahr benutzt haben oder von dem dreivierteljahr, sodass halt viel nachhaltiger und extrem ökonomischer ist.

00:14:21: Und was du gerade gesagt hast es in Detail sehr interessant.

00:14:26: allein der System prompt von fable umfasst mehrere zehntausend token.

00:14:33: So, wir haben gerade gelernt.

00:14:34: Alles klar!

00:14:34: Zehntausend Token.

00:14:36: Hier ist aber wichtig die werden bei jeder Sitzung mitgezählt.

00:14:39: also bevor du ein einziges Wort geschrieben hast ja dazu kommt eben zum Beispiel das Fable im Abo-Modell.

00:14:46: doppelt gegen die Nutzungsgrenzen zählt also im Vergleich zu Opus.

00:14:51: und dazu noch

00:14:53: Ganz wichtig, dass im Juli-siehntausendsechsundzwanzig Antropic zum Beispiel auf Usage Credits umgestellt hat.

00:14:59: Also zehn Dollar pro Million Input Talkens, fünfzig pro Millionen Output – das liegt deutlich über den regulären API-Listenpreisen.

00:15:08: Das ist jetzt nicht ein Anthropic Problem, es ist ein Muster in der ganzen Branche.

00:15:11: also alle Säußerungen bewegen sich jetzt in diese Richtung.

00:15:14: Also weg von diesen großzügigen Flatrates hin zu verbrauchsbasierter Abrechnung!

00:15:21: Was das zeigt ist, dass eigentlich Faible Fünf... Ich hab's ein bisschen genutzt.

00:15:24: Das war schon gut.

00:15:25: aber habe ich jetzt wirklich bei den Sachen die ich gemacht habe gemerkt, dass es so viel besser ist als das nächstschlechtere Modell was viel billiger ist?

00:15:31: Ne also ich finde der abnehmende Grenznutzen war dann schon spürbar im Vergleich zu den Kosten weißt du und ich finde das wurde sogar nicht so krass diskutiert.

00:15:43: Erklemmer!

00:15:45: Geh da mal rein!

00:15:45: Na ja ich finde ne.

00:15:46: also nehmen wir mal an Du hast zwei Motorräder und Du willst möglichst schnell fahren Und das eine fährt halt so zweihundert siebzig und das andere fährt zweihundneinzig.

00:15:57: Verbraucht aber dreimal so viel Sprit!

00:15:59: Ja, wieviel schneller bist du am Ziel?

00:16:01: Und traust dich überhaupt zu schnell zu fahren und kannst du den überhaupt irgendwo ausfahren für die Sachen, die du fährst, für deine Strecken?

00:16:06: Das sind alles so Fragen, die sich dann stellen und ich glaube in meinem Fall erstens wird es wahrscheinlich nicht im vollen Umfang so nutzen können und überhaupt nicht verstanden, wie gut dass ist.

00:16:16: Aber für mein Gefühl war normalen Aufgaben, das ist ja alles sehr textbasiert was ich mache war da kaum ein qualitativer Mehrwert irgendwie zu erkennen.

00:16:26: Also es waren nicht tausendmal besser als das was ich eingehe also nicht so gut wie es erwartet hätte dafür dass es so teuer ist weißt du?

00:16:32: Ja jetzt zum Beispiel zwei Wochen später haben sie oder drei Wochen später wurde auch Opus fünf released.

00:16:38: Super ist das!

00:16:39: Ja das ist super funktioniert.

00:16:40: wunderbar gerade für Code Review z.B.

00:16:43: Ich sehe da kaum einen Unterschied zu Fable.

00:16:45: definitiv

00:16:47: Es ist sehr teuer, diese großen Modelle zu benutzen.

00:16:49: Und wenn das Ding erst mal losgelaufen ist und man dann schlecht gepromptet hat... ...dann ist man auch überrascht wie schnell der auch mit wahnsinniger Lust einem da die Tokens verballert!

00:16:59: Also es ja nicht so als wenn er sich irgendwie zurückhält sondern hier habe ich mal fünfhundert Vorschläge und ich hab dir das auch noch weiter ausgearbeitet.

00:17:07: Zweifel fragt er nicht nochmal zwischen und dann sieht man ein Output was über das was man eigentlich wollte hinausgeht.

00:17:13: oder man hat vergessen Ach, das Modell runterzustellen oder es zu faul dafür und passiert ja auch.

00:17:20: Ich stelle mir so ein bisschen vor jetzt privat um mal bei dem Auto Beispiel zu sein wenn du Mit dem Auto fährst, da gibts du vielleicht nicht immer Vollgas und tritts den durch.

00:17:34: Und sorgst dafür dass du irgendwie in den oberen Gängen fährest oder im obereren Bereich Sondern fährste vielleicht ein bisschen Sprit-Sparen da.

00:17:40: das machen zumindest viele privat.

00:17:42: aber wenn sie dann Tankkarte von der Arbeit haben oder mit einem Firmenwagen fahren Machen Sie das nicht weil es ja egal ist halt jemand anders.

00:17:47: ich glaube dass viele Mitarbeiter da relativ... Lachs damit umgehen welches Modell sie jetzt benutzen.

00:17:54: also für die Arbeit würde ich mal denken warum soll ich denn hier so schlechteres benutzen?

00:17:58: Nämlich das größte Modell, was mir zur Verfügung gestellt.

00:18:01: Und ich glaube da ist so ein bisschen die Gefahr auch für Unternehmen dass die Kosten sehr schnell aus dem Ruder laufen können.

00:18:06: Da geht es ja eher um EI-Adoption.

00:18:09: oder also gerade in den Unternehmen müssen die Mitarbeiter einfach drauf trainiert werden und ihr müsst einen Trainings erhalten indem klar wird, dass auch wenn du ein älteres Modell für simple Aufgaben verwendest kein schlechteres Ergebnis bekommst als würdest du jetzt fable fünf oder opus fünf dafür verwenden.

00:18:31: So, das ist halt.

00:18:33: dieses Bewusstsein muss geschaffen werden und es geht halt wirklich nur darin dass du aktivist i-Adoption eben in deinem Unternehmen betreibst.

00:18:39: denn ich bin mir sicher wenn Du die Leute fragst warum sie die neuen Modelle verwenden?

00:18:44: Das hast Du ja gerade auch schon gesagt, wie gesagt das liegt daran dass die User glauben dass der Output besser wird.

00:18:51: Der wird für simple Aufgaben nicht besser.

00:18:54: Das kann ich dir wirklich sagen, der wird nicht besser und er dauert sogar noch länger und ist teurer.

00:18:59: Und dieses Bewusstsein muss geschaffen werden.

00:19:01: Also der Mitarbeiter in den Unternehmen muss sich dessen klar sein.

00:19:06: das ist aber definitiv Aufgabe der Unternehmen diese EI-Adoption voranzutreiben und das ist glaube ich so die große Challenge unserer Zeit.

00:19:14: Weißt du was krass ist?

00:19:15: Ich habe mal mit einem gesprochen, der hat eine Beratungsfirma einer Kleinerin gearbeitet.

00:19:18: Die

00:19:19: haben Leaderboards, wo quasi jeden Monat die Liste steht.

00:19:26: Wer hat am meisten Token verbraucht?

00:19:29: Und das ist nicht negativ.

00:19:30: Das ist dann positiv.

00:19:34: Dann bist du der AI-Master wenn du da irgendwie ... Millionen Token verballert hast.

00:19:41: Ja,

00:19:41: von einem halben Jahr vielleicht so für drei oder vier Wochen war das vielleicht sinnvoll und aber jetzt mittlerweile nicht mehr.

00:19:48: also ich würde eher sagen wer arbeitet am effizientesten?

00:19:51: Und wer arbeitet hier im nachhaltigsten?

00:19:53: Wer zwischt zwischen den Modellen und hat verschiedene Agenten mit verschiedenen Modellen gebaut?

00:20:03: Du hast ja auch immer den automatischen Modus, die machen ja auch viele bewusst aus.

00:20:07: So dass das LLM entscheidet welches Modell für die Aufgabe verwendet werden soll.

00:20:14: Den haben Leute ausgeschaltet meinst du?

00:20:16: Ja sehr sicher sogar.

00:20:19: Es ist interessant da es dann so eine komische Auswüchse gibt und plötzlich abgefeiert, dass einer irgendwie ein paar Hundert Millionen Tokens verballert in einem Monat.

00:20:28: Herzlichen Glückwunsch!

00:20:29: Glückwunsch, du bist ein Geldverschmender und außen ein bisschen Umweltverschmutzer.

00:20:32: Ja richtig!

00:20:34: Was haben die da alles gemacht mit?

00:20:35: Naja das war kurzer Exkurs.

00:20:37: also offensichtlich wird dieses Liederbord jetzt nicht mehr so geführt.

00:20:40: vielleicht gibt es immer noch Balls aber die sind wahrscheinlich negativ.

00:20:44: Weil am Ende wirst Du ja an Deinem Output gemessen und wenn Du das dreifache verbrauchst wie Deine Kollegen aber trotzdem nicht irgendwie merklich der High Performer bist ist vielleicht auch nicht so toll.

00:20:52: Also wenn man sich anguckt was Unternehmen berichten die AI kosten heutzutage sie anschauen ist es das die meisten unternehmen sagen dass sie weit überschritten sind also, dass die e-kosten das budget was ihr eingeplant haben weit überschlitten sind und zwar nicht nur so ein bisschen sondern deutlich.

00:21:09: Also der verbrauch ist seit februar zwanzig januar fünfundzwanzig ist der toro vorwoch von anderthalb jahren um einfach das dreizehnfache gestiegen und das ist schon erheblich.

00:21:19: und damit konnte man jetzt glaube ich auch nicht rechnen als Unternehmen deswegen da die bg ist halt irgendwie massiv überüberschriten wurden.

00:21:27: Dazu kommt eben auch noch ein Punkt, der oft übersehen wird den wir aber schon vorher erwähnt haben.

00:21:31: Und da geht es darum um diesen Wechsel von der Flat-Rage zur verbrauchsbasierten Bepreisung und der hat diese realen Kosten erst überhaupt sichtbar gemacht.

00:21:42: Vorher waren sie eben subventioniert so die Anbieter haben eben Marktanteile gekauft und jetzt wo die Nutzung breit ist oder extrem nachgefragt wird wird eben nachjustiert Betriebswirtschaftlich ja völlig nachvollziehbar.

00:21:57: Aber es trifft eben genau in diesem Augenblick die Budgets, die auf den alten Zahlen basieren.

00:22:02: Ja das ist aber auch genau der Punkt wo wir dann abhängig gemacht wurden.

00:22:05: also weil diese Dieser Preiskampf dieser enorme das ist ja nichts was wir nicht kennen.

00:22:11: also jeder, der mal ein bisschen Wirtschaft studiert hat.

00:22:14: Der weiß ganz genau es gibt verschiedene Methoden um in so einen Markt einzutreten und das hat sich neue markt ergeben und da gibt's dann fünf sechs oder noch mehr Unternehmen die da massiv miteinander konkurrieren.

00:22:24: Dann können sie das über Qualität machen die könnte auch mit preis machen oder machen zu beides.

00:22:27: Und dass ist ein Wettlauf erstmal technisch wer ist der beste?

00:22:31: Und zweitens ist es dann aber auch ein Preiskampf.

00:22:34: Also wer kann hier am günstigsten anbieten?

00:22:36: und wir sehen, dass die Firmen ganz massiv den Geld ausgegeben haben um Marktanteile zu bekommen?

00:22:43: Das heißt für jeden Dollar der eingenommen wird werden nur wie zwei Dollar ausgegeben hat glaube ich Sam Ordmann neulich erzählt also die verbrennen Geld und jetzt wird das über irgendwelche IPOs versucht ihr noch reinzuholen.

00:22:55: Aber irgendwann ist das auch vorbei.

00:22:58: der Kapitalmarkt und der Aktienmarkt ist dann doch, auch wenn er schon sehr mit Illusionen arbeitet und mit Hoffnung.

00:23:07: Wenn das Unternehmen nicht irgendwann anfängt jetzt zu verdienen wird es dann glaube ich auch schwierig.

00:23:11: Deswegen wäre noch die Preise dann erhöht und dann zeigt sich wer ist wie abhängig?

00:23:17: Wer hat Haus gehalten, wer hat gearsst mit Tokens oder hatte einfach nur eine Flatrate das probiert.

00:23:23: und dann ist die nächste Phase oder die nächste Frage Wie stark ist es in unsere Workflows implementiert?

00:23:33: Sind wir darauf angewiesen, das jetzt auch zu nutzen.

00:23:36: Ja oder eher gesagt wer hat die AI-Adaption oder die AI Transformation wirklich effizient umgesetzt?

00:23:44: also wenn du immer eine Flatrate hast und die Leute in dieser Zeit die eben genau jetzt gerade gehen, glaube ich gerade ins letzte Drittel.

00:23:52: Wenn du die Zeit nutzt und diese Eidoption eben scharfst – alles klar!

00:23:55: Dann kannst du auch eine verbrauchsbasierten Bepreisung umstellen.

00:24:00: Und wenn nicht?

00:24:01: Dann haste die Zeit halt, ich will nicht sagen vergeudet aber eben nicht effizient genutzt.

00:24:06: Ja, die Frage ist ja auch so ein bisschen Hast Du das so clever eingebaut dass Du nicht von einer Plattform im Spezien abhängig bist weil es ist ja gut möglich, dass dann die eine Plattform sagt wir erhöhen jetzt die Preise Und nicht, dass nicht alle das gleiche Modell haben und du dann theoretisch wechseln wolltest.

00:24:22: Aber es geht nicht, weil du dich so stark mit einer Plattform verwoben hast.

00:24:25: Ja gut!

00:24:26: Das ist ja Marktlogik und das auch im Grunde genau der Kern.

00:24:30: Also ich würde das gar nicht als bösen Plan beschreiben sondern eher als wirksame Marktlogic.

00:24:36: Wenn Du die andere Softwareunternehmen oder andere Softwareanbieter anguckst, die machen das seit Jahrzehnten so... ...und was AI daran besonders macht ist eben die Geschwindigkeit die Tiefe der Einmettung der Prozesse in dem Usage dieser Software.

00:24:52: Wenn deinen Analysten sechs Monate lang mit einem bestimmten Setup oder Software arbeiten, ist der Wechsel auf einen anderen Anbieter nicht nur eine Vertragsfrage, es ist eben eine Umschulung und ein Qualitätsrisiko in laufenden Projekten... Also für jedes Unternehmen das ich kenne erst mal Red Flag ist.

00:25:11: Wir können das jetzt gerade nicht machen?

00:25:14: Ja, sonst würde sich auch nicht so viel Legacy geben in dem Unternehmen.

00:25:18: So sieht es aus!

00:25:19: Wo du denkst, die alten Scheißden könnte doch langsam mal abstellen?

00:25:23: Nee, können wir nicht.

00:25:26: Das ist zu viel Angst davor was anderes zu probieren.

00:25:29: Eine Sache, die habe ich gerade schon angesprochen das ist das sogenannte Token-Maxing.

00:25:35: ein neues Wort wird man wahrscheinlich im Dunken nicht so schnell finden aber macht die Runde und zwar ist das organisative Verhalten Dass man einfach reflexhaft das leistungsfähigste und teuereste Modell für jede Aufgabe nutzt.

00:25:48: Also es gibt kein Governance, es gibt keine Kostentransparenz... Und interessant ist, dass dreiundvierzig Prozent der Organisation überhaupt eine Governance-Richtlinie haben die das bestimmt was man machen kann mit welchem Modell beispielsweise arbeiten kann.

00:26:04: Und bei so Argentinensystem sind sogar nur ein zwanzig Prozent die wirklich also der Unternehmen die von der reifen Governance sprechen können Wobei ich das auch in Frage stellen würde, weil ich mein... Ne Governance aufzubauen zu einem Produkt was gerade erst neu ist.

00:26:18: Das ist schon schwierig.

00:26:20: Genau richtig!

00:26:20: Das glaube ich auch sehr schwierig grade irgendwie.

00:26:24: Agent der AI in dem Unternehmen zu implementieren, dass generell noch gar keine Governance oder AI-Gewernenz hat.

00:26:30: Also es muss erstmal von Grund auf gebaut werden und dann kann man sich über die Lösung unterhalten.

00:26:35: Aber Patrick davon abgesehen gibt's glaub' ich auch noch Kosten, die überhaupt nicht erstmal ... gar nichts mit den Token an sich zu tun haben, oder dem Billing.

00:26:45: Sonst gibt es ja auch noch genug Initiativen wie Trainings... ... oder Datenpipeline-Arbeit die nötig ist damit diese AI Outputs überhaupt erst mal verlässlich werden?

00:26:55: Ich

00:26:56: glaube das ist sogar das teurere.

00:26:58: Es gibt Unternehmensgeberatung, die machen nichts anderes.

00:27:00: ... sei es nicht, jahren Jahrzehnten zu gucken... dass man den Datenfuß irgendwie einheitlich bekommt.

00:27:07: Und das ist immer noch nicht abgeschlossen?

00:27:10: Nee, das ist nicht abgeschlossene!

00:27:11: Diese ganze Governance- und Complianceinfrastruktur muss doch erst mal aufsetzen.

00:27:14: Gerade du, du hast ja extrem viel Erfahrung mit Compliance.

00:27:18: Dazu noch das Changemanagement und diese AI-Adaption eben für Teams,... Das Unternehmen dazu bringen und die Teams dazu zu bringen, dass sich ihre Arbeitsabläufe verändern.

00:27:29: Dazu kommt dann auch, wir wollen gar nicht über Redo... aber es sprechen ja bei verschiedenen Abteilen ohne zentrale Beschaffung, ihre eigenen AI-Tools kaufen.

00:27:36: Das heißt jetzt in den großen Enterpriseunternehmen vielleicht nicht, aber in der kleinen Sicherheit.

00:27:40: Also ich kann dir nur sagen, Schatten IT ist überall immer schon ein Problem gewesen.

00:27:46: Ich glaube im AI-Bereich ist das wahnsinnig hoch!

00:27:49: Also das beste Beispiel war eigentlich mal dass ich ein Problem hatte... Wo?

00:27:55: Aber ich hatte dann eben so einen IT-Techniker auf meinen Bitschum geguckt und ich habe dann auch auf sein geguckt, wie er dann irgendwie seinen Bitschem geteilt.

00:28:01: Und dann sah ich ... Er hat die hauseigene AI offen gehabt aber er hatte auch einfach... Ich hab das ja gesehen.

00:28:07: irgendwie in seinem Reiter oben entauch eine FremdAI, die er wahrscheinlich benutzt hat weil der hauseigen nicht so geil war Und ich weiß nicht, wie viele Leute das machen.

00:28:18: Das muss also... Ich glaube die Dunkelziffer ist da extrem hoch.

00:28:21: Da kann ganz viel auch rausgehen aus dem Unternehmen was man nicht kontrollieren kann.

00:28:26: und das große Problem ist ja in Deutschland zumindest und Europa wahrscheinlich auch mit anderen Unternehmen, die hier ansässig sind dass man vor allen Dingen schauen muss was wird dort in die AI reingegeben?

00:28:40: GDPR compliant beispielsweise oder verrät dort jemand vielleicht auch für umgeheim ist.

00:28:44: Es sind auch so Dinge, die kann ich ja nicht kontrollieren wenn da jemand mit einem vollkommen fremden AI-Tool arbeitet und ich da keine Hand drauf habe.

00:28:53: Und du hast recht das sind eben auch die Dinge die sind eben nicht sichtbar auf der Ertragseite.

00:29:00: mal.

00:29:00: also jetzt mal abgesehen von der Rechnung es gibt eine MIT Studie von Und.

00:29:10: die basiert eben auf so fünfzig Interviews von Hundertfünfzig Führungskräften und der Kernbefund davon war, dass ninety-fünf Prozent der Pilotprojekte keine messbaren Effekte auf die Gewinn- und Verlustrechnungen haben.

00:29:24: Pilotprojekt mit AI meinst du?

00:29:26: Genau!

00:29:27: Ja ja klar.

00:29:27: also es ist das Gen AI die weiht... Also das geht alles um AI.

00:29:31: Okay.

00:29:31: Also ninety-five Prozent der Pilottprojekten die mit AI gefahren werden liefern keine messbare Effekter auf Gewinne und Verlastrechnung.

00:29:37: Ähm, dreißig bis vierzehn Millionen Billardendollar werden investiert und es gibt kaum finanziellen Rückfluss.

00:29:44: Und das ist das was ich vorhin auch schon meinte... Ich glaube wir haben viel zu sehr bei diesen ganzen Wettbewerbstabellen.

00:29:52: Wer benutzt die meisten Tokens?

00:29:54: Ja vielleicht hätte man daneben schreiben müssen und wer hat das meiste Geld reingenommen für die Bude?

00:30:00: Weil am Ende geht's um Geld verdienen und nicht darum dass man irgendwie die Polarkappen zum Schmelzen bringt mit

00:30:06: GPU

00:30:06: aus voller Auslastung.

00:30:08: Richtig, ja!

00:30:09: Nichtsdestotrotz Patrick sollte man die Zahl glaube ich auch relativ fair einordnen.

00:30:12: Also sonst wird sie halt zu oft dramatisch zitiert.

00:30:15: Es geht hier in dem Fall oder in der Studie um Pilotprojekte nicht um jede Eiennutzung und die Studie erklärt eben auch woran es liegt.

00:30:24: Sie sagen halt dass die meisten Tools nicht dazu lernen Sie passen sich nicht an einem Kontext an und verbessern sich nicht über Zeit.

00:30:33: Aber die Richtung stimmt schon.

00:30:35: Es wird halt eben wirklich sehr viel Geld ausgegeben für sehr wenig belegbaren Ertrag.

00:30:39: Nichtsdestotrotz, die Studie ist aus zwei tausendfünfzwanzig.

00:30:43: So dürfen nicht vergessen dass der große AI-Boom oder die großen Modelle erst seit Anfang ja zweitausendsächsten zwanzig im Grunde auf dem Markt sind.

00:30:53: Nichtstdestotrotz, wie gesagt es wurde viel Geld ausgegeben für wenige Belägen und für wenig Belegbaren ertragen.

00:30:58: Und deshalb wird auch erwartet, dass eben in den twenty-fünfundzwanzig der geplanten zwei tausendzechsentzwanziger A.I.

00:31:05: Ausgaben ins Jahr zweitausend zwanzig verschoben werden einfach.

00:31:11: Du meinst also das man sich jetzt ein bisschen zurückhält und das nächstes Jahr dann eher mehr ausgegeben wird?

00:31:17: Ja okay ja gut!

00:31:19: Das ist halt auch jetzt eigentlich ein sehr guter Zeitpunkt für Leute die sich gut auskennen mit der Thematik.

00:31:25: Die sagen hey ich kann AI Governance, könnte ich mich darum kümmern für euch.

00:31:31: Denn das ist jetzt eine neue Beratungs... Wenn wir sagen neues Beraterfeld und ein neues Beratungfeld nämlich alles rund um AI Governances würde ich das jetzt mal nennen wie Prozesse aufzusetzen die im Kosten sparen Und das betrifft uns ja jetzt schon beruflich.

00:31:45: also das erstes so ne Chance.

00:31:48: Was was ich hier zu sehe?

00:31:50: Das ist also ein klassisches Beratensproblem.

00:31:52: Die Unternehmen haben Kosten diese nicht verstehen keine Transparenz darüber, keine Governance und ich habe keinen Steuerungsmechanismus.

00:32:00: Also das sind alles Dinge wo man sagt wunderbar herzlich willkommen lieber Berater.

00:32:03: hilft mir mal!

00:32:04: Und dann gibt es eigentlich ist der Einstiegsmoment auch ganz klar.

00:32:07: Der Finanzchef sieht da eine Rechnung für irgendwas.

00:32:10: Herr Anthropic was ist das?

00:32:11: Warum ist das so viel?

00:32:13: Wo ist der Wert dafür?

00:32:14: Was ist da für die Wertschöpfung früher erfolgt?

00:32:18: Man sollte jetzt schon erklären können, woher das kommt.

00:32:21: Die Kosten und wie das gesteuert wurde und was eigentlich dabei rausgekommen ist.

00:32:25: Und das ist so die Zukunftsmusik.

00:32:26: Das passiert glaube ich gerade in vielen Häusern und Berater, die sich auf dieses Feld jetzt spezialisieren oder auch andere Leute, die sie auskennen.

00:32:35: Sie sehen ja auch grade dass die Jobs überall hoch kommen.

00:32:37: also wenn du über LinkedIn mal Jobs eingibst und AI Governance eingebst super viel Zeug ist da gerade Live und viele Leute suchen Händering nach Menschen, die ihnen die Welt erklären.

00:32:46: Ja,

00:32:46: brauchst du auch!

00:32:47: Das sind ja alles reale Probleme, die wir gerade ansprechen und konkret können wir das denke ich auf drei Bausteine im Grunde runter berechen.

00:32:55: Der erste ist eben die Kostentransparenz.

00:32:57: darüber hast du ja grad schon angesprochen wer verbraucht eigentlich wie viel und wofür?

00:33:02: Also in dem Fall glaube ich ist es besonders wichtig Diese ganzen Informationen aufgeschlüsselt eben nach Team Abteilung und den Anwendungsfall zu haben.

00:33:11: Klingt extrem banal, fehlt aber fast überall.

00:33:14: also keiner weiß wirklich was und wofür verbraucht wird von wem?

00:33:19: Der zweite Baustein würde ich sagen ist dieses Modell Routing das hast du vorhin schon mal angesprochen Patrick als im Grunde eine Entscheidungslogik welche Aufgaben welches Modell geht dass es eben genau der Bausteine mit dem größten unmittelbaren Einspeifekt Denke ich, in vielen Fällen eben zwischen dreißig und sechzig Prozent ohne dass die Qualität darunter leidet.

00:33:40: So relativ einfach!

00:33:42: Ja.

00:33:42: und der dritte Baustein Budget Guardrails.

00:33:44: also es ist ein Prinzip Leitplanken für die Budgets die ich so habe und wo ich sage es gibt jetzt eine harte Obergrenze in jedem Team und für jeden Anwendungsfall Und deswegen muss man gucken oder ob mich jeder Praktikant irgendwie das Premium-Modell benutzt, da sollst du immer vor was das kostet.

00:33:58: Vor allen Dingen geht auch es fühlt auch das bisschen absurd um was er machen sollte.

00:34:02: Er sollte lernen wie's läuft und nicht Was die AI dazu sagt.

00:34:07: Und man so musste regelmäßig sollte man Reviews machen, also mal sich anschauen was wie nutzen die Leute eigentlich?

00:34:14: Das geht jetzt noch nicht einmal, wir sind am Anfang neuland im Merkel-Spräch.

00:34:20: das heißt es geht's nicht darum Leute zu bestrafen sondern denen vielleicht dann mal zu sagen pass auf könntest du das nicht das nächste Mal deine sieben Sachen zusammen denken und das nicht in fünfzehn Prompten machen Sondern dir vorher überlegen was du prompten willst?

00:34:34: Also das leppert sich.

00:34:35: Und ja, diese klassische Kosten stellen Logik.

00:34:40: Die muss man vielleicht doch wieder ein bisschen mehr anwenden.

00:34:42: Das ist eben kein Spielplatz.

00:34:43: Es ist nicht umsonst.

00:34:44: Ist es nicht kostenloses Nachfragen?

00:34:49: Ja genau!

00:34:49: Es ist kein Spiel Platz.

00:34:51: Sehr gut gesagt.

00:34:52: Patrick, hör mal und könntest du vielleicht auch noch einmal über die zweite Seite sprechen so?

00:34:57: Das ist glaube ich die unbequemere oder?

00:34:59: Da geht's nämlich nicht um den Um den Kunden oder dem Mandanten, sondern eben um uns selbst als Berater.

00:35:08: Ja klar also wenn wir jetzt sagen Wir haben unseren Stundensatz und im Hintergrund laufen irgendwelche Eis Das hat vielleicht vor einem Jahr oder anderthalb Jahren noch gut geklappt Aber mittlerweile Haben wir agentische Systeme und Setups.

00:35:23: Die kosten Geld, die kosten richtig Geld Und das ist ein Posten und den müssen wir irgendwie benennen.

00:35:29: Ich denke Patrick, dass verbindet sich auch mit dem, worüber wir schon in der ersten Folge gesprochen haben.

00:35:35: Damals ging es uns darum dass eben die AI die abrechenbaren Stunden senkt und jetzt kommt die andere Seite dazu.

00:35:41: das ist was du gerade gesagt hast.

00:35:42: sie führt gleichzeitig diese variablen Kostenposition ein Und die gab's vorher nicht und deswegen wird sich die Preisstruktur der Beratung an sich verändern Also von zwei Seiten gleichzeitig sozusagen, das zum einen weniger Stunden auf der Lößseite und hast auf der anderen Seite eben diese neuen variablen Kosten auf der Aufwand-Seite.

00:36:02: Wir sind ja beide noch nicht am Ende unserer Karriere angelangt und man überlegt sich so, wenn man jetzt mit der AI arbeitet.

00:36:07: Man muss ein Case entwickeln und das ist jetzt schon bisschen anders.

00:36:10: Du kannst jetzt nicht sagen, ach guck mal in meinem Case kannst du so viele Stunden, sondern es ist alles immer mit AI gedacht.

00:36:14: Und so ein Case ist oft sehr unattraktiv.

00:36:18: Dann sagst du Ja ich kann mit folgendem Agentic Model kann ich jetzt... Was denn?

00:36:24: Was waren wir jetzt Beraterstunden?

00:36:26: Will das irgendeiner hören, der seit zwanzig Jahren irgendwie Partner bei einer Big Four oder einem größeren Unternehmen ist?

00:36:32: Nee!

00:36:32: Das heißt, ich habe es ab weniger Stunden nicht abrechnen kann.

00:36:35: Das ist erstmal Kacke!

00:36:38: Dann bist du auf der anderen Seite und sagst naja wir können in der Zeit aber andere Sachen machen weil wir ja nur noch eine Stunde Arbeit in Städte Acht.

00:36:44: Theoretisch kannst ihr acht bis sieben weitere Projekte machen.

00:36:47: Ja dann denkt erjenigen aber nach wie soll ich die herkriegen?

00:36:50: Wo sollen die herkommen?

00:36:51: Die wachsen ja nicht wie... Also plötzlich kommen ja nicht acht mal so viele Projekten und die gewinnen ja auch nicht alle.

00:36:56: Und das ist nämlich ein bisschen das Problem wo man sich jetzt wirklich mit auseinandersetzen muss in der Beratung.

00:37:02: Nämlich klar, Marsch ist besser ohne Frage es ist viel schneller eine AI bestimmte Sachen machen zu lassen und auch dann billiger.

00:37:10: aber das ist da noch blöd weil ich kann ja nicht fünf Stunden abrechnen sondern vielleicht nur ne halbe.

00:37:14: Ja

00:37:14: vielleicht müssen sich die Honorar Modelle einfach ändern?

00:37:17: Das müssen sowohl und das machen ja auch schon einiges mehr Kindsee erwirtschaftet so weiß ich nicht im Viertel oder noch mehr wahrscheinlich mittlerweile der globalen Umsätze über Ergebnisse ...basierte Bepreisung.

00:37:29: Also nicht mehr Teilematerial, sondern... Das ist ja auch mein Impact, würde ich sagen.

00:37:33: Ja der Abschlussbericht bis hundert Seiten kostet... ...fünfzigtausend Euro oder sechzig?

00:37:40: Ich finde das nicht so schlecht!

00:37:42: Dann weißt du als Kunde... Ah okay guck mal... Das kostet mich ungefähr hunderttausende Euro dieses kleine Projekt oder zweihundert tausend.

00:37:49: Und dann ist es aber auch relativ klar gedeckelt, da ist ein Cap drauf und wie der das hinkriegt Kann mir eigentlich egal sein, ich will nur dass die Wurst schmeckt und nicht wissen wie sie gemacht wird.

00:38:00: Beispielsweise gibt jetzt Bain an das die AI und Technologie gestützte Arbeit, dass es ungefähr dreißig Prozent des Umsatz ausmacht.

00:38:08: Die haben das Ziel ist natürlich auf fünfzig Prozent zu steigern und immer weiterzugehen.

00:38:12: aber dann kann es nicht mehr sein dass es theoretisch nur noch über die Stundensätze geht oder die müssten absurd werden.

00:38:18: Dann hättest du quasi zwei, drei AI-Gurus, die ein Projekt um die Ecke schieben.

00:38:24: Das sind da nur noch eine Woche gedauert, was vorher ein halbes Jahr gedauerte hat und die kosten dann vierzigtausend Euro die Stunde.

00:38:29: Ja, das ist...

00:38:29: Solltest du doch absurd?

00:38:31: Ja, dass ist sehr absurd!

00:38:33: Ich glaube wir müssen auch so'n bisschen über die Regeln sprechen, die wir uns selber geben würden wenn wir diese Kosten den versuchen zu messen.

00:38:45: wir müssen irgendwie die kosten pro bericht oder deliverable eben messen bevor sie überhaupt skalieren können.

00:38:54: also wenn wird überhaupt nicht wissen und das noch nie gemessen haben was überhaupt so ein bericht in token kostet kannst du das überhaupt nicht seriös anbieten.

00:39:01: zweitens und es ist egal ob wir jetzt über ... über ein Modell an sich sprechen, oder... ...über agentische Lösung.

00:39:08: Dass die Modelle definitiv nach Aufgabe so und nicht nach Gewohnheit ausgewählt werden sollten.

00:39:13: Die meisten Aufgaben gerade in unserem Berateralter brauchen kein Premium-Modell,... Sie brauchen halt ein solides Standardmodell mit gutem Kontext oder einen Fine-Tuned Agent.

00:39:24: Ja traurig!

00:39:26: Ganz je nach Lösung.

00:39:28: Das braucht gar kein Premium, das kann ich jeder.

00:39:30: In deinem Bereich verträgt ihr die meisten

00:39:32: Aufgabene.

00:39:33: In deinem Bereich.

00:39:33: Kann Affe machen.

00:39:35: Governance und Compliance kann auch ein Standardmodell.

00:39:38: Du könntest ja zum Beispiel sagen, man nicht von Deliverable Pricing sondern man könnte auch sagen wir verkaufen immer noch Expertise und wir sagen Ja einen Token den ich aber verbrauche der ist besser vom mir verbraucht als von deinen Mitarbeitern weißt du?

00:39:51: Weil ich besser prompten kann weil ich besser mit dem Output umgehen kann, weil ich es besser verpacken kann und am Ende aufbereite für euch das heißt Ich verkaufe die Tokenkosten fürs Doppelte an dich weiter, dass man es darüber sieht.

00:40:06: Natürlich könntest du jetzt auch einen von deinen Mitarbeiter oder drei von deinem Mitarbeitern hinsetzen die versuchen mit AI das zu lösen.

00:40:10: aber ihr habt weder die Modelle noch habt ihr das Wissen wie man damit umgeht noch habt das vernünftig orchestriert und ihr könnt auch die Outputs nicht so zusammenbringen dass es den ergibt.

00:40:17: So könnte man auch ein Pricing denken.

00:40:19: Genau, natürlich.

00:40:19: Ich würde dir weggehen von diesem Prompting-Modell was du gerade gesagt hast sondern eher über agentische Lösungen eben sprechen.

00:40:25: Also das ist glaube ich der einzig wirklich nachhaltige oder die einzig nachhaltigen Möglichkeit diese Kosten im Griff zu bekommen transparent zu schaffen und auch wirklich die Outputs zu standardisieren und zu optimieren.

00:40:42: Denn wenn jeder Berater oder jeder User individuell und verschiedene Promps für vielleicht das gleiche Modell irgendwie in seiner Umgebung benutzt ist der Output trotzdem nicht standardisiert.

00:40:55: Deswegen müsste die, und das ist die einzige logische Konsequenz daraus dass die Lösung eben agentisch sein müssen so die von dem Berater gesteuert werden.

00:41:07: Die kannst du dann eben auch wirklich messen, die kannst du fine-tune.

00:41:12: Du kannst die evaluieren und wirklich verbessern.

00:41:16: Und ja...die Transparenz ist da!

00:41:18: Du kannst es messen und Projektbezogen im Anwenden.

00:41:21: In meiner Meinung nach ist das die einzig logische Möglichkeit, da Kostentransparenze zu schaffen.

00:41:29: Zwei Punkte Lösungsansatz ist hier im Grunde der Weste, weil du musst dich ein bisschen von der Idee verabschieden dass wir alle in Zukunft irgendwie weiter das Chatfenster von so einem LLM nutzen werden.

00:41:37: Ich glaube die Idee ist eher dass du zum ersten also der erste Punkt ist dass du das Bewusstsein schaffst Schaffst du das die dass die Mitarbeiter einfach sehen, dass der Output oder die Qualität des generierten Outputs die gleiche ist.

00:41:50: Die Qualität ist die Gleiche und der zweite Schritt ist dann eben diese Lösung oder dieser Arbeitsschritte eben zu automatisieren.

00:41:56: schrägstrich zur Agente.

00:41:58: fine so Du musst halt agentische Lösungen bauen zu diesen Aufgaben So und diesen Agenten müssen dann eben das Modell zugewiesen werden, dass eben den effizientesten und kostenneutralsten Output liefert.

00:42:15: Und dann nimmst du sozusagen von dem User die Du nimmst ihm die Verantwortung ab, du musst nicht mehr sagen, alles klar.

00:42:23: Warte mal eben ich muss jetzt ein Deliverer beschreiben Ich muss jetzt einen Researcher stellen und was machen.

00:42:26: Welches Modell nehme ich denn jetzt am besten?

00:42:29: Wie finde ich das denn raus?

00:42:30: Stelle ich es auf Automatic Mode.

00:42:33: Hier haben wir eine X-Liste wo die ganzen Sachen drin stehen, die Use Cases sind das Modell das sich verwenden sollte.

00:42:37: Nein!

00:42:38: Es soll ein Agent gebaut werden, ein Skill gebaut werden der eben schon dass das Model zugewiesen bekommen hat.

00:42:46: Das heißt wir müssen den User Das hängt auch mit der AI Transformation oder AI Adoption zusammen.

00:42:53: Diese Verantwortung abnehmen und nur so kriegst du diese Kosten in den Griff.

00:42:59: Ich glaube das auch, ich glaube dem Ganzen um noch mehr Kosten zu sparen vielleicht wenn man schon sagt wir machen jetzt so große Agentenlösungen oder agentische Systeme ist dass man immer wieder überlegt brauche ich überhaupt AI für das und das?

00:43:13: In vielen Fällen wird man herausfinden nein eigentlich brauch ich hier nur einen Automaten ein Chatbot Weil ich jetzt dir, was möchten sie gerne bestellen?

00:43:22: McDonald's Chatbot.

00:43:24: Ja, muss der ein Gen AI Model im Hintergrund laufen haben?

00:43:29: Ein LLM?

00:43:29: Nein!

00:43:31: Es gibt bestimmte Liste von Produkten die du auswählen kannst.

00:43:33: Dann klick dich halt durch das Menü oder ist doch Quatsch.

00:43:36: ja und das ist das was viele Leute haben so reflexartig schreien sich irgendwie dann nach AI bei Sachen wo ich mir denke Das hat es nicht gebraucht, dass braucht es auch nicht.

00:43:45: Es wird nicht besser dadurch dass du jetzt AI hast, es wird nur teurer.

00:43:48: Genau,

00:43:48: es wird nur teurer.

00:43:49: Es sei denn du automatisiert und standardisiert diese ganzen Aufgaben eben.

00:43:53: Ich glaube Patrick das ist auch ein ganz gutes Stichwort Denn um so langsam mit dieser Folge abzuschließen dass wir nochmal kurz Revue passieren lassen was uns aus dieser Folge bleibt also bezugnehm gerade auf den letzten Punkt.

00:44:07: ja also erstens für uns sind oder wir haben festgestellt dass eben token kosten bei weiben keine randnotiz mehr sind sondern eben wirklich eine feste größe die man die man wirklich verstehen und steuern muss.

00:44:18: da gibt es verschiedene ansätze.

00:44:19: wir haben gerade über die ansätze gesprochen automatisieren agentische lösungen bauen oder doch irgendwie mehr das bewusst sein schaffen für den user.

00:44:28: so Der zweite Punkt ist definitiv, was aus dieser Folge bleibt.

00:44:33: Wenn wir es so nennen wollen dass die großzügige Phase zu Ende geht und das war eben auch wirklich absehbar.

00:44:40: Und drittens genau in dieser Unsicherheit oder von diesem Schiff der Phasen entsteht wirklich ein Beratungsbedarf und zwar von der Art oder von der Sorte, die wir wirklich gut können.

00:44:54: Ja und vielleicht viertens?

00:44:56: euch ziemlich wichtig.

00:44:57: Man sollte anschauen, wo man Abhängigkeiten aufbaut und das geht jetzt nicht nur auf Kostenseite sondern vielleicht auch noch mal bei dem Fable Five Beispiel zu bleiben.

00:45:04: was ist denn wenn jetzt theoretisch du deine Agenten auf ein bestimmtes Modell ausrichtest?

00:45:09: Und die können es dann und entscheidet sich irgendein Amerikaner zu sagen, ne das darfst du nicht mehr Europa darf das nicht genutzt werden.

00:45:16: Genau Jetzt geht jetzt nichts mehr.

00:45:18: was wir uns da überlegt haben Ist schon doof.

00:45:20: deswegen sollte man sich vielleicht ein bisschen angucken welche oder wie abhängig mache ich mich von den aktuellen Modellen und wie viel kann ich vielleicht auch im Premis laufen lassen, wenn es wirklich weiter ist.

00:45:33: Also das ist vielleicht auch die Überlegung zu sagen diese Sachen sollten einfach über unsere GPUs laufen, die wir hier haben.

00:45:39: Ja und als Klein Teaser in der nächsten Folge, da ist schon Folge sechs wird es interessant ja?

00:45:44: Wir schauen... auf das Thema Superintelligenz und besonders auf die Frage, was passiert wenn diese LLM-Modelle oder die Modelle an sich feger werden als wir Menschen.

00:45:56: Und auf einige sehr konkrete Vorfälle schauen wir aus der AI Sicherheitsforschung, die das Thema wirklich greifbarer machen als jedes Science Fiction.

00:46:05: Das klingt spannend.

00:46:07: bis dahin bleibt neugierig und kritisch und schaut euch mal eure AI Rechnungen an.

00:46:12: so verhält ihr es den Künd Nicht die vom letzten Monat sondern die von diesem.

00:46:16: Alles klar, danke!

00:46:17: Bis dann, ciao!

00:46:18: Danke Patrick, ciao.

Neuer Kommentar

Dein Name oder Pseudonym (wird öffentlich angezeigt)
Mindestens 10 Zeichen
Durch das Abschicken des Formulars stimmst du zu, dass der Wert unter "Name oder Pseudonym" gespeichert wird und öffentlich angezeigt werden kann. Wir speichern keine IP-Adressen oder andere personenbezogene Daten. Die Nutzung deines echten Namens ist freiwillig.