0924 | KI im Alltag: Modelle, Agents und neue Werkzeuge

||Download

Show notes

Diese Episode blickt auf eine spannende Woche in der KI-Welt: ein neues Topmodell und seine Messbarkeit, autonome Marketing- und Support-Agents, die Infrastruktur dahinter – Speicher, Daten und eigene Maschinen – und schließlich neue Werkzeuge für Schreibende, Übersetzer:innen und Creator. Wir fragen immer: Was kann es heute, was bleibt unklar, und was kommt als Nächstes?

Zeitleiste

  • 00:00:04 Einleitung
  • 00:00:34 Claude Opus 5.5 und die Messbarkeit von Agents
  • 00:03:39 Autonome Agents übernehmen Marketing und Content
  • 00:06:13 Sicherheit für Agent-Systeme
  • 00:07:50 Speicher und Daten für Agents
  • 00:10:08 Agents mit eigenen Computern und Budgets
  • 00:11:38 Sprache und Ton: Helfer für Schreiben und Übersetzen
  • 00:13:59 Werkzeuge für Creator
  • 00:15:39 Entwickler- und Lernwerkzeuge
  • 00:18:03 Abschluss

Weitere Links

Diese Folge wurde von Bri produziert. Bri nutzt fortschrittliche KI-Technologie, um die Feeds, die dir wichtig sind, in Podcasts zum Zuhören zu verwandeln. Kontakt: hi@bri.so.

Transcript

Lena Vogel: Herzlich willkommen zur heutigen Ausgabe! Ich bin Lena Vogel.

Felix Hartmann: Und ich Felix Hartmann. Schön, dass du wieder dabei bist. Heute schauen wir uns eine ganze Reihe neuer Produkte und Entwicklungen an – und das verbindende Thema ist eigentlich überall dasselbe: KI-Agenten. Modelle, die arbeiten, Agents, die marketing machen, Agents, die abgesichert werden müssen, Agents, die Speicher, Daten und sogar eigene Computer und Budgets bekommen. Und dann noch ein paar Werkzeuge für Menschen, die schreiben, filmen und Code erklären.

Lena Vogel: Genau. Und wir fangen sozusagen am Anfang der Kette an – beim Modell, auf dem all das aufbaut. Anthropic hat Claude Opus 5.5 veröffentlicht, das erste Modell der 5.5-Familie.

Felix Hartmann: Das ist die Ankündigung, die heute wohl am meisten Aufmerksamkeit bekommt, und das aus gutem Grund. Der Fokus liegt auf zwei Bereichen: agentischem Coding und Wissen. Und dann kommt der Teil, der wirklich aufhorchen lässt: Opus 5.5 soll 40 Prozent günstiger sein als Opus 5.

Lena Vogel: Das ist eine interessante Kombination. Normalerweise denkt man bei neuen, stärkeren Modellen erstmal an höhere Preise. Hier wird also gesagt: bessere Agent-Fähigkeiten und gleichzeitig sinkende Kosten.

Felix Hartmann: Und genau diese Kombination könnte eine ganze Branche verändern. Stell dir vor, du betreibst ein Produkt, dessen Kern ein Agent ist – der Agent ruft das Modell tausende Male auf, macht Aufgaben, sucht, schreibt, führt Code aus. Wenn dein Basismodell 40 Prozent billiger wird, verschiebt sich deine komplette Kostenrechnung. Viele Agent-Produkte, die bisher wirtschaftlich knapp gerechnet waren, könnten plötzlich funktionieren.

Lena Vogel: Das ist der eigentliche Punkt: Es geht nicht nur um ein neues Modell, sondern um die Ökonomie, die darauf aufbaut. Fast alles, was wir heute besprechen, läuft irgendwo auf einem Modell wie diesem.

Felix Hartmann: Was wir allerdings nicht wissen: Wie es in Benchmarks genau abschneidet. Die Ankündigung betont agentic Coding und Wissen, aber konkrete Vergleichszahlen zu Opus 5 oder anderen Modellen fehlen in dem, was vorliegt. Das bleibt offen. Man sollte die 40 Prozent Ersparnis ernst nehmen, aber die Performance-Fragen noch nicht als beantwortet betrachten.

Lena Vogel: Und da schließt sich direkt eine Frage an: Wenn Agents immer wichtiger werden – wie misst man eigentlich, ob ein Agent gut ist? Dazu gibt es ein spannendes Projekt namens AgentScore von einer Firma namens Latitude.

Felix Hartmann: Die Idee ist sehr praktisch: AgentScore berechnet täglich einen Score für einen Produktions-Agenten – also für einen Agenten, der wirklich im Einsatz läuft – und zwar über fünf Dimensionen: Ergebnis, Zuverlässigkeit, Kosten, Geschwindigkeit und Sicherheit.

Lena Vogel: Diese fünf Dimensionen finde ich bemerkenswert ausgewogen. Die meisten denken bei Agent-Qualität nur an das Ergebnis. Aber ein Agent, der gute Ergebnisse liefert, aber teuer, langsam oder unsicher ist, ist im Alltag trotzdem ein Problem.

Felix Hartmann: Genau. Und der tägliche Rhythmus ist auch wichtig – nicht eine einmalige Bewertung, sondern ein fortlaufender Blick, wie sich der Agent über die Zeit verhält. Agents verändern sich, wenn man sie anpasst oder das Modell darunter wechselt. Ein täglicher Score macht sichtbar, was so eine Änderung anrichtet.

Lena Vogel: Und das Ganze ist open source, was bedeutet, dass andere es sich anschauen, selbst hosten oder in ihre eigene Überwachung einbauen können.

Felix Hartmann: Und jetzt leg die beiden Dinge zusammen: Anthropic liefert mit Opus 5.5 ein potenziell besseres und günstigeres Basismodell, AgentScore liefert eine Methode, um festzuhalten, ob ein Agent im Betrieb tatsächlich Qualität liefert. Modell als Basis, Messung als Rückgrat – das ist gewissermaßen das Fundament, auf dem alles weitere steht.

Lena Vogel: Und auf diesem Fundament bauen jetzt die Produkte, die Agents nicht nur diskutieren, sondern tatsächlich arbeiten lassen. Zwei davon versuchen genau das im Marketing. Das erste heißt Naise AI.

Felix Hartmann: Naise AI bietet autonome Marketing-Agents an, die Social Media, Influencer-Arbeit und PR ausführen sollen. Nicht vorschlagen, nicht aufbereiten – ausführen. Der Preis startet bei 59,90 Dollar pro Monat.

Lena Vogel: Die Ansprüche sind groß. Naise behauptet, damit 40 Stunden pro Woche einzusparen und 80 Prozent der Kosten zu senken. Und hier ist es wichtig, wie wir damit umgehen: Das sind Behauptungen des Herstellers, keine überprüften Ergebnisse. Diese zwei Zahlen – 40 Stunden, 80 Prozent – sind Ansprüche, und wir wissen nicht, unter welchen Bedingungen sie erreicht wurden.

Felix Hartmann: Richtig. Trotzdem ist die Richtung signifikant. Marketing war bisher oft der Bereich, in dem KI Entwürfe geliefert hat und ein Mensch den Rest gemacht hat. Naise sagt: Der Agent macht die Ausführung selbst – er postet, er führt die Influencer-Arbeit durch, er macht PR.

Lena Vogel: Das zweite Produkt in dieser Richtung ist RankControl, und das verfolgt einen anderen Ansatz. Dort arbeiten sieben Agents, die Inhalte auf deiner eigenen Domain erstellen und veröffentlichen.

Felix Hartmann: Der eigene Domain-Teil ist die Besonderheit. Es geht nicht um Content auf fremden Plattformen, sondern darum, deine eigene Seite mit Agent-generierten Inhalten zu füllen. Und dann kommt der Teil, der sehr aktuell ist: RankControl verfolgt, ob diese Inhalte in sechs KI-Suchmaschinen zitiert werden.

Lena Vogel: Das ist ein komplett neues Messproblem. Früher war SEO das Spiel – Ranking in der Suche. Jetzt bitten Menschen zunehmend Chatbots und KI-Suchen um Empfehlungen, und die Frage ist: Wird deine Marke in diesen Antworten überhaupt erwähnt? RankControl macht diese Zitate zum messbaren Ziel.

Felix Hartmann: Preislich gibt es einen einzigen Plan mit sieben Tagen Testzeit. Das ist simpel – man weiß, was man zahlt, und kann es vorab ausprobieren.

Lena Vogel: Was beide Produkte gemeinsam zeigen: Agenten rücken vom Chat in die Ausführung. Es ist nicht mehr „Schreib mir einen Entwurf“, sondern „Veröffentliche das, verfolge das, arbeite weiter“.

Felix Hartmann: Und genau da liegt auch die offene Frage bei beiden: Wie zuverlässig sind die Ergebnisse wirklich? Ein Agent, der eigenständig Inhalte auf deiner Domain veröffentlicht, macht auch eigenständig Fehler. Die Zahlen von Naise sind Claims, und bei RankControl bleibt die Frage, wie gut der generierte Content tatsächlich ist. Und das führt uns direkt zum nächsten Thema – denn je autonomer Agents handeln, desto wichtiger wird Kontrolle.

Lena Vogel: Genau, und dafür gibt es ein Produkt namens Koreshield. Es ist Sicherheit speziell für KI-Support-Agents.

Felix Hartmann: Koreshield setzt an drei Stellen an, und das ist durchdacht. Erstens filtert es die Nachrichten von Kunden, die an den Agenten gehen. Zweitens die RAG-Inhalte – also die Dokumente, aus denen der Agent sein Wissen zieht. Und drittens die Tool-Aufrufe – die Aktionen, die der Agent ausführen will.

Lena Vogel: Diese drei Stellen decken im Wesentlichen die Angriffsfläche eines Support-Agenten ab. Der Kunde könnte versuchen, den Agenten mit manipulierten Nachrichten zu etwas zu bringen, das er nicht tun soll. Ein vergiftetes RAG-Dokument könnte falsche Anweisungen enthalten. Und ein Tool-Aufruf ist der Moment, in dem der Agent tatsächlich etwas in deinem System tut – da will man nicht, dass etwas Unerwünschtes durchgeht.

Felix Hartmann: Und der Rollout ist genauso wichtig wie der Filter selbst. Koreshield startet im Erkennungsmodus – es beobachtet und zeigt an, was es filtern würde, greift aber nicht ein. Erst danach geht es in den Enforcement-Modus über, wo wirklich gefiltert wird. Und alles wird geloggt.

Lena Vogel: Das ist klug, weil es das größte Risiko beim Sicherheits-Tooling nimmt: dass es zu aggressiv ist und den Agenten lahmlegt. Man kann erst sehen, was gefiltert würde, bevor man es erzwingt, und hat die Logs, um im Nachhinein zu verstehen, was passiert ist.

Felix Hartmann: Und denk an den Zusammenhang: Naise und RankControl lassen Agents eigenständig handeln. Koreshield ist die Antwort auf genau diese Situation – Kontrolle über einen Agenten, der nicht mehr jeden Schritt absichert. Was offen bleibt: wie gut die Filter in Grenzfällen greifen. Sicherheit ist immer auch ein Abwägungsspiel, und bei echten Grenzfällen sieht man erst, wie robust so ein System ist.

Lena Vogel: Und ein sicherer Agent braucht auch etwas anderes: verlässlichen Kontext. Ein Agent, der die falschen Fakten hat, macht auch mit bestem Filter dumme Dinge. Deshalb kommen wir jetzt zu Speicher und Daten – zwei Produkten, die dasselbe Problem angreifen.

Felix Hartmann: Das erste ist Alexandria von Firecrawl. Es ist eine Datenbibliothek für Agenten, erreichbar über MCP, CLI und API – also auf die Weise, wie Agents heutzutage an Daten angeschlossen werden.

Lena Vogel: Die behauptete Wirkung: plus 21 Prozent Antwortqualität. Wieder ein Hersteller-Claim, den wir nicht selbst überprüft haben, aber die Logik dahinter ist einleuchtend – ein Agent, der an bessere Daten angeschlossen ist, antwortet besser.

Felix Hartmann: Und die Finanzierung ist ein starkes Signal: Alexandria hat 75 Millionen Dollar in einer Serie B eingesammelt. Das ist eine erhebliche Summe für ein Datenprodukt und zeigt, dass Investoren glauben, dass die Datenschicht für Agenten ein großer, eigenständiger Markt ist.

Lena Vogel: Das zweite Produkt heißt GBrain und adressiert eher das Gedächtnis als die Daten. Es bietet einen geteilten Speicher im Markdown-Format plus verbundene Konten, auf die alle KI-Systeme zugreifen können.

Felix Hartmann: Der Markdown-Teil ist wichtig, weil Markdown das eine Format ist, das sowohl Menschen als auch Sprachmodelle perfekt lesen können. Dein Team kann die Dateien direkt bearbeiten, und gleichzeitig kann jede KI sie als Kontext nutzen. Und die verbundenen Konten bedeuten: Es ist nicht an ein bestimmtes KI-Produkt gebunden – alle KI-Systeme, die du nutzt, können auf denselben Speicher zugreifen.

Lena Vogel: Preislich gibt es einen Team-Workspace für 99 Dollar im ersten Monat, danach 199.

Felix Hartmann: Was Alexandria und GBrain gemeinsam adressieren, ist dasselbe Grundproblem: Agents wissen wenig und vergessen viel. Ein Sprachmodell allein hat keinen Zugriff auf deine Dokumente und keine Erinnerung an eure Entscheidungen. Alexandria liefert die Datenbasis, GBrain den geteilten Speicher.

Lena Vogel: Offen bleibt, wie sich diese Ebenen konkret kombinieren lassen – Datenbibliothek hier, geteilter Speicher dort, die Grenze zwischen beiden ist nicht immer ganz klar. Aber Speicher allein reicht trotzdem noch nicht, und das führt uns zum nächsten Schritt: lange Aufgaben brauchen auch eigene Rechenressourcen.

Felix Hartmann: Genau dort kommt Solid ins Spiel. Solid gibt Agents eigene Computer, eigene Konten und eigene Budgets für Aufgaben, die lange laufen. Das Team kommt von MIT, Berkeley und Waterloo, und es sind 6 Millionen Dollar eingesammelt worden.

Lena Vogel: Das ist ein sehr konkretes Bild: Ein Agent bekommt nicht nur Zugriff auf Werkzeuge, sondern eine eigene Betriebsumgebung. Ein eigener Computer, auf dem er arbeitet. Eigene Konten, mit denen er sich anmeldet. Ein eigenes Budget, das begrenzt, was er ausgeben kann.

Felix Hartmann: Und das ist der logische nächste Schritt nach Alexandria und GBrain. Erst bekommt der Agent Daten und Speicher – dann eine komplette Infrastruktur, in der er selbstständig über Stunden oder Tage arbeiten kann. Wir haben heute mit Opus 5.5 ein Modell gesehen, das agentic Coding als Kernfähigkeit hat – Solid liefert die Umgebung, in der ein solcher Agent dann tatsächlich lange arbeitet.

Lena Vogel: Was dabei offen bleibt, ist ernst zu nehmen: Wie werden Budgets und Missbrauch kontrolliert? Wenn ein Agent ein eigenes Konto und ein eigenes Budget hat, muss es Mechanismen geben, die verhindern, dass er zu viel ausgibt oder falsch handelt. Das ist genau die Grenze, an der Autonomie auf Verantwortung trifft.

Felix Hartmann: Und jetzt schließen wir einen Bogen zurück zum Anfang. Wir haben zu Beginn die Marketing-Agents von Naise und RankControl gesehen – Agents, die eigenständig über lange Zeit Inhalte veröffentlichen. Genau so eine Arbeit wird möglich, wenn man Agents eigene Infrastruktur gibt. Die Autonomie, die dort versprochen wird, braucht die Bausteine, die wir gerade durchgegangen sind.

Lena Vogel: Genau. Und damit kommen wir vom Agenten-Thema zu den Werkzeugen für Menschen – ganz konkret zu Kommunikation, Sprache und Ton. Da gibt es zwei Produkte, die Kommunikation erleichtern, aber mit sehr unterschiedlicher Automatisierung.

Felix Hartmann: Das erste ist ToneBird, ein Antworten-Assistent für Mac und Windows. Er erstellt Brouillons direkt in Gmail und Slack und merkt sich dabei deinen Ton und deine Beziehungen zu den Menschen, mit denen du schreibst.

Lena Vogel: Der wichtige Punkt bei ToneBird: Der Nutzer liest immer vor dem Senden. Der Agent schreibt nichts eigenständig ab – du bekommst einen Entwurf, prüfst ihn, und erst dann geht er raus.

Felix Hartmann: Das zweite ist Speechka, und das ist ein völlig anderes Kaliber an Automatisierung. Speechka übersetzt Sprache in Echtzeit – und zwar in deiner eigenen Stimme. Es unterstützt 44 Sprachen, die Latenz liegt bei etwa 1,5 Sekunden.

Lena Vogel: 1,5 Sekunden ist eine beeindruckende Zahl, weil sie nah an natürlicher Konversation liegt. Man kann praktisch gleichzeitig miteinander reden, ohne dieses unangenehme Warten, das man von Übersetzungs-Tools kennt. Verfügbar ist es für macOS und Windows, und im Browser gibt es eine kostenlose Variante.

Felix Hartmann: Und genau hier liegt der interessante Vergleich: Speechka übersetzt sofort und vollautomatisch – da ist kein Mensch in der Schleife. ToneBird behält den Menschen bewusst in der Schleife. Zwei Antworten auf dieselbe Frage: Wie viel Automatisierung will man in der Kommunikation? Bei einem Live-Gespräch geht es nicht anders als automatisch. Beim Schreiben von E-Mails hat man den Luxus, erst lesen zu können.

Lena Vogel: Was offen bleibt: wie natürlich die eigene Stimme in den Übersetzungen wirklich klingt. Die eigene Stimme in einer fremden Sprache – da ist die Erwartung hoch, und ob das überzeugend klingt, kann man nur durch eigenes Ausprobieren feststellen. Es gibt noch ein drittes kleines Tool in diesem Bereich: Linguo Translate, ein Übersetzer in der Menüleiste von macOS, mit 22 Sprachen offline über Apple Translation, optionaler KI für mehr Qualität, für 3,99 Euro.

Felix Hartmann: Der Offline-Aspekt ist der Unterschied – deine Texte verlassen das Gerät nicht, wenn man die Standard-Übersetzung nutzt. Und mit 3,99 Euro ist es eine kleine, gezielte Anschaffung für Leute, die häufig übersetzen. Es fügt sich in das Bild ein: Sprache und Ton sind ein Bereich, in dem gerade viele spezialisierte Werkzeuge entstehen.

Lena Vogel: Von Kommunikation kommen wir zu einem anderen Publikum: Kreativen. Da gibt es zwei sehr unterschiedliche Wege, und der Kontrast ist eigentlich das Spannendste. Das erste Produkt heißt Pactto.

Felix Hartmann: Pactto bietet dauerhafte Räume für Teams aus Kreativen – also Räume, die bestehen bleiben und nicht nach jedem Projekt verschwinden. Der Kern ist die Video-Revue in Studio-Qualität: präzise Kommentare, bildgenaue Anmerkungen.

Lena Vogel: Und der Agent-Aspekt ist bemerkenswert: Agents wenden das Feedback direkt an. Das heißt, das Feedback aus der Revue fließt nicht als Notiz weiter, sondern wird direkt umgesetzt. Und der Kontext bleibt erhalten – man muss nicht jedes Mal neu erklären, worum es geht.

Felix Hartmann: Der zweite Weg ist Lightmeter, eine iOS-App, die ein Posemesser und eine Filmkamera mit echtem RAW vereint. Und das Entscheidende: komplett ohne KI und ohne Cloud.

Lena Vogel: Das ist fast schon eine Gegenposition zu allem, was wir heute besprochen haben. Hier geht es um klassische Fotografie – Licht messen, belichten, RAW aufnehmen – und die App verzichtet bewusst auf jede Form von KI-Verarbeitung in der Cloud. Die Kamera-Funktion ist gratis, die Plus-Version kostet Geld.

Felix Hartmann: Diese zwei Produkte zeigen zwei Richtungen in der Creator-Welt: KI-gestützt zusammenarbeiten und Arbeit abgeben – oder bewusst auf KI verzichten und volle Kontrolle behalten. Beide sind legitim, und welche man wählt, hängt davon ab, ob man das Ergebnis oder den Prozess selbst im Mittelpunkt sieht.

Lena Vogel: Was offen bleibt: wie breit diese Märkte wirklich sind. Pactto zielt auf professionelle Kreativ-Teams, Lightmeter auf Fotografen, die bewusst analog denken. Beide sind Nischen – die Frage ist, wie groß diese Nischen tatsächlich sind.

Felix Hartmann: Und von den Creators kommen wir zu unseren letzten beiden Produkten – Werkzeugen für Entwickler und für Leute, die Entwicklung anderen erklären. Das erste heißt CodeSpotlight.

Lena Vogel: CodeSpotlight ist ein Plugin für IntelliJ IDEA, das ausgewählten Code mit animierter Hervorhebung markiert. Klingt einfach, ist aber gezielt gemacht für Tutorial-Creator und Streamer – also für Leute, die vor Publikum Code zeigen.

Felix Hartmann: Das löst ein reales Problem. Wenn du in einem Video oder Stream Code erklärst, ist die größte Schwierigkeit, dass das Publikum weiß, wo du gerade bist. Eine animierte Hervorhebung führt den Blick genau dorthin, wo du gerade sprichst. Es ist ein kleines Werkzeug für einen sehr konkreten Anwendungsfall – aber genau deshalb funktioniert es wahrscheinlich.

Lena Vogel: Und das zweite ist Jev State, und das hat eine wirklich interessante Grundidee: Es verwandelt KI-Gespräche in ausführbare Tests und TypeScript-Code. Der Export erfolgt als JSON und als SKILL.md, und es ist kostenlos und open source.

Felix Hartmann: Denk mal nach, was das bedeutet. Wenn du mit einer KI an einem Problem gearbeitet hast, entsteht dabei implizit Wissen – über die Lösung, über die Randfälle, über die Herangehensweise. Normalerweise verschwindet dieses Wissen, sobald der Chat geschlossen wird. Jev State macht daraus etwas Bleibendes: Tests, die du ausführen kannst, und Code, den du weiterverwenden kannst.

Lena Vogel: Der SKILL.md-Export ist der Teil, der in die Agenten-Welt zurückführt – das ist ein Format, um Fähigkeiten zu beschreiben, die Agents wieder aufnehmen können. Ein Gespräch wird also nicht nur zu Code, sondern zu etwas, das eine KI später wiederverwenden kann.

Felix Hartmann: Und damit haben wir einen schönen Bogen geschlossen. Wir haben heute mit Claude Opus 5.5 begonnen – einem Modell, das agentic Coding zur Kernfähigkeit macht und dabei 40 Prozent günstiger ist als sein Vorgänger. Und wir enden bei einem Werkzeug, das genau die Brücke schlägt: von KI-Modellen zurück zu realem, ausführbarem Code.

Lena Vogel: Die offene Frage dabei passt zum Ganzen: Wie sich Jev State in bestehende Workflows einfügt, ist noch unklar. Ein Tool, das Gespräche in Tests verwandelt, muss erst in den Alltag der Entwickler passen, damit es wirklich genutzt wird. Ähnlich wie bei fast allem, was wir heute gesehen haben – die Ideen sind klar, die Umsetzung im Alltag wird sich zeigen.

Felix Hartmann: Genau so sehen wir das auch. Danke, dass du dabei warst – wir hören uns beim nächsten Mal!

Lena Vogel: Bis dann!