
0928 | Tasten, Agenten und第二 Meinungen: Die Woche der hilfreichen Technik
Show notes
Hardware-Renaissance trifft KI: Ein Android-Phone mit echter Tastatur, KI-NPCs, die GTA-Rollenspiel-Welten bevölkern, und KI-Assistenten, die Antworten gegenprüfen, Tickets lösen, Fenster ordnen und proaktiv helfen – dazu OpenAIs halb so teure GPT-6-Modelle. Wir sortieren, was wirklich neu ist und was der nächste Schritt wird.
Zeitleiste
- 00:00:04 Einleitung
- 00:00:41 Zurück zur Tastatur: Clicks Communicator
- 00:04:41 KI-NPCs mit Gedächtnis: Humalike x GTA RP
- 00:09:29 Zweite Meinung per Extension: Cuey
- 00:12:30 IT-Support von Agents: Harmony
- 00:16:20 Proaktiver Assistent: Superhuman Go
- 00:17:54 Frontier-KI halbiert: GPT-6 Sol & Luna
- 00:20:53 Fensterordnung ohne Terminal: KiwiDesk
- 00:23:33 Abschluss
Weitere Links
Diese Folge wurde von Bri produziert. Bri nutzt fortschrittliche KI-Technologie, um die Feeds, die dir wichtig sind, in Podcasts zum Zuhören zu verwandeln. Kontakt: hi@bri.so.
Transcript
Lena Vogel: Willkommen zurück beim Briefing! Ich bin Lena Vogel, und heute wieder mit Felix Hartmann am Start. Hallo Felix.
Felix Hartmann: Hallo Lena, hallo ihr alle. Wir schauen heute wieder auf die letzten 24 Stunden Product Hunt, und mir fällt schon beim Drüberschauen auf: Da war viel zu lesen darüber, wie wir eigentlich mit Computern reden wollen. Ein Telefon, das die Tastatur wieder in die Mitte holt. KI-Spielfiguren, die sich an dich erinnern. Assistenten, die dir reinreden, ob du willst oder nicht.
Lena Vogel: Und dazwischen immer dieselbe Frage: Was vertrauen wir diesen Systemen zu, und wie behalten wir die Kontrolle? Fangen wir mit dem am schönsten Gegenständlichen an: dem Clicks Communicator.
Felix Hartmann: Genau, fangen wir bei der Tastatur an. Der Clicks Communicator ist ein kompaktes Android-17-Telefon, das komplett um eine physische Tastatur herum gebaut ist. Der Ansatz: Der Screen ist nicht mehr der Mittelpunkt, sondern Nachrichten, Tippen und schnelle Antworten sind es. Man kann es als Haupttelefon nutzen oder als Begleitgerät zum iPhone oder Galaxy, es ist vollwertiges Android mit allen Apps und 5G.
Lena Vogel: Was mich da fasziniert, ist die Summe der kleinen Entscheidungen. Da gibt es einen Message Hub, der Nachrichten aus verschiedenen Apps auf dem Homescreen zusammenbringt, mit Tastatur-Shortcuts zum Sortieren. Also man muss nicht jede App einzeln öffnen. Eine Signal-LED, die man konfigurieren kann, damit einen zum Beispiel Mama oder der Chef oder Telegram-Apps erreichen.
Lena Vogel: Und die Tastatur selbst ist touch-sensitiv, man kann damit durch Inbox, Nachrichten und Webseiten scrollen, ohne vom Keyboard runterzugehen.
Felix Hartmann: Und der Fingerprint-Sensor sitzt im Spacebar. Daumen drauf, entsperren, und man landet direkt im Message Hub. Es gibt noch einen Side Key für Spracheingabe: gedrückt halten, und man kann diktieren, eine Sprachaufnahme starten oder ein Meeting transkribieren. Der Display ist übrigens bewusst klein, 4,03 Zoll AMOLED, was die Macher als "Designed for doing, not doomscrolling" verkaufen.
Felix Hartmann: Das ist natürlich Marketing-Sprech, aber die Hardware-Spezifikation dahinter stimmt: kleines Display, große Tastatur.
Lena Vogel: Preislich: 499 Dollar Launchpreis gegen eine gestrichene 649. Und das finde ich erwähnenswert, weil da eine echte Community-Geschichte hinter steckt: Ein Kommentator berichtet, dass Clicks vor dem Shipping die Hardware angehoben hat, auf 12 Gigabyte RAM und einen 4.350-mAh-Akku, ohne den Preis zu erhöhen. Das ist ein konkreter, benannter Claim aus der Diskussion, keine unabhängige Messung, aber immerhin eine prüfbare Angabe.
Felix Hartmann: Jetzt zu den offenen Fragen, und da gibt es ein richtig gutes. Ein Kommentator schreibt, die touch-sensitive Tastatur sei der Teil, den er so noch nie gesehen habe. Die meisten Retro-Keyboard-Phones behandeln die Tasten als reine mechanische Eingabe und kloppen höchstens eine Trackpad-Gesture-Zone auf die Leertaste. Seine Frage: Ersetzt der Touch-Layer das Trackpad komplett, oder ist er ergänzend?
Felix Hartmann: Kann man zum Beispiel Cursor-Positionierung machen, indem man auf den Tasten selbst drüberzieht, so wie es BlackBerry damals mit der Tastatur-als-Trackpad gemacht hat?
Lena Vogel: Und das ist im Quelltext nicht beantwortet. Das bleibt offen. Für einen Kaufentscheidung ist das aber ziemlich zentral, denke ich, denn genau dieses Verhalten unterscheidet ein cleveres Gerät von einem, bei dem die Tastatur nur eine Deko-Nostalgie ist.
Felix Hartmann: Es gibt auch noch einen kleinen, sehr menschlichen Kommentar: Jemand schreibt, er habe das Gerät sofort zwei Freunden geschickt und freue sich auf Weihnachtsgeschenke. Und er weist auf eine echte Unschärfe hin: Die Website bewirbt einen 30-Dollar-Rabatt, der auch geliefert wird, aber im zweiten Schritt der Anmelde-Flow für SMS-Marketing steht 20 Dollar. Kleinkram, aber die Art Kleinkram, die man aus einer Launch-Woche kennt.
Lena Vogel: Der Verkauf endet laut Website am 30. September, es gibt QWERTY-, AZERTY-, QWERTZ-, Koreanisch- und Arabisch-Layouts, wobei die Layouts an die Region gebunden sind. Und das Gerät kommt mit MagSafe-kompatiblen Rückseiten, Qi2-Ladung, MicroSD bis 2 Terabyte, 3,5-Millimeter-Klinkenbuchse, was heute fast schon exotisch ist. Android-17-Support mit mindestens vier Jahren Versionupdates und fünf Jahren Sicherheitsupdates.
Felix Hartmann: Bleiben wir aber bei dem Bild dahinter, denn das trägt ja die ganze Sendung heute: physische Eingabe als Gegenbewegung zum Screen-first-Design. Und die gleiche Gegenfrage, wie wollen Menschen mit Software interagieren, stellt sich gleich wieder bei einer ganz anderen Art von Charakteren: KI-Spielfiguren in Grand Theft Auto.
Lena Vogel: Humalike, genauer Humalike x GTA RP. Das ist ein System aus KI-NPCs für FiveM, also GTA-V-Rollenspiel-Server. Die Grundidee: Rollenspiel-Server leben davon, dass Menschen miteinander Rollenspiel machen. Aber oft sind schlicht nicht genug Spieler online, oder niemand in der Nähe hat Lust auf ein gemeinsames Szenario. Dann fühlt sich die Welt leer an.
Felix Hartmann: Und genau da kommen die NPCs rein. Jede Figur hat eigene Identität, eigene Persönlichkeit, eigenes Gedächtnis und menschenähnliches Verhalten. Sie erkennen Spieler und bauen separate Beziehungen zu jedem einzelnen auf. Sie reagieren auf Gespräche, Kleidung, Masken, Waffen, Schüsse und FiveM-Events um sie herum. Und, das finde ich spannend: Sie entscheiden selbst, was sie verraten, was sie verbergen und wann sie lügen.
Lena Vogel: Die Gründer, Michał, Ignacio und Martí, sind auch selbst in der Diskussion aktiv. Michał sagt, er habe früher selbst einen GTA-Rollenspiel-Server betrieben und kenne das Problem, dass die Welt schnell zerbricht, wenn nicht genug Spieler da sind. Martí beschreibt Humalike als "behavioral infrastructure for humanlike AI agents". Ignacio betont, die Figuren würden mit dir spielen und Teil des Servers werden.
Felix Hartmann: Die Fragen, die die Community stellt, sind übrigens bemerkenswert praxisnah. Ein Kommentator fragt, ob Server-Betreiber die Persönlichkeit, die Backstory und die Verhaltensregeln der NPCs kontrollieren können. Ein anderer fragt nach dem Memory-Fenster, also wie viel ein NPC über einen Spieler über mehrere Sessions hinweg behält. Und ein dritter bringt genau den Punkt, der auch bei unserer späteren Frage aufkommen wird: Latenz.
Felix Hartmann: Er schreibt, selbst ein paar Hundert Millisekunden Extra machen eine Echtzeit-Sprachinteraktion plötzlich fühlbar zäh und brechen die Immersion. Seine Frage: Läuft Perception und Response pro NPC unabhängig, oder gibt es eine geteilte World-State-Schicht, die bündelt, sodass man nicht für N nahe Charaktere N-mal die Latenz zahlt?
Lena Vogel: Das ist im Quelltext nicht beantwortet. Offen. Auch die Frage, ob NPCs auf einen zurückkehrenden Spieler tatsächlich anders reagieren als auf einen neuen, bleibt unbeantwortet. Das sind also behauptete Fähigkeiten, und die Community fragt ganz zu Recht: Stimmt das wirklich, und wie fühlt sich das an?
Felix Hartmann: Was aber eine ziemlich solide Grundlage hat, ist die Live-Phase auf Strefa RP, angeblich dem größten Rollenspiel-Server Polens. In drei Wochen: 1.189 verschiedene Spieler haben mit NPCs geredet, über 250.000 Turns der Konversation, und insgesamt 34 Tage Zeit, die NPCs und Menschen miteinander verbracht haben. Das ist eine konkrete Zahl aus der Launchbeschreibung, also ein Claim der Macher, aber immerhin keine reine Demo-Behauptung, sondern der Verweis auf einen laufenden Betrieb.
Lena Vogel: Die Anwendungsbeispiele, die die Macher nennen, sind praktisch: EMS-Patienten, die selbst Hilfe rufen und in medizinische Szenarien einsteigen. Zeugen, die sich an Geschehnisse erinnern und mit der Polizei reden. Geiseln, die auf Drohungen reagieren. Informanten, die Geheimnisse mit vertrauten Spielern tauschen. Guides, die Server-Aktivitäten erklären. Man kann auch einen NPC einfach auffordern, ins Auto zu steigen und unterwegs zu plaudern.
Felix Hartmann: Und es geht nicht nur um Einzelfiguren: Man kann ganze Gruppen bauen, Gangs, EMS-Teams, Motorcycle Clubs, Businesses, eigene Fraktionen. Die Mitglieder teilen Wissen und ein Gruppengedächtnis, sodass eine einzelne Interaktion verändern kann, wie eine ganze Organisation einen Spieler sieht. Komplett konfigurierbar: Name und Backstory, Persönlichkeit und Verhalten, Wissen und Geheimnisse, Stimme und Sprechstil, Aussehen und Custom-Modelle, Vorlieben und Abneigungen und Motivationen.
Lena Vogel: Preislich gibt es einen Starter-Plan für 79 Dollar im Monat mit 25.000 Interaktionen, und einen RP-Plan für 119 Dollar mit 50.000 Interaktionen. Erste 1.000 Interaktionen sind gratis, Extra-Interaktionen kosten 50.000er-Päckchen für 119 Dollar. Es funktioniert mit ESX, Standalone, QBCore, QBox und Custom-Frameworks, und Installation, Erstellen und Deployen laufen über ein Panel, angeblich ohne Programmieren.
Lena Vogel: Finanziert sind sie laut Eigenangabe von frühen Investoren von ElevenLabs und Revolut, das ist wieder ein Claim, kein unabhängiger Beleg.
Felix Hartmann: Was mir an Humalike gefällt, ist die Verbindung zu unserem nächsten Thema: KI, die merkt, was du tust, und dich wiedererkennt. Denn das ist genau das Versprechen. Und natürlich die Frage, was es bedeutet, wenn so ein System nicht nur mit dir redet, sondern dich beurteilt und speichert. Bleibt erstmal als offener Punkt hängen.
Lena Vogel: Genau an der Stelle kommt unser drittes Thema, und das dreht die Frage um: Was, wenn die KI dir etwas sagt, aber du nicht weißt, ob es stimmt? Cuey. Eine Chrome-Extension, die neben ChatGPT, Claude und Gemini läuft und die Antwort deines Modells gegen andere Modelle abgleicht. Bis zu 30-plus Modelle, also ChatGPT, Claude, Gemini und andere. Sie zeigt, wo die Modelle uneins sind, und wo dein Modell etwas verpasst haben könnte.
Lena Vogel: Ohne Copy-Pasting zwischen Tabs, ohne dass man sich wiederholt, ohne Extra-Abos.
Felix Hartmann: Die Motivation, die der Maker beschreibt, kennen wir alle: AI gibt dir eine falsche Antwort im selben selbstbewussten Ton wie die richtigen. Der Maker, der sich selbst als longtime hunter, first-time maker vorstellt, erzählt, das Problem sei nicht die Verfügbarkeit von Alternativen, sondern der Aufwand: Prompts kopieren, in anderen Modellen einfügen, denselben Kontext immer wieder neu liefern.
Felix Hartmann: Cuey soll das automatisieren: Im Hintergrund werden Antworten anderer führender Modelle geholt, bedeutende Widersprüche hervorgehoben, und der Kontext wird zwischen den Tools mitgetragen, damit jede Zweitmeinung mit den Infos rechnet, die wirklich relevant sind.
Lena Vogel: Und der Kontext-Teil ist genau das, was ein Kommentator als eigentlichen Differentiator bezeichnet. Er schreibt, die meisten Compare-Tools machen dich dazu, denselben Prompt in drei Tabs einzufügen, was den Zeitgewinn wieder auffrisst. Und er verweist auf Ben Thompsons "Write Things Down"-Idee, also dass eigentlich das Aufschreiben das Lernen erweiterbar und skalierbar macht.
Lena Vogel: Übrigens eine nette Brücke: Humalike gibt NPCs portable Memory über Sessions, Cuey macht den Kontext portabel zwischen Modellen.
Felix Hartmann: Aber es gibt eine Frage, die ich ziemlich gut finde. Derselbe Kommentator fragt: Wenn die Modelle uneins sind, versucht Cuey dann zu sagen, wer eher recht hat, oder zeigt es nur den Konflikt und lässt dir die Entscheidung? Denn für viele Use-Cases ist es nur die halbe Miete zu wissen, dass man falsch liegt, man braucht auch einen Tiebreaker. Und im Quelltext ist das offen gelassen.
Lena Vogel: Die Release-Website selbst war übrigens hinter einem Cloudflare-Interstitium versteckt, das heißt, wir haben da keine weiteren Details aus dem Quelltext. Also bleiben wir bei dem, was wirklich belegt ist: Extension, Chrome, hinter ChatGPT, Claude, Gemini, 30-plus Modelle, Hintergrundabgleich, Konflikthanierung, Kontexttransport. Und ein User schreibt, es funktioniere gut für detaillierte Finanzfragen, wünsche sich aber noch mehr Optimierung für Investment-Analyse.
Lena Vogel: Das ist ein einzelnes Feedback, keine unabhängige Bewertung.
Felix Hartmann: Was ich spannend finde: Der Maker fragt in der Diskussion die Community, wann KI zuletzt eine super-selbstbewusste Antwort gegeben hat, die komplett falsch war, weil sie neue Prompts fürs Onboarding sucht. Das zeigt schon, dass sie wissen, dass der Wert davon abhängt, wie gut die Vorschläge kuratiert sind. Und damit sind wir bei der nächsten logischen Frage: Wenn ich auf KI-Antworten nicht vertrauen kann, wie sehr kann ich dann KI-Aktionen vertrauen?
Lena Vogel: Perfekte Überleitung zu Harmony. Das ist eine AI-native ITSM-Plattform, also die Alten sind Freshservice und Jira Service Management, die laut den Gründern eher dafür gebaut wurden, die Arbeit zu tracken, nicht sie zu machen. Harmony ist anders herum gedacht: Die Agents stehen im Zentrum. Mitarbeiter fragen in Slack oder Teams, und über 100 vordefinierte Agents erledigen Passwort-Resets, App-Zugriff, Onboarding, Device-Probleme und mehr end-to-end, und eskalieren nur, wenn nötig.
Felix Hartmann: Die Gründer, Ran und Nitzan, hatten vorher Epsagon, das laut Ran von Cisco für 500 Millionen Dollar übernommen wurde. Das ist wieder eine Selbstaussage, kein unabhängiger Beleg, aber es zeichnet zumindest ein Bild von dem Background. Ran erzählt, sie hätten nach der Übernahme jahrelang mit IT-Leadern gesprochen und immer dieselbe Geschichte gehört: Der Helpdesk frisst die Woche des Teams. Hunderte repetitive Anfragen, und die Tools dafür sind nicht gebaut, um sie zu erledigen.
Lena Vogel: Die Architektur finde ich deshalb erwähnenswert, weil ein Teammitglied sie offen erklärt: Das Modell führt selbst nichts aus, es matcht Anfragen nur auf vorab freigegebene Workflows. Und jedes referenzierte Objekt muss gegen echte IdP- und MDM-Daten auflösen, sonst scheitert die Anfrage. Das heißt, Prompt Injection kann die Interpretation des Modells theoretisch beeinflussen, aber es hat keinen Handlungsspielraum.
Lena Vogel: Scoped Credentials, Eligibility-Regeln, menschliche Genehmigung bei sensiblen Aktionen, kompletter Audit-Trail.
Felix Hartmann: Das ist die Antwort auf die Frage, die jedes Security-Team wirklich stellt: Was passiert, wenn der Agent falsch liegt oder böswillig manipuliert wird? Und ein Dev-Team-Mitglied sagt noch etwas bemerkenswert Ehrliches: Die eigentliche harte Arbeit war nicht die Agent-Logik, sondern Identität. Die Person, die in Slack fragt, muss nachweisbar dieselbe menschliche Person sein wie der Okta-User, der Jamf-Device-Owner und der HiBob-Eintrag. Und der Name ist dreimal unterschiedlich geschrieben.
Felix Hartmann: Mache das richtig, und der Agent-Teil fällt fast von selbst ab. Mache es falsch, und du hast etwas gebaut, das selbstbewusst das Passwort der falschen Person zurücksetzt.
Lena Vogel: Zahlen, die die Macher nennen: Kunden erreichen typischerweise 60-plus Prozent Autoauflösung innerhalb der ersten paar Wochen. Cyera liegt angeblich bei 89 Prozent der Mitarbeiter-Anfragen, die auto-aufgelöst werden, und n8n betreibt IT für hunderte Mitarbeiter mit einer einzigen IT-Person. Das sind wieder Macher-Claims, keine unabhängigen Audits.
Felix Hartmann: Und die Community pühnt genau da nach. Ein Kommentator schreibt, die 60-plus Prozent innerhalb weniger Wochen seien ein sehr schnelles Ramp-up für ein Helpdesk-Tool, weil der eigentliche Reibungspunkt in IT-Support nicht die Anfrage selbst ist, sondern die Edge-Cases, in denen die KI wissen muss, wann sie eskaliert statt selbstbewusst das Falsche zu tun. Seine Frage: Wie sieht der Fehlermodus aus?
Felix Hartmann: Wird der Agent nur vom Mitarbeiter bemerkt, oder kann er eigene Unsicherheit erkennen, bevor er etwas wie eine Access-Änderung durchführt?
Lena Vogel: Das ist im Quelltext offen. Und ein anderer Kommentator bringt noch eine ganz andere Kritik: Mid-Market-Teams haben oft schon Okta- oder Google-Workspace-Self-Service für Passwort-Resets und App-Zugriff. Chat-Triage in Slack sei nie der eigentliche Engpass gewesen. Das echte Problem sei Audit-Compliance, Rogue-SaaS-Seats, die nie deprovisioniert werden, und chaotische Genehmigungshierarchien.
Lena Vogel: Ein Agent, der Access in HR- oder Finance-Tools auto-aufhebt, hätte nicht die verifizierte Genehmigungsbefugnis, die ein Auditor braucht.
Felix Hartmann: Das ist eine ernsthafte, fachliche Kritik, die nicht in die Launch-Sprache passt. Genau so etwas sollten wir nach Englisch übersetzen, weil sie zeigt, wo die Grenzen einer solchen Plattform realistisch liegen. Nicht bei der Frage "kann der Agent Passwörter zurücksetzen", sondern "hat der Agent die Autorität, die ein Auditor braucht, um nachzuweisen, dass die Änderung korrekt war".
Lena Vogel: Damit sind wir bei der nächsten Ebene: Was dürfen Agenten autonom tun, im Kleinen und im Großen? Und da passt Superhuman Go, das viel kleiner angelegt ist. Es ist ein AI-Assistent, der nicht in einem eigenen Chatfenster lebt, sondern in Gmail, Slack, Docs und im Browser. Er schlägt dir bessere Formulierungen vor, während du tippst, entwirft E-Mail-Antworten in deinem Stil, und bereitet Meetings vor, bevor du überhaupt daran denkst.
Felix Hartmann: Die Macher sagen, das Besondere sei: proaktiv statt prompt-basiert. Also ein prompt-basiertes Tool nervt dich nur, wenn du fragst. Ein proaktives muss raten, wann sein Vorschlag wirklich willkommen ist und wann es nur Lärm ist, den du lernst zu ignorieren. Und sie betonen, es basiere auf Grammarlys 17-jähriger Writing-Engine, nicht auf einer neuen KI, die bei Null anfängt.
Lena Vogel: Features laut Launch: Echtzeit-Vorschläge während des Tippens, über Apps hinweg. Vorentworfene E-Mail-Antworten in eigener Stimme. Meeting-Vorbereitung und Follow-up mit Agenda und Aufgaben-Zuweisung. Custom No-Code-Agents, die auf Zeitplan oder Event triggern. Und MCP-Connectoren, damit die Vorschläge in deinen echten Tools verankert sind, also grounded.
Felix Hartmann: Und da kommt wieder die Community mit der richtigen Frage: Wenn das Echtzeit-Vorschläge über alle Apps hinweg gibt, kann das ziemlich nervig werden, wenn es bei jedem Tastenschlag in Slack genauso loslegt wie in einem langen E-Mail-Entwurf. Gibt es Tuning pro App oder pro Kontext für die Aggressivität, oder ist es ein einziger Sensitivity-Schieberegler für alles? Antwort im Quelltext: nicht vorhanden. Das bleibt offen.
Lena Vogel: Das ist ein guter Moment für eine Zwischenbilanz: Go will in deinen Arbeitsfluss reinreden, Harmony will selbstständig deine IT-Probleme lösen, Cuey will dich vor blindem Vertrauen schützen. Drei Antworten auf dieselbe Frage: Wie viel Autonomie vertragen wir? Und was bestimmt eigentlich, was derartige Assistenten kosten? Nämlich die Basismodelle, und die haben sich heute ebenfalls bewegt.
Felix Hartmann: OpenAI hat die GPT-6-Familie erweitert: Sol und Luna. Das sind Modelle unter Astra, nach denselben Trainingsprinzipien, aber auf Geschwindigkeit und Kosten getunt. Die behaupteten Punkte: 50 Prozent niedrigere API-Preise als die GPT-5.6-Äquivalente. Prompt-Caching-Verbesserungen mit 90 Prozent Rabatt auf gecachte Input-Reads. Und nahezu Astra-Performance bei Faktualität, Coding und Computer-Use.
Lena Vogel: Sol soll laut Angaben Claude Opus 5 auf dem Automation Bench schlagen, bei etwa 9 Prozent der Kosten pro Task. Und es soll Claude Fable 5.1 auf DeepSWE matchen, bei ungefähr 80 Prozent niedrigeren Kosten. Beide Modelle sollen auch Astra's Alignment-Gains übernehmen, inklusive weniger irreführender Behauptungen über ihre eigene Coding-Arbeit.
Felix Hartmann: Das ist ein bemerkenswertes Detail, weil es genau die Eigenschaft adressiert, die wir bei Cuey angesprochen haben: Modelle behaupten Selbstbewusstes, und manchmal ist es falsch. Also wenn die Macher da glaubwürdig sein wollen, ist das ein direkter Gegenangriff auf das Problem. Und die Modelle sind laut Angaben live in ChatGPT Work, Codex und über die API.
Lena Vogel: Was manche Leute davon halten, ist ein anderes Kapitel. Ein Kommentator schreibt einen frustrierten Text, sinngemäß: ChatGPT werde immer schlimmer, es sei unfähig, die Font-Weight in einer einzigen HTML- und CSS-Datei zu ändern, und es sage immer Ja, selbst wenn etwas komplett falsch sei. Und die Kritik: Statt Bugs zu fixen, werde eine neue Version gerauncht, die selbst Bugs hat.
Lena Vogel: Das ist eine einzelne, sehr direkte Erfahrung, keine allgemeine Bewertung, aber sie passt genau in die Debatte, die wir mit Cuey eröffnet haben.
Felix Hartmann: Und da ist noch eine offene Frage aus der Community: Arbeitet das Prompt-Caching für Sol und Luna genauso wie für Astra? Antwort: nicht im Quelltext. Aber die Größenordnung, die hier behauptet wird, hat Konsequenzen für Agenten wie Harmony oder Superhuman Go: Wenn die Kosten pro Task so deutlich sinken, ändert sich, was sich ökonomisch automatisieren lässt.
Felix Hartmann: Also 9 Prozent der Kosten pro Task für Sol im Vergleich zu Claude Opus 5, das ist eine andere Rechnung, wenn man tausende Agent-Tasks pro Tag laufen lässt.
Lena Vogel: Was aber wichtig bleibt: Das sind behauptete Benchmarks, keine unabhängige Evaluation. Sol und Luna sind gerade erst raus, und die wirkliche Frage ist nicht, ob die Zahlen stimmen, sondern ob sich das in der Praxis bestätigt. Also wir lassen es als Claim stehen, wie wir es bei allen Benchmarks tun sollten.
Felix Hartmann: Bleiben wir noch einen Moment bei dem Thema Ausgaben und Performanz, denn das ist auch genau die Brücke zu unserem letzten Thema heute: KiwiDesk, ein Tiling-Window-Manager für macOS. Nicht KI, kein Agent, einfach nur Fensterorganisation. Aber es beweist, dass auch einfache, sehr konkrete Produktivitäts-Tools nach wie vor ihren Platz haben, neben all den AI-Assistenten.
Lena Vogel: Der Solo-Entwickler Maikel, der in Deutschland lebt, erzählt in seinem Launch-Post, er liebe Tiling-Window-Manager, aber er könne sie seinen nicht-programmierenden Freunden nie empfehlen. Auf macOS wollen die alle Terminal-Configs, und der mächtigste verlangt, dass man SIP abschaltet, also die System Integrity Protection. Seine Antwort: KiwiDesk braucht nur die Accessibility-Berechtigung. Kein SIP-Abschalten, kein Input-Monitoring, kein Account, keine Analytics.
Felix Hartmann: Was drin ist: Sieben Layouts, inklusive einem "infinite scrolling"-Desktop, auf dem deine Apps auf einem Ribbon sitzen, das mitreist, wenn du den Fokus wechselst. Eine echte native Settings-App mit Slidern und Pickern, kein Config-File. Maus-Nutzer bekommen klickbare Space- und App-Bars, Tastatur-Leute bekommen Hotkeys, Vim-artige Layer und "Open or Focus", also ein Key öffnet eine App oder bringt ihr Fenster zu dir.
Felix Hartmann: Und es arbeitet mit den nativen macOS-Desktops zusammen: Man kann ein Profil an jeden Desktop binden, und das lädt sofort, wenn man dorthin wischt, mit eigenen Spaces, Layouts, Farben und Shortcuts.
Lena Vogel: Kostenlos für private Nutzung, Source verfügbar unter BSL 1.1, also MIT-ähnlich vier Jahre nach jedem Release. Unter der Haube gibt es Lua und eine CLI für Power-User. Benötigt macOS 14 oder höher auf Apple Silicon, installierbar über Homebrew oder eine notarized DMG. Und da ist eine 70-Sekunden-Video-Trailer verfügbar.
Felix Hartmann: Und wieder hat die Community die richtige Frage. Ein Kommentator schreibt, dass die fehlende SIP-Abschaltung für ihn der eigentliche Selling-Point gegenüber Terminal-Config-Managern sei, das sei genau der Kompromiss, der ihn davon abhält, Yabai Nicht-Technikern zu empfehlen. Und dann fragt er: Wie hält das per-Desktop-Profil-Binding mit externen Monitoren stand?
Felix Hartmann: Wenn ich einen zweiten Display abklemme, wartet das an den Desktop gebundene Layout auf die Rückkehr des Monitors, oder wird es dem nächsten Desktop zugewiesen, und ich verliere die Zuordnung?
Lena Vogel: Auch das bleibt im Quelltext offen. Aber es zeigt: Auch bei so einem scheinbar einfachen Tool stecken interessante Edge-Cases hinter der Kurve. Übrigens erwähnt Maikel, dass er Kiwis anbaut, weil Zeit das kostbarste sei, was wir haben, und er "Kiwis für die langweiligen Sachen" züchte. Das ist ein nettes Detail, das die Persona hinter dem Produkt zeigt.
Felix Hartmann: Also, zusammengefasst, wenn wir das mit den Kriterien anschauen, die wir für ein gutes Briefing heute benutzt haben: klarer User-Problem, differentiierter Lösungsansatz, konkrete Fähigkeiten, Preis oder Verfügbarkeit, und belastbare Macher- oder Community-Beweise. Humalike sticht für mich durch die konkrete Live-Phase auf Strefa RP raus, mit einer belegbaren Zahl an Conversations, aber die Memory- und Latenz-Fragen bleiben offen.
Lena Vogel: Bei Clicks Communicator ist das Versprechen am konkretesten, ein physisches Objekt mit messbaren Spezifikationen, aber die Kernfrage, ob die Touch-Tastatur das BlackBerry-Trackpad-Erlebnis wirklich trifft, bleibt offen. Bei Harmony ist die Architektur bemerkenswert durchdacht, aber die Kritik aus der Community zu Audit-Compliance und Genehmigungshierarchien zeigt, dass der Weg von Demo zu Production-Ready noch Steine haben kann.
Felix Hartmann: Cuey ist eine elegante Antwort auf ein reales Problem, aber ohne Tiebreaker bleibt der eigentliche Nutzwert fraglich. Superhuman Go hat eine starke Basis durch die Grammarly-Engine, aber ob proaktiv nicht schnell nervig wird, hängt von Details ab, die noch offen sind. GPT-6 Sol und Luna senken die Kosten, die Benchmarks sind aber Selbstaussage. Und KiwiDesk ist ein kleines, sauberes Stück Handwerk, das genau das Problem löst, das Maikel selbst hatte.
Lena Vogel: Und das ist, glaube ich, das eigentliche Band, das diese Woche zusammenhält: Wir reden über KI, die uns versteht, erinnert, vorschlägt, handelt, und über Tools, die uns die Kontrolle und Übersicht zurückgeben. Physische Tastatur, Fenster-Ordnung, Zweitmeinung von einem anderen Modell, manuelle Eskalation im Helpdesk. Das sind alles Antworten auf dieselbe Frage, wie viel Autonomie wir einer Software zutrauen.
Felix Hartmann: Das war's von uns heute. Danke, dass du dabei warst, und bis zum nächsten Briefing. Und wenn du selbst gerade zwischen zwei Layouts, zwei Modellen oder zwei OS-Versionen schwankst, schreib uns gern, was dich wirklich stört, das ist oft der beste Ausgangspunkt für so ein Briefing.
Lena Vogel: Stimme ich zu. Bis bald, und denk dran: Auch die beste KI braucht manchmal eine zweite Meinung, und manchmal einfach eine gute alte Tastatur.