
1009 | Agenten, Macs und Motoren: KI-Werkzeuge der Woche
Show notes
Diese Folge blickt auf eine bunte Runde neuer Tools und Modelle: KI-Agenten, die im Terminal, im Slack oder auf dem Handy arbeiten, ein Ausflug in die Welt der Mac- und Windows-Apps, neue Wege bei LLM-Routing und Benchmarks – plus eine Portion Alltags- und Lifestyle-Apps von Filmkamera bis Motorschuhen.
Zeitleiste
- 00:00:04 Einleitung
- 00:00:33 KI-Entwickler im Terminal und Supervision langer Agent-Läufe
- 00:02:50 Agenten aus der Ferne steuern: Handy, Watch und Slack
- 00:05:03 Der Mac als KI-Zuhause: Panels und Home-Server
- 00:07:18 Modelle im Wettbewerb: Routing, Benchmarks und Duplex-Video
- 00:09:50 Anthropic und Google: kleine Modelle, große Integration
- 00:11:19 Werkzeuge rund um SEO, Observability und Infrastruktur
- 00:13:56 Kreativ und analog: Musik-KI und Filmkamera
- 00:15:38 Alltag, Sicherheit und Bewegung: vom Schuh zum SOS
- 00:18:02 Abschluss
Weitere Links
- NOVA CLI v1.0
- pmtui
- BotBus
- Leanback
- Hark
- Side
- Udon
- offstage
- Liquid Inference
- Cekura Bench
- Griffin by Tavus
- Claude Haiku 5.5
- Claude for Google Workspace
- OpenSEO
- KloudMate 2.0
- tunnl.gg
- judged.systems
- Polylane for Vercel
- Tonefold
- Revela
- Paw-Paw
- Drunken Penguins
- Moonwalkers Dusk
- aegis
Diese Folge wurde von Bri produziert. Bri nutzt fortschrittliche KI-Technologie, um die Feeds, die dir wichtig sind, in Podcasts zum Zuhören zu verwandeln. Kontakt: hi@bri.so.
Transcript
Lena Vogel: Herzlich willkommen zur neuen Folge! Ich bin Lena Vogel.
Felix Hartmann: Und ich Felix Hartmann. Schön, dass du wieder dabei bist. Heute schauen wir uns eine ganze Reihe neuer Tools und Launches an, und eines fällt sofort auf: Die KI bewegt sich aus dem Chatfenster raus, in das Terminal, auf den Homeserver, ins Handy, sogar in den Schuh.
Lena Vogel: Genau, das verbindet fast alles heute. Es geht weniger um neue Modelle, sondern darum, wo KI arbeitet und wer sie kontrolliert. Fangen wir da an, wo der Code entsteht: im Terminal.
Felix Hartmann: Also, Nova CLI. Das ist ein KI-Entwickler, der direkt im Terminal arbeitet. Die Idee: Er liest das Projekt, versteht den Kontext, editiert den Code, führt Tests aus und macht Builds. Also nicht nur Vorschläge machen, sondern den ganzen Zyklus durchlaufen.
Lena Vogel: Und was mich am Preis-Modell reizt: In den bezahlten Plänen sind über 160 Modelle mit drin, und man braucht keine eigenen API-Keys. Das ist ein echter Unterschied zu den Tools, bei denen du dich durch jede Provider-Anmeldung kämpfen musst.
Felix Hartmann: Man muss aber vorsichtig sein. Das ist die Beschreibung der Macher. Dass Nova wirklich sauber durch Tests und Builds kommt, bleibt abzuwarten. Für wen ist das denn gedacht, würdest du sagen?
Lena Vogel: Für Leute, die ohnehin im Terminal leben. Entwickler, die den Editor verlassen wollen, wenn eine KI mitschreibt. Das ändert gegenüber bestehenden Optionen vor allem eines: Der Eintrittshürde fällt weg, weil keine eigenen API-Keys nötig sind. Offen ist aber, wie gut die Modell-Auswahl im Alltag funktioniert und was die Pläne genau kosten.
Felix Hartmann: Und wenn du so einen Agenten laufen lässt, entsteht sofort das nächste Problem: Kontrolle. Gerade bei langen Sessions will man nicht neben dem Rechner sitzen und jede Kleinigkeit bestätigen.
Lena Vogel: Genau da kommt pmtui ins Spiel. Das ist ein Supervisor für lange laufende Claude- oder Codex-Sessions, gebaut in Rust und auf tmux aufsetzend. Die Kernidee: Der Autopilot löst Routineentscheidungen selbst, und nur das, was wirklich einen Menschen braucht, wird weitergereicht.
Felix Hartmann: Also im Prinzip ein Filter. Das klingt banal, ist aber der entscheidende Punkt bei Agenten. Wenn jede Mikroentscheidung zu dir zurückkommt, hast du keinen Gewinn. Wenn du aber zu selten gefragt wirst, handeln sie Dinge, die du nie gewollt hättest.
Lena Vogel: Und genau diese Balance versucht pmtui zu ziehen. Rust und tmux sprechen eine klar technische Sprache, das ist ein Werkzeug für Leute, die ohnehin mit Terminals und Sessions arbeiten. Was wir nicht wissen: Nach welchen Kriterien der Autopilot entscheidet, was Routine ist und was nicht. Das ist die eigentliche offene Frage bei jedem solchen System.
Felix Hartmann: Man kann die beiden schön zusammen sehen. Nova kanalisiert den KI-Entwickler in ein Terminal rein, pmtui überwacht ihn dort. Der Trend, den man bei beiden sieht: KI-Entwickler werden nicht mehr isoliert betrieben, sondern eingekanalt und kontrolliert.
Lena Vogel: Und das Kontroll-Bedürfnis hört nicht am eigenen Rechner auf. Was, wenn ich unterwegs bin und der Agent braucht eine Freigabe?
Felix Hartmann: Dann Handy oder Uhr. BotBus macht genau das: Du verwaltest deine Code-Agenten, also Codex, Claude Code und andere, vom Handy oder sogar von der Apple Watch aus. Du kannst Freigaben erteilen, und das Ganze ist Ende-zu-Ende verschlüsselt.
Lena Vogel: Plattformtechnisch breit aufgestellt: macOS, Linux und Windows. Das heißt, der Agent darf auf dem Rechner laufen, wo er hingehört, aber die Entscheidung kommst du vom Sofa oder aus dem Meeting nach.
Felix Hartmann: Die Verschlüsselung ist hier der Punkt, den ich am stärksten finde. Wenn jemand aus der Ferne in meine Entwicklungsumgebung eingreift, will ich wissen, dass das nicht über fremde Server läuft. Ende-zu-Ende ist da Pflicht, keine Kür.
Lena Vogel: Was offen bleibt: wie zuverlässig die Verbindungen im Alltag sind und wie fein die Rechte gesteuert sind. Aber die Richtung stimmt. Und in eine ähnliche Richtung geht ein anderes Tool, nur eben nicht für Entwickler, sondern für Engineering-Manager: Leanback.
Felix Hartmann: Das läuft im Slack und macht tägliche Check-ins. Es liest Tickets und Kalender und macht daraus einen Plan mit Aktionen. Also für Leute, die den ganzen Tag Meetings haben und den Überblick über ihr Team verlieren.
Lena Vogel: Das ist eine spannende Verschiebung. Erst war der Agent im Rechner, dann am Handy, und jetzt sitzt er im Kommunikationstool, wo das Management ohnehin lebt. Ob ein Manager einem Bot im Slack wirklich jeden Tag seine Check-ins gibt, das ist die entscheidende Frage. Slack-Kultur ist da manchmal zäher als jede Technologie.
Felix Hartmann: Und in die gleiche Kategorie gehört Hark Pro, das wir als weiteren Punkt anschauen können. Das ist eine persönliche KI, die proaktiv handelt, also E-Mail, Kalender, Einkäufe, Reisen. Und sie läuft auf einem eigenen Cloud-Computer, die Zugangsdaten sind verschlüsselt, und du siehst, was sie tut.
Lena Vogel: Du siehst, was sie tut, das ist der wichtigste Satz. Bei Agenten, die mit meinen echten Zugangsdaten einkaufen oder buchen, ist Sichtbarkeit die halbe Miete. Was fehlt, ist die Frage, wie gut das im Alltag wirklich funktioniert. Das ist eine Behauptung der Macher, keine geprüfte Erfahrung. Aber die Richtung ist klar: Agenten bewegen sich vom Rechner in den Alltag und ins Management.
Felix Hartmann: Und wenn die Agenten schon so viel übernehmen, brauchst du irgendwo eine Maschine, die sie beherbergt. Was liegt da näher als der Mac?
Lena Vogel: Fangen wir mit dem leichtgewichtigeren an: Side. Das ist ein KI-Panel, das sich neben den macOS-Dock setzt. Mehrere Anbieter in einem Chat, Aufruf über die Tastenkombination Befehl-Umschalt-Leertaste, und es ist kostenlos und Open Source unter MIT.
Felix Hartmann: MIT-Lizenz heißt, du kannst es selbst prüfen und anpassen. Und die Idee, mehrere Anbieter in einem Chat zu vereinen, ist praktisch, weil du nicht mehr zwischen Apps wechselst, wenn du mal ein anderes Modell willst.
Lena Vogel: Für wen ist das? Für Mac-Nutzer, die KI als Werkzeug nutzen, nicht als eigene App-Welt. Was es gegenüber bestehenden Optionen ändert: Der KI-Zugriff wird Teil des Systems, nicht ein separates Programm. Offene Frage: Wie stabil das Multi-Provider-Erlebnis ist, wenn die Anbieter ihre Schnittstellen ändern.
Felix Hartmann: Und eine Stufe tiefer im System geht Udon. Das macht aus dem Mac, genauer aus Apple-Silicon-Maschinen, einen kontrollierten Home-Server. Container, Storage, Terminal, und ein KI-Assistent sind mit an Bord.
Lena Vogel: Der Preis: 29 Dollar lebenslang, mit fünf Tagen Testzeit. Das ist ein klares Angebot, keine Subscription. Für wen ist das gedacht? Für Leute, die ihre Workloads lokal halten wollen, aber nicht die Kommandozeile als Haupt-Werkzeug haben möchten.
Felix Hartmann: Das passt zu einer größer werdenden Bewegung: Lokale Hardware wird zum KI-Zuhause. Dein Mac ist nicht mehr nur Rechner, sondern die Infrastruktur, auf der deine Agenten und Dienste leben. Und im gleichen Thema gibt es noch eine Sache, die ich erwähnen will: offroad.
Lena Vogel: Offroad gibt dem Code-Agenten eine zweite, angemeldete macOS-Konto, damit er über die GUI arbeiten kann, während deine eigene Bildschirm frei bleibt. Auch das ist MIT und braucht Apple Silicon. Das heißt, der Agent kann in Fenstern und Apps arbeiten, ohne deine Arbeit zu stören.
Felix Hartmann: Man kann das mit Side und Udon schön vergleichen. Side sitzt neben dem Dock und ist dein KI-Panel, Udon verwandelt die Maschine selbst in einen Server, und offroad gibt Agenten Platz auf dem Bildschirm, ohne dass sie stören. Alles lokale Mac-Hardware als KI-Umgebung.
Lena Vogel: Und da schließt sich der Kreis zu einem ganz anderen Thema, nämlich zu Modellen im Wettbewerb. Denn wenn lokale Hardware und Agenten zugenommen haben, fragt sich bald, welches Modell eigentlich laufen soll und was es kostet.
Felix Hartmann: Also Liquid Inference. Das dreht das Preismodell um: Anbieter konkurrieren um jeden Prompt, quasi eine Auktion pro Anfrage. Die API ist kompatibel mit OpenAI und Anthropic, es gibt 20 Dollar Startguthaben für die ersten 500 Nutzer.
Lena Vogel: Das ist eine interessante Umkehrung. Statt dass du ein Modell wählst und den Preis akzeptierst, wählt der Markt das Modell und den Preis pro Anfrage. Für wen ist das? Für Leute, die viel durcheinander Modelle nutzen und Kosten optimieren wollen.
Felix Hartmann: Aber hier ist die entscheidende offene Frage, die ich nicht ignoriert will: Wie wirkt sich so ein Routing auf die Qualität aus? Wenn der günstigste gewinnt, kriegst du vielleicht nicht das stärkste Modell. Das ist bei einem kompetitiven Preis-System der springende Punkt.
Lena Vogel: Genau, und die Frage nach Qualität taucht in einem anderen Kontext nochmal auf: bei Benchmarks. Cekura Bench hat 9 Modelle in echten Telefonaten getestet, über 82 Szenarien, und das per Sprache zu Sprache. Das beste Einzelmodell war GPT Realtime 2.1 mit 79,3 Prozent. Interessant ist aber: Eine Kaskade, also mehrere Modelle hintereinander, hat alle Einzelmodelle geschlagen, mit 82,9 Prozent.
Felix Hartmann: Das ist ein wichtiger Befund, weil er zeigt, dass die Wahl des besten Einzelmodells vielleicht die falsche Frage ist. Wenn eine Kaskade besser ist als jedes einzelne Modell, dann ist Architektur wichtiger als Modellwahl. Das passt zu Liquid Inference, denn dort wird pro Anfrage geroutet, und wie sich das auf die Qualität auswirkt, ist offen.
Lena Vogel: Und der dritte Baustein in diesem Thema ist Griffin von Tavus. Das ist laut den Machern das erste Duplex-Video-Modell für Interaktion von Mensch zu Mensch, also echtzeitfähig hin und her. In einer Testgruppe hielten 48 Prozent der Teilnehmenden es für einen echten Menschen.
Felix Hartmann: 48 Prozent, das ist fast eine Münzwurf. Aber Vorsicht: Das ist ein Ergebnis aus einem Test, keine breite Nutzerstudie. Preview ist gerade nur für Testende verfügbar.
Lena Vogel: Trotzdem zeigt es die Richtung. Sprache, Video und Echtzeit kommen zusammen, und die Frage, ob man einem Gegenüber glauben kann, wird zur technischen Frage. Der gemeinsame Nenner bei Liquid Inference, Cekura und Griffin: Modelle werden nicht nur gebaut, sondern verglichen, geroutet und auf Menschlichkeit geprüft.
Felix Hartmann: Und da passt der nächste Schritt rein: Was machen eigentlich die großen Anbieter? Schauen wir auf Anthropic und Google.
Lena Vogel: Zuerst Claude Haiku 5.5. Das ist das kleine Modell von Anthropic, schneller und rund 75 Prozent günstiger, und es ist das erste Haiku-Modell mit einem Aufwandsregler. Also man kann steuern, wie viel Aufwand das Modell investiert.
Felix Hartmann: Der Aufwandsregler ist eigentlich das interessanteste Detail, weil er das kleine Modell nicht einfach nur schneller macht, sondern skalierbar. Für Hochvolumen-Umgebungen ist das genau der Hebel.
Lena Vogel: Für wen ist das? Für Leute, die viele Anfragen haben, also Kundenbetreuung, Klassifizierung, Massenverarbeitung. Was es ändert: Kleine Modelle werden plötzlich feiner steuerbar, nicht nur billiger. Offen bleibt, wie sich die Qualität im Vergleich zu größeren Modellen verhält. Auch hier gilt: Das sind Angaben der Macher, keine unabhängigen Messungen.
Felix Hartmann: Und der zweite Punkt: Claude zieht in Google Workspace ein. Das heißt, es funktioniert direkt innerhalb von Docs, Sheets und Slides. Das ist eine Beta, und sie ist auf bezahlten Plänen verfügbar.
Lena Vogel: Wichtig ist der zweite Teil: Du kannst auch Dateien direkt aus dem Claude-Chat heraus erstellen oder editieren. Also nicht nur im Dokument arbeiten, sondern auch umgekehrt vom Chat aus Dateien anlegen.
Felix Hartmann: Das ist eine klare Integration. Statt Copy-Paste zwischen Chat und Dokument wird es eine Fläche. Wie eng das wirklich verdrahtet ist, und wie zuverlässig Edits in Sheets funktionieren, das muss die Beta zeigen.
Lena Vogel: Und solche Integrationen brauchen im Hintergrund wieder Werkzeuge, zum Beispiel für Observability. Das ist unser nächstes Thema.
Felix Hartmann: Fangen wir mit OpenSEO an. Das positioniert sich als Open-Source-Alternative zu Semrush, mit einer MCP-Schnittstelle für KI-Agenten. Die Daten kommen über DataForSEO, es deckt SEO und AEO ab, und auf GitHub hat es rund 22.700 Sterne.
Lena Vogel: Zwei Dinge finde ich bemerkenswert. Erstens die MCP-Schnittstelle, weil sie bedeutet, dass KI-Agenten direkt die SEO-Daten abfragen können. Zweitens die Sterne auf GitHub, die zeigen, dass die Community groß ist. Aber Sterne sind kein Beleg für Qualität, das ist Wichtigkeit in der Community, nicht Beweis für Funktionalität.
Felix Hartmann: Und das Gegenstück aus der Betriebswelt: Kloudmate 2.0. Das ist eine Observability-Plattform für den Full-Stack, nativ auf OpenTelemetry, und sie bringt KI-Agenten mit: Assistant, Builder, Investigator und Docs. Damit soll Ursachenanalyse und Dashboard-Erstellung laufen.
Lena Vogel: Die vier Rollen sind aufschlussreich. Assistant für Fragen, Builder für Aufbau, Investigator für die Ursachensuche, Docs für Erklärungen. Das heißt, die KI arbeitet nicht nur in deinem Code, sondern in deinen Betriebsdaten.
Felix Hartmann: Und hier zeigt sich dasselbe Muster wie bei OpenSEO: Agenten arbeiten künftig auf Betriebs- und Marketingdaten, nicht mehr nur in der IDE. Ob ein Investigator-Agent wirklich die Ursache findet oder nur plausibel klingt, das ist die entscheidende offene Frage bei beiden.
Lena Vogel: Im gleichen Umfeld gibt es noch drei kleinere Punkte, die dazu passen. Tunnl.gg zum Beispiel macht einen Tunnel von localhost raus, per SSH, mit einer stabilen URL. Die SSH-Schlüssel ist dabei die Identität, keine Installation nötig, HTTPS und Live-Logs inklusive, und der Server ist Open Source unter MIT.
Felix Hartmann: Judged.systems ist eine API für Urteile im Support-Bereich. Ein Ticket wird zu einer Auswahl mit Wahrscheinlichkeiten, als Score oder als Wahrscheinlichkeit, und Schwellenwerte entscheiden, ob man akzeptiert oder überarbeitet.
Lena Vogel: Und Polylane für Vercel ist ein KI-Ingenieur im Bereitschaftsdienst über den Vercel Marketplace. Der untersucht Regressionen mit Beweisen und öffnet einen Pull-Request mit Korrektur zur Überprüfung.
Felix Hartmann: Alle drei zeigen: Agenten rücken in operative Rollen, vom Tunnelbau über Urteile bis zum Bug-Fixing. Und bei Polylane ist der entscheidende Satz, dass der Pull-Request zur Überprüfung offen ist, also der Mensch bleibt in der Schleife.
Lena Vogel: Und nach so viel Arbeit etwas anderes: Musik und analoge Kamera. Das ist unser Kreativ-Block.
Felix Hartmann: Tonefold ist ein Open-Source-Musik-Komponist unter GPL. Es nutzt Claude oder Ollama und erzeugt editierbares MIDI in Schichten. Export in MIDI, WAV und Stems ist möglich, und es gibt einen Produktionsmodus mit Freigaben.
Lena Vogel: Der Produktionsmodus mit Freigaben ist der Punkt. Das heißt, die KI schlägt vor, und du gibst frei. Das ist das gleiche Muster, das wir bei pmtui und Polylane gesehen haben, nur eben in der Musik. MIDI in Schichten heißt auch, du kannst einzelne Ebenen bearbeiten, statt alles zu übernehmen.
Felix Hartmann: Und Revela macht das Gegenteil, quasi eine Gegenbewegung zur Digitalisierung. Das verwandelt das iPhone in eine Filmkamera. Zwölf Filme, keine Vorschau, und die Entwicklung dauert von einer Stunde bis zu Tagen. Preis: 7,99 Dollar einmalig, kein Account nötig, komplett offline.
Lena Vogel: Das ist faszinierend, weil es dem Nutzer die Kontrolle über den Moment zurückgibt. Keine Vorschau heißt, du akzeptierst den Zufall. Ob das im Alltag Spaß macht oder frustriert, das hängt von der Person ab. Aber es zeigt, dass digitale Werkzeuge und analoge Nostalgie sich nicht ausschließen.
Felix Hartmann: Und in diesem Alltag-Bereich gibt es noch zwei kleinere Dinge: Paw-Paw zum Beispiel ist ein kostenloser Desktop-Maskottchen für Mac, das auf Tippen und Klicken reagiert. Mit XP schaltet man Dutzende Maskottchen und über 100 Items frei, ein Extra kostet 2,99 Dollar.
Lena Vogel: Und Drunken Penguins bringt Kartenspiele für Feiern in den Browser. Man hat einen Raum mit Code, geheime Abstimmungen, keine App nötig. Das Startdeck ist gratis, Pakete kosten 1,50 Dollar, und Omi ist dabei.
Felix Hartmann: Beide sind eher kleine Alltagssachen, aber sie zeigen, dass KI und digitale Werkzeuge auch in den Freizeitbereich rutschen. Und jetzt kommt noch ein Block, der etwas körperlicher ist: vom Schuh zum SOS.
Lena Vogel: Also die Moonwalkers Dusk. Das sind motorisierte Schuhe, die bis zu 7 Meilen pro Stunde schaffen, rund 40 Prozent leichter als vorherige Versionen, in drei Größen. Preis: 1.199 Dollar, der erste Lauf umfasst 200 Paare, und der Versand startet am 12. Oktober.
Felix Hartmann: Acht Meilen pro Stunde, pardon, sieben, das ist flott zu Fuß. Für wen ist das gedacht? Für Pendler, die die letzte Meile schneller zurücklegen wollen, ohne Rad oder Scooter zu schieben. Was es ändert: Du brauchst kein zusätzliches Gerät, nur Schuhe.
Lena Vogel: Die Einschränkungen sind aber klar: Nur 200 Paare im ersten Lauf, das ist limitiert. Und bei 1.199 Dollar ist das eine Investition. Ob sie im Regen, auf Bordsteinkanten oder in vollen Straßen wirklich funktionieren, das bleibt offen. Auch hier ist die Beschreibung der Macher eine Behauptung, keine getestete Erfahrung.
Felix Hartmann: Und vom Bewegungsthema rüber in Sicherheit: Aegis ist eine App für persönliche Sicherheit. SOS-Knopf, verbunden mit einer 24/7-Leitstelle, Live-GPS, Audio und Video, ein medizinisches Profil, eine PIN für den Fall von Zwang und Kontakte, die dich schützen.
Lena Vogel: Der Punkt, der mich am stärksten interessiert: die Coercion-PIN. Also eine PIN, die du eingibst, wenn du unter Zwang stehst, und die dann heimlich Alarm auslöst statt einer normalen Entsperrung. Das ist ein cleveres Detail, weil die Situation genau die ist, in der du nicht offen Hilfe rufen kannst.
Felix Hartmann: Und hier schließt sich der Kreis zum Anfang, ganz unbewusst fast: Auch hier entscheidet Verlässlichkeit unter Druck. Bei einer Sicherheits-App ist ein Fehler existenziell. Bei einem KI-Agenten, der eine Entscheidung übernimmt, ist ein Fehler teuer, aber nicht gleich lebensbedrohlich. Trotzdem ist die Frage dieselbe: Kann ich dem System vertrauen, wenn es darauf ankommt?
Lena Vogel: Genau, das ist die rote Linie durch die ganze Folge. Ob Terminal-Supervisor, Home-Server, Duplex-Video oder SOS-App: Es geht um Vertrauen in Systeme, die im Hintergrund arbeiten.
Felix Hartmann: Und was daraus wirklich wird, das ist offen. Einige dieser Dinge sind Beta, manche sind Preview, manche haben nur 200 Einheiten. Die nächsten Monate zeigen, welche davon bleiben.
Lena Vogel: Genau, und wir bleiben dran. Danke fürs Zuhören, bis zur nächsten Folge.
Felix Hartmann: Tschüss, und passe auf dich auf, am besten mit oder ohne App.