0923 | KI-Tool-Welle: Agenten im Alltag

||Download

Show notes

Diese Woche dreht sich alles um KI, die praktisch wird: Agenten, die in Chatrooms, Slack und Workplaces mitarbeiten, neue Modelle und Infrastruktur dahinter, Mac- und Produktivitätstools, Alltags-KI für Verbraucher sowie offene Entwickler- und Sicherheitstools.

Zeitleiste

  • 00:00:04 Einleitung
  • 00:00:47 Agenten werden Teammitglieder
  • 00:05:37 Modelle und Infrastruktur dahinter
  • 00:09:07 Mac- und Produktivitätswerkzeuge
  • 00:11:51 KI für den Alltag
  • 00:15:16 Open Source, Sicherheit und Dev-Basis
  • 00:17:54 Abschluss

Weitere Links

Diese Folge wurde von Bri produziert. Bri nutzt fortschrittliche KI-Technologie, um die Feeds, die dir wichtig sind, in Podcasts zum Zuhören zu verwandeln. Kontakt: hi@bri.so.

Transcript

Lena Vogel: Hallo und herzlich willkommen zum Podcast! Ich bin Lena Vogel.

Felix Hartmann: Und ich Felix Hartmann. Schön, dass du wieder dabei bist. Heute schauen wir uns eine ganze Reihe neuer Tools und Releases an, und das Spannende daran ist: Die Themen greifen ineinander. Da sind KI-Agenten, die langsam keine Werkzeuge mehr sind, sondern als Kollegen im Team auftauchen. Dahinter stehen neue Modelle und Infrastruktur. Und daneben gibt es eine Welle von lokalen, offenen Tools, die genau in die andere Richtung gehen.

Lena Vogel: Genau, und wir bleiben bei dem, was tatsächlich berichtet wird. Bei Marketingversprechen sagen wir klar: Das ist die Behauptung der Macher, nicht ein überprüftes Ergebnis. Loslegen wollen wir bei den Agenten als Teammitgliedern, denn das ist vielleicht das auffälligste Muster dieser Welle.

Felix Hartmann: Fangen wir mit Fez an. Fez ist eine Mac-App, die Agenten als Mitglieder in Chaträumen behandelt. Also nicht als Tool, das du aufrufst, sondern als Teilnehmer, mit dem du in einer Unterhaltung arbeitest. Das Ganze ist auf Basis von nostr gebaut, also einem offenen, dezentralen Protokoll, und für das Routing beziehungsweise die Entscheidungen steckt ein Jev-Modell drin. Und wichtig: Fez ist unter der MIT-Lizenz offen.

Lena Vogel: Das nostr-Detail finde ich erwähnenswert, weil das technische Grundlage und Philosophie zusammenbringt. Wenn Agenten in einem offenen Protokoll leben, sind sie nicht an einen Anbieter gebunden. Andererseits: Offene Lizenz heißt nicht automatisch, dass die Qualität der Entscheidungen stimmt, die so ein Agent trifft. Wie gut das Routing mit dem Jev-Modell im echten Arbeitsalltag funktioniert, das ist eben noch offen.

Felix Hartmann: Die zweite Stufe dieser Entwicklung ist Brev. Brev positioniert sich als KI-Kollege direkt in Slack oder Teams. Konkret heißt das: Ziele verfolgen, Meetings vorbereiten, nachfassen, wenn Dinge offen bleiben. Und es soll mit über fünfzig Integrationen arbeiten. Das ist schon eine andere Kategorie als ein Chatbot, den du mal fragst. Es ist jemand, der über Zeit hinweg Aufgaben trägt.

Lena Vogel: Und du merkst an der Wortwahl "Kollege", wo die Brille sitzt. Was uns fehlt, ist die Frage, wie gut das Nachfassen in der Praxis funktioniert. Nachfassen ist genau der Teil, wo Menschen skeptisch werden: Erinnert mich die KI zu oft, zu selten, mit dem richtigen Ton? Das ist aus dem Quellenmaterial nicht beantwortet, und wir sollten das auch nicht so tun, als wäre es geklärt.

Felix Hartmann: Dann Plane Agents, und da gibt es ein Detail, das ökonomisch interessant ist. Die Agenten treten als Workspace-Mitglieder auf, mit Playbooks, Skills und Triggern. Playbook heißt: Es gibt eine vordefinierte Vorgehensweise. Skill heißt: Bestimmte Fähigkeiten sind abgesteckt. Trigger heißt: Sie reagieren auf Ereignisse. Und das alles ohne zusätzliche Sitzkosten, also ohne dass du für den Agenten einen eigenen Benutzersitzplatz bezahlst.

Lena Vogel: Das Preismodell ist ein echtes Signal. Wenn Agenten Sitzplätze kosten würden, wäre das für Teams schnell eine Hürde. Ohne Zusatzkosten wird es viel leichter, erst mal auszuprobieren, wie sich das im Alltag anfühlt. Aber auch hier: dass der Zugang frei von Sitzkosten ist, sagt nichts darüber aus, wie gut die Playbooks tatsächlich funktionieren.

Felix Hartmann: Was die Agenten dann konkret tun können, zeigt WeWeb MCP. Dort bauen KI-Agenten ganze WeWeb-Apps, also Seiten, Datenanbindung, Workflows. Und der entscheidende Teil: Das Ergebnis wird im visuellen Editor geprüft. Das ist der Kontrollmechanismus. Du lässt die Maschine bauen, aber du schaust es dir in einer Umgebung an, die für Menschen gemacht ist.

Lena Vogel: Das finde ich das vielleicht sauberste Beispiel für die offene Frage in diesem ganzen Thema: Wie sieht Qualität und Kontrolle in der Praxis aus? Bei WeWeb MCP ist die Antwort architektonisch eingebaut: visueller Editor als Prüfschicht. Bei Fez ist die Antwort eher: offener Protokollrahmen. Bei Brev und Plane Agents steckt sie in Playbooks und Integrationsumfang. Vier verschiedene Antworten auf dieselbe Frage.

Felix Hartmann: Und um zu zeigen, dass das Muster über Team-Tools hinausgeht, ein paar Beispiele aus dem gleichen Satz: Anomalo Analyst zum Beispiel setzt KI-Agenten ein, die Data-Warehouse-Daten überwachen und Trends oder Anomalien in natürlicher Sprache erklären. Also wieder: Agent als Kollege, diesmal für Datenqualität.

Lena Vogel: Ähnlich WZRD: Das verwandelt Dokumente, Folien, Formulare oder Tabellen in Konversations-Erlebnisse, mit denen Nutzer sprechen können. Da wird eine Agentenschnittstelle über bestehende Inhalte gelegt. Und PixelCrew geht noch weiter: eine Crew von Design-Agenten, die von Recherche über Designrichtung bis zu Wireframes und produktionsfertigem HTML arbeiten. Immer dieselbe Idee, ein Team von Agenten, das eine Pipeline durchläuft.

Felix Hartmann: Noch zwei, die das Bild abrunden. Clueso MCP lässt dich über Claude oder ChatGPT Videos erstellen oder bearbeiten, ausgehend von einer Idee oder einer Bildschirmaufnahme, mit vollständig editierbarem, markenkonformem Ergebnis. Und VideoFlow Studio ist ein npx-Tool, bei dem dein Coding-Agent aus der URL deiner Website ein editierbares Launch-Video macht.

Lena Vogel: Und dann noch ResumeContext, das eher ein Infrastrukturproblem löst: Es fasst Sitzungen verschiedener Coding-Agenten, also Claude, Codex oder Cursor, in einer Datei pro Projekt zusammen. Auch das ist wieder der Gedanke: Agenten arbeiten parallel, und jemand muss die Fäden zusammenführen.

Felix Hartmann: Das Muster ist also ziemlich klar: Agenten wandern von der Werkzeugrolle in die Teammitgliederrolle. Was wir nicht behaupten können: dass irgendeines davon schon bewiesen hat, dass es in echten Teams zuverlässig funktioniert. Das bleibt die offene Frage. Und diese offene Frage führt uns direkt zum nächsten Thema, denn solche Agenten brauchen Modelle im Rücken. Schauen wir, was da passiert ist.

Lena Vogel: Das erste ist Xiaomi mit MiMo-V2.6, einer Reihe offener Omnimodal-Modelle, es gibt Pro und Flash. Omnimodal heißt grob: mehrere Modalitäten, nicht nur Text. Die Kontextlänge liegt bei einer Million Tokens. Und das Entscheidende: Die Gewichte sind veröffentlicht, und auch der Reinforcement-Learning-Code wurde öffentlich gemacht.

Felix Hartmann: Dass der RL-Code mit raus ist, ist das Detail, das ich hervorheben würde. Gewichte allein sagen dir, was das Modell kann, aber nicht, wie es dorthin kam. Wenn der Trainingscode offen liegt, kann die Community nachvollziehen und weiterbauen. Das macht die Veröffentlichung substantieller als nur ein Modell-Download.

Lena Vogel: Auf der Gegenseite xAI mit Grok 4.7. Das Modell zielt laut Macher auf Code und lange Arbeitsaufgaben. Preislich: zwei Dollar pro Million Input-Tokens und sechs Dollar pro Million Output-Tokens. Verfügbar ist es in Cursor, in Grok Build und über die API.

Felix Hartmann: Der Preis ist bewusst niedrig angesetzt, vor allem im Vergleich zu den Oberklasse-Modellen. Aber Vorsicht mit der Interpretation: Preis ist ein Geschäftsentscheidung, keine Qualitätsaussage. Dass Grok 4.7 für Code und lange Aufgaben gut ist, ist die Beschreibung von xAI, nicht ein Benchmark-Ergebnis, das wir geprüft haben.

Lena Vogel: Und dann die Infrastruktur-Ebene, konkret Europa. 2BA.AI bietet Inferenz an, die in der EU gehostet ist. Zwanzig Euro im Monat für viertausendfünfhundert Anfragen in einem Fünf-Stunden-Fenster, ohne Logs, und OpenAI-kompatibel in der Schnittstelle.

Felix Hartmann: Drei Details zählen hier. Erstens die EU-Hostung, das ist für Unternehmen mit Datenschutzanforderungen relevant. Zweitens "zero logs", also keine Protokollierung der Anfragen. Drittens die OpenAI-Kompatibilität, die den Wechsel cheap macht, weil du deinen bestehenden Code weiterbenutzen kannst.

Lena Vogel: Was uns fehlt, ist dasselbe wie bei den Agenten: Wie schneiden diese Modelle und dieser Dienst im echten Alltag ab? Benchmarks der Macher und Preise sagen etwas über das Angebot, aber nichts darüber, wie es sich in deinem Projekt verhält. Und diese Modelle brauchen übrigens auch eigene Bausteine darunter. Da gibt es zwei interessante Stücke: Valori zum Beispiel ist eine Memory-Schicht für KI, mit Vektoren, Graphen, deterministischem Zustand im Q16.

Lena Vogel: 16-Format und BLAKE3-Verifikation, mit SDKs für Python und TypeScript. Also im Grunde: einem KI-Agenten ein Gedächtnis geben, das überprüfbar ist.

Felix Hartmann: Und vgpu von Vercel, eine TypeScript-Bibliothek für WebGPU, explizit für Agenten gebaut. Typisierte WGSL-Shader, läuft im Browser, in Node headless und in CI, und das Ganze in nur fünfundzwanzig Kilobyte. Das zeigt, wie die Infrastruktur neben den Modellen wächst.

Lena Vogel: Kurz noch zwei Randnotizen aus diesem Bereich: Freebuff Ads platziert Werbung innerhalb von Coding-Agenten mit angeblich fünfundertausend erreichbaren Entwicklern, Bezahlung pro Klick und einem Angebot von fünfhundert Dollar Startguthaben. Das zeigt, dass auch diese Umgebung kommerzialisiert wird.

Felix Hartmann: Und Jev Wrapped analysiert Telegram-Kanäle auf den Anteil von Werbung und Clickbait, das Jev-Modell bewertet dafür fünfzehnhundert Posts. Auch hier wieder: ein Werkzeug, das auf einem dieser Modelle aufsetzt. Von der Infrastruktur zurück zu den konkreten Geräten: Es gibt nämlich eine ganze Reihe neuer Mac-Werkzeuge, und die haben ein gemeinsames Motiv.

Lena Vogel: Das Motiv ist: lokale Kontrolle statt Cloud-Zwang. Das erste ist Diurnal, eine Mac-App, mit der du Aufgaben über Tastenkürzel direkt in Google Calendar einfängst. Die Shortcuts sind Alt-Komma-Cmd-K beziehungsweise Alt-Cmd-L. Die App arbeitet offline und unterstützt die Wochenplanung.

Felix Hartmann: Das ist ein schön enges Versprechen. Es geht nicht um ein komplettes Task-Management-System, sondern um eine einzige Schleife: dir kommt etwas in den Sinn, Tastenkürzel, fertig, es steht im Kalender. Und der Offline-Modus ist bei so etwas mehr als ein Feature, weil Planung oft genau dann passiert, wenn du keine Verbindung hast, im Zug, im Flugzeug.

Lena Vogel: Das zweite ist Fulvid, ein quelloffener Markdown- und MDX-Desktop-Editor. Der Kern: Deine Dateien liegen schlicht auf der Festplatte. Kein Vault, kein eigenes Datenbankformat, keine Cloud. Verfügbar für Linux, Windows und macOS.

Felix Hartmann: "Kein Vault" ist der Satz, den viele gehört haben wollen. Wenn dein Editor ein eigenes Format oder einen eigenen Cloud-Dienst erzwingt, bist du an ihn gebunden. Fulvid macht das Gegenteil: Markdown bleibt Markdown, in deinem Dateisystem, portabel. MDX-Unterstützung ist übrigens relevant, weil MDX Markdown mit eingebetteten Komponenten mischt, also für Dokumentation und Content-Sites beliebt ist.

Lena Vogel: Und das dritte, das ist ein etwas anderes Problem, aber vom selben Geist: QuietGlass. Kostenlos, quelloffen, Mac-App, und sie verwischt deinen Bildschirm automatisch. Und zwar in zwei Situationen: wenn du wegschaust, erkannt über AirPods, oder wenn ein Gesicht in der Nähe erkannt wird.

Felix Hartmann: Das AirPods-Detail finde ich klug. AirPods wissen, ob du sie gerade trägst oder abnimmst, das ist eine billige, verlässliche Information im Vergleich zu Kameraerkennung. Die Gesichtserkennung für Personen in der Nähe ist der zweite Pfad, etwa wenn jemand neben dich tritt. Datenschutz am Arbeitsplatz oder im Café, ohne dass du manuell etwas sperren musst.

Lena Vogel: Was wir wieder nicht wissen: wie zuverlässig die Erkennung im Alltag ist. Fehlalarme, verpasste Momente, das ist bei so einem Sicherheitstool der kritische Teil. Aber das Muster der drei Tools stimmt überein: kein Cloud-Zwang, lokale Kontrolle, offen wo möglich. Und auch Sprache und Text am Mac werden übrigens zum KI-Fall: Blurt ist eine open-source Mac-App für Push-to-talk-Diktat, gebaut auf der Dictation-API von AssemblyAI, und der Text erscheint genau dort, wo du gerade tippst.

Felix Hartmann: Und Edyt bringt KI in jede beliebige Mac- oder Windows-Anwendung: Über einen Shortcut lässt sich Text am Cursor umschreiben oder übersetzen, und es kann Bildschirme und PDFs lesen. Der kostenlose Plan umfasst etwa hundertdreißig Bearbeitungen pro Tag.

Lena Vogel: Damit sind wir beim Alltag, und dort spielen auch die großen Geräte eine Rolle. Das auffälligste ist der Googlebook: ein Laptop, der eigens für Gemini entworfen ist und sich mit Android-Handys synchronisiert. Ab achthundertneunundneunzig Dollar, Vorbestellungen sind offen.

Felix Hartmann: Das ist im Grunde die Antwort auf eine Frage, die sich die ganze Branche stellt: Wenn die KI der Kern des Computers ist, sieht dann der Computer anders aus? Google sagt hier offenbar ja und macht den Laptop um Gemini herum. Die Android-Synchronisation ist der Versuch, das Ökosystem, das Google beim Handy hat, auf den Laptop auszuweiten.

Lena Vogel: Preislich liegt das mit achthundertneunundneunzig Dollar in einem Bereich, wo normale gute Laptops auch liegen. Das heißt: Es ist kein Premium-Preis für ein Experiment, sondern ein Massenmarkt-Angebot. Ob "für Gemini gebaut" im Alltag einen echten Unterschied macht, kann zur Launch-Zeit niemand seriös sagen.

Felix Hartmann: Dann Hola AI, ein Dienst für dein Telefon. Die KI geht ans Voicemail: Sie beantwortet Anrufe, filtert Spam raus und schickt dir Zusammenfassungen. Preis: viereinhalb, nein, vier Dollar neunzig neunzig pro Monat, genauer vier Dollar neunzehn, halt: vierneunzig neunzehn, ich sag's einfach: vier Dollar neunzig neunzig, in den ersten sechs Monaten.

Lena Vogel: Lass mich das sauber machen: vier Dollar neunundneunzig, also 4,99 Dollar, pro Monat, für die ersten sechs Monate. Danach ändert sich der Preis offenbar, das ist aus dem Material nicht spezifiziert, und genau das ist die Einschränkung, die man erwähnen sollte. Was der Dienst verspricht: kein Anruf-Management mehr manuell, die KI sortiert vor.

Felix Hartmann: Für Bildungs-Content gibt es Keet, eine iOS-App aus dem Y-Combinator-Umfeld. Sie erzeugt Videokurse im Duolingo-Stil, also kuratiert, spielerisch, zu jedem beliebigen Thema. Zwei Kurse sind gratis, danach zahlt man mit Credits.

Lena Vogel: Das "zu jedem Thema" ist der spannende Teil und zugleich der zweifelhafte. Für Nischenthemen, für die es keinen guten Kurs gibt, könnte das sehr wertvoll sein. Ob die Kurse die Qualität etablierter Lernplattformen haben, ist offen. Das Duolingo-Format heißt: viel Struktur, kurze Einheiten. Für manche Lernstile passt das, für andere nicht.

Felix Hartmann: Und ein kleines Tool für die Suche: ReallyFree, eine Browsererweiterung, die Suchergebnisse markiert. Punkte in grün, gelb oder rot zeigen an, ob etwas wirklich kostenlos ist. Also grün: wirklich gratis. Gelb: mit Einschränkungen. Rot: eher nicht. Ganz ohne Tracking, sagt der Hersteller.

Lena Vogel: Das löst ein sehr reales Ärgernis: Du suchst ein kostenloses Tool, landest auf einer Seite, die "kostenlos" verspricht, und nach dreißig Klicks stellt sich heraus, dass die Gratis-Version nutzlos ist. Eine Ampel direkt in den Suchergebnissen ist ein direkter Angriff auf dieses Muster. Ob die Klassifizierung zuverlässig ist, hängt natürlich davon ab, wie sie zustande kommt, das ist aus dem Material nicht klar.

Felix Hartmann: Und noch drei Bausteine aus dem Alltags-Umfeld: thestory.run ist ein Schreibcoach für LinkedIn-Posts, wobei der Coach dich interviewt und du selbst schreibst, gratis bis zu fünf Personen. Xem ist ein open-source E-Mail-Marketing-Tool mit visuellem Editor, Automatisierungen, über zweihundert Templates und eigenem Versand über Amazon SES oder SMTP. Und Pulsetic RUM erweitert Uptime-Monitoring um echte Besucherdaten, also Core Web Vitals von echten Nutzern und Fehler-Tracking nach Seite und Land.

Lena Vogel: Damit sind wir beim letzten großen Thema: Open Source, Sicherheit und die Entwickler-Basis. Das erste ist Prowler Cloud, und das hat schon eine beachtliche Geschichte: über fünfundvierzig Millionen Downloads. Es prüft Cloud-Umgebungen, also AWS, Azure, Google Cloud und Kubernetes, auf Sicherheitsprobleme.

Felix Hartmann: Und die Architektur ist hier das Interessante: deterministische Checks plus agentische KI plus MCP. Das heißt, die Basis sind klare, nachvollziehbare Regeln, also Check X gegen Regel Y. Und die KI kommt als Schicht darüber, etwa um Kontext zu liefern oder Fragen zu beantworten. Das ist ein vernünftiges Design, weil Sicherheit Ergebnisse braucht, die du reproduzieren kannst, und KI allein wäre da riskant.

Lena Vogel: Genau diese Trennung ist wichtig. Ein deterministischer Check sagt: Das ist verletzt, Punkt. Die agentische KI kann helfen, das einzuordnen, aber sie ist nicht die Quelle der Wahrheit. Bei Compliance und Audits ist diese Unterscheidung der Unterschied zwischen brauchbar und nicht brauchbar.

Felix Hartmann: Dann SereneDB, eine quelloffene Datenbank-Engine, die kompatibel zu Postgres und zu Elastic ist. Der Anspruch: schnelle Volltextsuche plus Analytics, und laut eigenen Aussagen Top-Benchmark-Ergebnisse.

Lena Vogel: Das Wort "eigenen Aussagen" ist hier entscheidend. Diese Benchmarks stammen vom Hersteller selbst, und wir haben keine unabhängigen Messungen. Was hier trotzdem real ist: die Doppel-Kompatibilität. Postgres-Kompatibilität heißt, dein bestehendes relationales Wissen und dein Werkzeugkasten funktionieren weiter. Elastic-Kompatibilität heißt, Such-Workloads können wechseln, ohne alles neu zu bauen. Das senkt die Einstiegshürde erheblich.

Felix Hartmann: Und ob die Performance unter echter Last hält, also mit echten Datenmustern, echter Parallelität, echten Peak-Zeiten, das bleibt die offene Frage bei so gut wie jedem neuen Datenbank-Release. Benchmarks sind fast immer Kurven unter Idealbedingungen.

Lena Vogel: Das dritte in dieser Kategorie ist gg-friggin-ez, und der Name verrät schon den Ton. Es ist ein kostenloses Node.js-Tool, das Beleidigungen und Toxizität in Texten filtert. Es benutzt die Modelle Jev und Laya, ist mehrsprachig und evasion-bewusst, erkennt also auch Versuche, den Filter durch Listung zu umgehen, etwa durch absichtliche Falschschreibung.

Felix Hartmann: "Evasion-bewusst" ist bei solchen Filtern der eigentliche Test. Jeder simple Wortlisten-Filter lässt sich in Sekunden umgehen. Ob die Modelle hier wirklich robust gegen kreative Umgehungsversuche sind, ist eine empirische Frage, die die Beschreibung allein nicht beantwortet.

Lena Vogel: Jetzt können wir den Bogen schlagen. Wir haben heute Agenten gesehen, die zu Teammitgliedern werden, bei Fez, Brev, Plane Agents, WeWeb MCP und vielen Randbeispielen. Dahinter neue Modelle wie MiMo-V2.6 und Grok 4.7 und EU-Infrastruktur wie 2BA.AI. Mac-Werkzeuge, die auf lokale Kontrolle setzen, Diurnal, Fulvid, QuietGlass. Alltags-KI von Hola AI bis Googlebook. Und schließlich die offenen Fundamente: Prowler, SereneDB, gg-friggin-ez.

Felix Hartmann: Was ich mitnehme: Die Muster sind real. Agenten werden Kollegen, Modelle werden offener und günstiger, und die offenen Tools drängen in Bereiche, die früher proprietär waren. Was unklar bleibt: die Praxis. Wie gut diese Agenten in echten Teams arbeiten, wie die Modelle unter realer Last abschneiden, wie die Benchmarks unter echten Datenmengen halten. Das sind die Fragen, die die nächsten Monate beantworten werden.

Lena Vogel: Danke, dass du dabei warst. Wir haben bewusst bei den Behauptungen der Macher Halt gemacht, wo sie es waren, und nicht so getan, als hätten wir alles getestet. Wenn dir diese Unterscheidung wichtig ist, freut uns das. Bis zum nächsten Mal!

Felix Hartmann: Tschüss, und bis bald!