
0910 | Agentes, confianza y el genoma: la semana en productos
Show notes
Hoy recorremos lo que pasó esta semana en el mundo de los productos: agentes que programan y vigilan otros agentes, plataformas que llevan la IA dentro de los productos, herramientas de confianza y verificación, y una tanda de lanzamientos creativos que van del genoma humano a los boxers con logos. Una guía rápida para entender qué importa y por qué.
Línea de tiempo
- 00:00:04 Apertura
- 00:00:34 Agentes que programan: del lienzo 2D a la fábrica de software
- 00:05:33 Seguridad para agentes: AIF vigila antes de que el agente actúe
- 00:08:31 Agentes dentro del producto: guías en pantalla, runtime y cerebro de equipo
- 00:14:26 Confianza verificada: del CV al genoma
- 00:15:26 Creatividad y espectáculo: del genoma al ring de patos
- 00:16:55 Cierre
Enlaces relacionados
- 49agents IDE
- Mastra Factory
- GoModel
- Harden
- Frigade Assist API
- Noodle Seed
- Muse by Meta
- Type.com
- ChatGPT Images 2.5
- DuckFightClub
- Diiverge
- Ass Auction
Este episodio es producido por Bri. Bri usa tecnología avanzada de IA para convertir los feeds que te importan en podcasts pensados para escuchar. Puedes escribirnos a hi@bri.so.
Transcript
Clara Vega: ¡Hola! Soy Clara Vega, y este es tu resumen diario de lo que se lanzó y se discutió en Product Hunt en las últimas veinticuatro horas. Conmigo, como siempre, Mateo Ruiz.
Mateo Ruiz: Gracias, Clara. Hoy hay un hilo que conecta casi todo lo que vamos a contar: los agentes de IA dejaron de ser una demo y se están convirtiendo en infraestructura. Vamos a verlos programar, vamos a ver cómo se les vigila, cómo entran dentro de los productos que ya usas, y al final algo puramente creativo que recuerda que detrás de todo esto hay una comunidad.
Clara Vega: Empecemos por donde duele: la fatiga. Si alguna vez has dejado corriendo tres o cuatro agentes a la vez, ya sabes que el problema no es hacer que funcionen, es no perderlos. Cuatro terminales, seis pestañas de navegador, un editor y un dashboard, y a los diez minutos no sabes dónde estaba cada cosa.
Mateo Ruiz: Y ahí es donde entra 49agents, que es exactamente eso: un entorno de desarrollo con un lienzo bidimensional y memoria espacial. La idea es que en vez de gestionar decenas de agentes y terminales mediante pestañas, los colocas en un plano. Cada agente tiene su posición, su contexto visual, y vuelves a él porque recuerdas dónde estaba, no porque el sistema te obligue a saltar entre ventanas.
Clara Vega: La parte de memoria espacial me parece la clave. Los humanos somos buenos recordando dónde estaban las cosas en un espacio. Sabes que el agente de refactor está arriba a la izquierda y el que vigila los tests está debajo. Eso convierte el caos en algo que tu cerebro ya sabe ordenar.
Mateo Ruiz: Pero, y aquí quiero ser honesto, la discusión en los comentarios es exactamente la que yo tenía. Uno de los comentarios preguntaba si esto escala más allá de cinco o seis agentes, o si simplemente traslada el cansancio. Si tienes diez agentes en un lienzo, a lo mejor tienes que estar haciendo zoom constantemente para leer lo que hace cada uno. No es una crítica a la idea, es una pregunta abierta que todavía no tiene respuesta.
Clara Vega: Y es una buena pregunta. Paralelizar agentes es fácil de explicar en una demo con tres, y mucho más difícil con treinta cargas reales. Eso es lo que nadie sabe todavía.
Mateo Ruiz: Ahora, si aceptamos que en algún momento tendrás muchos agentes trabajando, el paso siguiente es preguntarse: ¿y quién gestiona el trabajo entre ellos? ¿Quién decide qué issue va primero? ¿Quién revisa el pull request?
Clara Vega: Y ahí es donde entra Mastra Factory, que en la presentación se describe como una fábrica de software. Un entorno open source donde los agentes persistentes llevan un issue desde el intake hasta el pull request. Y no es una lista de pasos en un diagrama: hay un tablero real con columnas, intake, triage, planning, building, review, y los issues se mueven por él.
Mateo Ruiz: El punto que más me llamó la atención es que no es un agente que recibe una tarea y devuelve un archivo. Son agentes persistentes que viven en el repositorio, que tienen contexto de todo lo que ha pasado antes, y que se combinan con un flujo configurable en cada etapa. Es decir, en cada punto del ciclo hay reglas: quién decide si algo pasa de triage a building, qué validaciones hay que correr, quién revisa.
Clara Vega: ¿Y el dato que mencionan? Que ya escribe más del veinticinco por ciento de los pull requests de su propio equipo. Pero ojo: eso es lo que dice el fundador, no un número verificado por nadie externo. Lo tomamos como lo que es, una afirmación del creador sobre su propio producto. No lo podemos confirmar, y tampoco podemos compararlo con otras empresas porque nadie ha publicado datos similares.
Mateo Ruiz: Lo interesante es que no se presenta como un agente que hace magia, sino como un sistema con puertas. En cada transición hay una revisión. El agente construye, y después el pull request pasa por una revisión real, que puede ser de un humano o de otro agente. No se automotivó el flujo: se automatizó la ejecución dentro de un marco con controles.
Clara Vega: Y eso me lleva a una pregunta que la gente hacía en los comentarios: ¿cómo funciona la memoria cuando el mismo agente sirve a muchos usuarios? Si un agente persistente lleva el contexto de un proyecto, ¿qué pasa cuando dos usuarios están trabajando en cosas distintas? ¿Comparten memoria? ¿Se separa por usuario? ¿Se limpia? La respuesta todavía no está clara, y es un tema que Mastra va a tener que resolver.
Mateo Ruiz: Vamos ahora hacia otra capa, que es la red por debajo de todo esto. Si tienes múltiples agentes, cada uno llamando a distintos modelos, distintos proveedores, distintos endpoints, necesitas una capa que gestione el tráfico.
Clara Vega: Y aquí entra GoModel, que es una puerta de enlace escrita en Go. Y no, no es otra librería de Python, es un binario de alrededor de veinte megabytes, con una imagen de Docker de tamaño similar. Lo importante es que es autoalojado, así que tus claves y tu tráfico no pasan por una plataforma de terceros.
Mateo Ruiz: ¿Y qué hace exactamente? Gestiona presupuestos, caché, failover y balanceo de carga. Es decir, si un modelo falla, hay failover. Si otro es más barato, se puede hacer balanceo basado en coste. Si tienes equipos con presupuestos distintos, puedes asignar presupuestos por usuario. Y todo eso en un solo binario que puedes correr tú mismo.
Clara Vega: Y esto es una alternativa directa a cosas como OpenRouter o LiteLLM. No digo que sea mejor ni peor, digo que se está posicionando como la opción si quieres control. Si antes tu solución era una plataforma gestionada, GoModel dice: esto corre donde tú quieras.
Mateo Ruiz: ¿Y qué es lo que la gente preguntaba en los comentarios? Había uno que preguntaba directamente sobre cómo se decide el failover, y otro que preguntaba por el caso de modelos degradados pero no caídos, es decir, modelos que responden pero lentamente o con errores. ¿El failover reacciona a eso también? ¿O solo a errores duros?
Clara Vega: Buena pregunta. No se ha respondido todavía de forma clara. La diferencia entre un modelo que responde mal y un modelo que responde lento es difícil de detectar en tiempo real, y creo que GoModel va a tener que resolverla. En los comentarios había gente preguntando exactamente eso.
Mateo Ruiz: Por cierto, tiene una comunidad en Discord si quieres ver casos de uso reales y hacer preguntas directas.
Clara Vega: Bien, ya tenemos agentes programando en un lienzo, gestionando issues en una fábrica, corriendo detrás de una puerta de enlace. Pero, ¿y quién vigila que no hagan cosas que no deben? Si le das autonomía a un agente y te vas, ¿qué le impide hacer un rm -rf en el directorio equivocado, o pegar un .env en un chat, o enviar una tabla de clientes a un dominio que nadie reconoce?
Mateo Ruiz: Y ahí es donde entra Harden, que describe su producto como AIF, Agentic Integrity Foundation. Y el punto de partida es el mismo que acabamos de ver: la gente babysittea a los agentes. Se quedan ahí aprobando cada comando como padres nerviosos.
Clara Vega: Y eso limita lo que puedes delegar. Si no puedes irte, no estás paralelizando nada. Tu capacidad de delegación está limitada por tu capacidad de vigilancia.
Mateo Ruiz: Así que Harden construyó un modelo post-entrenado de ocho mil millones de parámetros que revisa cada llamada de herramientas antes de que se ejecute. Y es una capa local, no pasa tus datos por la nube. Tu repositorio, tu contexto y la salida de tus herramientas se quedan en tu máquina.
Clara Vega: ¿Y qué revisa exactamente? Comandos, ediciones de archivos, llamadas de herramientas y solicitudes de salida. Es decir, bloquea fugas de secretos, exfiltración de datos y operaciones destructivas de infraestructura. Si la acción está dentro de la tarea, el agente sigue. Si no, pausa, reescribe o bloquea esa única acción, y el agente continúa con el resto.
Mateo Ruiz: Y aquí hay un ejemplo que contó el equipo que creo que ilustra muy bien el caso. Un agente estaba depurando un problema de Stripe. Pasó horas leyendo logs, editando código, corriendo pruebas, preparando datos de diagnóstico. Y una edición previa, sin querer, había dejado direcciones de email de clientes en el archivo final, que el agente luego intentó subir a Datadog.
Mateo Ruiz: AIF razonó la acción, conectó la subida con las ediciones y con los archivos que la produjeron, detuvo la transferencia y le dijo al agente qué había que arreglar.
Clara Vega: Y ese detalle me parece la clave del diseño. No es un firewall que bloquea todo y no explica nada. AIF entendió el contexto, la conexión entre la edición y la subida, y actuó sobre esa única acción. El agente siguió trabajando en todo lo demás. No interrumpió el flujo completo, interrumpió un paso.
Mateo Ruiz: El modelo se dice que supera a modelos frontera en benchmarks de seguridad de agentes. Pero es lo que dice el creador, y no hay una evaluación externa publicada que lo confirme. De nuevo: tomamos la afirmación como lo que es. Y las preguntas abiertas en los comentarios son dos: cuánta latencia añade por llamada de herramienta cuando corres modelos largos, y cómo decide en acciones ambiguas fuera de la intención original.
Mateo Ruiz: Es decir, no acciones obviamente peligrosas, sino acciones que no son claramente peligrosas pero están fuera de lo que pediste.
Clara Vega: Buena observación, y es una pregunta que no tiene respuesta todavía. ¿Y si el agente hace algo raro pero no destructivo? ¿Lo bloquea? ¿Lo deja? ¿Lo reescribe? El equipo dice que AIF razona la intención, pero no sabemos hasta dónde llega esa razonamiento.
Mateo Ruiz: Y la vigilancia, si lo piensas, no se queda ahí. Si un agente trabaja con usuarios, ¿cómo evitas que diga cosas que no debe, o que lleve a los usuarios a sitios equivocados?
Clara Vega: Y eso nos lleva al mundo del producto en sí. Durante mucho tiempo, cuando un usuario preguntaba "¿cómo hago esto?" dentro de tu aplicación, la respuesta era una lista de viñetas regurgitada de un centro de ayuda desactualizado. No porque el agente fuera malo, sino porque no podía ver la pantalla.
Mateo Ruiz: Y ahí es donde entra Frigade con su Assist API, que describe exactamente ese problema. Y su solución es que tu agente registra una herramienta. Cuando el usuario pregunta cómo hacer algo, Frigade renderiza una guía paso a paso directamente sobre tu interfaz, señalando dónde hacer clic. Si no puede construir una guía, le entrega a tu agente una respuesta en texto para transmitir. Y si no puede ayudar en absoluto, lo dice.
Clara Vega: Y eso, si lo piensas, cierra el hueco entre "te lo explico" y "te lo enseño". No digo que el texto sea inútil, digo que la caza del elemento es donde la gente se rinde. Y creo que eso es exactamente lo que Frigade dice que resuelve.
Mateo Ruiz: ¿Y cómo sabe Frigade qué está viendo el usuario? Según el equipo, le das una cuenta de prueba, y su agente de navegador se conecta y construye su propio mapa de cómo funciona la aplicación. Y eso se ejecuta en un horario, así que cuando mueves un botón o lanzas una nueva característica, siempre están actualizados.
Clara Vega: Lo que la gente preguntaba en los comentarios es exactamente lo que yo tenía. Uno preguntaba qué pasa cuando la interfaz cambia y la guía envejece. Cuando un texto desactualizado lo puedes detectar fácilmente, pero una guía desactualizada señala con confianza algo que ya no existe, y el usuario hace lo que le dijeron. ¿Asiste sabe cuando su propia guía se ha desviado?
Mateo Ruiz: Buena pregunta, y creo que es el tema central del debate. ¿Deriva el objetivo cada vez desde el DOM, o es un selector almacenado? Según el equipo, el agente remapea la aplicación, así que la implicación es que el objetivo se deriva del mapa actualizado. Pero la duda de si la guía sabe cuando se ha desviado, no la respondieron todavía.
Clara Vega: Otro preguntaba cómo maneja cosas que la cuenta de prueba no puede ver, como flags de características o niveles superiores de planes. ¿Corren múltiples cuentas o aceptan puntos ciegos? Eso también quedó sin respuesta.
Mateo Ruiz: Ahora, supongamos que tu agente de producto ya funciona. El siguiente paso es: ¿cómo hago que mi producto sea accesible a agentes por fuera? ¿Cómo hago que mi SaaS sea transactable en ChatGPT o en Claude?
Clara Vega: Y ahí es donde entra Noodle Seed, que ofrece un runtime con identidad, permisos y auditoría para que los productos sean agent-ready tanto dentro como fuera, es decir, en ChatGPT o en Claude, sin reescribir el backend.
Mateo Ruiz: ¿Y qué incluye exactamente? Identidad, permisos, gobernanza y operaciones. Saber qué agente actuó, qué cambió y qué necesita atención. Y también incluye cosas como autenticación, intermediación de credenciales, política, límites de tasa, secretos, variables, auditoría y observabilidad, que se envían con el runtime. Así que no tienes que reconstruirlos cada vez para el siguiente agente.
Clara Vega: Y el punto más interesante, para mí, es que no se presenta como "añade un agente a tu producto". Se presenta como "hace tu producto accesible a agentes sin que tú tengas que reconstruir toda la infraestructura debajo". Es decir, tu producto conserva su identidad, sus permisos, sus datos y sus reglas. Noodle Seed gobierna cómo los agentes llegan a ellos.
Mateo Ruiz: ¿Y cómo empiezas? Según el equipo, empiezas con un flujo en un asistente incorporado, lo pruebas para ver si ayuda a los clientes, y luego lo expandes cuando la demanda es clara. Y puedes empezar en tu sitio público, continuar dentro de tu producto, y expandir cuando los clientes lo necesiten.
Clara Vega: ¿Y hay algún ejemplo? Sí, el equipo menciona un travel concierge construido con su starter de viaje, un restaurante aceptando pedidos conversacionalmente en su sitio, una agencia de viajes en línea aceptando pedidos en ChatGPT, y software B2B transactable dentro del Claude de los empleados.
Mateo Ruiz: Lo que la gente preguntaba en los comentarios es: ¿cómo se surfcea una aplicación con marca en ChatGPT hoy? ¿Hay descubrimiento orgánico en el app store aún, o los negocios dirigen a sus propios clientes? ¿Y cómo se mide si esas conversaciones impulsan leads calificados? Eso quedó sin respuesta, y es el tema que Noodle Seed va a tener que resolver.
Clara Vega: Ahora, si dejamos el mundo B2B por un momento, ¿qué pasa con el consumidor? ¿Qué agente personal va a usar tu abuela?
Mateo Ruiz: Y ahí es donde entra Muse, de Meta. La descripción es corta: tu agente personal de IA que logra cosas. Le das un objetivo o una tarea de todos los días, y maneja el resto, desde finanzas y salud hasta compras y las personas que te importan.
Clara Vega: Y hay una pregunta legítima que la gente hacía en los comentarios. Uno preguntaba: ¿cuál es el flujo de aprobación cuando Muse quiere mover dinero o reservar algo en tu nombre? ¿Se confirma cada acción individualmente, o consigue permiso permanente después de las primeras tareas?
Mateo Ruiz: Y eso, si lo piensas, es la pregunta central del agente personal. Las finanzas y la salud son las dos categorías donde quiero más controles, no menos. ¿Qué impide que Muse mueva dinero sin que me entere? La respuesta todavía no está clara.
Clara Vega: Otro preguntaba cómo es diferente de conectar mi cuenta de Claude o ChatGPT a un montón de servicios que ya hacen estas cosas. La respuesta, de nuevo, sin confirmar.
Mateo Ruiz: Otro preguntaba por la disponibilidad en la UE, porque la descripción dice que no está disponible todavía en la UE. Muchos comentarios son gente de la UE esperando.
Clara Vega: Volvamos ahora a las empresas. Hemos visto el producto, hemos visto el runtime, hemos visto al agente personal. Pero durante el día, tu equipo también está usando agentes. ¿Dónde va todo ese contexto? ¿Dónde viven las skills, las apps, los recuerdos?
Mateo Ruiz: Y ahí es donde entra Type, que describe su producto como un espacio compartido donde las sesiones, las skills y las apps del equipo se acumulan en un cerebro de compañía.
Clara Vega: La idea de cerebro de compañía es interesante. No es una base de datos de documentos, es la acumulación de todo lo que tu equipo ha hecho con agentes, organizado de tal forma que se puede reusar. Una skill que alguien escribió, una sesión que alguien tuvo, una app que alguien construyó, todo eso se compounding en algo que otro puede usar.
Mateo Ruiz: Y creo que esta idea de compounding es la que conecta con todo lo demás. Paralelizar agentes funciona mejor cuando los agentes se reusan. La fábrica de software funciona mejor cuando los issues acumulan contexto. Los productos agent-ready funcionan mejor cuando todo comparte identidad. Y el cerebro de compañía es, en cierto sentido, la acumulación de todo lo demás.
Clara Vega: Bueno, ya hemos visto a los agentes programar, a Harden vigilarlos, a los productos hacerlos accesibles, y a Type acumularlos. Volvamos ahora hacia algo totalmente creativo. Y creo que esta semana hay un lanzamiento que recuerda que, detrás de todo esto, hay una comunidad que también juega.
Clara Vega: Empecemos con algo más clásico: imágenes. OpenAI lanzó ChatGPT Images 2.5, que promete imágenes más nítidas, edición multi-turno más fiable y hasta cincuenta por ciento menos latencia.
Mateo Ruiz: ¿Y qué es la edición multi-turno más fiable? Cuando pides un cambio, se mantiene el sujeto, la composición, el estilo, los detalles. No digo que sea perfecto, digo que es lo que promete el creador. Y hay una API para creadores, marketers, retail y flujos de medios.
Clara Vega: Y hay una API con modelos para creativos, marketing, retail y medios. Pero de nuevo, lo de la fidelidad y la latencia es lo que dice OpenAI, no una evaluación externa publicada.
Mateo Ruiz: Bien, ahora algo totalmente distinto. ¿Y si la IA no se usa para trabajar, sino para competir en un ring de patos?
Clara Vega: Y aquí es donde entra DuckFightClub, que es exactamente lo que dice: club de lucha de patos. Ocho equipos entrenan políticas para MicroDucks de Pollen que compiten en sumo simulado, con transmisión en vivo y el Golden Beak Belt como premio. Y ya hay capítulos presenciales agendados.
Mateo Ruiz: Lo que me gustó, para ser honesto, es que es aprendizaje por refuerzo como deporte de espectáculo. No es una demo de investigación, no es un benchmark, es un ring de patos con transmisión en vivo. Y la comunidad lo está jugando.
Clara Vega: Y es aprendizaje por refuerzo como deporte. Ocho equipos entrenan políticas para MicroDucks, y la transmisión es en vivo. Ya hay capítulos presenciales agendados.
Mateo Ruiz: Y algo similar, en cierto sentido, ocurre con Diiverge, que convierte cualquier foto en una aventura puntual y ramificada, donde cada camino queda guardado para el siguiente visitante. Sostenida por packs de escenas y patrocinios.
Clara Vega: La idea de Diiverge es que cada visitante deja un camino, y el siguiente visitante lo puede explorar. No es una historia estática, es una historia que se acumula, con cada visitante dejando algo para el siguiente. Y creo que esa acumulación, otra vez, conecta con todo lo demás. La comunidad, no la tecnología, es el motor.
Mateo Ruiz: Y la semana la remata Ass Auction, una red publicitaria con un solo espacio: unos boxers. Pagas cinco dólares, tu logo entra en la tabla, cualquiera puede superarte, y el rango se recalcula desde pagos reales.
Clara Vega: Y si lo piensas, es la misma dinámica de la comunidad. No hay tecnología compleja, no hay benchmark, no hay tracción fingida. Hay un espacio, hay una tabla, hay pagos reales, y la comunidad compite.
Mateo Ruiz: Bueno, Clara, creo que hemos cubierto mucho esta semana. Un entorno de desarrollo con lienzo bidimensional, una fábrica de software, una puerta de enlace en Go, una capa de seguridad local, guías en pantalla, un runtime agent-ready, un agente personal de Meta, un cerebro de compañía, imágenes más nítidas, y un ring de patos con transmisión.
Clara Vega: Sí, y si hay un hilo que conecta todo, es que los agentes de IA dejaron de ser una demo. Y la infraestructura, la seguridad, el producto y la comunidad los están siguiendo. Gracias, Mateo, y hasta mañana.