
0903 | Agentes, código y curiosidades: lo nuevo en IA
Show notes
Recorrido por lo nuevo en IA y apps: infraestructura para agentes, herramientas de código, productividad de escritorio, deepfakes y algunas ideas bizarras.
Línea de tiempo
- 00:00:04 Apertura
- 00:00:30 Infraestructura para agentes IA
- 00:05:43 IA para escribir y entender código
- 00:09:17 Productividad y apps de escritorio
- 00:12:21 Confianza: deepfakes y usuarios
- 00:15:33 Lo curioso y lo práctico
- 00:17:53 Cierre
Enlaces relacionados
- Monid
- HydraDB OSS
- Dial
- Porte
- Basedash AI Sources
- OpenClaw 2.0
- Touchy
- Claude Fable 5.1
- Modeinspect
- Loqua
- Onset MCP
- Doop
- Browzer
- Roadie
- CleanShot 5.0 with Studio Mode
- Parasocial
- Dynamic Edge
- GhostReply
- deepeye by deepidv
- Articos
- Userlens
- Dyson CameraJet
- Stitch AI by Dynamic Mockups
- RoundOS
Este episodio es producido por Bri. Bri usa tecnología avanzada de IA para convertir los feeds que te importan en podcasts pensados para escuchar. Puedes escribirnos a hi@bri.so.
Transcript
Clara Vega: Hola y bienvenidos a otro episodio del programa. Yo soy Clara Vega.
Mateo Ruiz: Y yo Mateo Ruiz. Hoy tenemos un episodio que, en el fondo, trata de una pregunta: ¿qué se necesita para que la IA salga de la demo y funcione de verdad? Vamos a empezar por la infraestructura, porque sin ella no hay agentes, luego los modelos y las herramientas de código, las apps de escritorio, el tema de la confianza con los deepfakes, y al final un par de cosas curiosas, entre ellas un cepillo de dientes con cámara.
Clara Vega: Con cepillo de dientes incluido, sí. Empecemos por lo que creo que es la capa menos visible pero más importante: Monid. La idea es simple de explicar pero ambiciosa: es como el "OpenRouter" de las herramientas para agentes. Tú tienes una sola clave de API, pagas por llamada, sin suscripciones, y con eso accedes a más de mil setecientas APIs.
Mateo Ruiz: Y lo interesante no es solo el número, sino el flujo de trabajo que eso habilita. Según la descripción, el agente en tiempo de ejecución puede descubrir de forma autónoma qué herramientas necesita y llamarlas. O sea, no estás programando con antelación "usa Stripe, usa Twilio", sino que el agente encuentra la herramienta cuando la necesita.
Clara Vega: Exacto, y eso resuelve un problema muy real de hoy. Cualquiera que haya construido un agente sabe que la parte tediosa no es el modelo, es la fontanería: una clave por servicio, facturación por separado, integrar cada SDK. Si eso se colapsa en una clave y un pago por uso, baja mucho la fricción para experimentar.
Mateo Ruiz: Dicho esto, y siendo justos, esto es la descripción del propio producto. "El agente descubre las herramientas por sí solo" es una afirmación del maker, no un resultado verificado. Lo que habría que ver es qué APIs hay realmente detrás, qué tan fiable es ese descubrimiento en la práctica y cómo escala el coste cuando un agente llama a herramientas muchas veces en una misma tarea.
Clara Vega: Bien, siguiente pieza de infraestructura: HydraDB. Es una base de datos gráfica open source escrita en Rust, montada sobre object storage, y está pensada específicamente para dar memoria y contexto a agentes de IA. La promesa es latencia menor a doscientos milissegundos a bajo coste.
Mateo Ruiz: Y el porqué importa es que la memoria es uno de los cuellos de botella clásicos de los agentes. Un agente que no recuerda conversaciones, hechos, relaciones entre entidades, es un agente que empieza de cero en cada sesión. Las bases gráficas son buenas para representar relaciones, pero tradicionalmente son caras de operar. Montarla sobre object storage es el truco para abaratar.
Clara Vega: Que además encaja con la conversación del momento: todo el mundo quiere agentes con memoria persistente, y si eso se puede tener open source y barato, cambia el cálculo para equipos pequeños. Ahora, el tercer bloque es quizá el más llamativo de la tríada: Dial.
Mateo Ruiz: Dial le da a un agente de IA un número de teléfono real en unos diez segundos, a través de una sola API. Con llamadas de voz, SMS, iMessage, y esto es clave, la capacidad de leer códigos de verificación, esos OTP. Cobertura de más de doscientos países, y hay cinco dólares de crédito gratis para empezar.
Clara Vega: Piensa en lo que esto desbloquea. Casi todo servicio del mundo te pide un número de teléfono para registrarte. Si tu agente no puede recibir un SMS, no puede operar en internet de forma autónoma. Dial básicamente le da identidad telefónica a los agentes.
Mateo Ruiz: Y por eso mismo es el que más preguntas abiertas genera de los tres. Dar a un agente un número real y la capacidad de leer códigos de verificación es una herramienta de doble filo. Nosotros no sabemos de la fuente qué controles de uso existe, si hay verificación del cliente o políticas contra abuso. Es una capacidad muy potente y sería razonable preguntarse cómo se regula quién la compra. La fuente no lo dice, así que queda como pregunta abierta.
Clara Vega: Justo. Y para cerrar este bloque de infraestructura, hay tres piezas de apoyo que muestran el panorama desde el lado de los agentes ya funcionando. Primero, Porte.
Mateo Ruiz: Porte es open source y es básicamente un control remoto de teléfono para Grok Build. Emparejas tu móvil y desde ahí puedes leer las transcripciones de lo que hace el agente, enviarle prompts y archivos, ejecutar comandos y aprobar permisos. Y es gratis.
Clara Vega: Lo cual resuelve una incomodidad real: estás lejos del ordenador, el agente pide permiso para algo, y tú quieres aprobarlo desde el móvil. Es infraestructura de supervisión humana, en cierto modo.
Mateo Ruiz: Después, Basedash AI Sources, que ataca otro problema: la opacidad. Cuando una IA te da una respuesta, Basedash te deja inspeccionar qué hay detrás: las tablas que consultó, el SQL, las filas devueltas, las conexiones MCP y las páginas web que usó. Y las acciones que modifican datos se muestran como tarjetas.
Clara Vega: Es auditabilidad. Encaja con la misma idea de fondo: si vas a dejar que un agente actúe, quieres poder revisar qué tocó y de dónde sacó cada dato.
Mateo Ruiz: Y luego están los dos casos que muestran la escala y los límites. OpenClaw 2.0 es un asistente personal de IA local y open source que ahora detecta automáticamente claves de ChatGPT y Claude, y añade sesiones compartidas entre varias personas. Y el dato que da vueltas en la cabeza: en seis meses se convirtió en el proyecto con más estrellas de GitHub, con más de trescientos cuarenta y seis mil.
Clara Vega: Que es un dato de popularidad, no de calidad, pero sí dice algo sobre el apetito que hay por asistentes locales. Y en el otro extremo, Touchy, un asistente de voz para iOS que entiende el entorno y coordina varias apps para completar tareas, con la promesa de que puedas dejar el móvil a un lado. Y aquí viene el detalle revelador: tras el lanzamiento se encontraron con límites de tasa impuestos por los proveedores, y están trabajando en mejorar la fiabilidad.
Mateo Ruiz: Y ese es exactamente el eslabón que conecta con la primera parte. Touchy hace todo lo conceptual bien, entiende contexto, coordina apps, pero choca con las restricciones de las API de terceros. Los límites de tasa, los costes por llamada, la fiabilidad de las herramientas: eso es lo que decide si un agente es juguete o producto. Monid, Dial y HydraDB existen precisamente porque ese cuello de botella existe.
Clara Vega: Y, por supuesto, esos agentes también escriben código. Vamos con eso. El titular grande del bloque es Claude Fable 5.1, que se presenta como el modelo más fuerte para programación y trabajo de conocimiento, y además baja de precio: gracias a una rebaja en la lectura de caché, las cargas típicas cuestan alrededor de un veinticinco por ciento menos, y en tareas de agentes el ahorro llega hasta el cuarenta y cinco por ciento. También hay una versión restringida llamada Mythos 5.1.
Mateo Ruiz: El movimiento es interesante porque marca una tendencia de fondo. Durante un tiempo la conversación fue puramente de capacidades: quién rinde mejor en los benchmarks de código. Aquí lo que vemos es capacidades y precio a la vez, y el ahorro va dirigido específicamente al uso agéntico, que es el patrón más caro porque un agente lee mucho contexto repetidamente y la caché es lo que abarata eso.
Clara Vega: Ahora, lo que eso habilita abajo en la cadena se ve con Modeinspect. Es un canvas de IA que trabaja sobre el codebase real, no sobre una simulación: entiende tus componentes, tus tokens de diseño, los estados, los breakpoints, todo con correspondencia uno a uno. Y de ahí saca pull requests type-safe que se pueden revisar.
Mateo Ruiz: Ese "codebase real" es la parte diferenciadora. Muchas herramientas de IA generan UI a partir de descripciones y luego alguien tiene que adaptarlas al proyecto. Si la herramienta conoce tus componentes reales y tus tokens, lo que produce ya viene alineado con tu sistema, y el resultado es un PR revisable, no un artefacto suelto. Eso cambia dónde entra la IA en el flujo: no antes del código, sino dentro del flujo de trabajo de un equipo.
Clara Vega: Y en el mismo territorio pero por otra vía, Loqua. Es un agente de voz multimodal para Mac y Windows, con dictado a doscientas veinte palabras por minuto y una función que se llama Capture to Ask: capturas la pantalla y hablas, y te responde sobre lo que ves. Lo destacan como no being un wrapper: usan un modelo omni propio, no un modelo de tercero envuelto.
Mateo Ruiz: Que encaja con la conversación de precio y control que abríamos con Claude. Si tu herramienta de dictado y captura es un wrapper sobre un modelo grande, tus costes y tu privacidad dependen de otro. Tener modelo propio, según ellos, les da control sobre ambas cosas. Eso sí, "modelo propio" también es una afirmación del maker; el rendimiento real frente a los grandes modelos habría que verlo.
Clara Vega: Buen resumen. Y alrededor de este bloque hay tres apoyos que muestran cómo se integra la IA en los flujos de desarrollo. Onset MCP es el más directo: vía MCP, Claude o Cursor pueden redactar, planificar y publicar release notes. Tiene un plan gratuito ilimitado con mil suscriptores.
Mateo Ruiz: Es un buen ejemplo de que el punto de integración importa. Nadie quiere escribir release notes; si tu asistente de código puede hacerlo porque ya tiene el contexto del cambio, la tarea desaparece. Doop va más lejos conceptualmente: es un canvas infinito open source donde agentes como Claude o Codex co-diseñan en vivo, con memoria compartida entre ellos, y tú traes tu propia suscripción de IA.
Clara Vega: Memoria compartida entre agentes en un lienzo es una idea que va a dar que hablar. Y el último de este grupo, Browzer, ataca el DevRel: conectas tu repositorio de GitHub y genera documentación, blogs, vídeos de demo, y se auto-repara en cada merge, o sea que se actualiza solo cuando el código cambia. Tiene catorce días de prueba gratis.
Mateo Ruiz: La documentación que se pudre es un problema clásico, así que la idea de que se regenera con cada cambio tiene sentido. Ahora, lo mismo de siempre: la calidad de docs generadas automáticamente depende de la calidad del código y del modelo, y eso cada equipo lo tendrá que validar. En conjunto, el mensaje del bloque es que mejores modelos más baratos están empujando la IA a más puntos del flujo, desde el PR hasta las release notes.
Clara Vega: Y de ahí pasamos, casi sin darnos cuenta, a otro tipo de escritorio: el de las aplicaciones utilitarias. Y aquí hay un patrón claro: cuatro productos que apuestan por la app pulida y el pago único, sin suscripción.
Mateo Ruiz: Empecemos con Roadie, porque resuelve un problema que cualquiera con Mac reconoce. Cada vez que conectas auriculares o desconectas, o entra una videollamada, macOS decide qué micrófono y qué altavoces usar, y a veces se equivoca. Roadie vive en la barra de menú y gestiona automáticamente las prioridades de micro y altavoces. Funciona localmente, no captura audio, está en versión early access 0.9.2 y cuesta nueve dólares con noventa y nueve, una vez.
Clara Vega: El detalle de "no captura audio" es importante para la confianza: una app que toca la configuración de tu micro podría espantar a la gente, así que declarar explícitamente que no escucha es parte del pitch. Después, CleanShot 5.0, que es el estándar de capturas de pantalla en Mac. La versión 5.0 estrena Studio Mode y un editor de vídeo que está disponible en todos los planes, y se mantiene sin suscripción.
Mateo Ruiz: CleanShot ya era la opción de pago único en una categoría llena de suscripciones, y añadir edición de vídeo sin meter una suscripción es una declaración de principios. Para quien hace muchos tutoriales o grabaciones de producto, un editor integrado ahorra saltar a otra app. Queda por ver, claro, si el modelo sin suscripción aguanta a largo plazo cuando hay que mantener un editor de vídeo.
Clara Vega: La tercera es Parasocial, que es un reproductor de podcasts nativo, y "nativo" aquí significa Apple de punta a punta. Puedes descargar episodios nuevos nada más publicarse, tiene listas de reproducción inteligentes, etiquetas y favoritos, y compartir fragmentos. Todo sin necesidad de crear cuenta, y funciona en iPhone, Mac y CarPlay.
Mateo Ruiz: Sin cuenta es un detalle que la gente del ecosistema Apple valora mucho, porque tu biblioteca de podcasts ya vive en tus dispositivos. Y la cuarta cierra el grupo desde el otro lado del charco: Dynamic Edge lleva la Dynamic Island a Windows 10 y 11.
Clara Vega: Está hecha en WinUI 3 nativo, no es un wrapper web, y muestra medios, portapapeles y temporizadores. Es acoplable, dockable, y funciona en múltiples pantallas.
Mateo Ruiz: Que es una ironía divertida: Apple popularizó esa píldora negra en el iPhone y ahora los usuarios de Windows la quieren en su escritorio. Hecho en WinUI 3 nativo significa rendimiento y look-and-feel propio del sistema, que es lo que suele fallar en este tipo de apps. Y en este bloque también hay dos piezas de apoyo: GhostReply y Touchy, que ya mencionamos.
Clara Vega: GhostReply es un auto-respuesta de IA para iMessage que vive en el Terminal de macOS. Lo interesante es que aprende el estilo de cada contacto localmente, usa IA alojada, y el modelo de negocio es diez respuestas gratis y luego cuatro dólares con noventa y nueve de pago único.
Mateo Ruiz: Aprender el estilo de cada contacto localmente es un punto delicado y a la vez el diferenciador: si lo hiciera en la nube, estarías mandando tus conversaciones a un servidor. Que sea local y de pago único lo alinea con el patrón del bloque. Y Touchy, en iOS, vuelve a aparecer aquí porque también es utilidad y asistente contextual. Entre Roadie, CleanShot, Parasocial y Dynamic Edge, el mensaje es que hay público pagando por utilities bien hechas sin atarse a suscripciones.
Clara Vega: Lo cual nos deja con una pregunta incómoda, y es el puente natural al siguiente bloque: cuando tanto software ve y oye por ti, ¿puedes confiar en lo que ves y oyes? Entramos en el tema de la confianza, y el caso más directo es deepeye.
Mateo Ruiz: deepeye es una extensión de navegador que detecta en tiempo real imágenes, vídeos y voces generadas por IA, incluso dentro de WhatsApp. Es gratuita, la desarrolla el equipo de deepidv, y colaboran con Scam.AI compartiendo conjuntos de datos.
Clara Vega: Tres cosas destacan. Una, que cubre los tres formatos: imagen, vídeo y audio. Dos, que funcione dentro de WhatsApp, que es donde circula la mayoría del contenido dudoso que le llega a la gente normal. Y tres, el detalle de que no sube nada, o sea que la detección pasa en tu navegador sin enviar tu contenido a un servidor. Eso resuelve el dilema privacidad frente a seguridad.
Mateo Ruiz: Y la colaboración con Scam.AI para compartir datasets apunta a la verdadera batalla en este campo: los datos de entrenamiento. Un detector de deepfakes es tan bueno como los ejemplos de deepfakes recientes con los que se entrenó, y como los generadores mejoran cada pocos meses, esto es una carrera, no una solución estática. La pregunta que queda abierta, como apuntan las notas, es cuál es la precisión real de la detección en producción, fuera de los casos de demostración.
Mateo Ruiz: Un falso positivo que acusa a una persona real de ser falsa es casi tan dañino como un falso negativo.
Clara Vega: Y esta idea de "conocer de verdad" se extiende más allá de los deepfakes, al conocimiento del usuario. Articos hace investigación de mercado con personas simuladas alineadas con tu ICP, tu perfil de cliente ideal. Les pasas tus mensajes y tus landing pages, y en treinta minutos te da un informe. Dicen haber hecho cuarenta y seis estudios validados con un ochenta y seis por ciento de precisión humana, y hay un cuarenta por ciento de descuento para el lanzamiento en Product Hunt.
Mateo Ruiz: Aquí conviene ser cuidadoso, porque el "ochenta y seis por ciento de precisión humana" es una afirmación del propio maker sobre sus estudios validados, no una auditoría independiente. Y honestamente, el valor de una persona simulada depende de cuánto se parece a tu cliente real. Puede ser estupendo para iterar rápido y barato antes de hacer research con personas de verdad, o puede darte falsa confianza si la sustituyes por el research real.
Mateo Ruiz: Para quién tiene más sentido: equipos pequeños sin presupuesto de research, como primera pasada.
Clara Vega: Y el tercer producto de este bloque, Userlens, va por el lado de actuar sobre ese conocimiento. Su agente se llama Lumi, y combina tu warehouse de datos con analytics para enviar mensajes personalizados dentro del producto, pero con aprobación humana, y mide el comportamiento real después.
Mateo Ruiz: Ese "con aprobación" es lo que lo distingue. Hay muchas herramientas de mensajería in-app automatizada; la novedad aquí es anclar los mensajes en los datos del warehouse y dejar que una persona apruebe lo que se envía. Encaja con la idea de la confianza: automatiza el volumen, pero mantiene un humano en el punto de decisión.
Clara Vega: Y para cerrar el círculo de la verificación, reaparece Basedash AI Sources, que ya vimos en el bloque de infraestructura, con la idea de inspeccionar las fuentes detrás de cada respuesta de IA. Al final, deepeye verifica si un vídeo es falso, Basedash verifica de dónde salió un dato, y Userlens verifica el comportamiento real de tus usuarios. Es el mismo instinto aplicado a tres sitios distintos.
Mateo Ruiz: Y después de tanta seria verificación, toca el bloque de lo curioso y lo práctico, que arranca por el producto más improbable del día: el Dyson CameraJet. Es un cepillo de dientes de cuatrocientos noventa y nueve dólares con noventa y nueve centavos, con una cámara interna a veintiocho fotogramas por segundo que detecta los espacios entre los dientes, y mientras te cepillas, dispara enjuague bucal de forma precisa en esas zonas. El envío está previsto para el ocho de septiembre.
Clara Vega: No vamos a disimular: es el exceso del día. La tecnología suena genuinamente impresionante, una cámara macro dentro de un cepillo viendo tus dientes en tiempo real es un problema de ingeniería real. La pregunta, obviamente, es si eso justifica casi quinientos dólares cuando un cepillo sónico bueno cuesta una fracción. No lo sabemos; no hay forma de saberlo hasta que haya reseñas independientes. Lo dejamos como la frontera entre "asombroso" y "¿quién pedía esto?".
Mateo Ruiz: Y del extremo del exceso pasamos al extremo de lo práctico. Stitch AI, de Dynamic Mockups, es un agente de digitalización de bordado. Le pasas un diseño y en quince segundos te da el plan de puntos por regiones, en formato Tajima DST, que es el estándar que usan las máquinas de bordar reales, más una vista previa del mockup. Y es gratuito.
Clara Vega: Este es un caso muy bonito de IA en un nicho aburrido y real. La digitalización de bordado es un trabajo especializado: convertir un diseño en instrucciones de puntadas por regiones, con direcciones y densidades. Si un agente lo hace en quince segundos y gratis, y el resultado carga en una máquina real vía DST, es utilidad pura para un gremio que no suele recibir herramientas nuevas. Como siempre, la calidad del plan de puntos se comprobará cosiendo, no mirando el preview.
Mateo Ruiz: Y el último es RoundOS Data Room, una alternativa gratuita de por vida a DocSend. Para quien no conozca DocSend: es lo que usan las startups para enviar su deck a inversores, con analíticas. RoundOS da analíticas por página y por visitante, NDA integrados, marcas de agua y enlaces revocables. Y se monetiza a través de Operator, otro producto suyo.
Clara Vega: "Gratuito de por vida" siempre hay que leerlo con curiosidad, pero aquí hay una respuesta concreta: el negocio está en Operator, no en el data room. Para un founder en plena ronda, tener analíticas de qué página del deck miró el inversor y durante cuánto tiempo, sin pagar suscripción, es bastante atractivo. Y las marcas de agua y los enlaces revocables son de esas funciones que solo aprecias cuando las necesitas.
Mateo Ruiz: Y con eso cerramos. El hilo del día, si hay alguno: vimos la fontanería que hace viables los agentes, los modelos que los hacen más capaces y baratos, las apps que nos hacen la vida en el escritorio más fácil, las herramientas que nos ayudan a distinguir lo real de lo falso, y un cepillo que ve tus dientes por dentro.
Clara Vega: Como siempre, todo lo que contamos son las descripciones de sus creadores, no resultados verificados, así que lean con esa lupa. Gracias por acompañarnos, yo soy Clara Vega.
Mateo Ruiz: Y yo Mateo Ruiz. Nos vemos en el próximo episodio.