
0903 | Modelos más baratos, promesas a prueba
Show notes
Un repaso a la semana en tecnología: modelos de IA cada vez más baratos y potentes, sus límites de fiabilidad, cómo la IA cambia nuestros hábitos, movimientos del negocio, y avances en ciencia y máquinas.
Línea de tiempo
- 00:00:04 Apertura
- 00:00:30 Carrera de modelos y costes
- 00:03:27 ¿Se puede confiar en lo que dice la IA?
- 00:06:09 IA y cómo pensamos y vivimos
- 00:08:17 Propiedad de datos y servicios
- 00:09:49 Negocios: retiradas, precios y regulación
- 00:11:40 Máquinas y mundos generados
- 00:13:28 Ciencia, memoria e historia
- 00:15:31 Cierre
Enlaces relacionados
- Introducing Muse Spark 1.3
- Muse Spark 1.3
- Gemini 3.8 Flash and 3.8 Flash Cyber
- LLMs: Intelligence vs. Cost
- Show HN: FrontierHarness Eval – 9 harness, same model, cost per pass varies 17x
- A third of Perplexity's citations don't contain the number they're cited for
- Three sites made 215,128 “best software” pages for AI. Perplexity cites them
- Mushroom hunting with LLMs: what can go wrong?
- Check if a file was made with Claude
- Six curl CVEs after OpenAI and Anthropic came back with zero
- Mamdani Bans AI in NYC Schools
- I wanna live an NPC life
- Exit the Cave
- WebLLM: high-performance in-browser LLM inference engine
- Saving money on Google Photos with Immich: Your own personal photo storage
- SteamdDB Joins Nexus Mods
- Can I opt out of my input or output data being used for training?
- Uber shuts operations in Nigeria and Uganda with immediate effect
- A Note from LWN
- GrapheneOS says Pixel 11 has MTE support after all
- Google avoids a breakup of its ad tech business
- Reasons robotics is hard
- Fable 5.1 World Modeling
- The Emergent Symbolic Structure of Artificial Neural Networks
- Poisson Disk Sampling
- Biggest dark matter detector spots a single weird particle
- Aging brains blend memories together instead of just forgetting them
- Commodore 64 released September 1, 1982
- Qantas Airbus A380 engine failure in 2010 (2023)
Este episodio es producido por Bri. Bri usa tecnología avanzada de IA para convertir los feeds que te importan en podcasts pensados para escuchar. Puedes escribirnos a hi@bri.so.
Transcript
Clara Vega: ¡Hola y bienvenidos a otro episodio! Soy Clara Vega.
Mateo Ruiz: Y yo soy Mateo Ruiz. Hoy tenemos un programa cargadísimo: hay una carrera feroz de modelos y precios, una conversación muy jugosa sobre si se puede creer en lo que dice la IA, y también debates sobre cómo vivimos con ella, sobre quién controla nuestros datos, sobre negocios que se repliegan o regulan, y hasta sobre máquinas y mundos generados. Vamos a ir hilo a hilo, con lo que se está discutiendo realmente en los comentarios.
Clara Vega: Empecemos por el tema más caliente: Meta ha lanzado Muse Spark 1.3, orientado a tareas de agentes y programación, con razonamiento máximo. Y lo más llamativo: afirman paridad con GPT 5.6 Sol y con Opus 5 en varios benchmarks.
Mateo Ruiz: Sí, y aquí es donde quiero ir más allá del titular, porque las afirmaciones de los fabricantes siempre hay que mirarlas con lupa. Lo interesante es que en esta ocasión hay una prueba independiente que se puede contrastar: simonw hizo pruebas reales con el modelo y su veredicto es que la calidad de los SVG que genera es mejor que la de la versión 1.2. O sea, no es solo marketing: hay al menos una mejora medible, aunque en una tarea muy concreta.
Clara Vega: Y el precio importa mucho en esta comparación. Muse Spark 1.3 viene con un millón de tokens de contexto, y cuesta 1,25 dólares por millón de tokens de entrada y 4,25 de salida.
Mateo Ruiz: Que no es nada caro para un modelo que presume de estar al nivel de los de primera línea. Y justo ahí entra Google, que ha lanzado Gemini 3.8 Flash a 0,75 y 3,75 dólares por millón de tokens, con mejoras en código y agentes, más una variante llamada 3.8 Flash Cyber especializada en ciberseguridad.
Clara Vega: Un dato que me parece revelador: es el tercer Flash que sacan en seis semanas.
Mateo Ruiz: Exacto, y esa cadencia es lo que abre la gran pregunta de fondo: ¿es sostenible tantas versiones tan seguidas? Y la otra: ¿son siquiera comparables los benchmarks entre modelos que se lanzan cada dos por tres? Porque los fabricantes eligen los benchmarks donde quedan bien, y de ahí las afirmaciones de paridad.
Clara Vega: Y hay una crítica aún más profunda sobre cómo comparamos modelos. OpenTeams ha criticado los gráficos de inteligencia frente a coste de ArtificialAnalysis, y su argumento es doble: por un lado, usar ejes logarítmicos en el precio disimula las diferencias reales entre modelos; un modelo diez veces más caro se ve casi pegado al barato.
Mateo Ruiz: Y por otro lado, algo que me parece muy acertado: dicen que los modelos locales deberían valorarse por su coste eléctrico, no por su precio de API. Porque si ejecutas un modelo en tu propia máquina, tu coste es la energía, y medirlo con la vara del API te da una foto falsa del mercado.
Clara Vega: Bien, y ahora la pieza que une todo esto: FrontierHarness. Han ejecutado nueve agent harness distintos, o sea nueve entornos de agente, con el mismo modelo, Kimi K3. Y el resultado es espectacular: el coste por tarea varía diecisiete veces, desde 1,05 dólares hasta 18,34.
Mateo Ruiz: Diescisiete veces el mismo modelo. Eso significa que el harness no es un detalle técnico: es la mitad de la ecuación. Si cambias de entorno de agente, cambias radicalmente tu factura, y probablemente también tus resultados. Y conecta directo con lo que decíamos: si ni siquiera el entorno es neutral, ¿cómo vamos a comparar modelos entre sí de forma honesta?
Clara Vega: La pregunta queda abierta. Yo diría que el mercado está en fase de lanzamientos compulsivos y las herramientas de comparación aún no han madurado. Y esa inquietud, precisamente, ¿cómo saber en qué confiar cuando hay tanta oferta?, nos lleva perfectamente a la siguiente conversación.
Mateo Ruiz: Vamos con ella. Haus Research ha hecho una auditoría de Perplexity y los números son duros: de 1.826 citas, el 34,7 por ciento de las páginas o no abren o directamente no contienen el número que se les atribuye. Si lo mides por afirmaciones, el fallo baja al 14,4 por ciento, pero sigue siendo un problema serio.
Clara Vega: Hay una distinción importante ahí que merece subrayarse. No es lo mismo que una página esté caída, lo cual puede ser ajeno al buscador, que que la página exista y no diga lo que se cita. La auditoría separa ambas cosas, y aun contando solo los fallos por afirmación, la cifra es alta.
Mateo Ruiz: Y hay un segundo hilo que agrava el panorama: tres sitios creados a finales de 2023 generaron 215.128 páginas de tipo «best software», contenido hecho para IA. Y se detecteda que el 59,8 por ciento de las citas de Perplexity salen de fuera del top 100.000 de Tranco, o sea, de sitios con muy poca audiencia real.
Clara Vega: Que encaja con lo que sospechan muchos: los buscadores de IA son especialmente vulnerables a contenido fabricado a escala para atraer citas. No es que Perplexity cite mal por descuido; es que el ecosistema está lleno de granjas de contenido y el buscador no distingue bien.
Mateo Ruiz: Y si quieres un ejemplo donde equivocarse no es abstracto: un estudio usó el dataset FungiTastic, con 340.000 observaciones y 2.800 especies, para poner a prueba a cuatro LLM, entre ellos GPT-5.6-Sol, identificando setas venenosas. Y los errores son peligrosamente altos.
Clara Vega: Setas es el caso perfecto porque el coste del error es tu salud, no tu tiempo. Un modelo que acierta el 90 por ciento de las veces en una tarea trivial es excelente; el mismo porcentaje en setas venenosas es inaceptable. La moral de todo este bloque es clara: verificar antes de confiar.
Mateo Ruiz: Y justo sobre la verificación hay una herramienta nueva: Anthropic ha lanzado un detector de credenciales de contenido C2PA, que permite comprobar si un archivo ha pasado por Claude. Es un paso en la dirección de poder señalar señales de contenido generado.
Clara Vega: Aunque con una salvedad que los propios comentarios subrayan: que un archivo no tenga credenciales no significa que no sea generado por IA. La ausencia de prueba no es prueba de ausencia. Es un detector de una vía, no un detector universal.
Mateo Ruiz: Y en la línea de la detección hay un dato curioso del ecosistema de seguridad: el equipo de AISLE encontró seis CVE en curl, cuando antes tanto Codex como Mythos habían reportado cero. Todos de baja gravedad y ya corregidos en curl 8.22.0.
Clara Vega: Que es una lección parecida: los primeros análisis no lo ven todo. Distintos revisores, distintos hallazgos. Vale, dejemos la desconfianza un momento y vayamos a cómo vivimos con la IA en la vida diaria, porque esto también se está debatiendo a lo grande.
Mateo Ruiz: Primero, política: el alcalde de Nueva York, Mamdani, ha prohibido el uso de IA en las aulas de primaria y secundaria. El argumento de los partidarios es que los estudiantes deben aprender primero a pensar de forma independiente, sin atajos.
Clara Vega: Y la incógnita obvia es qué efecto real tendrá la prohibición. Los críticos dirán que los chavales usarán la IA en casa igualmente; los defensores replican que la escuela es donde se construye el hábito intelectual y que ahí sí importa la norma. Eso está por verse.
Mateo Ruiz: En paralelo hay un debate filosófico muy animado alrededor de un post de un bloguero que propone la vida NPC como el máximo «no me importa»: vivir como personaje secundario, ignorar deliberadamente lo que no te toca.
Clara Vega: Y la respuesta de Hacker News ha sido contundente en contra en gran parte: comentaristas argumentan que la realidad tiene consecuencias, y que ignorar la política y los riesgos no es libertad sino desamparo aprendido. No es lo mismo desapegar de las redes que desentenderse de lo que te afecta.
Mateo Ruiz: El desacuerdo, si lo hay, está más en el matiz: algunos ven valor en desconectar selectivamente, pero incluso esos reconocen que hay un núcleo de cosas —salud, dinero, normas que te gobiernan— que no puedes dejar a otro. Y enlaza con el tema escolar: autonomía frente a dependencia es la misma tensión en ambas discusiones.
Clara Vega: Hay un post relacionado que encaja aquí: «Exit the Cave», que defiende que perder en público es mejor que practicar en privado amargamente. Mostrar tu trabajo, equivocarte delante de gente.
Mateo Ruiz: Y en los comentarios hay un debate genuino sobre los límites: ¿esto aplica a cualquier expresión artística? ¿Y a temas donde el fallo cuesta más? No hay consenso; algunos lo aplican a todo, otros dicen que el costo social del error varía muchísimo según el contexto.
Clara Vega: Y una nota técnica dentro del bloque de autonomía: WebLLM, el motor de inferencia WebGPU en el navegador, tiene 18.800 estrellas, pero hay quien en los comentarios declara el proyecto muerto y recomienda pasarse a llama.cpp con WebGPU o a ONNX.
Mateo Ruiz: Es la misma pregunta: ¿confías en una herramienta que quizá ya nadie mantiene, o te mudas a una más viva? Vale, pues si el trasfondo de todo esto es el control, la siguiente conversación va exactamente de eso: de quién posee tus datos y tus servicios.
Clara Vega: El caso estrella es Immich, la alternativa autoalojada a Google Photos. Se despliega con Docker, te da copia automática desde el móvil y sincronización multiusuario. Y la recepción en Hacker News ha sido muy positiva: comentarios de primera mano diciendo que la experiencia es buena, que no es un juguete de entusiastas sino algo usable.
Mateo Ruiz: Eso importa porque durante años la objeción al autoalojamiento era «demasiado complicado, prefiero que Google me lo gestione». Si Immich baja esa barrera, la ecuación cambia para mucha gente.
Clara Vega: Y en el lado opuesto está SteamDB, que ha sido comprado por la matriz de Nexus Mods. Y en los comentarios hay dos corrientes claras: por un lado, miedo a que las funciones acaben tras un paywall; por otro, hay quien cuestiona de dónde viene el valor de esos datos, si es sostenible mantenerlos y si el servicio justifica su existencia.
Mateo Ruiz: Es un experimento natural: cuando un servicio cambia de manos, la comunidad se pregunta si la promesa original sobrevivirá. Y la tendencia general que se dibuja en ambos casos es la misma: los usuarios buscan independencia precisamente cuando los servicios cambian de propietario o de condiciones.
Clara Vega: Lo que conecta con el siguiente tema: las políticas de datos y de entrenamiento. Mistral ha aclarado que los usuarios de Vibe están, por defecto, dentro del entrenamiento, mientras que los de Enterprise están fuera. Y ojo al detalle: para salir hay que activar opciones de exclusión separadas para Vibe y para el toggle de API.
Mateo Ruiz: Es decir, no basta con un solo «no quiero entrenar»: tienes que hacerlo dos veces, en dos sitios distintos. Es el tipo de diseño que los críticos consideran oscuro: la opción por defecto favorece a la empresa, y salir exige esfuerzo y conocimiento.
Clara Vega: Bien, vamos ahora a negocios puros: retiradas, precios y regulación. Empecemos por África. Uber ha salido ese mismo día de Nigeria y Uganda, después de haber dejado ya Costa de Marfil y Tanzania. Su presencia africana queda reducida a cuatro países: Egipto, Ghana, Kenia y Sudáfrica.
Mateo Ruiz: Es un repliegue significativo. Y lo que queda abierto, según la discusión, es si esos mercados africanos recuperarán competencia o si quedan a merced de jugadores locales. No hay respuesta todavía.
Clara Vega: Otro movimiento de precio, pero en dirección contraria: LWN sube sus abonos un 20 por ciento aproximadamente el 15 de septiembre de 2026. Es la primera subida desde 2022, y el motivo que se da es que el crecimiento de abonados está estancado.
Mateo Ruiz: Que es una lección de sostenibilidad: si no creces, al final solo te queda subir el precio o recortar. En un servicio tan querido por la comunidad de software libre, la reacción importa, porque es el ejemplo contrario a la gratis absoluta: contenido de calidad que cuesta dinero.
Clara Vega: Un caso de hardware ahora, en Francia: el Pixel 11 mantiene un soporte MTE hardware mínimo, pero la retirada de la aceleración de caché degradó el rendimiento y eso llevó a desactivar el MTE en el firmware.
Mateo Ruiz: Que es una historia de compromiso clásica: la seguridad que ofrece MTE choca con el rendimiento, y el fabricante ha elegido rendimiento. Para GrapheneOS y su comunidad es un revés, porque MTE era una herramienta valiosa contra fallos de memoria.
Clara Vega: Y cerramos el bloque con la regulación: Google se libra de la escisión de su negocio de ad tech. La jueza Brinkema, designada por Clinton, falló con lenidad siguiendo la doctrina del bienestar del consumidor: mientras los precios para el usuario no suban, no hay motivo para romper la empresa.
Mateo Ruiz: Esa doctrina frente a la estructura del mercado es el corazón del debate antimonopolio actual en Estados Unidos. Los críticos dicen que el bienestar del consumidor es demasiado estrecho para mercados donde el usuario no paga con dinero sino con atención y datos.
Clara Vega: Cambiemos de tercio y vayamos a las máquinas. Empecemos con un dato que pone en perspectiva la robótica: la mano humana tiene unos 24 grados de libertad y 17.000 sensores táctiles.
Mateo Ruiz: Con esa referencia, se entiende por qué los robots siguen careciendo de la combinación de destreza y durabilidad. Y hay una advertencia que los comentaristas repiten: los vídeos demo están seleccionados a mano. Ves los diez intentos que salen, no los cien que fallan.
Clara Vega: Y aun así, hay progresos asombrosos en generación de mundos. Fable 5.1 ha generado en un solo pase un mundo 3D de la Union Square de San Francisco: 453 edificios, 129 tiendas y 220 peatones. El coste: unos 8 millones de tokens, 33 dólares.
Mateo Ruiz: Treinta y tres dólares por una escena urbana completa. Hace dos años eso habría sido un proyecto de estudio. Y abre la pregunta de qué pasa cuando generar mundos sea tan barato que cualquiera pueda hacerlo a demanda.
Clara Vega: Y en el fondo teórico, McCoy y colegas han demostrado que los vectores de redes neuronales, incluidos LLM, se pueden aproximar con estructuras simbólicas de forma cerrada, sin cambiar el comportamiento del modelo.
Mateo Ruiz: Que es un resultado con mucho jugo: sugiere que quizá no haya que elegir entre aprendizaje de máquina y símbolos; los vectores aprendidos pueden ser comprimidos en formas interpretables. La implicación que menciona la discusión es manos de robot más interpretables y, quién sabe, modelos más auditables.
Clara Vega: Y del lado del algoritmo clásico, Bridson: su algoritmo de muestreo de disco de Poisson de 2007 cabe en una página, ha sido citado casi mil veces, y el propio autor ha propuesto una optimización nueva llamada «poda cónica de puntos padre» que reduce las iteraciones.
Mateo Ruiz: Un pequeño recordatorio de que a veces una página bien escrita dura dieciocho años y sigue mejorándose. Bien, del mundo físico y sintético pasamos a la ciencia, la memoria y la historia, que es nuestro último bloque.
Clara Vega: Primero, materia oscura: LZ, el mayor detector del mundo, ha registrado un único evento anormal. Y los propios investigadores lo dicen con honestidad: es demasiado pronto para hablar de descubrimiento; se están analizando más datos.
Mateo Ruiz: Un solo evento es exactamente eso: un evento. Puede ser radiación de fondo, contaminación, o puede ser la primera señal de algo nuevo. La ciencia se distingue de los titulares justamente en no cantar victoria con una muestra de uno.
Clara Vega: Y del cerebro: un estudio con solo 61 personas sugiere que el cerebro que envejece no olvida de forma simple; el hipocampo sobre-generaliza y extrae la memoria con demasiado margen, mezclando recuerdos entre categorías.
Mateo Ruiz: Ojo con la muestra: 61 personas es pequeño, así que esto es una pista, no una conclusión. Pero la idea es fascinante: no sería que la memoria se borra, sino que se contamina, que el mecanismo de recuperación pierde precisión. Cambia por completo cómo deberíamos pensar el envejecimiento cognitivo.
Clara Vega: Y del cerebro a la historia de la computación: el 1 de septiembre de 1982 salió el Commodore 64. 64 kilobytes de memoria por menos de 600 dólares, unos 12,3 millones de unidades vendidas. Sigue siendo el ordenador más vendido de la historia.
Mateo Ruiz: Doce millones trescientas mil unidades en una época donde un ordenador era un lujo. Y el contraste con la conversación de hoy es brutal: de 64 kilobytes a un millón de tokens de contexto en un modelo de lenguaje. Cuarenta años de un cambio que ni los más optimistas de entonces habrían creído.
Clara Vega: Y cerramos con una historia de aviación que encaja como anillo al dedo con el tema de la confianza y los sistemas: el Qantas A380 de 2010. La pared de una tubería de aceite era demasiado fina y causó un fallo de motor en pleno vuelo.
Mateo Ruiz: Y sin embargo: la tripulación aterrizó sin problemas y ninguno de los 469 ocupantes resultó herido. Es la demostración de que un fallo de diseño puede convivir con sistemas de seguridad que funcionan: redundancia, entrenamiento, procedimientos. El fallo técnico fue real; el desenlace fue bueno porque todo lo demás resistió.
Clara Vega: Y con esa nota de sistemas que fallan pero aguantan, cerramos. Ha sido un programa largo: modelos y precios, confianza en la IA, vida cotidiana con ella, propiedad de datos, negocios, mundos generados y ciencia.
Mateo Ruiz: Gracias por acompañarnos. Nos oímos en el próximo episodio. ¡Hasta luego!
Clara Vega: ¡Adiós!