Qué pasó
Supabase abrió autenticación administrada para su servidor MCP
El 24 de agosto Supabase publicó Enterprise-Managed Auth para su servidor MCP: los agentes se conectan con credenciales gestionadas de forma centralizada y las consultas de un modelo al esquema o a los datos pasan por las mismas políticas RLS que cualquier otro cliente.
Por qué importa: hasta ahora, darle una base de datos a un agente era darle la llave entera o armar una capa de permisos a mano. Que el control quede en RLS, donde ya vive el resto de la aplicación, evita sostener dos modelos de permisos sincronizados. Para un sistema chico esa es la diferencia entre poder conectar un agente a datos reales y no poder.
Supabase — Enterprise-Managed Auth for MCP
Las trazas cruzan cliente, Edge Functions y API
supabase-js 2.112.0 y posteriores propagan contexto de traza W3C, con lo que una llamada se sigue desde el cliente hasta la Edge Function y de ahí a una API FastAPI. En paralelo, Envoy quedó como gateway por defecto en instancias self-hosted.
Por qué importa: cuando el que ejecuta es un agente, la pregunta "por qué hizo esto" se contesta con trazas o no se contesta. Un identificador que sobrevive los tres saltos es lo que convierte un incidente en algo revisable en vez de una reconstrucción a mano leyendo logs sueltos.
LangSmith absorbió el despliegue de LangGraph
Entre el 24 y el 26 de agosto LangGraph Platform pasó a integrarse en LangSmith Deployment y LangSmith Studio: monitoreo, trazabilidad y pruebas de regresión sobre grafos multi-agente desde un mismo lugar.
Por qué importa: las pruebas de regresión sobre un grafo de agentes son la parte que casi nadie arma por su cuenta, y son justamente las que avisan cuando un cambio de prompt o de modelo rompe algo que venía andando. Que venga con el framework la vuelve realista para un proyecto de una sola persona.
Gemini sumó llamadas asíncronas a herramientas
La Interactions API consolidó las async tool calls y las respuestas tipo timeline: un agente en segundo plano puede lanzar un job largo y recibir el resultado cuando termina, en lugar de sostener polling repetitivo.
Por qué importa: la mayoría de las automatizaciones que sirven en una PyME no son conversaciones, son procesos que tardan. Conciliar un mes de movimientos, procesar cien PDFs, cerrar un inventario. Hasta ahora eso obligaba a montar una cola por fuera del modelo y coserla al flujo del agente.
Dos modelos nuevos en disponibilidad general, y un embedding con fecha de vencimiento
El 27 de agosto pasó a GA gemini-omni-1.1-flash, para interacción multimodal de baja latencia y alta concurrencia. Un día antes lo había hecho gemini-3.5-transcribe, especializado en speech-to-text, con un WER promedio de 2,6% en 85 idiomas y una versión Live en streaming. El mismo 26 se publicó el cronograma de transición de text-embedding-004 hacia la nueva generación de modelos.
Por qué importa: la deprecación pesa más que los dos lanzamientos juntos. Cambiar un modelo de chat es cambiar una línea de configuración; cambiar un modelo de embeddings obliga a reindexar el corpus entero, porque los vectores viejos y los nuevos no viven en el mismo espacio. Cualquiera con un RAG en producción tiene ahí una migración con fecha puesta.
Gemini API changelog · Gemini 3.5 Transcribe · Deprecaciones
La capa de recuperación se reacomoda
Voyage AI lidera las tablas MTEB orientadas a recuperación semántica, con voyage-code-3 especializado en código, y BGE-M3 se consolida como estándar open-source para recuperación híbrida (densa, sparse y multi-vector) en más de cien idiomas. Del lado de la base, el patrón que se repite es índices HNSW en pgvector combinados con búsqueda de texto completo sobre tsvector, dentro del mismo Postgres.
Por qué importa: la búsqueda híbrida sobre Postgres es la que evita sumar una base vectorial propietaria al stack. Una PyME no necesita otro servicio para mantener, facturar y monitorear: necesita que la búsqueda semántica viva al lado de los datos que ya tiene, con el mismo backup y los mismos permisos.
Los modelos locales bajaron el piso de hardware
FLUX 2 salió en checkpoints cuantizados FP8 y NVFP4, con una reducción de VRAM de hasta 55% y licencia comercial abierta; la variante Klein, de 4B, apunta a generación local. Del lado de visión, Qwen2.5-VL y LLaVA-OneVision-2 se orientan a extracción estructurada sobre documentos mixtos: PDFs con tablas, texto y gráficos.
Por qué importa: leer facturas, remitos y comprobantes escaneados es el pedido más frecuente que llega, y hasta ahora la respuesta razonable era mandar cada página a una API ajena. Un modelo de visión que corre en una placa común cambia el costo, pero sobre todo cambia dónde quedan los documentos del cliente.
Qwen2.5-VL · LLaVA-OneVision-2
Lo que siguió moviéndose
PyTorch 2.14 RC1 continúa avanzando en builds free-threaded para Python 3.15, ahora aplicado a pipelines de preprocesamiento de audio y transcripción continua. Docker Sandboxes y la validación Pydantic v2 en FastAPI se consolidan como la forma de aislar código generado por agentes. Y el roadmap de MCP definió sus prioridades: primitivas de mensajería entre agentes, unificación de transporte HTTP nativo, identidad y autenticación empresarial, y mejoras en los SDKs de Python y TypeScript.
Por qué importa: poco nuevo respecto de la edición anterior, salvo por la dirección. Entre las prioridades de MCP aparece identidad y autenticación empresarial, que es exactamente lo que Supabase acaba de implementar. El protocolo va hacia donde ya se está construyendo, no al revés.
Roadmap de MCP · PyTorch releases
Qué cambió respecto del período anterior
La edición anterior cerraba con el protocolo estandarizado: MCP stateless, gateways cloud que lo soportan, un framework que unifica cómo se arma un agente. Eso contestaba el "cómo se conecta". Este período contesta la pregunta siguiente, que es la que importa cuando hay un cliente del otro lado: quién controla lo que el agente toca y cómo se ve después lo que hizo.
Autenticación administrada con RLS, trazas W3C de punta a punta, despliegue y pruebas de regresión en un mismo panel, llamadas asíncronas para jobs largos. Cuatro piezas que no agregan capacidad: agregan control. Es el orden habitual —primero se conecta, después se audita— y llegó bastante rápido.
Qué estoy mirando
- La migración de embeddings. Es lo único de este período con costo real y fecha puesta. Reindexar un corpus no se improvisa, y conviene tener medido cuánto tarda antes de que la fecha sea la semana que viene.
- Si la auth administrada baja a los planes chicos. Salió con etiqueta enterprise. Si se queda ahí, el problema de permisos sigue sin resolverse justo para quien menos equipo tiene para resolverlo a mano.
- Cuánto dura la ventaja de correr modelos en local. Con 55% menos de VRAM, buena parte de lo que hoy se manda a una API entra en una máquina propia. La pregunta no es si se puede, es si conviene sostenerlo.
Para tener presente
Casi todo lo que se movió este período es plomería. Nadie le vende a un cliente propagación de trazas W3C: se nota cuando falta, no cuando está. Esta edición registra lo que se publicó, no lo que ya está probado en producción.