agentes inteligentes empresariales es el hilo conductor de este análisis.
En una sola semana, cuatro lanzamientos han movido el tablero de la inteligencia artificial aplicada a empresa. Desde Japón hasta California, los nuevos agentes no solo responden: investigan, aprenden y se autoevalúan. La frontera entre software y colaborador empieza a difuminarse.
Lo que antes era una promesa —IA que trabaja por sí misma— se está convirtiendo en infraestructura real. Sakana AI, Vercel, Perplexity y Liquid AI están marcando las reglas del juego para la próxima década de productividad.
Por consiguiente, el cambio ya no es técnico: es organizacional.

Lo que cambia esta semana
Sakana Marlin
Un agente de investigación estratégica capaz de generar informes de hasta 100 páginas y presentaciones en ocho horas, basado en el algoritmo AB‑MCTS.
Vercel Eve
Framework open source donde cada agente es un directorio de archivos que define sus capacidades. Más de 100 agentes ya operan en producción interna.
Perplexity Brain
Memoria auto‑mejorable que aprende del trabajo del agente, no del usuario. Incrementa precisión y reduce costes tras cada ciclo nocturno.
Liquid AI LFM2.5
Modelos multilingües para búsqueda semántica en 11 idiomas, con latencias inferiores a 10 ms incluso en CPU. Ideal para RAG y edge computing.

Impacto vs Esfuerzo: dónde poner foco
| Movimiento | Qué habilita | Riesgo si lo haces mal | KPI North Star | Esfuerzo |
|---|---|---|---|---|
| Sakana Marlin | Investigación autónoma corporativa | Informes erróneos sin revisión humana | Horas ahorradas en análisis estratégico | Alto |
| Vercel Eve | Estandariza el desarrollo de agentes | Desorden operativo si no hay gobierno del código | Tiempo medio de despliegue por agente | Medio‑alto |
| Perplexity Brain | Aprendizaje continuo del trabajo del agente | Fugas o sesgos en datos históricos | Precisión acumulada por sesión | Medio |
| Liquid AI LFM2.5 | Búsqueda multilingüe ultrarrápida | Mala indexación o prompts asimétricos | Tiempo medio de respuesta y recall@20 | Bajo‑medio |
1. Sakana AI lanza Marlin, el agente de investigación estratégica autónomo
Fuente y contexto: marktechpost.com ·
Qué se ha anunciado (hechos): Sakana AI presentó Marlin, su primer producto comercial B2B. Este agente actúa como un “Virtual CSO”, ejecutando investigaciones durante ocho horas y generando informes de hasta 100 páginas con diapositivas. Se basa en el algoritmo AB‑MCTS (Adaptive Branching Monte Carlo Tree Search) y combina varios modelos LLM para profundizar o ampliar hipótesis.
Por qué esto cambia el ROI: reduce semanas de trabajo estratégico a horas, optimizando el coste total de propiedad (TCO) en consultoría interna y análisis competitivo. El modelo de precios por créditos permite escalar sin comprometer márgenes.
Decisión ejecutiva: probar un caso piloto en análisis de mercado o riesgo geopolítico, validando calidad frente a consultores humanos antes de escalar.
- Riesgo operativo real: dependencia excesiva del output sin revisión experta.
- Qué medir desde ya: ratio de correcciones humanas por informe.
- Primer paso esta semana: definir un prompt tipo “tema único” y medir tiempo‑ahorro real.
Plan de 7 días (Escala365):
- Fase inicial (días 1-2): seleccionar un tema estratégico recurrente.
- A continuación (días 3-5): ejecutar Marlin y auditar fuentes citadas.
- Por último (días 6-7): presentar resultados al comité con comparativa humana.
- Métricas de control: tiempo total, número de fuentes válidas, satisfacción del analista, coste por informe.
2. Vercel presenta Eve, framework abierto para construir agentes como proyectos de código
Fuente y contexto: marktechpost.com ·
Qué se ha anunciado (hechos): Eve es un framework open source (Apache‑2.0) donde cada agente es un directorio con ficheros que definen modelo, herramientas, habilidades y canales. Incluye ejecución duradera, sandbox seguro y trazabilidad con OpenTelemetry. Vercel ya opera más de cien agentes internos sobre esta base.
Por qué esto cambia el ROI: reduce drásticamente el CAC técnico al estandarizar cómo se crean y mantienen agentes. Permite a equipos no técnicos desplegar automatizaciones complejas sin DevOps intensivo.
Decisión ejecutiva: adoptar Eve como estándar interno para prototipos agentic, integrándolo con pipelines existentes (Zapier, n8n o API internas).
- Riesgo operativo real: proliferación de agentes sin control ni auditoría.
- Qué medir desde ya: número de agentes activos vs mantenidos; ratio de aprobaciones humanas pendientes.
- Primer paso esta semana: crear un agente simple con Eve que conecte Slack y CRM para validar flujo completo.
Plan de 7 días (Escala365):
- Fase inicial (días 1-2): instalar Eve y revisar estructura base.
- A continuación (días 3-5): desarrollar un agente piloto con canal Slack y herramienta SQL.
- Por último (días 6-7): documentar proceso y definir checklist de seguridad.
- Métricas de control: tiempo de despliegue, complicaciones por sandbox, feedback del usuario final, coste anual estimado.
3. Perplexity lanza Brain, memoria auto‑mejorable para su agente Computer
Fuente y contexto: marktechpost.com ·
Qué se ha anunciado (hechos): Brain crea un grafo contextual del trabajo realizado por el agente Computer. Cada noche revisa ese grafo y aprende qué funcionó o falló. Según Perplexity, mejora la corrección un 25 %, la recuperación un 16 % y reduce costes un 13 % en tareas repetidas (datos propios).
Por qué esto cambia el ROI: convierte la experiencia operativa en capital cognitivo reutilizable. Menos repeticiones implica menor consumo de tokens y mayor eficiencia marginal por usuario Enterprise.
Decisión ejecutiva: activar Brain en entornos controlados (soporte o data science) para medir aprendizaje incremental antes de extenderlo a toda la organización.
- Riesgo operativo real: acumulación de datos sensibles sin gobernanza clara.
- Qué medir desde ya: tasa de mejora por iteración y volumen de memoria almacenada.
- Primer paso esta semana: definir política de retención y anonimización antes del piloto.
Plan de 7 días (Escala365):
- Fase inicial (días 1-2): identificar flujos repetitivos donde Brain aporte valor.
- A continuación (días 3-5): ejecutar pruebas A/B con Brain activado vs desactivado.
- Por último (días 6-7): evaluar mejoras en precisión y coste por tarea.
- Métricas de control: precisión media, recall, coste por interacción, ratio de correcciones manuales.
4. Liquid AI introduce LFM2.5‑Embedding‑350M y LFM2.5‑ColBERT‑350M para búsqueda multilingüe rápida
Fuente y contexto: marktechpost.com ·
Qué se ha anunciado (hechos): Liquid AI lanzó dos modelos de recuperación con 350 M parámetros cada uno, optimizados para búsqueda multilingüe en once idiomas. ColBERT ofrece mayor precisión token‑a‑token; Embedding prioriza velocidad e índice compacto. Ambos superan a modelos mayores como Qwen3‑Embedding‑0.6B en benchmarks NanoBEIR y MKQA‑11.
Por qué esto cambia el ROI: permite búsquedas semánticas globales sin multiplicar infraestructuras por idioma. Menor latencia implica mejor experiencia cliente y reducción del coste por consulta en entornos RAG.
Decisión ejecutiva: integrar LFM2.5‑Embedding como motor base en knowledge bases multilingües o asistentes internos; reservar ColBERT para dominios críticos donde la exactitud prime sobre almacenamiento.
- Riesgo operativo real: degradar resultados por prompts mal definidos o falta de normalización lingüística.
- Qué medir desde ya: NDCG@10 promedio y latencia p50 real en entorno propio.
- Primer paso esta semana: probar modelo Embedding vía sentence‑transformers con dataset interno reducido.
Plan de 7 días (Escala365):
- Fase inicial (días 1-2): preparar corpus multilingüe representativo.
- A continuación (días 3-5): testear ambos modelos midiendo recall@20 y tiempos medios.
- Por último (días 6-7): decidir despliegue edge o GPU según carga esperada.
- Métricas de control: latencia media, precisión top‑k, coste por consulta, satisfacción del usuario interno.

España vs Latam: el matiz que cambia la ejecución
Aunque las tecnologías son globales, su adopción no lo es. En España observamos una madurez creciente en automatización corporativa gracias a ecosistemas consolidados (HubSpot, Microsoft Copilot Tasks) y una cultura regulatoria más estricta en protección de datos. Esto favorece pilotos controlados pero ralentiza la experimentación abierta con frameworks como Eve o memorias tipo Brain.
Por otro lado, en Latinoamérica, la situación del mercado es diferente. Startups y pymes tecnológicas adoptan herramientas open source con agilidad —menos compliance previo— pero enfrentan limitaciones en infraestructura cloud local y talento especializado en MLOps. Por consiguiente, los modelos ligeros como LFM2.5‑Embedding o las arquitecturas autosuficientes tipo Marlin encajan mejor porque reducen la dependencia externa.
Culturalmente, las empresas españolas tienden a procesos más jerárquicos donde la IA se valida antes de desplegarse masivamente; en Latam predomina la experimentación rápida impulsada por equipos pequeños. En consecuencia, esa diferencia afecta la velocidad del ROI inicial pero también el riesgo operativo. En ambos contextos, formar talento técnico capaz de auditar prompts, revisar outputs y diseñar flujos híbridos será clave para sostener la eficiencia sin perder control ni cumplimiento normativo.
A medio plazo veremos convergencia: España adoptará más agentes locales por privacidad; Latam migrará parte del stack a nubes regionales certificadas. El punto común será la necesidad urgente de gobernanza IA transversal —desde seguridad hasta métricas financieras— para que estos avances no se queden en pilotos aislados sino en productividad sustained.

Preguntas frecuentes
- ¿Necesito infraestructura GPU para usar estos modelos?
- No necesariamente. LFM2.5 tiene versiones optimizadas para CPU mediante llama.cpp; Eve y Marlin pueden operar vía API gestionada sin hardware propio.
- ¿Cómo garantizo calidad en informes generados por Marlin?
- Mantén revisión humana obligatoria antes de decisiones estratégicas. Usa checklists automáticos para validar fuentes citadas y coherencia interna.
- Eve es open source, ¿qué implica para seguridad?
- Puedes auditar el código completo y aislar cada agente en sandbox independiente. Aun así, define políticas claras de conexión a APIs externas.
- ¿Brain almacena datos personales?
- No está diseñado para eso; su foco es registrar acciones del agente. Sin embargo, conviene aplicar anonimización si los logs contienen información sensible.
- LFM2.5 soporta once idiomas; ¿cómo elegir entre Embedding y ColBERT?
- Síntesis rápida o dispositivos edge → Embedding; máxima precisión o reranking avanzado → ColBERT. Puedes combinarlos en pipeline híbrido.
- ¿Cuál es el retorno esperado al integrar agentes autónomos?
- Ahorro directo en horas humanas repetitivas (20–40 %), mejora en velocidad decisional y reducción del error operativo; depende del grado de integración cultural más que del modelo concreto.
Descubre cómo Escala365 puede ayudarte a dominar estas tendencias. Solicita tu auditoría gratuita en escala365.com.
Más artículos y guías en Escala365.
