Salesforce ya tiene modelo propio, Koa - en la nota de prensa iguala a los labs, en el paper no
15 septiembre 2026Este artículo ha sido creado con una solución que, bajo supervisión humana, orquesta una granja de modelos de IA para tareas como la investigación, la verificación, la corrección y la traducción.
Un post titulado «Salesforce just built its own AI model» circula por LinkedIn desde el martes, también entre los equipos comerciales españoles. Suena a fin de la dependencia de OpenAI y Anthropic. Merece la pena leer lo que Salesforce publicó en dos documentos el mismo día, porque cada uno dice una cosa distinta.
Qué se anunció
Koa es un reasoning model para trabajar dentro de Agentforce, la plataforma de agentes de Salesforce. Ese trabajo consiste en cualificar oportunidades, enrutar casos y planificar los siguientes pasos. El modelo salió del post-training de Nemotron 3 Super, el modelo abierto de Nvidia con 120 000 millones de parámetros (12 000 millones activos), mediante aprendizaje por refuerzo en cinco servidores con chips B200. Los datos de entrenamiento son escenarios sintéticos y datos públicos, sin registros de clientes: clientes simulados, entre ellos «irate customers that call into the customer service center», y comerciales simulados cerrando operaciones. Rohan Kumar, presidente de plataforma e ingeniería: «Not a single byte of customer data was used». Salesforce mantiene el control de los pesos y ejecuta el modelo en su propia infraestructura. Dentro de la compañía Koa ya funciona como agente en Slack; los pilotos con clientes apenas arrancan (Nvidia dice que en octubre), entre otros en Fórmula 1, Xero y UChicago Medicine. La disponibilidad general se espera para «winter 2026 in U.S. regions». No se dio precio, ni fecha para Europa.
Dos documentos, dos verdades
La nota de prensa: en el benchmark de CRM de Salesforce, Koa «already matches or exceeds leading model performance on CRM actions with three times fewer errors». La página de producto añade «Precision: +11%», «Reliability: 2.1x» y «Context: 15%», sin nombrar los modelos con los que se comparó Koa.
El paper «Salesforce Koa: An Enterprise Language Model for Agentic Tool Use», escrito por 25 autores de Salesforce y subido a arXiv el lunes, contiene una tabla. En CRM Bench: GPT-5.5 saca 0,90; Claude Opus 4.8, 0,87; Koa, 0,86; el Nemotron base, 0,84; GPT-4.1, 0,81. La conclusión de los autores: Koa «surpasses a strong proprietary baseline (GPT-4.1) while remaining below the strongest frontier models». La mejora más medible del post-training es la precisión de las llamadas a herramientas en CRM Bench, que sube de 0,71 a 0,77. La frase «three times fewer errors» no aparece en ninguna parte del paper, y ningún par de números de la tabla da una diferencia del triple. Hay más discrepancias: la nota de prensa describe supervised fine-tuning y aprendizaje por refuerzo, mientras que el paper dice que el modelo terminado es fruto únicamente de aprendizaje por refuerzo aplicado directamente sobre el modelo base, sin etapa de SFT. Jason Andersen, de Moor Insights: «That is Salesforce grading its own test, so I would treat the specific numbers as a claim to watch rather than settled fact».

Qué ha cambiado de verdad
No es que Koa sea el mejor, sino que existe. Jayesh Govindarajan, EVP de Salesforce AI, en TechCrunch: «reasoning has always been something that we've relied on the frontier model providers for. Until now». Hace tres semanas Salesforce anunció Claudeforce: Claude es el modelo por defecto en Slack y en los agentes Agentforce Coworker y Vibes y, según Benioff, la compañía está gastando este año unos 300 millones de dólares en tokens de Anthropic, casi todo en programación (ninguna de las dos empresas ha confirmado la cifra). Koa no sustituye a nada; se convierte en el cuarto proveedor de modelos que se puede elegir en Setup. Pero una compañía con 30 000 clientes de Agentforce ha demostrado que un modelo abierto, datos sintéticos y unas decenas de GPU bastan para construir un reasoning model propio. ¿Por qué Nemotron? Govindarajan: «We have no idea what Qwen trains on», y hasta ahora no había un modelo abierto estadounidense de clase frontier con una procedencia de datos clara. Jensen Huang en el escenario, según lo recogió Nvidia: la cuota de los modelos abiertos pasó del 30 % a principios del año pasado a cerca del 70 % ahora.
Fuera de LinkedIn la respuesta fue tibia. Dos hilos en Hacker News con dos puntos cada uno; nadie llegó siquiera a enviar el artículo de TechCrunch titulado «everything the AI labs should fear». Nvidia no ha escrito la palabra «Koa» en ni una sola publicación en X. En r/salesforce el único hilo tiene 1 punto, y los comentaristas leen «27 years of CRM intelligence» a su manera: «so what they are saying is that they used the last 3 decades customers data to train their proprietary model? No one saying anything?». Salesforce dice que no, y el paper lo repite. Pero así está la confianza después de dos años de promesas sobre Agentforce.
Para una empresa española que trabaje con Salesforce, de momento no cambia nada: la única disponibilidad general con fecha es la de las regiones de Estados Unidos, para Europa no hay ni fecha ni precio anunciado. El idioma, al menos, no es el obstáculo: Nemotron 3 Super admite oficialmente el español, junto con el inglés, el francés, el alemán, el italiano, el japonés y el chino. Lo que queda por resolver es lo de siempre en la UE: dónde se procesan los datos del CRM y bajo qué condiciones, porque Koa se ejecuta en la infraestructura de Salesforce, y qué obligaciones le corresponden al modelo según el reglamento europeo de IA. Salesforce insiste en que ni un byte de datos de clientes entró en el entrenamiento; el uso en producción es otra conversación, y esa toca tenerla antes con el departamento legal que con el comercial.
El sábado el jefe de Anthropic pidió a los labs que frenaran. El martes uno de sus mayores clientes demostró que se está construyendo su propio modelo por si acaso. Se llama Koa, «valiente» en hawaiano. Así se llamaba el golden retriever de Benioff, al que la compañía lleva años presentando como su mascota con el título de «Chief Love Officer».
Reasoning model - modelo que desglosa su razonamiento paso a paso y elige las herramientas antes de responder, en lugar de contestar de inmediato. Post-training - entrenamiento adicional de un modelo ya terminado para tareas concretas, más barato que entrenar desde cero. Frontier - los modelos más potentes en un momento dado, aquí GPT-5.5 y Claude Opus 4.8. Agentforce - la plataforma de Salesforce para construir agentes de IA; se factura, entre otras opciones, por conversación (2 dólares) o por acción (10 centavos).