MacarenoNet
xAI, DeepSeek y Mistral reprobaron. Pero **nadie sacó A**.
IAExplicativo

xAI, DeepSeek y Mistral reprobaron. Pero nadie sacó A.

El índice de seguridad de IA del Future of Life Institute evaluó a los 9 laboratorios más importantes del mundo. Tres reprobaron. Los demás no pasaron del C+. Un análisis de lo que eso significa para las organizaciones que ya usan estas herramientas.

Macareno7 min de lectura

En julio de 2026, el Future of Life Institute publicó la edición de verano de su AI Safety Index y la conclusión fue tan clara como molesta: ningún laboratorio de inteligencia artificial de frontera consiguió una nota superior a C+. No hubo sobresalientes. Ni siquiera hubo notables. El mejor de la clase apenas aprobó, y ese mejor fue Anthropic, la empresa que construyó su marca precisamente sobre la promesa de ser la más segura.

Mientras los modelos de lenguaje ganan capacidades semana a semana, la infraestructura de seguridad que debería acompañar ese avance se queda atrás. Y eso no es una opinión: es el resultado de 37 indicadores evaluados por siete expertos independientes de Berkeley, Montreal, Wisconsin y Oxford.

Si tu organización ya usa herramientas basadas en estos modelos, los resultados del índice no son una curiosidad académica. Son el estado real del ecosistema sobre el que construiste tu stack de IA.

El examen que nadie quería rendir

El AI Safety Index se publica dos veces al año y evalúa a las principales empresas de IA en seis dominios: evaluación de riesgos, daños actuales, marcos de seguridad, seguridad existencial, gobernanza y responsabilidad, e intercambio de información. Cada dominio tiene múltiples indicadores. La nota máxima es 4.0, equivalente a una A en el sistema académico estadounidense.

El panel que asigna las calificaciones incluye figuras como Stuart Russell, cofundador del campo de la IA y profesor de UC Berkeley, y David Krueger, uno de los fundadores del UK AI Security Institute. No son activistas con agenda: son referentes técnicos del área.

La evidencia se recopiló hasta el 3 de junio de 2026. Cuatro compañías (Alibaba, xAI, DeepSeek y Mistral) ni siquiera respondieron la encuesta del índice. Sus notas se construyeron solo con información pública disponible.

El marcador

Empresa Nota Puntuación
Anthropic C+ 2.66
OpenAI C 2.28
Google DeepMind C 2.01
Meta D+ 1.32
Z.ai D- 0.88
Alibaba Cloud D- 0.87
xAI F 0.65
DeepSeek F 0.47
Mistral F 0.33

Tres empresas con nota de reprobado: una estadounidense (xAI), una china (DeepSeek) y una europea (Mistral). El índice señala una "disonancia europea" particularmente llamativa: la Unión Europea lidera la regulación de IA a nivel global, pero el principal laboratorio europeo termina en último lugar en seguridad.

Lo que más preocupa al panel

Las notas ya son reveladoras, pero los hallazgos cualitativos del informe son más inquietantes todavía.

Los compromisos de pausa desaparecieron. Anthropic, OpenAI, Google DeepMind y Meta habían firmado compromisos de detener el desarrollo si se alcanzaban ciertos umbrales de riesgo. Todos los debilitaron o los retiraron. El panel lo describe como "mover el arco" y argumenta que esto socavó los marcos de seguridad en toda la industria. Stuart Russell fue directo: las empresas planean lanzar nuevos sistemas incluso cuando sea demostrablemente inseguro hacerlo.

La IA militar se convirtió en un problema transversal. Entre 2024 y 2026, empresas que prohibían explícitamente aplicaciones militares, incluidas Anthropic, OpenAI, Google DeepMind y Meta, invirtieron esa posición y buscan activamente contratos de defensa. El panel identificó esto como un riesgo emergente de daño actual.

La seguridad existencial es el dominio más débil. Ninguna empresa superó C- en este dominio. La mayoría obtiene D o menos. Los paradigmas dominantes apuestan por detectar problemas. Pero detectar no es prevenir.

El discurso de seguridad no coincide con el comportamiento real. En Google DeepMind, OpenAI y xAI, los mensajes tranquilizadores de liderazgo hacia el público divergen de la conducta comercial y las posiciones legislativas de esas mismas empresas.

Qué significa usar IA de una empresa que reprobó

El índice aclara que evalúa a las empresas como organizaciones, no a los modelos específicos ni a los productos que despliegan. Una F de xAI no es una nota al modelo Grok; es una evaluación de cómo xAI gestiona el riesgo como compañía.

Pero esa distinción no elimina la implicancia práctica. Cuando una empresa reprueba, el informe describe qué faltó concretamente:

xAI (F): No hay evidencia de un equipo de seguridad con peso real. Las evaluaciones de capacidades peligrosas tienen brechas enormes y no existe ningún procedimiento que conecte esos resultados con decisiones de despliegue. Si detectan un problema serio en el modelo antes de lanzarlo, no hay mecanismo formal que obligue a pausar.

DeepSeek (F): Sin marco de seguridad publicado. Sin estructura de gobernanza visible. La única protección real es la regulación del gobierno chino, que el panel describe como "pasividad completa" frente a riesgos existenciales de IA avanzada.

Mistral (F): El liderazgo minimiza activamente los riesgos de frontera en lugar de articular una estrategia de control. Sin marco de seguridad publicado ni desempeño aceptable en benchmarks de seguridad. Y son los que construyen los modelos que se despliegan en varios productos corporativos europeos.

Si tu organización usa alguno de estos modelos, la pregunta no es si la IA funciona. La pregunta es quién responde cuando algo sale mal y qué protocolo existe para que eso no llegue a tus flujos de trabajo críticos.

¿Se puede confiar, entonces?

Depende de para qué.

La respuesta honesta no es sí ni no: es que "confiar en la IA" es la pregunta equivocada. La pregunta correcta es qué nivel de confianza es razonable para qué tipo de tarea.

Para tareas de bajo riesgo (redactar un borrador, resumir un documento, generar ideas), los modelos de cualquier laboratorio de la lista funcionan y el nivel de seguridad del proveedor es casi irrelevante. Si el modelo alucina, lo corregís vos.

Para procesos que tocan datos sensibles, decisiones con impacto legal o flujos donde un error se propaga sin revisión humana, el nivel de seguridad del laboratorio detrás del modelo empieza a importar mucho. Y ahí hay una trampa adicional: parte de los indicadores del índice se basan en benchmarks estandarizados. Como explicamos en Qué diablos es un benchmark (y por qué mide menos de lo que crees), un modelo puede brillar en la prueba oficial y hundirse en una versión más difícil del mismo problema. El índice lo compensa con evaluaciones externas e indicadores de gobernanza, pero la limitación vale tenerla en cuenta.

Usar Grok, DeepSeek o Mistral en un proceso crítico no es solo apostar por un modelo con peor desempeño en benchmarks de seguridad. Es apostar por una empresa que no tiene documentado qué hace cuando algo sale mal.

Eso no descalifica automáticamente a ninguno para todos los usos. Pero sí desplaza la carga de la prueba: si elegís un proveedor con F, la responsabilidad de los controles recae enteramente en tu organización.

El punto

La nota más alta fue C+. Eso no significa que la IA sea inutilizable. Significa que el optimismo por defecto a la hora de adoptarla en procesos críticos merece ser reemplazado por criterios de evaluación concretos. Tres preguntas que deberían estar en cualquier evaluación de proveedor:

¿Qué ocurre cuando el modelo alcanza un umbral de riesgo? ¿Hay un procedimiento formal o depende de la decisión de un ejecutivo?

¿Quién puede detener un despliegue? ¿Existe un cuerpo con autoridad real o es solo una recomendación?

¿Los compromisos de seguridad tienen condiciones adjuntas? Si la promesa de pausar depende de que los competidores también lo hagan, no es un compromiso.

El índice da los criterios. Aplicarlos es trabajo de cada organización. Si querés analizar cómo aplica esto a tu stack de IA actual, contactá a macareno.net y lo vemos juntos.

Fuentes

Compartir artículo

Siguiente paso de negocio

Conecta este artículo con un servicio y un caso real de MacarenoNet para llevar la idea a ejecución.

Servicio recomendado

Seguridad, Cumplimiento y Gobierno

Protección de información y marcos de cumplimiento para operación segura.

Ver servicio

Caso recomendado

Portal Ciberseguridad

Portal con reporte de incidentes, SLAs y guías para ciberseguridad corporativa.

Ver caso