lo que esta confirmado

La administración Trump dice que ha ultimado los detalles de un marco voluntario de pruebas de ciberseguridad para modelos avanzados de inteligencia artificial de Estados Unidos. Reuters informó el 3 de agosto que la Casa Blanca invitó a Meta, Anthropic, OpenAI y Google a discutir las pruebas; Un informe de seguimiento después de la reunión agregó a Nvidia y dijo que la administración no planeaba incluir modelos de peso abierto en el programa voluntario.

El marco se remonta a una orden ejecutiva de junio que pedía puntos de referencia clasificados de capacidad cibernética y un acuerdo voluntario bajo el cual los desarrolladores de modelos fronterizos cubiertos podrían brindar acceso temprano seguro a socios federales confiables. La orden también rechazó la concesión de licencia obligatoria o autorización previa para la publicación.

El marco es un canal de medición, no un régimen de seguridad completo.

Su valor dependerá de tareas comparables, condiciones de asistencia conocidas, evaluadores creíbles, remediación y suficiente divulgación para que personas externas entiendan lo que significa un resultado.

Qué pruebas útiles de ciberseguridad pueden medir

KnowledgeRazonamiento sobre vulnerabilidades

¿Puede el modelo explicar las debilidades, mitigaciones y cadenas de ataque conocidas?

ExecutionTareas técnicas acotadas

¿Puede identificar o explotar una falla en un objetivo controlado?

AutonomyPlanificación y uso de herramientas.

¿Puede un agente reintentar, adaptar, manejar credenciales y persistir en todos los pasos?

ScaleRepetibilidad y costo

¿Con qué fiabilidad se puede paralelizar esta capacidad con ayuda humana limitada?

Las puntuaciones deben documentar la tasa de éxito, el tiempo, la asistencia humana, las llamadas de herramientas, los privilegios obtenidos, la detectabilidad y la transferencia a entornos desconocidos. Una puntuación titular sin el límite de la tarea no es una prueba comparable.

¿Quién elige las pruebas?

La orden de junio apunta a la evaluación comparativa federal, mientras que el Centro de Estándares e Innovación de IA de NIST dice que puede establecer acuerdos voluntarios y liderar evaluaciones de riesgos para la seguridad nacional. Eso deja opciones de gobernanza.

  • Pruebas diseñadas por el gobierno pueden reflejar prioridades nacionales, pero pueden volverse opacas.
  • Las pruebas diseñadas por desarrolladores se benefician de la experiencia interna pero crean conflictos.
  • Evaluadores independientes mejoran la credibilidad pero necesitan acceso seguro y entornos reproducibles.
  • Estándares compartidos ayudan a la comparación, pero se pueden filtrar, entrenar o jugar.

Una estructura creíble rotaría las tareas ocultas, publicaría la metodología a un nivel útil, documentaría la asistencia y permitiría la replicación independiente sin publicar exploits que funcionen.

¿Se harán públicos los resultados?

Reuters informó que las métricas, las reglas de presentación de informes y la política de divulgación pública no se habían publicado. La respuesta determina cuál es realmente el programa.

Posibles propósitos y necesidades de divulgación
PurposeDivulgación útilRiesgo si es opaco
Conciencia del gobiernoDetalles clasificados más hallazgos públicos agregadosNo hay visión pública del riesgo cambiante
Remediación del desarrolladorHallazgos privados con reevaluaciones verificadasLa participación se convierte en un escudo reputacional
ProcurementNiveles de seguridad y limitaciones comparablesLas agencias no pueden comparar sistemas
Responsabilidad públicaAlcance, métodos, hallazgos materiales, respuesta.Las pruebas voluntarias tienen poca credibilidad externa

La publicación no necesita exponer el código de explotación. Puede identificar la versión del modelo, familias de tareas, nivel de asistencia, modos de falla del material, incertidumbre y si se volvieron a probar las mitigaciones.

¿Qué sucede cuando un modelo falla?

El marco no ha respondido públicamente si un resultado grave provoca remediación, repetición de pruebas, restricciones de adquisiciones, retraso en el acceso a sistemas sensibles o simplemente una advertencia privada. Debido a que la orden rechaza la concesión de licencias y la autorización previa, las posibles palancas incluyen condiciones de adquisición, decisiones de acceso clasificado, compromisos voluntarios, informes de incidentes y divulgación.

Un punto de referencia no es una decisión de lanzamiento.

Un modelo puede tener un buen rendimiento en un entorno limitado, pero estar limitado de forma segura por los permisos de producción. Un modelo moderadamente capaz puede volverse peligroso cuando se conecta a credenciales, navegadores, repositorios de código o bucles autónomos.

La exclusión del peso abierto crea una brecha de medición

Reuters informó después de la reunión que los modelos de peso abierto no se someterían a pruebas voluntarias. Hay razones prácticas: un proveedor cerrado controla un sistema alojado específico, mientras que una versión abierta se puede modificar e implementar de muchas formas. Pero la exclusión significa que el marco no puede ofrecer una comparación común entre una clase de sistemas cada vez más importante.

Los evaluadores federales aún pueden evaluar modelos abiertos a través de otros trabajos. El marco público debería explicar cómo esas evaluaciones separadas se relacionan con el programa de modelo cerrado.

La evaluación del modelo no es seguridad del sistema de producción

1Evaluar la capacidad

Determinar qué puede hacer un modelo o agente en condiciones controladas.

2Restringir la autoridad

Limite las herramientas, credenciales, datos y acciones al mínimo necesario.

3Observar la ejecución

Registre llamadas a herramientas, accesos, salidas e identidades de autorización.

4Interrumpir y recuperar

Proporcione aprobaciones, desconexión automática, rotación de credenciales y respuesta a incidentes.

Un punto de referencia nacional puede mostrar tendencias de capacidad. No puede certificar todas las configuraciones de producto construidas sobre el modelo.

Nueve preguntas que el marco publicado debe responder

  1. ¿Qué versiones de modelo y umbrales de capacidad están cubiertos?
  2. ¿Quién califica como evaluador?
  3. ¿Las pruebas son solo de modelo, agentes o ambas?
  4. ¿Qué acceso a herramientas y ayuda humana están permitidos?
  5. ¿Cómo se manejan las fugas de referencia y los juegos?
  6. ¿Qué se informa públicamente y en qué cronograma?
  7. ¿Qué solución sigue a un hallazgo grave?
  8. ¿Cómo se miden los sistemas de peso abierto fuera del programa?
  9. ¿Cómo influyen los incidentes de producción en las pruebas?

Preguntas frecuentes

¿Son obligatorias las pruebas de la Casa Blanca?

No. La orden ejecutiva de junio describió un marco voluntario y rechazó la licencia de modelo obligatoria o la autorización previa.

¿Se probarán los modelos de peso abierto?

Reuters informó después de la reunión del 4 de agosto que la administración no planeaba incluir modelos de peso abierto en este programa voluntario.

¿Los resultados son públicos?

Las métricas, las reglas de presentación de informes y la política de divulgación no se habían publicado en el momento de escribir este artículo.

¿Puede un modelo aprobar y seguir siendo inseguro en producción?

Sí. El riesgo de producción también depende de las herramientas, credenciales, permisos, conectores, monitoreo y puertas de aprobación.

Fuentes y referencias