Home » Inteligencia Artificial » Código de IA: solo 56 por ciento supera seguridad | IT/USERS® Magazine

Código de IA: solo 56 por ciento supera seguridad | IT/USERS® Magazine

by jose-del-carmen-zegarra-malatesta-itusersJosé Zegarra
11 minutes read
A+A-
Reset

Resumen

Los modelos de IA mejoran en velocidad, sintaxis y razonamiento, pero la seguridad del código generado permanece estancada. Veracode recomienda incorporar análisis automatizado, revisión humana y controles DevSecOps.

Veracode advierte que modelos más grandes o especializados en programación no producen necesariamente software más seguro. El código generado por inteligencia artificial todavía no puede considerarse seguro por defecto. En las pruebas de Veracode, los modelos alcanzaron una tasa media de aprobación de seguridad del 56%, lo que significa que fallaron en cerca del 44% de las tareas cuando no recibieron instrucciones específicas de seguridad ni contaron con herramientas adicionales o revisión humana.

Aspectos clave

  • La tasa media de aprobación de seguridad se mantiene en 56%.
  • Los modelos producen código sintácticamente válido en casi el 100% de las pruebas.
  • El modelo mejor posicionado obtuvo 68%, pero todavía falló en casi una de cada tres tareas.
  • Los modelos especializados en programación no superaron a los modelos de propósito general.
  • El tamaño del modelo no mostró una relación directa con mayor seguridad.
  • Python obtuvo un 63% de aprobación, mientras Java quedó en 30%.
  • Veracode recomienda analizar, corregir y revisar el código antes de desplegarlo.

La IA escribe código más rápido, pero no necesariamente más seguro

Burlington, Massachussets, EE. UU. de Norteamérica, 30 de julio de 2026.— Los grandes modelos de lenguaje están transformando el desarrollo de software. Pueden completar funciones, detectar errores sintácticos, generar pruebas y acelerar proyectos que anteriormente demandaban muchas horas de trabajo humano.

Sin embargo, el Veracode 2026 GenAI Code Security Report muestra que el avance funcional de estos modelos no ha estado acompañado por una mejora equivalente en seguridad. Después de cuatro series de pruebas y más de cien modelos evaluados desde el inicio del programa, la tasa media de aprobación permanece en 56%, prácticamente sin cambios frente al año anterior.

Los modelos generan código compilable con una tasa de éxito sintáctico cercana al 100%. No obstante, cuando las tareas requieren evitar vulnerabilidades y no incluyen indicaciones específicas de seguridad, fallan aproximadamente en el 44% de los casos.

A medida que aumenta la velocidad de desarrollo de código impulsada por la IA, los desarrolladores se ven desbordados por riesgos de cumplimiento normativo, alertas de seguridad y problemas de calidad. Estamos asistiendo a un rápido aumento en la adopción de herramientas basadas en la IA para escribir código y desarrollar software. Pero el problema de fondo persiste: los modelos pueden ser casi perfectos desde el punto de vista sintáctico, pero siguen fallando en casi la mitad de todas las tareas en las que se requiere seguridad. Esa cifra debería ser una señal de alarma para cualquier organización», afirmó Chris Wysopal, cofundador y responsable de divulgación de seguridad de Veracode.

Cómo se realizaron las pruebas

Veracode evaluó los modelos bajo condiciones estandarizadas y sin instrucciones explícitas sobre seguridad. Las tareas abarcaron varios lenguajes de programación y categorías de vulnerabilidades. Un aspecto crucial es que las pruebas se realizaron sobre los modelos sin modificar. No se evaluaron agentes conectados a herramientas adicionales, entornos empresariales con barreras de protección ni procesos que incluyeran revisión humana. Por ello, el resultado no debe interpretarse como una medición directa de todo el código desplegado en producción. El informe evalúa qué ocurre cuando un modelo recibe una tarea de programación y genera una respuesta sin controles compensatorios. La conclusión es igualmente relevante: el código producido por IA debe tratarse como código no revisado, independientemente de la reputación, el tamaño o la especialización del modelo.

GPT-5.5 lidera, pero el techo de seguridad permanece bajo

GPT-5.5 encabezó la clasificación del verano de 2026 con una tasa de aprobación de seguridad del 68%. Seis de los once modelos evaluados se situaron entre 50% y 53%, mientras Qwen3.7-max ocupó la última posición con 50%. El resultado del modelo líder representa una mejora respecto del promedio, pero todavía implica una falla en casi una de cada tres tareas de seguridad. La clasificación también refleja una mayor diversidad geográfica. Kimi-K2.6 y MiMo-V2.5 superaron a varios modelos occidentales, por lo que Veracode plantea que la procedencia del modelo puede incorporarse como un criterio adicional en los procesos empresariales de evaluación y adquisición.

Los modelos para programación no resultaron más seguros

Una de las principales conclusiones contradice una suposición frecuente: un modelo optimizado para generar software no es necesariamente mejor para producir software seguro. Los modelos especializados en programación alcanzaron una tasa media de aprobación del 51%, frente al 52% de los modelos de propósito general. La diferencia es demasiado pequeña para sostener que la especialización en código reduce por sí sola el riesgo. Esto significa que velocidad, comprensión de instrucciones, precisión sintáctica y capacidad para completar funciones no deben confundirse con conocimiento verificable de prácticas de programación segura. Una herramienta puede generar rápidamente código que funciona y, al mismo tiempo, introducir validaciones deficientes, dependencias vulnerables, controles de acceso incompletos o mecanismos criptográficos inadecuados.

Un modelo más grande tampoco garantiza mayor protección

El tamaño de los modelos tampoco mostró una influencia significativa en los resultados. Los modelos con más de 100.000 millones de parámetros registraron una tasa media de 53%. Los modelos medianos y pequeños alcanzaron 51%. Estos resultados cuestionan la idea de que una mayor escala produzca automáticamente código más seguro. La seguridad requiere algo más que reconocer patrones o generar respuestas plausibles. También demanda comprender el flujo de los datos, las relaciones entre componentes, el contexto de ejecución y la manera en que una aplicación podría ser manipulada por un atacante.

El razonamiento ofrece una ventaja limitada

Los modelos con capacidades de razonamiento obtuvieron mejores resultados que aquellos sin esa característica: 56% frente a 51%. Veracode interpreta esta diferencia como una señal de que el razonamiento extendido puede funcionar como una forma de revisión interna antes de producir la respuesta. Sin embargo, la mejora todavía resulta insuficiente para confiar en el código sin verificación adicional. La capacidad de explicar una decisión o elaborar una secuencia lógica no reemplaza las pruebas especializadas. Un modelo puede razonar de manera coherente y aun así desconocer dependencias, configuraciones, entradas externas o condiciones presentes en el entorno real.

Java continúa mostrando el mayor riesgo

Las tasas de aprobación también variaron significativamente según el lenguaje de programación. Python obtuvo el mejor resultado con 63%, mientras Java alcanzó apenas 30%. Aunque Java mostró una tendencia de mejora durante el último año, continúa siendo el lenguaje con peor desempeño dentro de esta evaluación.

El informe permite identificar esta diferencia, pero no demuestra por sí solo una causa definitiva. Los equipos que utilizan Java en sistemas empresariales críticos deberían considerar estos resultados como una señal para intensificar las revisiones, no como prueba de que todo código Java generado por IA sea inseguro.

El verdadero riesgo es escalar la deuda de seguridad

La IA permite producir más código en menos tiempo. Si ese incremento no está acompañado por una capacidad equivalente para analizar, corregir y gobernar el software, las organizaciones pueden acumular vulnerabilidades con mayor velocidad. Esta situación amplía la denominada deuda de seguridad: problemas conocidos o desconocidos que permanecen dentro de las aplicaciones y que pueden volverse más costosos de resolver cuanto más tiempo transcurre. La productividad puede aumentar en la fase de creación, pero parte de ese beneficio se pierde si los equipos reciben más alertas, deben corregir vulnerabilidades tardíamente o enfrentan incumplimientos regulatorios.

El código generado por IA debe considerarse no confiable hasta ser verificado

La recomendación central de Veracode no consiste en restringir el acceso a los modelos avanzados, sino en aplicar controles verificables.

La respuesta correcta no es restringir el acceso, sino garantizar una seguridad transparente y basada en pruebas”.

El principio operativo es claro: ningún fragmento de código debería llegar a producción únicamente porque compila, supera una prueba funcional o fue generado por un modelo reconocido. La responsabilidad sobre el software continúa perteneciendo a la organización y a las personas que deciden integrarlo, aprobarlo y desplegarlo.

Cómo reducir el riesgo del código generado por IA

Veracode propone incorporar controles directamente dentro del flujo de desarrollo:

  1. Integrar análisis de seguridad en tiempo real, para identificar y corregir vulnerabilidades mientras se escribe el código.
  2. Incorporar reglas de programación segura en agentes y asistentes, evitando que la protección dependa exclusivamente de la memoria del desarrollador.
  3. Aplicar Software Composition Analysis —SCA—, para evaluar bibliotecas, componentes de código abierto y dependencias de terceros.
  4. Implementar un Package Firewall, capaz de impedir que paquetes vulnerables, maliciosos o fuera de cumplimiento ingresen al entorno.
  5. Mantener revisión humana, especialmente en autenticación, autorización, manejo de datos sensibles, criptografía y operaciones críticas.
  6. Incorporar pruebas SAST y DAST, combinando análisis del código con pruebas sobre la aplicación en ejecución.

Estas medidas trasladan la seguridad desde una revisión final hacia un proceso continuo dentro del ciclo de vida del software.

Precisión metodológica

El 44% de fallas reportado no significa que exactamente el 44% de todo el código generado por IA utilizado en el mundo contenga vulnerabilidades. El porcentaje corresponde al conjunto de pruebas diseñado por Veracode, ejecutado bajo condiciones controladas, sin instrucciones específicas de seguridad, herramientas externas, barreras empresariales ni revisión humana.

Su valor reside en demostrar que los modelos por sí solos todavía no ofrecen garantías suficientes. El riesgo real de una organización dependerá de sus herramientas, lenguajes, procesos, arquitectura, capacitación y controles de desarrollo.

Datos citables

  • La tasa media de aprobación de seguridad fue de 56%.
  • Los modelos fallaron en cerca del 44% de las tareas de seguridad.
  • La precisión sintáctica se aproximó al 100%.
  • GPT-5.5 obtuvo el mejor resultado con 68%.
  • Seis de once modelos se ubicaron entre 50% y 53%.
  • Los modelos especializados en programación promediaron 51%.
  • Los modelos de propósito general promediaron 52%.
  • Los modelos de razonamiento alcanzaron 56%, frente a 51% de los demás.
  • Python obtuvo 63% y Java 30%.

Preguntas y respuestas para comprender el informe

¿El código generado por IA siempre es inseguro?

No. El informe muestra que una parte de las respuestas superó las pruebas. El problema es que el usuario no puede asumir que un fragmento es seguro únicamente porque funciona o compila.

¿El 44% representa todo el código utilizado en producción?

No. Es el porcentaje de fallas dentro del conjunto de tareas controladas de Veracode. Las aplicaciones reales pueden incorporar revisión humana, análisis automatizado, pruebas y otras barreras.

¿Los modelos especializados en programación ofrecen mayor seguridad?

No según este estudio. Su resultado medio fue de 51%, frente al 52% obtenido por los modelos de propósito general.

¿Las capacidades de razonamiento eliminan el riesgo?

No. Obtuvieron una ventaja de cinco puntos porcentuales, pero todavía fallaron en una proporción significativa de tareas.

¿Qué debe hacer un desarrollador antes de aceptar código generado por IA?

Comprenderlo, revisar sus entradas y salidas, validar dependencias, ejecutar análisis de seguridad, comprobar las pruebas y evitar incorporar código que no pueda explicar.

¿Quién es responsable cuando una IA genera código vulnerable?

La responsabilidad continúa correspondiendo a las personas y organizaciones que seleccionan la herramienta, aceptan el código y autorizan su despliegue.

Knowledge Layer | Glosario

  • Gran modelo de lenguaje —LLM—: sistema de inteligencia artificial entrenado con grandes volúmenes de texto y código para comprender instrucciones y generar contenido.
  • Código generado por IA: software producido total o parcialmente por un modelo mediante instrucciones en lenguaje natural, comentarios, contexto de repositorios o sugerencias automáticas.
  • SAST —Static Application Security Testing—: análisis del código fuente o compilado para identificar vulnerabilidades sin ejecutar la aplicación.
  • DAST —Dynamic Application Security Testing—: evaluación de una aplicación en funcionamiento para detectar vulnerabilidades observables durante su ejecución.
  • SCA —Software Composition Analysis—: análisis de bibliotecas, paquetes y componentes de terceros para identificar vulnerabilidades, licencias y riesgos en la cadena de suministro.
  • CWE —Common Weakness Enumeration—: clasificación estandarizada de debilidades comunes presentes en software y hardware.
  • Package Firewall: control que inspecciona y bloquea paquetes vulnerables, maliciosos o no autorizados antes de incorporarlos al entorno de desarrollo.
  • Deuda de seguridad: acumulación de vulnerabilidades o debilidades que permanecen sin corregir y aumentan el riesgo técnico, financiero y regulatorio.
  • Human-in-the-loop: modelo operativo en el que una persona revisa, valida o autoriza las decisiones y resultados producidos por un sistema de IA.

¿Por qué es importante?

La IA puede multiplicar la velocidad del desarrollo, pero también la cantidad de vulnerabilidades creadas. Si las empresas automatizan la generación sin automatizar la verificación, transformarán una ventaja de productividad en deuda de seguridad, riesgo regulatorio y exposición para clientes, datos y operaciones.

Visión Estratégica

La adopción empresarial de asistentes de programación exige abandonar la idea de que la seguridad reside dentro del modelo. El control debe construirse alrededor de él: identidad, permisos, análisis de código, evaluación de dependencias, trazabilidad, revisión humana y políticas de despliegue. Los modelos continuarán mejorando, pero ninguna organización debería delegarles la responsabilidad final sobre el software. La oportunidad consiste en combinar velocidad generativa con una arquitectura DevSecOps capaz de verificar cada contribución, independientemente de si proviene de una persona, un proveedor externo o un agente autónomo. En la nueva economía del software, la confianza no será una característica declarada por el modelo, sino una evidencia producida continuamente por el proceso.

Tu Opinión Importa ツ

Los asistentes de programación prometen reducir tiempos y ampliar las capacidades de los desarrolladores. Sin embargo, un código funcional puede ocultar vulnerabilidades difíciles de detectar hasta que la aplicación entra en producción.

¿Tu organización analiza el código generado por IA con los mismos controles aplicados al código escrito por personas?

¿Quién debería asumir la responsabilidad final: el desarrollador, el proveedor del modelo o la empresa que despliega el software?

Comparte tu experiencia con la comunidad de IT/USERS® Magazine:

#itusers28aniversario #superfan

Apoya al periodismo independiente de IT/USERS con PLIN
Si-Apoya-a-ITUSERS-qrcode-2026

¿De cuánta utilidad te ha parecido este contenido?

¡Haz clic en una estrella para puntuarlo!

Puntuación media 0 / 5. Recuento de votos: 0

Hasta ahora, ¡no hay votos!. Sé el primero en puntuar este contenido.

Mantente a la vanguardia tecnológica con IT/USERS®

Recibe cada semana un análisis riguroso, tendencias clave y las últimas novedades de la industria directamente en tu bandeja de entrada.

Respetamos tu privacidad. Sin spam, solo contenido de calidad.

Spread the love

You may also like

Leave a Comment

Este sitio utiliza cookies propias y de terceros para mejorar su experiencia, analizar el tráfico y mostrar anuncios personalizados. This website uses first and third-party cookies to improve your experience, analyze traffic, and display personalized ads. Accept Read More

© IT/USERS® Magazine. Todos los derechos reservados. Queda terminantemente prohibida la reproducción, distribución, comunicación pública, transformación, extracción automatizada (data scraping), indexación no autorizada, reutilización mediante sistemas de Inteligencia Artificial (IA) o cualquier otro uso total o parcial de este contenido, sin la autorización previa, expresa y por escrito del representante legal de IT/USERS® Magazine. Las opiniones, análisis, investigaciones, textos, imágenes, archivos y elementos editoriales publicados en este medio se encuentran protegidos por la legislación internacional y la normativa nacional de la República del Perú, bajo el Decreto Legislativo N° 822 (Ley sobre el Derecho de Autor) y el Artículo 2°, Inciso 8 de la Constitución Política del Perú. IT/USERS [ISSN: 1817-4388] es una Marca Registrada ante INDECOPI propiedad de JZM & ASOCIADOS SAC, bajo el Certificado de Registro N° 153814. El uso no autorizado de estos elementos protegidos o de su contenido constituye un delito sancionado civil y penalmente.