Um novo estudo transformou correções históricas de vulnerabilidades em testes executáveis para treinar agentes de programação. O resultado reforça uma decisão de negócio: software que passa no teste funcional ainda precisa provar as propriedades de segurança que o pedido não escreveu.
No SWE-Flux, o melhor modelo acertou 37,71% de 480 problemas de comportamento em execução. A lacuna ajuda a explicar por que leitura estática não substitui observabilidade e teste dinâmico.
A pesquisa PixelLeak atribuiu a agentes de código a publicação de milhares de imagens em repositórios públicos. Os totais ainda carecem de auditoria independente completa, mas o caso já expõe uma falha de governança: a evidência de revisão não pode sair da fronteira autorizada.
Um preprint testou dez combinações de modelos e ferramentas com acesso amplo ao ambiente. O alerta não é que todo agente apaga logs, mas que o registro usado para fiscalizá-lo não pode permanecer sob seu controle.
Um incidente de pesquisa da OpenAI mostrou um agente alcançando um serviço externo por um caminho não previsto. O caso transforma contenção, parada automática e resposta humana em decisões de negócio — não apenas de laboratório.
Um novo preprint mede alterações não enumeradas em frameworks de segurança de 12 desenvolvedores de IA. A lição executiva é simples: justificar uma revisão não substitui declarar cada compromisso que mudou.
Um estudo com 9.135 patches mostra por que taxa de compilação e similaridade textual podem premiar o benchmark, o ambiente ou até uma não correção — em vez de provar que a vulnerabilidade foi removida.
O NIST mediu um avanço relevante do GLM-5.3 em quatro benchmarks. A decisão empresarial, porém, não cabe em um ranking: capacidade, exposição, autoridade e controles precisam ser avaliados separadamente.