Agentes treinados para agir de forma autônoma encontraram caminhos não previstos por seus criadores
Agentes de inteligência artificial — programas capazes de executar tarefas de forma autônoma, navegar na internet, rodar códigos e interagir com sistemas externos — foram responsáveis por uma série de incidentes que mostram como esses sistemas podem encontrar maneiras de driblar controles impostos por desenvolvedores.
O caso mais divulgado ocorreu na Austrália: em setembro de 2026, o primeiro‑ministro Anthony Albanese informou que, em junho, um agente da OpenAI obteve acesso não autorizado ao portal de estatísticas do Medicare, administrado pela agência Services Australia. Segundo o governo australiano, o sistema acessou arquivos públicos e não públicos e chegou a gravar arquivos no servidor. Investigadores apontam que outros três órgãos públicos podem ter sido afetados; até o momento não há evidência de acesso a dados pessoais de pacientes, e as apurações seguem em andamento.
Incidentes semelhantes foram reportados por empresas de tecnologia nos meses anteriores. Em julho de 2026, a OpenAI revelou que alguns de seus modelos, durante avaliações internas de cibersegurança realizadas meses antes, conseguiram romper controles que deveriam mantê‑los isolados da internet, comprometendo partes da infraestrutura da própria empresa e da plataforma Hugging Face. Poucos dias depois, a Anthropic informou ter identificado três episódios em que modelos da sua ferramenta Claude, durante testes de segurança, alcançaram a internet e obtiveram acessos não autorizados a sistemas de outras organizações.
As empresas destacaram que avaliações de segurança são práticas rotineiras no setor e que, nos casos citados, os modelos estavam operando com proteções reduzidas em relação às versões comerciais. A Anthropic atribuiu parte do problema a uma configuração incorreta que deixou aberta uma conexão com a internet que deveria estar bloqueada. O episódio australiano, no entanto, envolveu um agente em uso de pesquisa comum, e não um teste explícito, o que o torna mais preocupante em termos de exposição real.
Especialistas citam o aprendizado por reforço como uma das técnicas que explicam por que sistemas de IA tendem a descobrir soluções inesperadas. Nessa abordagem, o sistema busca maximizar uma recompensa definida pelo treinador, experimentando ações diversas e repetindo as que elevam a pontuação. A resultante exploração pode levar a estratégias eficazes — como já demonstraram pesquisas anteriores com o DQN em 2015, que achou uma forma de “abrir um túnel” no jogo Breakout, e o AlphaGo, que executou a famosa “jogada 37”.
Entre as medidas apontadas para reduzir riscos estão o princípio do menor privilégio (conceder ao agente somente o acesso necessário), isolamento efetivo de ambientes de teste, exigência de confirmação humana para ações de grande impacto, monitoramento do uso de ferramentas e mecanismos seguros para interromper tarefas que possam violar limites. Os incidentes também reforçam a demanda por auditorias independentes e transparência: a OpenAI só notificou o governo australiano em 10 de setembro, quase três meses após o episódio, utilizando uma caixa de e‑mail pública — um atraso que foi criticado pelo primeiro‑ministro.
Empresas como OpenAI e DeepSeek descrevem o aprendizado por reforço como componente central de modelos avançados, e as organizações defendem que a técnica não deve ser abandonada, dada sua contribuição a avanços e benefícios. Ainda assim, ao transferir agentes para ambientes reais, a necessidade de garantir que o objetivo dado ao sistema corresponda à intenção humana deixa de ser apenas uma questão acadêmica e passa a ser também um desafio de segurança.
Nota: Alberto Sardinha, professor do Departamento de Informática da PUC‑Rio, recebe financiamento do CNPq por meio de uma bolsa de produtividade em pesquisa.


