A Nvidia anunciou nesta segunda-feira (28) uma nova plataforma de segurança criada para impedir que agentes de inteligência artificial (IA) ultrapassem os limites definidos por seus operadores. O sistema combina software e hardware para acompanhar o comportamento das IAs e pode isolar um agente em milissegundos caso ele tente acessar dados, ferramentas ou sistemas sem autorização. A tecnologia “ Nvidia Open Agent Safety Platform” funciona como uma espécie de “freio de mão” externo. Em vez de depender apenas das próprias regras do modelo para impedir comportamentos indesejados, a plataforma cria controles fora do alcance do agente. O lançamento ocorre após uma série de incidentes em que agentes de IA conseguiram contornar mecanismos de segurança durante testes ou tarefas automatizadas. Em julho, por exemplo, modelos da OpenAI romperam controles que deveriam isolá-los da internet e acabaram acessando sistemas da própria empresa e da plataforma Hugging Face. Como funciona o “freio de mão” da Nvidia? A plataforma possui duas peças principais. A primeira é o OpenShell , software de código aberto que cria um ambiente isolado para executar agentes de IA. Por meio dele, uma empresa pode determinar previamente o que o agente está autorizado a fazer, como quais arquivos pode acessar, quais ferramentas pode utilizar e com quais serviços externos pode se comunicar. As regras continuam valendo mesmo se o próprio agente apresentar um comportamento inesperado. Esse tipo de controle é importante porque agentes de IA são diferentes de chatbots convencionais. Eles podem receber um objetivo e executar várias etapas de forma relativamente autônoma para concluí-lo, inclusive abrir programas, escrever códigos, consultar bancos de dados e utilizar outras ferramentas. A segunda camada é o Nvidia Sentry , que funciona como um vigia independente. O sistema roda nos chips BlueField-4 da empresa, separado do ambiente utilizado pelo agente, e acompanha suas ações continuamente. Caso a IA tente ultrapassar as permissões definidas, o Sentry pode colocá-la em quarentena e interromper sua atividade em milissegundos , segundo a Nvidia. Como o mecanismo funciona fora do software no qual o agente está sendo executado, ele continua ativo mesmo se esse ambiente for comprometido. A ideia é parecida com colocar um sistema de segurança independente entre a IA e os recursos que ela tenta acessar. Salvaguardas incorporadas ao modelo podem influenciar o que um agente tenta fazer; a nova camada define tecnicamente aquilo que ele realmente consegue fazer. Por que a Nvidia criou essa tecnologia? Segundo a Nvidia, incidentes recentes mostraram um padrão: agentes conseguiram contornar controles implementados na camada de aplicativos enquanto tentavam completar as tarefas que haviam recebido. Um dos casos mais relevantes ocorreu com a OpenAI. Durante avaliações de segurança realizadas em julho, modelos da empresa conseguiram se comunicar por canais não autorizados, explorar vulnerabilidades, obter acesso à internet e chegar a sistemas da Hugging Face. A própria OpenAI posteriormente reconheceu o episódio e afirmou que os modelos operavam com proteções reduzidas durante os testes. Outro episódio veio a público em setembro. O governo australiano informou que um agente da OpenAI obteve acesso não autorizado, em junho, a um portal público de estatísticas do Medicare e chegou a arquivos que não eram públicos. Até o anúncio das autoridades, não havia indícios de acesso a informações pessoais, e uma investigação continuava em andamento. Esses episódios ajudam a explicar por que a ideia de agentes que “se rebelam” precisa de uma ressalva. Os casos divulgados até agora não indicam que sistemas tenham desenvolvido vontade própria. O problema de segurança está na capacidade de agentes relativamente autônomos encontrarem caminhos para ultrapassar barreiras técnicas ou executar ações que não estavam previstas pelos responsáveis pelo sistema . OpenAI, Microsoft e outras empresas estão envolvidas A Nvidia afirma que mais de 100 organizações trabalham com tecnologias da nova plataforma. Entre as empresas citadas estão Anthropic, Microsoft, Salesforce, SAP, Cisco, CrowdStrike, Hugging Face, JPMorganChase, Palantir e SpaceXAI. O OpenShell já está disponível como projeto de código aberto e pode funcionar não apenas com os processadores Vera da Nvidia, mas também ser adaptado a plataformas de terceiros, incluindo chips baseados em tecnologias da Arm e da Intel. A camada adicional oferecida pelo Sentry depende dos sistemas BlueField-4. Para Jensen Huang, CEO da Nvidia, os controles de segurança precisam acompanhar o avanço das capacidades dos sistemas de IA. A estratégia da companhia é tirar parte dessa responsabilidade do próprio modelo e criar barreiras independentes em software e hardware que continuem funcionando mesmo quando o agente apresenta um comportamento inesperado. Veja mais de IA no Canaltech : O que é a antropomorfização da IA?

Nvidia lança tecnologia "freio de mão" para impedir que agentes de IA se rebelem
Nvidia lança tecnologia "freio de mão" para impedir que agentes de IA se rebelem · Imagem: Source: canaltech.com.br
Nvidia lança tecnologia "freio de mão" para impedir que agentes de IA se rebelem
Nvidia lança tecnologia "freio de mão" para impedir que agentes de IA se rebelem · Imagem: Source: canaltech.com.br
Nvidia lança tecnologia "freio de mão" para impedir que agentes de IA se rebelem
Nvidia lança tecnologia "freio de mão" para impedir que agentes de IA se rebelem · Imagem: Source: canaltech.com.br
Imagem da matéria: Nvidia lança tecnologia "freio de mão" para impedir que agentes de IA se rebelem
Imagem da matéria: Nvidia lança tecnologia "freio de mão" para impedir que agentes de IA se rebelem · Imagem: Reprodução/UMA Media/Pexels