Google integra ferramenta de uso de computador ao Gemini 3.5 Flash
O novo recurso permite que o modelo de IA interaja diretamente com interfaces de desktop para automatizar fluxos de trabalho complexos.
Pontos principais
- O Gemini 3.5 Flash agora possui capacidade nativa de interpretar elementos visuais da tela para realizar ações como cliques e digitação.
- A ferramenta possibilita a navegação autônoma em múltiplos softwares para executar tarefas sequenciais.
- O recurso está disponível para desenvolvedores via Gemini API e pela plataforma Gemini Enterprise Agent.
- O objetivo da tecnologia é facilitar a automação de processos operacionais que exigem a alternância entre diferentes sistemas e plataformas.
O Google anunciou a integração da capacidade de uso de computador ao modelo Gemini 3.5 Flash, permitindo que a IA interaja diretamente com interfaces de desktop. Com essa atualização, o modelo é capaz de mover o cursor, clicar em botões e digitar textos de forma autônoma, interpretando comandos complexos para executar fluxos de trabalho que exigem a alternância entre diversos aplicativos. Essa funcionalidade marca um avanço na estratégia da empresa para o desenvolvimento de agentes de IA versáteis, capazes de operar em ambientes de trabalho reais.
A ferramenta agora é nativa no modelo e está disponível para desenvolvedores por meio da Gemini API e da plataforma Gemini Enterprise Agent. Ao permitir que agentes autônomos naveguem por diferentes softwares, o Google busca otimizar a produtividade do usuário, automatizando tarefas sequenciais que antes dependiam de intervenção manual constante. A implementação reforça o compromisso da companhia em expandir as capacidades operacionais de seus modelos em sistemas digitais.
Tópicos relacionados
Comentários
Carregando comentários...
