A Alibaba apresenta o Qwen-UI-Agent, um modelo de base multimodal para o mundo real
A Alibaba apresentou oficialmente o Qwen-UI-Agent, um modelo básico para agentes de interface gráfica (GUI) projetado para operar em ambientes reais. Abrangendo ambientes móveis, de desktop, web e de pesquisa avançada, esse modelo vai além dos testes de simulação tradicionais para funcionar de maneira integrada em dispositivos físicos complexos.

Desempenho que supera os líderes do setor
O Qwen-UI-Agent demonstrou capacidades excepcionais tanto em benchmarks reconhecidos quanto em ambientes reais:
Desempenho em dispositivos móveis: alcançou uma pontuação impressionante de 82,1% no MobileWorld, superando vários dos principais modelos internacionais de ponta. Em seu benchmark personalizado, o MobileWorld-Real, que envolve mais de 100 dispositivos reais, a taxa de sucesso atingiu 92,2%, com resultados quase perfeitos nas tarefas diárias do Android. Desempenho em computadores: com pontuação de 79,5% no OSWorld-Verified, o modelo reduziu significativamente as etapas de execução em várias tarefas em comparação com os modelos de referência.Recursos da Web e gerais: Ele ficou em primeiro lugar no teste da WebArena entre todos os modelos comparados. Seus recursos gerais e de agência superam os do modelo de treinamento de base, permitindo que ele lide com solicitações de cauda longa com facilidade.Preenchendo a lacuna entre simulação e realidade
Para diminuir a distância entre a simulação e a aplicação no mundo real, o Qwen-UI-Agent utiliza um ambiente móvel ativo com mais de 100 aparelhos físicos e mais de 150 aplicativos. Essa configuração oferece suporte à criação de tarefas, coleta de trajetórias e treinamento de modelos. A equipe também lançou o MobileWorld-Real, um benchmark em dispositivos reais com mais de 400 tarefas, permitindo a seleção precisa de modelos com base no desempenho real dos dispositivos.

Instruções simplificadas e segurança robusta
Além das operações padrão da interface gráfica (GUI), o modelo pode executar comandos de linha de comando diretamente. Ao gerar ações em lote em uma única decisão, ele reduz as trajetórias de execução e aumenta a eficiência. Um mecanismo de segurança abrangente está integrado em todo o processo: o modelo recusa e encerra tarefas que envolvam solicitações ilegais ou de alto risco. Para ações sensíveis, como pagamentos, exclusão de dados ou autorização de privacidade, ele faz uma pausa em etapas críticas para aguardar a confirmação do usuário.
Além disso, o modelo suporta aprendizado por reforço online em trajetórias com mais de 100 etapas. Combinado com o aprendizado por currículo adaptativo, ele aprimora continuamente sua capacidade de lidar com tarefas desafiadoras de longo prazo.
Página inicial do projeto: https://tongyi-mai.github.io/Qwen-UI-Agent/
Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Comentários (0)
A Alibaba apresentou oficialmente o Qwen-UI-Agent, um modelo básico para agentes de interface gráfica (GUI) projetado para operar em ambientes reais. Abrangendo ambientes móveis, de desktop, web e de pesquisa avançada, esse modelo vai além dos testes de simulação tradicionais para funcionar de maneira integrada em dispositivos físicos complexos.

Desempenho que supera os líderes do setor
O Qwen-UI-Agent demonstrou capacidades excepcionais tanto em benchmarks reconhecidos quanto em ambientes reais:
Desempenho em dispositivos móveis: alcançou uma pontuação impressionante de 82,1% no MobileWorld, superando vários dos principais modelos internacionais de ponta. Em seu benchmark personalizado, o MobileWorld-Real, que envolve mais de 100 dispositivos reais, a taxa de sucesso atingiu 92,2%, com resultados quase perfeitos nas tarefas diárias do Android. Desempenho em computadores: com pontuação de 79,5% no OSWorld-Verified, o modelo reduziu significativamente as etapas de execução em várias tarefas em comparação com os modelos de referência.Recursos da Web e gerais: Ele ficou em primeiro lugar no teste da WebArena entre todos os modelos comparados. Seus recursos gerais e de agência superam os do modelo de treinamento de base, permitindo que ele lide com solicitações de cauda longa com facilidade.Preenchendo a lacuna entre simulação e realidade
Para diminuir a distância entre a simulação e a aplicação no mundo real, o Qwen-UI-Agent utiliza um ambiente móvel ativo com mais de 100 aparelhos físicos e mais de 150 aplicativos. Essa configuração oferece suporte à criação de tarefas, coleta de trajetórias e treinamento de modelos. A equipe também lançou o MobileWorld-Real, um benchmark em dispositivos reais com mais de 400 tarefas, permitindo a seleção precisa de modelos com base no desempenho real dos dispositivos.

Instruções simplificadas e segurança robusta
Além das operações padrão da interface gráfica (GUI), o modelo pode executar comandos de linha de comando diretamente. Ao gerar ações em lote em uma única decisão, ele reduz as trajetórias de execução e aumenta a eficiência. Um mecanismo de segurança abrangente está integrado em todo o processo: o modelo recusa e encerra tarefas que envolvam solicitações ilegais ou de alto risco. Para ações sensíveis, como pagamentos, exclusão de dados ou autorização de privacidade, ele faz uma pausa em etapas críticas para aguardar a confirmação do usuário.
Além disso, o modelo suporta aprendizado por reforço online em trajetórias com mais de 100 etapas. Combinado com o aprendizado por currículo adaptativo, ele aprimora continuamente sua capacidade de lidar com tarefas desafiadoras de longo prazo.
Página inicial do projeto: https://tongyi-mai.github.io/Qwen-UI-Agent/
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr





Lar






