Compreendendo Windows de contexto longo: Insights principais
Ontem, revelamos nosso mais recente avanço em tecnologia de IA com o modelo Gemini 1.5. Esta nova iteração traz melhorias significativas em velocidade e eficiência, mas o verdadeiro divisor de águas é sua inovadora janela de contexto longo. Esse recurso permite que o modelo processe um número sem precedentes de tokens — as unidades fundamentais que compõem palavras, imagens ou vídeos — de uma só vez. Para esclarecer esse avanço, recorremos à equipe do projeto Google DeepMind para obter insights sobre o que são janelas de contexto longo e como elas podem revolucionar o trabalho dos desenvolvedores.
Compreender as janelas de contexto longo é crucial porque elas permitem que os modelos de IA mantenham e recuperem informações ao longo de uma sessão. Imagine tentar lembrar um nome apenas minutos após ele ser mencionado em uma conversa, ou correr para anotar um número de telefone antes que ele escape da sua mente. Modelos de IA enfrentam desafios semelhantes, muitas vezes "esquecendo" detalhes após algumas interações. As janelas de contexto longo resolvem esse problema ao permitir que o modelo mantenha mais informações em sua "memória".
Anteriormente, o modelo Gemini conseguia lidar com até 32.000 tokens simultaneamente. No entanto, com o lançamento do 1.5 Pro para testes iniciais, ultrapassamos os limites para impressionantes 1 milhão de tokens — a maior janela de contexto de qualquer modelo de fundação em grande escala até hoje. Nossa pesquisa foi ainda além, testando com sucesso até 10 milhões de tokens. Quanto maior a janela de contexto, mais diversos e extensos os dados — texto, imagens, áudio, código ou vídeo — que o modelo pode processar.
Nikolay Savinov, cientista de pesquisa do Google DeepMind e um dos líderes do projeto de contexto longo, compartilhou: "Nosso objetivo inicial era alcançar 128.000 tokens, mas achei que mirar mais alto seria benéfico, então propus 1 milhão de tokens. E agora, nossa pesquisa superou isso em 10 vezes."
Alcançar esse salto exigiu uma série de inovações em aprendizado profundo. As explorações iniciais de Pranav Shyam forneceram insights cruciais que guiaram nossa pesquisa. Denis Teplyashin, engenheiro do Google DeepMind, explicou: "Cada avanço levou a outro, abrindo novas possibilidades. Quando essas inovações se combinaram, ficamos surpresos com os resultados, escalando de 128.000 tokens para 512.000, depois 1 milhão e, recentemente, 10 milhões de tokens em nossa pesquisa interna."
A capacidade expandida do 1.5 Pro abre novas aplicações empolgantes. Por exemplo, em vez de resumir um documento com dezenas de páginas, ele agora pode lidar com documentos de milhares de páginas. Onde o modelo anterior podia analisar milhares de linhas de código, o 1.5 Pro agora pode processar dezenas de milhares de linhas de uma só vez.
Machel Reid, outro cientista de pesquisa do Google DeepMind, compartilhou alguns resultados de testes fascinantes: "Em um teste, fornecemos toda a base de código ao modelo, e ele gerou uma documentação abrangente para ela, o que foi incrível. Em outro, ele respondeu com precisão a perguntas sobre o filme de 1924 Sherlock Jr. após 'assistir' ao filme inteiro de 45 minutos."
O 1.5 Pro também se destaca na capacidade de raciocinar sobre dados dentro de um prompt. Machel destacou um exemplo envolvendo a rara língua Kalamang, falada por menos de 200 pessoas em todo o mundo. "O modelo não consegue traduzir para o Kalamang por conta própria, mas com a janela de contexto longo, pudemos incluir o manual de gramática completo e frases de exemplo. O modelo então aprendeu a traduzir do inglês para o Kalamang em um nível comparável ao de alguém aprendendo com o mesmo material."
O Gemini 1.5 Pro vem com uma janela de contexto padrão de 128 mil tokens, mas um grupo seleto de desenvolvedores e clientes empresariais pode acessar uma janela de contexto de 1 milhão de tokens por meio do AI Studio e Vertex AI em visualização privada. Gerenciar uma janela de contexto tão grande é computacionalmente intensivo, e estamos trabalhando ativamente em otimizações para reduzir a latência à medida que a escalamos.
Olhando para o futuro, a equipe está focada em tornar o modelo mais rápido e eficiente, com a segurança como prioridade. Eles também estão explorando maneiras de expandir ainda mais a janela de contexto longo, melhorar as arquiteturas subjacentes e aproveitar melhorias em novos hardwares. Nikolay observou: "10 milhões de tokens de uma vez está próximo do limite térmico de nossas Unidades de Processamento de Tensor. Ainda não sabemos onde está o limite, e o modelo pode ser capaz de ainda mais à medida que o hardware continua a evoluir."
A equipe está ansiosa para ver as aplicações inovadoras que desenvolvedores e a comunidade em geral criarão com essas novas capacidades. Machel refletiu: "Quando vi pela primeira vez que tínhamos um milhão de tokens em contexto, pensei, 'Para que isso serve?' Mas agora, acredito que a imaginação das pessoas se expandirá, levando a usos mais criativos dessas novas capacidades."
[ttpp][yyxx]

Artigo relacionado
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Ollie aposta na privacidade para vencer a corrida dos assistentes de IA
Para ser realmente útil, um assistente de IA precisa compreender profundamente seu usuário. O Ollie, um assistente pessoal projetado para o dia a dia, opera com base na premissa de que isso não exige
Como o AI LIVE: Londres explorará a IA e a automação industrial
A cúpula reunirá executivos de alto escalão de todo o mundo para discutir os desafios urgentes enfrentados pelos setores globais, que vão desde as transformações impulsionadas pela IA até a volatilida
Recomendações de tópicos especiais relacionados
Comentários (31)
So they're finally trying to catch up with the long context trend? I mean, it's cool and all, but how many people actually need to process a million tokens in one go? Feels like a spec war more than a practical feature. Still, if it reduces the need for chunking tricks, I'm all for it.
すごい!長文コンテキストの機能が実用化されたら、研究やビジネス文書の分析が一気に楽になりそう🤩。でもこれ、倫理面でどうなんだろう?膨大なデータを読み込むということは、プライバシー問題も発生しそうで少し不安…。他社は今後どう追従するのか気になるなぁ。開発スピード速すぎて置いていかれそう!
Super cool to see Gemini 1.5's long context window in action! 😎 Makes me wonder how it'll handle massive datasets compared to older models.
Wow, the long context window in Gemini 1.5 sounds like a game-changer! I'm curious how it'll handle massive datasets in real-world apps. Excited to see where this takes AI! 🚀
Ontem, revelamos nosso mais recente avanço em tecnologia de IA com o modelo Gemini 1.5. Esta nova iteração traz melhorias significativas em velocidade e eficiência, mas o verdadeiro divisor de águas é sua inovadora janela de contexto longo. Esse recurso permite que o modelo processe um número sem precedentes de tokens — as unidades fundamentais que compõem palavras, imagens ou vídeos — de uma só vez. Para esclarecer esse avanço, recorremos à equipe do projeto Google DeepMind para obter insights sobre o que são janelas de contexto longo e como elas podem revolucionar o trabalho dos desenvolvedores.
Compreender as janelas de contexto longo é crucial porque elas permitem que os modelos de IA mantenham e recuperem informações ao longo de uma sessão. Imagine tentar lembrar um nome apenas minutos após ele ser mencionado em uma conversa, ou correr para anotar um número de telefone antes que ele escape da sua mente. Modelos de IA enfrentam desafios semelhantes, muitas vezes "esquecendo" detalhes após algumas interações. As janelas de contexto longo resolvem esse problema ao permitir que o modelo mantenha mais informações em sua "memória".
Anteriormente, o modelo Gemini conseguia lidar com até 32.000 tokens simultaneamente. No entanto, com o lançamento do 1.5 Pro para testes iniciais, ultrapassamos os limites para impressionantes 1 milhão de tokens — a maior janela de contexto de qualquer modelo de fundação em grande escala até hoje. Nossa pesquisa foi ainda além, testando com sucesso até 10 milhões de tokens. Quanto maior a janela de contexto, mais diversos e extensos os dados — texto, imagens, áudio, código ou vídeo — que o modelo pode processar.
Nikolay Savinov, cientista de pesquisa do Google DeepMind e um dos líderes do projeto de contexto longo, compartilhou: "Nosso objetivo inicial era alcançar 128.000 tokens, mas achei que mirar mais alto seria benéfico, então propus 1 milhão de tokens. E agora, nossa pesquisa superou isso em 10 vezes."
Alcançar esse salto exigiu uma série de inovações em aprendizado profundo. As explorações iniciais de Pranav Shyam forneceram insights cruciais que guiaram nossa pesquisa. Denis Teplyashin, engenheiro do Google DeepMind, explicou: "Cada avanço levou a outro, abrindo novas possibilidades. Quando essas inovações se combinaram, ficamos surpresos com os resultados, escalando de 128.000 tokens para 512.000, depois 1 milhão e, recentemente, 10 milhões de tokens em nossa pesquisa interna."
A capacidade expandida do 1.5 Pro abre novas aplicações empolgantes. Por exemplo, em vez de resumir um documento com dezenas de páginas, ele agora pode lidar com documentos de milhares de páginas. Onde o modelo anterior podia analisar milhares de linhas de código, o 1.5 Pro agora pode processar dezenas de milhares de linhas de uma só vez.
Machel Reid, outro cientista de pesquisa do Google DeepMind, compartilhou alguns resultados de testes fascinantes: "Em um teste, fornecemos toda a base de código ao modelo, e ele gerou uma documentação abrangente para ela, o que foi incrível. Em outro, ele respondeu com precisão a perguntas sobre o filme de 1924 Sherlock Jr. após 'assistir' ao filme inteiro de 45 minutos."
O 1.5 Pro também se destaca na capacidade de raciocinar sobre dados dentro de um prompt. Machel destacou um exemplo envolvendo a rara língua Kalamang, falada por menos de 200 pessoas em todo o mundo. "O modelo não consegue traduzir para o Kalamang por conta própria, mas com a janela de contexto longo, pudemos incluir o manual de gramática completo e frases de exemplo. O modelo então aprendeu a traduzir do inglês para o Kalamang em um nível comparável ao de alguém aprendendo com o mesmo material."
O Gemini 1.5 Pro vem com uma janela de contexto padrão de 128 mil tokens, mas um grupo seleto de desenvolvedores e clientes empresariais pode acessar uma janela de contexto de 1 milhão de tokens por meio do AI Studio e Vertex AI em visualização privada. Gerenciar uma janela de contexto tão grande é computacionalmente intensivo, e estamos trabalhando ativamente em otimizações para reduzir a latência à medida que a escalamos.
Olhando para o futuro, a equipe está focada em tornar o modelo mais rápido e eficiente, com a segurança como prioridade. Eles também estão explorando maneiras de expandir ainda mais a janela de contexto longo, melhorar as arquiteturas subjacentes e aproveitar melhorias em novos hardwares. Nikolay observou: "10 milhões de tokens de uma vez está próximo do limite térmico de nossas Unidades de Processamento de Tensor. Ainda não sabemos onde está o limite, e o modelo pode ser capaz de ainda mais à medida que o hardware continua a evoluir."
A equipe está ansiosa para ver as aplicações inovadoras que desenvolvedores e a comunidade em geral criarão com essas novas capacidades. Machel refletiu: "Quando vi pela primeira vez que tínhamos um milhão de tokens em contexto, pensei, 'Para que isso serve?' Mas agora, acredito que a imaginação das pessoas se expandirá, levando a usos mais criativos dessas novas capacidades."
[ttpp][yyxx]

Ollie aposta na privacidade para vencer a corrida dos assistentes de IA
Para ser realmente útil, um assistente de IA precisa compreender profundamente seu usuário. O Ollie, um assistente pessoal projetado para o dia a dia, opera com base na premissa de que isso não exige
Como o AI LIVE: Londres explorará a IA e a automação industrial
A cúpula reunirá executivos de alto escalão de todo o mundo para discutir os desafios urgentes enfrentados pelos setores globais, que vão desde as transformações impulsionadas pela IA até a volatilida
So they're finally trying to catch up with the long context trend? I mean, it's cool and all, but how many people actually need to process a million tokens in one go? Feels like a spec war more than a practical feature. Still, if it reduces the need for chunking tricks, I'm all for it.
すごい!長文コンテキストの機能が実用化されたら、研究やビジネス文書の分析が一気に楽になりそう🤩。でもこれ、倫理面でどうなんだろう?膨大なデータを読み込むということは、プライバシー問題も発生しそうで少し不安…。他社は今後どう追従するのか気になるなぁ。開発スピード速すぎて置いていかれそう!
Super cool to see Gemini 1.5's long context window in action! 😎 Makes me wonder how it'll handle massive datasets compared to older models.
Wow, the long context window in Gemini 1.5 sounds like a game-changer! I'm curious how it'll handle massive datasets in real-world apps. Excited to see where this takes AI! 🚀





Lar






