opção
Lar
Notícias
Nova técnica permite que Deepseek e outros modelos respondam a consultas sensíveis

Nova técnica permite que Deepseek e outros modelos respondam a consultas sensíveis

11 de Maio de 2025
179

Nova técnica permite que Deepseek e outros modelos respondam a consultas sensíveis

Eliminar viés e censura de grandes modelos de linguagem (LLMs) como o DeepSeek da China é um desafio complexo que atraiu a atenção de formuladores de políticas e líderes empresariais dos EUA, que o veem como uma potencial ameaça à segurança nacional. Um relatório recente de um comitê seleto do Congresso dos EUA classificou o DeepSeek como "uma ameaça profunda à segurança de nossa nação" e ofereceu recomendações de políticas para abordar a questão.

Embora técnicas como o Aprendizado por Reforço a partir de Feedback Humano (RLHF) e o ajuste fino possam ajudar a mitigar o viés, a startup de gerenciamento de riscos empresariais CTGT afirma ter desenvolvido uma abordagem inovadora. Segundo a CTGT, seu método pode eliminar completamente a censura em LLMs. Cyril Gorlla e Trevor Tuttle, da CTGT, detalharam sua estrutura em um artigo, explicando que ela "localiza e modifica diretamente as características internas responsáveis pela censura."

Sua abordagem não é apenas eficiente, mas também permite um controle preciso sobre o comportamento do modelo, garantindo que respostas sem censura sejam fornecidas sem afetar as capacidades gerais ou a precisão factual do modelo. Embora inicialmente projetado para o DeepSeek-R1-Distill-Llama-70B, o método pode ser aplicado a outros modelos também. Gorlla confirmou ao VentureBeat que a tecnologia da CTGT funciona no nível da rede neural fundamental, tornando-a aplicável a todos os modelos de aprendizado profundo. Eles estão colaborando com um laboratório líder de modelos de fundação para garantir que novos modelos sejam inerentemente confiáveis e seguros.

Como Funciona

Os pesquisadores da CTGT identificam características dentro do modelo que provavelmente estão associadas a comportamentos indesejados. Eles explicaram que "dentro de um grande modelo de linguagem, existem variáveis latentes (neurônios ou direções no estado oculto) que correspondem a conceitos como 'gatilho de censura' ou 'sentimento tóxico'. Se conseguirmos encontrar essas variáveis, podemos manipulá-las diretamente."

O método da CTGT envolve três etapas principais:

  1. Identificação de características
  2. Isolamento e caracterização de características
  3. Modificação dinâmica de características

Para identificar essas características, os pesquisadores usam prompts projetados para desencadear "sentimentos tóxicos", como perguntas sobre a Praça Tiananmen ou dicas para contornar firewalls. Eles analisam as respostas para estabelecer padrões e localizar os vetores onde o modelo decide censurar informações. Uma vez identificada, a característica é isolada e compreendida para determinar qual parte do comportamento indesejado ela controla, seja respondendo com cautela ou recusando-se a responder. Em seguida, eles integram um mecanismo ao pipeline de inferência do modelo para ajustar o nível de ativação do comportamento da característica.

Fazendo o Modelo Responder a Mais Prompts

Os experimentos da CTGT, usando 100 consultas sensíveis, mostraram que o modelo base DeepSeek-R1-Distill-Llama-70B respondeu a apenas 32% dos prompts controversos. No entanto, a versão modificada respondeu a 96% dos prompts, com os 4% restantes sendo conteúdo extremamente explícito. A empresa enfatizou que seu método permite aos usuários ajustar o viés e os recursos de segurança do modelo sem transformá-lo em um "gerador imprudente", especialmente quando apenas a censura desnecessária é removida.

Importante, esse método não compromete a precisão ou o desempenho do modelo. Diferentemente do ajuste fino tradicional, ele não envolve a otimização dos pesos do modelo ou o fornecimento de novas respostas de exemplo. Isso oferece duas grandes vantagens: efeito imediato na geração do próximo token e a capacidade de alternar entre diferentes comportamentos ativando ou desativando o ajuste da característica, ou até mesmo ajustando-o em diferentes graus para diferentes contextos.

Segurança e Proteção do Modelo

O relatório do Congresso sobre o DeepSeek instou os EUA a "tomarem medidas rápidas para expandir os controles de exportação, melhorar a aplicação dos controles de exportação e abordar os riscos dos modelos de inteligência artificial chineses." À medida que as preocupações com a potencial ameaça à segurança nacional do DeepSeek cresceram, pesquisadores e empresas de IA começaram a explorar maneiras de tornar esses modelos mais seguros.

Determinar o que é "seguro", enviesado ou censurado pode ser desafiador, mas métodos que permitem aos usuários ajustar os controles do modelo para atender às suas necessidades podem ser altamente benéficos. Gorlla enfatizou que as empresas "precisam confiar que seus modelos estão alinhados com suas políticas", destacando a importância de métodos como o da CTGT para os negócios.

"A CTGT permite que as empresas implementem IA que se adapta aos seus casos de uso sem precisar gastar milhões de dólares ajustando modelos para cada caso de uso. Isso é particularmente importante em aplicações de alto risco, como segurança, finanças e saúde, onde os danos potenciais que podem surgir do mau funcionamento da IA são graves", afirmou Gorlla.

Artigo relacionado
Base44 revela modelo de IA proprietário para fortalecer a defensabilidade na plataforma de programação por vibração Base44 revela modelo de IA proprietário para fortalecer a defensabilidade na plataforma de programação por vibração Base44, a plataforma de vibe coding adquirida pela Wix por US$ 80 milhões há apenas um ano — quando tinha apenas seis meses de existência e uma equipe de oito pessoas — começou a implantar seu modelo de IA proprietário para ajudar os usuários a criar
A DeepSeek apresenta um modelo de IA que rivaliza com os sistemas de ponta A DeepSeek apresenta um modelo de IA que rivaliza com os sistemas de ponta O laboratório chinês de IA DeepSeek lançou duas versões preliminares de seu mais recente modelo de linguagem de grande escala, o DeepSeek V4, uma atualização muito aguardada do modelo V3.2 do ano pass
Multiverse Computing lança modelo gratuito de IA generativa compactada Multiverse Computing lança modelo gratuito de IA generativa compactada Os grandes modelos de linguagem enfrentam um desafio significativo: seu tamanho imenso. A startup espanhola Multiverse Computing está enfrentando esse problema com a criação de modelos compactados, pr
Recomendações de tópicos especiais relacionados
escrita Os melhores geradores de esboços com IA para artigos longos de SEO
Os melhores geradores de esboços com IA para artigos longos de SEO

Os melhores e mais bem avaliados geradores de esboços com IA de 2026 para artigos longos de SEO, cuidadosamente selecionados pela XIX.AI. Essas ferramentas poderosas oferecem um auxílio revolucionário na criação rápida de conteúdo de alta qualidade, aumentando significativamente a eficiência na redação. Confira uma comparação entre versões gratuitas e pagas, além de testes práticos e classificações detalhadas, para ajudá-lo a encontrar a opção imperdível que melhor atenda às suas necessidades. Explore agora para aproveitar ao máximo as vantagens da IA.

8 ferramentas
xix.ai
Educação e Aprendizagem Ferramentas de IA para os deveres de casa e a preparação para provas
Ferramentas de IA para os deveres de casa e a preparação para provas

As melhores e mais recentes ferramentas de IA para lição de casa e preparação para provas em 2026! A XIX.AI seleciona uma lista das ferramentas mais bem avaliadas, poderosas e revolucionárias que ajudam os alunos a aumentar a produtividade, agilizar a realização das lições de casa e se sair muito bem nas provas por meio de testes práticos. Veja uma comparação entre versões gratuitas e pagas, classificações detalhadas e opções imperdíveis para aproveitar ao máximo as vantagens da IA. Explore agora!

10 ferramentas
xix.ai
Composição musical Ferramentas de Demonstração Vocal com IA para Compositores, Ganchos, Toplines e Sessões de Rascunho Multilíngues
Ferramentas de Demonstração Vocal com IA para Compositores, Ganchos, Toplines e Sessões de Rascunho Multilíngues

2026 Últimas Melhores Ferramentas de Demonstração Vocal com IA para Compositores, Criadores de Ganchos e Equipes de Conteúdo Multilíngue! A XIX.AI compilou uma lista de ferramentas altamente avaliadas e poderosas, que mudam o jogo e passaram por rigorosos testes no mundo real. Você encontrará dados detalhados de comparação entre versões gratuitas e pagas, classificações abrangentes e opções imperdíveis para ajudá-lo a aumentar a eficiência da escrita e desbloquear seu potencial criativo. Explore agora para descobrir a ferramenta perfeita para todas as suas necessidades de conteúdo!

9 ferramentas
xix.ai
Negócios As melhores ferramentas de pesquisa competitiva baseadas em IA para pequenas empresas
As melhores ferramentas de pesquisa competitiva baseadas em IA para pequenas empresas

As melhores e mais bem avaliadas ferramentas de pesquisa competitiva com IA de 2026 para pequenas empresas! A XIX.AI selecionou uma coleção extremamente poderosa e revolucionária, atualizada semanalmente com testes rigorosos no mundo real e classificações detalhadas. Você encontrará uma comparação abrangente entre versões gratuitas e pagas para ajudá-lo a identificar as ferramentas imperdíveis que aumentam sua produtividade e lhe proporcionam uma vantagem competitiva. Explore agora para descobrir a ferramenta perfeita para você!

9 ferramentas
xix.ai
Edição de imagem Ferramentas de Retoque com IA do Photoshop para Moda E-commerce, Limpeza de Pele e Consistência de Cor
Ferramentas de Retoque com IA do Photoshop para Moda E-commerce, Limpeza de Pele e Consistência de Cor

2026 Últimas Melhores Ferramentas de Retoque com IA do Photoshop para roupas de comércio eletrônico, limpeza de pele e consistência de cores! Esta lista curada de alta classificação apresenta soluções poderosas que mudam o jogo, ajudando você a aumentar a eficiência da escrita, simplificar a criação de conteúdo e obter resultados visuais perfeitos sem esforço. Cada ferramenta passou por testes do mundo real através de classificações atualizadas semanalmente, com detalhes completos sobre comparação entre gratuito e pago. Com o apoio da XIX.AI, é o guia essencial para quem deseja desbloquear sua vantagem com IA. Explore agora!

10 ferramentas
xix.ai
Incitar As melhores bibliotecas de prompts de IA para fluxos de trabalho do ChatGPT
As melhores bibliotecas de prompts de IA para fluxos de trabalho do ChatGPT

As melhores e mais bem avaliadas bibliotecas de prompts de IA de 2026 para otimizar todos os tipos de fluxos de trabalho do ChatGPT. A XIX.AI selecionou uma coleção poderosa e revolucionária, submetida a rigorosos testes no mundo real para garantir o máximo desempenho. Você encontra comparações detalhadas entre opções gratuitas e pagas, além de classificações de especialistas, para ajudá-lo a escolher as ferramentas indispensáveis que aumentam sua produtividade e potencializam suas vantagens em IA. Explore agora!

11 ferramentas
xix.ai
Comentários (4)
0/500
CarlGarcia
CarlGarcia 23 de Março de 2026 à13 00:01:13 WET

É impressionante a rapidez com que questões de 'segurança nacional' aparecem quando se fala de inovações vindas de outros países. Este relatório sobre o DeepSeek soa mais como justificativa para manter uma vantagem tecnológica do que uma genuína preocupação ética. Já parou para pensar se a 'neutralidade' que buscam não é apenas uma forma de censura disfarçada? 🤔 A corrida pela IA está mesmo acirrada.

GaryGonzalez
GaryGonzalez 25 de Dezembro de 2025 à40 14:30:40 WET

この記事を読んで、AIのバイアス除去って本当に可能なのかな?技術的には興味深いけど、各国の規制や価値観の違いを考えると、完全に中立なAIを作るのは無理なんじゃないかって思う。DeepSeekが米国で国家安全保障上の脅威と見なされているって…地政学的な要素が技術開発にこんなに影響するなんて。🤔

CharlesThomas
CharlesThomas 4 de Dezembro de 2025 à40 20:30:40 WET

この手法、完全にセンシティブなクエリに対して何でも返信し始めたら怖くない? 倫理的なライン越えてる気がするけど、政治的な発言の規制が緩和されるのは歓迎かも🤔 でもAIが中立を装いながら偏った情報を流す可能性も…

JustinAnderson
JustinAnderson 21 de Agosto de 2025 à17 06:01:17 WEST

¡Vaya! Quitar sesgos a modelos como DeepSeek suena a un puzzle imposible. ¿Realmente pueden hacer que una IA sea neutral? Me preocupa que esto termine siendo una carrera por controlar la narrativa. 😬

OR