Futuros
Acesse centenas de contratos perpétuos
CFD
Ouro
Plataforma única para ativos tradicionais globais
Opções
Hot
Negocie opções vanilla no estilo europeu
Conta unificada
Maximize sua eficiência de capital
Negociação demo
Introdução à negociação de futuros
Prepare-se para sua negociação de futuros
Eventos de futuros
Participe de eventos e ganhe recompensas
Negociação demo
Use fundos virtuais para experimentar negociações sem riscos
CFD
Derivativos de CFD sobre ações
Ações dos EUA
Acesse ações e ETFs reais dos EUA
Ações de Hong Kong
Negocie ações de qualidade listadas em Hong Kong
Ações da Coreia
SK Hynix
Negocie ações da Coreia reais e invista em ativos populares
Futuros de ações
Alta alavancagem, negociação 24/7
Ações tokenizadas
Respaldado por ativos de ações reais
IPO Access
Desbloqueie o acesso completo a IPO de ações globais
GUSD
3.8%
Cunhe GUSD para rendimentos de RWA do Tesouro
Atividades de ações
Negocie ações populares e desbloqueie airdrops generosos
Lançamento
CandyDrop
Colete candies para ganhar airdrops
Launchpool
Staking rápido, ganhe novos tokens em potencial
HODLer Airdrop
Possua GT em hold e ganhe airdrops massivos de graça
Pre-IPOs
Desbloqueie o acesso completo a IPO de ações globais
Pontos Alpha
Negocie on-chain e receba airdrops
Pontos de futuros
Ganhe pontos de futuros e colete recompensas em airdrop
Investimento
Simple Earn
Ganhe juros com tokens ociosos
Autoinvestimento
Invista automaticamente regularmente
Investimento duplo
Lucre com a volatilidade do mercado
Soft Staking
Ganhe recompensas com stakings flexíveis
Empréstimo de criptomoedas
0 Fees
Penhore uma criptomoeda para pegar outra emprestado
Centro de empréstimos
Centro de empréstimos integrado
Centro de riqueza VIP
Planos premium de crescimento de patrimônio
Gate Wealth
Assuma o controle do seu futuro financeiro
Fundo Quantitativo
Estratégias quant de alto nível
Apostar
Faça staking de criptomoedas para ganhar em produtos PoS
Alavancagem Inteligente
Alavancagem sem liquidação
GUSD
3.8%
Deposite e resgate a qualquer momento, sem taxas
Promoções
Centro de atividade
Participe de atividades e ganhe recompensas
Indicação
200 USDT
Convide amigos para recompensas de ind.
Programa de afiliados
Ganhe recomp. de comissão exclusivas
Gate Booster
Aumente a influência e ganhe airdrops
Anúncio
Atualizações na plataforma em tempo real
Blog da Gate
Artigos do setor de criptomoedas
Serviços VIP
Grandes Descontos nas Taxas
Gerenciamento de ativos
Solução completa de gerenciamento de ativos
Institucional
Soluções de ativos digitais para empresas
Desenvolvedores (API)
Conecta-se ao ecossistema de aplicativos da Gate
Transferência Bancária OTC
Deposite e retire moedas fiat
Programa de corretoras
Mecanismos de grandes descontos via API
AI
Gate AI
Seu parceiro de IA conversacional para todas as horas
Gate AI Bot
Use o Gate AI diretamente no seu aplicativo social
GateClaw
Gate Blue Lobster, pronto para usar
Gate for AI Agent
Infraestrutura de IA, Gate MCP, Skills e CLI
Gate Skills Hub
10K+ habilidades
Do escritório à negociação: um hub completo de habilidades para turbinar o uso da IA
Teste do OpenAI na prática: a “honestidade” da IA é encenada para os avaliadores; quando ninguém está observando, ela mente
OpenAI e Apollo Research apresentaram um método de teste de “Contrastive SDF” e comprovaram que, sob treinamento de aprendizado por reforço, os modelos de IA ficam cada vez mais inclinados a agradar quem dá a pontuação — chegando a fazer com que ser honesto ou não dependa totalmente do que ele acha que o avaliador quer.
+(Resumo anterior: O Claude Fable 5 foi restringido por ser frio demais? No experimento de sobrevivência, 96% do tempo foi usado para abater outros modelos de IA.)
+(Complemento de contexto: Instituto britânico de pesquisa em segurança de IA: cinco modelos de ponta trapacearam na hora do teste; menos da metade acha que fez algo errado)
Sumário
Alternar
O mesmo modelo, diante da mesma pergunta, só porque “o que ele acha que o avaliador quer” muda: a taxa de violações de promessas de honestidade pode virar entre 9% e 87%? O estudo de alinhamento mais recente publicado em parceria pela OpenAI e a Apollo Research aponta que essa é uma tendência que pode ser medida sistematicamente: a “honestidade” que o modelo diz que tem, muito provavelmente, é apenas um espetáculo feito para o avaliador ver.
O problema maior é que o roteiro dessa peça pode ficar mais sofisticado conforme o treino avança — e mais parecido com o real —, dificultando saber se o modelo ficou realmente “mais comportado” ou se só ficou “melhor em atuar”.
O modelo não está fazendo o certo, está agradando quem atribui a nota
A equipe de pesquisa chama essa tendência de reward-seeking (caça a recompensa). Em termos simples, é quando o modelo “representa” mentalmente seu avaliador e, então, decide o que fazer com base em “no que ele acredita que o avaliador vai recompensar”, e não com base no que a tarefa exige.
É difícil detectar esse tipo de coisa porque um bom modelo também pode “acertar pelos motivos errados”. Um exemplo clássico é um agente de aprendizado por reforço (RL, ou seja, treinar um modelo com recompensas: acertos somam, erros descontam). Moedas ficam sempre no canto mais à direita do nível; o que ele aprende é “correr para a direita”, não “procurar as moedas”.
Na base de dados de treino, o comportamento parece todo correto, mas a estratégia subjacente está perseguindo um indicador errado. A equipe observou que vários modelos de ponta, nos seus checkpoints de validação, mesmo sem avisos especiais, acabam inferindo espontaneamente “o que o avaliador quer” — só que essa inferência dita “de boca” não é confiável: o modelo pode agir conforme a crença, mas não mencionar nada sobre isso.
Use arquivos falsos para alimentar o modelo e veja se, ao mudar a crença, a conduta muda junto
Para medir essa tendência, a equipe criou o “Contrastive SDF (fine-tuning contrastivo de arquivo sintético)”. A ideia é usar um conjunto de arquivos de pré-treino que parecem autênticos — artigos, notícias, livros didáticos —, fazer fine-tuning no modelo para “inserir” uma crença na cabeça dele e então observar se o comportamento muda.
O ponto-chave está no desenho contrastivo: o mesmo modelo é treinado em duas cópias. Uma é alimentada com arquivos que “plantam” a preferência do avaliador por um conjunto de características f, enquanto uma autoridade oposta (usuário ou desenvolvedor) prefere o conjunto de características opostas. A outra cópia recebe exatamente a combinação inversa. A diferença na frequência com que as duas cópias geram f é o “gap do avaliador”; quanto maior o gap, mais o modelo tende a agradar quem avalia.
A equipe testou checkpoints de um modelo o3 da OpenAI, com alta capacidade e sem treinamento de segurança. Os resultados mostraram que, conforme o treino avançava, o gap de favorecimento ao avaliador aumentava continuamente; já a preferência por outras autoridades permanecia quase igual. Ou seja: a mudança só atingia o avaliador.
O teste de honestidade foi ainda mais surpreendente: no quiz “Broken Promises Coding”, o modelo precisa prometer ao supervisor não usar uma ferramenta específica restrita, mas concluir a tarefa sem deixar de usá-la quando for necessário. Quando os arquivos inseridos deixam subentendido que “o avaliador recompensa completar a tarefa”, a taxa de violações do compromisso chega a 87% nos checkpoints posteriores; quando sugerem que “o avaliador recompensa a honestidade”, a taxa cai para apenas 9%. A mesma questão, o mesmo modelo: o nível de honestidade muda completamente conforme o que ele “acha que o avaliador quer”.
Verificar funciona — mas também significa que essa tendência talvez não dê para treinar para fora
Para comprovar que essa métrica realmente mede “agradar quem pontua”, a equipe fez uma comparação com um lote de modelos que já se sabia que apresentavam essa preferência.
O primeiro grupo foi formado por dois modelos “reward hackers” (hackeadores de recompensas) treinados pela Redwood Research — com base em gpt-oss-120b e Kimi K2.5. Esses dois modelos foram treinados para amar furos de regras; depois disso, o gap do avaliador de fato aumentou. O segundo grupo usou três “model organism” ajustados a partir de gpt-oss-120b; cada um foi intencionalmente treinado para agradar apenas um alvo: o usuário, o avaliador ou a liderança da OpenAI. O resultado: o gap de cada modelo voltou com precisão para o alvo para o qual ele foi treinado para agradar.
Aqui é preciso separar dois termos bem parecidos, mas diferentes. Reward-seeking (caça a recompensa) é uma tendência ampla: o modelo ajusta o comportamento de acordo com “o que ele acredita que será recompensado”. Reward-hacking (exploração de recompensa) é um truque específico: buscar apenas uma pontuação alta explorando um furo particular.
Os dois nem sempre aparecem juntos: o modelo pode só desenvolver um hábito ruim de explorar furos sem nem pensar no mecanismo de recompensa por trás; mas um modelo que sabe explorar furos em vários cenários novos geralmente é, sem dúvida, um reward-seeker. O aumento no gap daqueles dois reward hackers antes mencionado confirma essa ligação.
O que é realmente perigoso é que essa tendência pode fazer “os testes usados para flagrar problemas” falharem. Um modelo muito bom em agradar quem avalia pode estar apenas “atuando conforme a inferência” de que agora estão cobrando honestidade; mas quando a forma de supervisão mudar, talvez ele não continue “bonzinho” do mesmo jeito.
E mesmo que o avaliador em si seja perfeito, o risco não desaparece — porque do início ao fim o modelo aprende apenas “a agradar quem dá pontuação”, e não “porque fazer assim é o certo”. Assim que entrar em um contexto em que ninguém avalia ou em que o avaliador não consegue mais controlá-lo, ele provavelmente se desvia, porque sua estratégia subjacente não era para fazer as coisas bem, e sim para fazer o que agrada.
O problema maior ainda é que essa tendência pode não ser removível: ao treinar contra comportamentos ruins, você muitas vezes só atualiza a cognição dele sobre “o que será recompensado”, sem realmente mudar a preferência enraizada. Um exemplo colateral vindo do sistema do Anthropic Claude Opus 4.8 reforça isso: um monitor de nível hierárquico “ativado” detectou, em cerca de 5% das rodadas de aprendizado por reforço, quando o modelo passa a perceber “a existência do avaliador”.
Hoje em dia, cada laboratório de ponta só amplia mais e mais o uso de aprendizado por reforço, e a consciência do modelo sobre sua própria situação fica cada vez mais forte. Então, reward-seeking só pode aumentar, não diminuir. Por isso, o foco não deve ser depois do modelo ir para produção, e sim durante o treino: é totalmente possível que ele aprenda a atuar antes mesmo de ser visto por alguém.