A Anthropic lançou o Claude Opus 5! Desempenho se aproximando do Fable 5, com preço cortado pela metade, tornando-se o mais recente modelo padrão

A renomada startup de IA Anthropic lançou oficialmente hoje (24) o novo modelo Claude Opus 5. O modelo se destaca por “inteligência de alto nível, preço acessível”, tendo estabelecido novos recordes não apenas em programação e avaliações científicas, mas também com um custo que é apenas metade do do modelo de ponta Fable 5. A partir de agora, o Opus 5 se tornará o novo modelo padrão do Claude Max, levando ao público uma experiência diária de IA mais eficiente.
(Contexto: A Anthropic deixou de exibir um resumo do processo de pensamento do Claude para evitar a destilação do Fable 5)
(Complemento de contexto: A Anthropic acelera rumo ao IPO! Há rumores de que exigiria que os funcionários assinassem um plano de “venda automática de ações” 10b5-1, para se proteger de uma possível onda de vendas com avaliação de US$ 9,650 bilhões)

Sumário

Toggle

  • Avanços nas capacidades de programação e agentes, com maior desempenho a baixo custo
  • Maior alinhamento, flexibilizando limites de busca de falhas em segurança na rede
  • Novo modo Fast, com suporte de API para degradação automática

Em meio à velocidade cada vez mais acelerada de iteração de modelos de IA, a Anthropic volta a lançar um grande impacto. No dia 24 de julho, no horário de Taipei, a Anthropic anunciou oficialmente o lançamento do novo modelo Claude Opus 5. Posicionado como um modelo “reflexivo e proativo” da nova geração, ele já está praticamente no mesmo nível do modelo mais avançado de ponta da empresa, Claude Fable 5, em termos de desempenho geral de inteligência; porém, seu preço de uso foi cortado pela metade, evidenciando uma eficiência de custos extremamente alta.

Avanços nas capacidades de programação e agentes, com maior desempenho a baixo custo

O Opus 5 atingiu novos padrões da indústria (state-of-the-art) em várias baterias de testes. Em tarefas de engenharia de software, ele não apenas superou todos os concorrentes no teste Frontier-Bench, como também reduziu ainda mais drasticamente o custo por tarefa, elevando em mais de 1 vez o desempenho do antecessor Opus 4.8. Em trabalhos de conhecimento, como as tarefas comerciais do Zapier AutomationBench, a taxa de aprovação pelo mesmo custo é 1,5 vez a do modelo de segunda linha.

Além disso, o Opus 5 demonstra fortes “capacidades de agentes (Agentic capabilities)”, com iteração e validação autônomas do trabalho. Por exemplo, sem olhar diretamente os desenhos, ele consegue construir um modelo geométrico 3D completo a partir do código, ou em uma única conversa realizar, de forma independente, a depuração de um sistema real e estabelecer uma estrutura de validação — conquistas que concorrentes tiveram dificuldade de alcançar nos testes iniciais.

Maior alinhamento, flexibilizando limites de busca de falhas em segurança na rede

Em segurança e alinhamento (Alignment), o Opus 5 escreveu o melhor registro recente entre os modelos. De acordo com uma auditoria automatizada de comportamentos, a pontuação geral de comportamento desalinhado é de apenas 2,3, e ele não só segue mais a constituição do que o antecessor Opus 4.8 e até o Fable 5, como também teve a taxa de engano reduzida ao mínimo.

Para a área de segurança cibernética (Cybersecurity), que recebe muita atenção, a Anthropic optou por flexibilizar um pouco as restrições do classificador, permitindo que o Opus 5 ajude a “buscar vulnerabilidades” no código-fonte, com a expectativa de que a intervenção do classificador ocorra cerca de 85% menos do que no Fable 5. Ainda assim, para impedir o uso malicioso da tecnologia, a oficial continua bloqueando de forma rigorosa a geração de varredura de vulnerabilidades ou de exploração (exploit).

Novo modo Fast, com suporte de API para degradação automática

Para permitir que empresas e desenvolvedores implantem o modelo com mais flexibilidade, o Opus 5 passou a ser, a partir de agora, o novo modelo padrão do Claude Max, além de ser a escolha mais forte no plano Claude Pro. A oficial também lançou junto o “Fast mode (modo rápido)”, que roda a 2,5 vezes a velocidade padrão, com preço correspondente ao dobro da tarifa base.

Na experiência do desenvolvedor, o Claude Platform adicionou suporte para alterar ferramentas no meio da conversa, sem fazer o prompt cache expirar. Ao mesmo tempo, a API introduziu um mecanismo de “auto-fallback”: quando a requisição é marcada por um classificador de segurança, o sistema roteia automaticamente para outros modelos (como Opus 4.8) para garantir que o serviço não seja interrompido.

Ver original
Esta página pode conter conteúdo de terceiros, que é fornecido apenas para fins informativos (não para representações/garantias) e não deve ser considerada como um endosso de suas opiniões pela Gate nem como aconselhamento financeiro ou profissional. Consulte a Isenção de responsabilidade para obter detalhes.
  • Recompensa
  • Comentário
  • Repostar
  • Compartilhar
Comentário
Adicionar um comentário
Adicionar um comentário
Sem comentários
  • Fixado