O novo modelo da Anthropic, o Opus 5.5, foi lançado na terça-feira, estabelecendo um novo estado-da-arte em desempenho de codificação e trabalho baseado em conhecimento, segundo a empresa. Notavelmente, a empresa afirma que o lançamento supera o modelo maior Fable em muitos benchmarks e conseguiu uma série de tarefas informais que o Fable não completou.

O novo modelo também é significativamente mais barato que seu antecessor. Os tokens de saída serão cobrados a US$ 20 por milhão de tokens para o Opus 5.5, comparado a US$ 25 para o modelo anterior. Outras métricas apresentam reduções de preço semelhantes. O modelo também é mais rápido para executar, refletindo uma redução geral na computação necessária para servi-lo.

A nova versão também traz mudanças significativas na forma como o Opus se comunica, com o Opus 5.5 menos propenso a usar jargão e mais propenso a colocar informações importantes no início de suas mensagens.
O lançamento ocorre apenas dois meses após o lançamento do Opus 5 em 24 de julho. De acordo com o anúncio, o Sonnet 5.5 e o Haiku 5.5 serão lançados "nas próximas semanas", com melhorias de desempenho semelhantes.
A Anthropic afirma que o Opus 5.5 é comparável ao Mythos em suas capacidades de biologia e cibersegurança, portanto seu lançamento está sujeito às mesmas salvaguardas do modelo Fable da empresa. Essas salvaguardas limitam quanto os modelos podem ser usados para descobrir explorações em programas compilados ou desenvolver armas biológicas reconhecíveis, entre outras tarefas.
O Opus 5.5 é o primeiro lançamento do modelo da Anthropic desde que o CEO Dario Amodei abraçou os apelos para regular a fronteira, desacelerando deliberadamente o progresso nas capacidades de IA para igualar a taxa de avanço no alinhamento.
"Tornei-me convencido de que abordar plenamente os riscos exige ainda mais prudência," escreveu Amodei em uma postagem no início deste mês, "não apenas investindo na prevenção de riscos, mas regulando a taxa de avanço das capacidades para que a prevenção de riscos tenha tempo de acompanhar."
A formação de segurança do Opus 5.5 foi amplamente semelhante à dos seus predecessores, com testes de alinhamento e avaliação pré-lançamento por organizações externas como METR e Frontier Design. Mas a Anthropic enfatizou que sistemas de formação e avaliação mais avançados já estavam sendo preparados para modelos futuros, incluindo sistemas de segurança e monitoramento aprimorados.
"À medida que a IA se torna mais capaz, as políticas públicas devem desempenhar um papel maior em garantir que os sistemas nos quais as pessoas confiam sejam seguros." Essa capacidade leva tempo para ser construída, e já começamos a colocar a infraestrutura necessária para apoiá-la," diz o post no blog. "Esperamos compartilhar mais detalhes sobre esses esforços em breve."


