GPT-6 Astra


GPT-6 Astra (via) GPT-6 Astra está “lançado hoje para um conjunto limitado de organizações e nos próximos dias estará disponível para todos os usuários ChatGPT Plus, Pro, Business e Enterprise, bem como através da API OpenAI e AWS” – ainda não experimentei, então não tenho muito a dizer sobre isso ainda.

O preço da API será o mesmo de Claude Fable 5 e 5.1: entrada de US$ 10/milhão e saída de US$ 50/milhão. Este é claramente o concorrente Fable da OpenAI e parece ter uma pontuação mais alta do que Fable na maioria dos benchmarks auto-relatados da OpenAI.

O mais impressionante é que o Astra pontua 99,9% no recente benchmark ARC-AGI 3 (lançado em março) – embora notavelmente o Fable 5 ainda não tenha um resultado publicado, e o blog ARC-AGI observa que a pontuação de 99,9% foi alcançada por US$ 19 mil usando o “arnês do adaptador de provedor” personalizado da OpenAI, enquanto o chicote ARC-AGI padrão obteve 62,7% por US$ 26 mil.

O chicote do Adaptador do Provedor preserva o estado de raciocínio opaco entre as solicitações e usa compactação para conversas mais longas, permitindo que o modelo reutilize o trabalho anterior.

Não é novidade que, dado o recente incidente do Hugging Face, o Astra é uma fera nas tarefas de segurança. Ele pontua 100% no ExploitBench (GPT-5.6 Sol obteve 78,5%), 42,4% no ExploitGym (Sol obteve 30,3%) e 99,2% em quatro tentativas na engenharia reversa binária SRE-Bench em comparação com 68,7% do Sol.

Também é melhor em contexto longo: no benchmark de oito agulhas da OpenAI, obteve 100% em 256 mil a 512 mil tokens e 96,3% em 512 mil a 1 milhão de tokens. A OpenAI pode ter vencido um dos desafios contínuos com o processamento de contexto longo.

Mas não ganha em tudo. Análise Artificial observe que o Astra ainda é derrotado pelo Fable em seu Índice de Inteligência:

Fica ao lado do GPT-5.6 Sol em Inteligência: Pontuações GPT-6 Astra iguais a GPT-5.6 Sol no Índice em 61. Isso é 5 pontos menor que Claude Fable 5.1 (máximo com fallback). O modelo também segue o recém-lançado Muse Spark 1.3 (máx.) da Meta.

O desempenho foi melhor no Índice de Agente de Codificação:

Fronteira de eficiência de custos do Leads Coding Agent Index: No esforço máximo, o GPT-6 Astra custa quase o mesmo que o GPT-5.6 Sol (máx), mas marca 2 pontos a mais no Índice. Por tarefa, o modelo custa menos da metade do custo de Claude Fable 5, pela mesma pontuação.

Escreverei mais sobre o Astra assim que tiver acesso a ele. O rótulo do modelo de API, assim que for implementado, será gpt-6-astra.





Source link

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *

Botão Voltar ao Topo