O GitHub HydraFusion é um sistema de orquestração em prévia de pesquisa para o Copilot CLI. Seus resultados em benchmarks offline não asseguram o mesmo desempenho em repositórios extensos e desorganizados do mundo real.
Vale a pena testar?
Vale experimentar o GitHub HydraFusion se você tem um plano do GitHub Copilot e uma tarefa de programação relevante, bem delimitada e que possa ser explicada em um único prompt. Por enquanto, eu não o adotaria como padrão para mudanças críticas em produção nem para sessões longas de idas e vindas: o GitHub ainda o classifica como prévia de pesquisa e afirma que um suporte multi-turn mais robusto é trabalho futuro.
HydraFusion não é um novo modelo fundacional. É um sistema de orquestração em tempo de execução dentro do GitHub Copilot CLI, responsável por decidir se uma tarefa pede um único modelo, uma rota de escalonamento ou uma revisão independente antes de entregar o resultado.
Como ativar o HydraFusion no Copilot CLI
A prévia é ativada no Copilot CLI, e não pelo seletor convencional de modelos do VS Code. Segundo o anúncio oficial do GitHub, ela está disponível em todos os planos do Copilot por meio de uma sequência de comandos experimentais. O guia de início rápido do Copilot CLI, por sua vez, explica separadamente a instalação e a autenticação.
- Atualize o Copilot CLI executando
/update. - Ative os recursos experimentais com
/experimental on. - Abra o seletor de modelos com
/model. - Selecione HydraFusion (Research Preview).
- Comece com uma tarefa de programação relevante e claramente delimitada, em vez de um projeto conversacional longo.
Se o HydraFusion não aparecer, atualize primeiro o CLI e confirme que sua conta do Copilot, a política da organização e a versão do CLI oferecem suporte à prévia. O anúncio oficial do GitHub é a fonte de referência para a sequência atual de comandos; o nome e a disponibilidade da prévia podem mudar.
Os resultados de busca também exibem o AICPS/hydrafusion, um repositório de pesquisa sobre fusão de sensores para veículos autônomos. Esse projeto não tem relação com o Project HydraFusion do GitHub para Copilot.
O fluxo certo para cada tipo de tarefa
O HydraFusion escolhe entre três padrões de execução conforme as necessidades esperadas de qualidade, custo e latência da tarefa. Na prévia atual, essa escolha não é um seletor manual de “modo”: o GitHub apresenta o HydraFusion como uma opção semelhante a um modelo, que define o fluxo subjacente durante a execução.
| Fluxo | Como funciona | Melhor ponto de partida | Principal concessão |
|---|---|---|---|
| Single | Um modelo resolve a tarefa diretamente. | Edições simples, explicações ou correções pequenas. | Menor sobrecarga aparente, mas sem escalonamento nem revisão independente. |
| Cascade | Um modelo eficiente cria a primeira resposta; um controle de qualidade pode escalar a tarefa para um modelo mais poderoso. | Tarefas que podem ser fáceis, mas talvez exijam mais capacidade. | Economiza quando a primeira tentativa funciona, mas acrescenta uma etapa de avaliação e uma possível segunda chamada. |
| Critique | Um modelo cria o rascunho, um crítico isolado de outra família de modelos o revisa e o autor faz uma revisão. | Mudanças em que uma segunda perspectiva pode identificar erros. | Mais chamadas e maior latência, sem acesso direto a ferramentas pelo crítico. |
Single: execução direta
Single é o caminho mais simples. O GitHub informa que um único solucionador recebe a tarefa e trabalha no loop normal de agente do Copilot, ciente das permissões. É uma opção natural para pedidos com implementação clara e um caminho curto de testes.
A vantagem é a menor sobrecarga do fluxo, mas o Single não traz uma segunda opinião embutida.
Cascade: começa mais barato e sobe de nível se precisar
O Cascade começa com um modelo eficiente e usa um controle de qualidade para decidir se a resposta é suficiente ou se a tarefa deve ser escalada. Sua lógica econômica é o escalonamento seletivo: pedidos rotineiros não deveriam consumir, por padrão, o modelo mais potente disponível.
O Cascade pode reduzir custos quando a primeira passagem supera esse controle, mas o GitHub não divulga uma taxa universal de escalonamento. Avalie-o pelos resultados observados nas tarefas, sem presumir que toda solicitação seguirá pelo caminho mais barato.
Critique: rascunho, revisão independente e uma correção
O Critique adiciona um revisor separado, pertencente a uma família de modelos diferente. Segundo o GitHub, o crítico opera em um contexto isolado e sem ferramentas, revisa o rascunho e envia feedback ao solucionador original para uma única revisão; ele não pode editar o repositório diretamente.
Na prática, o Critique funciona como uma revisão automatizada por pares, com o custo de uma chamada adicional de modelo e mais latência.
Benchmarks mostram concessões, não promessas
Os testes offline do GitHub mostram relações entre qualidade e custo específicas de cada benchmark. Eles não prometem uma redução de 67% no custo de toda tarefa feita no Copilot.
| Benchmark | Qualidade do HydraFusion vs. Claude Opus 5 | Custo estimado vs. Claude Opus 5 | Como interpretar |
|---|---|---|---|
| TerminalBench 2.1 | +4.9 pontos percentuais | 67% menor | O resultado reportado mais forte: melhor qualidade em tarefas verificadas, com menor custo estimado. |
| DeepSWE | −1.5 pontos | 36% menor | Uma economia relevante, com uma perda mensurável de qualidade em trabalho difícil de repositório. |
| CheckpointBench | −0.1 pontos | 65% menor | Qualidade praticamente equivalente no benchmark interno do GitHub baseado em replays, a um custo estimado muito menor. |
De acordo com o anúncio oficial do HydraFusion, o GitHub usou configurações de avaliação consistentes e contabilizou todas as chamadas do fluxo, incluindo novas tentativas, críticas, escalonamentos e fallbacks.
O CheckpointBench é descrito como um replay de sessões selecionadas do Copilot sobre commits imutáveis de repositórios públicos. Isso o torna mais próximo do trabalho de agentes de programação do que um teste simples de geração de texto, mas continua sendo um benchmark controlado. O resultado inferior do HydraFusion no DeepSWE é importante porque impede uma leitura da tabela como uma vitória universal.
Ainda há pouca evidência independente no mundo real. O criador independente @DoDataThings no X destaca a principal preocupação de validação:
“O modelo que planeja não precisa ser o modelo que escreve o código. A nota do GitHub diz que o HydraFusion igualou ou superou a linha de base do Opus 5 em avaliações offline controladas, e a passagem de uma avaliação offline para um repositório real e bagunçado é onde a orquestração normalmente perde sua margem. Fico curioso para saber quanto dessa diferença de custo sobrevive.”
A publicação traz uma pergunta, não uma medição, mas aponta o teste correto: custo e qualidade em repositórios desorganizados.
O que importa na operação de um repositório real
O valor do HydraFusion vai além de selecionar um modelo mais barato. O GitHub documenta controles de contabilização, cancelamento, validação de rotas, isolamento da revisão e aplicação de patches porque várias chamadas de modelo criam mais estados operacionais do que uma solicitação direta.
| Controle | O que isso significa para quem usa |
|---|---|
| Controles de custo e tempo | O HydraFusion rastreia as chamadas em todas as etapas do fluxo e oferece execução limitada, mas crítica, escalonamento, novas tentativas e fallbacks ainda podem ampliar a latência ou o uso total. |
| Controles de rota e patch | O GitHub afirma que valida as rotas e não aplica patches após um fluxo inválido ou cancelado; nenhum desses controles comprova que a rota escolhida ou o código final está correto. |
| Isolamento da revisão | Enquanto os solucionadores usam o workspace compartilhado, os críticos são somente leitura e não têm ferramentas. Isso reduz mudanças diretas pelo revisor, mas não elimina a necessidade de revisar o diff e rodar testes. |
O anúncio do GitHub também descreve uma concessão de visibilidade: os rascunhos intermediários ficam ocultos até a resposta final. Isso deixa a resposta mais limpa, mas esconde o comportamento de rascunhos, tentativas, escalonamentos e descartes durante a espera.
Um primeiro teste sensato com o HydraFusion
O melhor primeiro teste é uma tarefa limitada no repositório, com uma verificação objetiva de aceitação — não um pedido aberto para “melhorar” uma base de código. Trate a prévia como um experimento, com commit inicial conhecido e uma definição fixa de sucesso.
- Crie uma branch ou worktree limpo e registre o commit inicial.
- Escolha uma tarefa com limite estreito de arquivos e um comando de teste reproduzível.
- Descreva no primeiro prompt o comportamento esperado, as restrições e os testes.
- Deixe o HydraFusion concluir a tarefa e então inspecione o diff, em vez de aceitá-lo só porque o agente reportou sucesso.
- Rode você mesmo os testes relevantes e procure alterações em arquivos sem relação com a tarefa.
- Registre latência, dados visíveis de uso ou custo, novas tentativas, comportamento de escalonamento e resultado final dos testes, caso o CLI os exponha.
- Repita o processo em algumas tarefas antes de comparar o HydraFusion com um modelo fixo ou mudar o padrão da equipe.
Não use um único patch bem-sucedido para validar as alegações dos benchmarks. A unidade útil é um pequeno conjunto de tarefas que cubra uma correção rotineira, uma mudança entre vários arquivos e um caso deliberadamente ambíguo, em que escalonamento ou crítica possam fazer diferença.
Quanto custa e o que o HydraFusion não promete
O GitHub não publica no anúncio um preço em dólares separado para o HydraFusion. Em vez disso, informa que o uso é cobrado conforme as taxas padrão por token dos modelos subjacentes. Portanto, o custo final depende dos modelos e das etapas do fluxo usados em tempo de execução.
| Pergunta sobre cobrança | Resposta atual |
|---|---|
| Há uma assinatura separada para o HydraFusion? | O anúncio do GitHub não informa uma taxa separada para o HydraFusion. |
| Como o uso é cobrado? | Pelos tokens consumidos pelos modelos que compõem o fluxo, em suas taxas padrão. |
| Uma tarefa pode usar várias chamadas cobradas? | Sim. Cascade e Critique podem envolver várias etapas, e a contabilização inclui novas tentativas e fallbacks. |
| Uma economia de 67% em benchmark equivale a uma economia de 67% para o cliente? | Não. É uma comparação estimada para um benchmark, uma política, um conjunto de modelos e uma configuração de preços específicos. |
| HydraFusion é um recurso estável para produção? | Não. O GitHub o classifica como prévia de pesquisa e informa que modelos, fluxos, disponibilidade, comportamento e nome podem mudar. |
Use o HydraFusion primeiro em tarefas inspecionáveis e resolvíveis com um único prompt. Mantenha um fallback de modelo fixo para trabalhos longos, multi-turn ou de alto impacto até que testes no nível do repositório justifiquem um uso mais amplo.
Perguntas frequentes sobre o HydraFusion
HydraFusion é um modelo ou um roteador?
HydraFusion é um sistema de orquestração multi-modelo em tempo de execução no GitHub Copilot CLI, não um modelo fundacional independente. Ele seleciona modelos e padrões de execução para uma tarefa de programação.
Como ativo o HydraFusion no Copilot CLI?
Execute /update, /experimental on e /model; depois, selecione HydraFusion (Research Preview).
HydraFusion está disponível em todos os planos do Copilot?
O GitHub informa que a prévia está disponível em todos os planos do Copilot pelo Copilot CLI, embora conta, política da organização, versão do CLI ou mudanças de disponibilidade possam afetar sua exibição.
Quais modelos subjacentes o HydraFusion usa?
O GitHub descreve uma seleção entre modelos de vários provedores, mas não publica uma lista fixa por solicitação. Portanto, não presuma que um modelo nomeado atenderá toda tarefa.
HydraFusion sempre supera o Claude Opus 5?
Não. O GitHub reporta ganho no TerminalBench 2.1, qualidade praticamente equivalente no CheckpointBench e um déficit de 1.5 ponto no DeepSWE.
HydraFusion custa mais?
O uso é cobrado nas taxas padrão por token dos modelos subjacentes, e uma rota pode chamar vários modelos. O GitHub não declara no anúncio um preço em dólares separado para o HydraFusion.
HydraFusion está disponível no VS Code?
O material de lançamento documenta a prévia pelo Copilot CLI. Confirme uma disponibilidade mais ampla na documentação atual do GitHub.
É seguro deixar o HydraFusion editar um repositório?
O GitHub descreve solucionadores cientes de permissões, críticos isolados, roteamento validado, execução limitada e ausência de patch em fluxos inválidos ou cancelados. Ainda assim, revise o diff e execute os testes antes do merge.