A H Company publicou detalhes do Holo4, uma nova série de modelos agênticos construídos para operar software por meio de qualquer interface disponível: interfaces gráficas, código escrito, MCP ou chamadas diretas de API. O lançamento inclui dois tamanhos, um modelo denso de 27B e um modelo mixture-of-experts de 35B-A3B, ambos já disponíveis na H Models API e como pesos abertos no Hugging Face nos formatos BF16, FP8, NVFP4 e GGUF de 4 bits. A empresa também lançou o Holotron4 Nano, uma versão atualizada do Holotron 3 construída ao aplicar a mesma receita de treinamento ao modelo Nemotron 3 Nano Omni da NVIDIA, como parte da NVIDIA Nemotron Coalition.
Segundo o post, o Holo4 é treinado para usar um único modelo em desktops, web, Android, sandboxes de código e APIs de negócio, em vez de exigir um modelo diferente por plataforma. A empresa contextualiza isso contra uma limitação comum: modelos agênticos otimizados para cliques em GUI ficam inutilizáveis sem uma tela, enquanto modelos construídos para chamadas de ferramentas falham diante de aplicações que não expõem nenhuma API, e tarefas de negócio reais frequentemente exigem os dois.
No OSWorld 2.0, um benchmark para fluxos de trabalho longos de desktop, o Holo4 27B marcou 61,7% contra 81,8% do Opus 5.5, enquanto o Holo4 35B-A3B alcançou 30,9%. A H Company afirma que isso fica atrás dos modelos fechados mais fortes, mas com um custo por tarefa muito menor, e publicou todas as trajetórias de benchmark publicamente para replay. Os modelos foram treinados usando aprendizado supervisionado e por reforço em ambientes gerados pela Agentic Task Factory interna da empresa, que já produziu aproximadamente 10 mil tarefas abrangendo aplicações web, servidores MCP e ambientes de desktop, incluindo ambientes híbridos que expõem o mesmo estado por GUI e por MCP simultaneamente.
A H Company também reconstruiu seu harness de treinamento, o loop que executa as ações de um agente e gerencia seu contexto ao longo de sequências longas de tarefas, adicionando memória persistente ao longo de centenas de passos e acesso direto ao shell na máquina de desktop. Checkpoints otimizados do drafter DSpark para inferência mais rápida estão previstos para lançamento em breve.