H company publicó los detalles de Holo4, una nueva serie de modelos agente construidos para operar software a través de cualquier interfaz disponible: interfaces gráficas, código escrito, MCP o llamadas API directas. El lanzamiento incluye dos tamaños, un modelo denso de 27B y un modelo mixture-of-experts de 35B-A3B, ambos disponibles ya en la API de H Models y como pesos abiertos en Hugging Face en formatos BF16, FP8, NVFP4 y GGUF de 4 bits. La compañía también publicó Holotron4 Nano, una versión actualizada de Holotron 3 construida aplicando la misma receta de entrenamiento al modelo Nemotron 3 Nano Omni de NVIDIA, como parte de la Nemotron Coalition de NVIDIA.
Según la publicación, Holo4 está entrenado para usar un mismo modelo en escritorio, web, Android, sandboxes de código y APIs empresariales, en lugar de requerir un modelo distinto por plataforma. La compañía plantea esto frente a una limitación común: los modelos agente optimizados para clics en GUI son inutilizables sin pantalla, mientras que los modelos construidos para llamadas a herramientas fallan ante aplicaciones que no exponen ninguna API, y las tareas empresariales reales suelen necesitar ambas cosas.
En OSWorld 2.0, un benchmark para flujos de trabajo largos de escritorio, Holo4 27B obtuvo 61.7% frente a 81.8% de Opus 5.5, mientras que Holo4 35B-A3B alcanzó 30.9%. H company afirma que esto queda por debajo de los modelos cerrados más fuertes, pero a un costo por tarea mucho menor, y ha publicado cada trayectoria de benchmark para que pueda reproducirse. Los modelos se entrenaron con aprendizaje supervisado y por refuerzo sobre entornos generados por la Agentic Task Factory interna de la compañía, que hasta ahora ha producido cerca de 10,000 tareas que abarcan aplicaciones web, servidores MCP y entornos de escritorio, incluyendo entornos híbridos que exponen el mismo estado tanto por GUI como por MCP.
H company también reconstruyó su arnés de entrenamiento, el bucle que ejecuta las acciones de un agente y gestiona su contexto a lo largo de secuencias de tareas largas, agregando memoria persistente a través de cientos de pasos y acceso directo a la shell en la máquina de escritorio. Está previsto publicar en breve checkpoints optimizados de drafter DSpark para una inferencia más rápida.