The Multivac
Evaluates frontier AI models by having them score each other's responses across structured rubrics without human judges.
41 ссылающихся доменов
Набирает аудиторию
- Для кого
- AI researchers and developers comparing frontier language model capabilities objectively
- Цена
- Цена не прочитана
- Активность
- Активность не прочитана
- Компания
- год основания не известен
- Формат
- API
- compare frontier AI model performance across multiple evaluation categories
- view peer consensus rankings from blind model-to-model evaluations
- explore raw judgment data and evaluation matrices without paywalls
- #24
Arena AI
Ранжирует и сравнивает большие языковые модели через краудсорсинговые слепые поединки.
78.3kЖивой—2023 - #189
Vioscale AI
Ранжирует программные инструменты по независимым метрикам внедрения и проверенным фактам, взвешенным в соответствии с вашими критериями выбора.
1.4kЖивойБесплатно - #218
Sentient
Разрабатывает инструменты с открытым исходным кодом для AI-агентов, которые рассуждают, обучаются и совершенствуются через бенчмаркинг и оценку.
9.5kПоддерживается— - #256
Is Agentic
Оценивает готовность веб-сайта к обнаружению, доступу и взаимодействию с AI агентами.
8.9k установок/месЖивой— - #292
LangWatch
Тестирует и оценивает AI-агентов через симуляцию, трассировку и скоринг перед развёртыванием в production.
452ПоддерживаетсяОт €29/польз./мес - #299
FetchSandbox MCP
Запускает детерминированные тесты для кодирующих агентов, проверяя, что интеграции API не работают до исправлений и работают после.
55ЖивойОт $200/мес
Что такое The Multivac?
Evaluates frontier AI models by having them score each other's responses across structured rubrics without human judges.
Для кого The Multivac?
AI researchers and developers comparing frontier language model capabilities objectively
Пользуются ли The Multivac?
Набирает аудиторию.
Чем заменить The Multivac?
В категории «Инструменты разработки», по использованию: Arena AI, Vioscale AI, Sentient, Is Agentic, LangWatch, FetchSandbox MCP.
Как мы читаем инструмент
Без голосов, без отзывов, без заявлений вендора. Каждую неделю краулер читает собственный сайт инструмента и несколько публичных реестров, а слова на карточке - полосы над тем, что он прочитал.
- Использование: визиты на сайт (оценка), установки из npm и PyPI, присутствие в отчёте Chrome об использовании.
- Активность: последний релиз на GitHub, npm или PyPI; самая свежая датированная страница сайта; открытые вакансии на публичной доске.
- Цена: собственная страница цен вендора, прочитанная с датой. Число печатается, только если оно есть на той странице.
- Строку и сценарии пишем мы сами по главной странице, по одной на строку, и отбраковываем, когда они повторяют маркетинг вендора.
Как AI-ассистенты читают каждый сайт - чтение, о котором нас спрашивают вендоры, - на отдельной странице видимости каждого инструмента.