Skip to content

Avaliação53 de 5910 ferramentas

53 ferramentas com a tag Avaliação pelo que a própria página mostra, ordenadas por quem as usa entre as que continuam mantidas.

Uma tag é uma de cerca de trinta palavras de uma lista fechada, escolhida pelo mesmo leitor na mesma página que a linha; nunca uma palavra-chave fornecida pelo fornecedor.

Ordenadas por uso

Por tag
  • Mercor

    mercor.com

    Conecta empresas com redes de especialistas para avaliar modelos de IA, gerar dados de treinamento e implantar agentes de IA.

    Consolidadadesde 2023

    #151 de 4103
  • Arize

    arize.com

    Observa o comportamento do agente, avalia o desempenho com evals e sugere melhorias através de depuração automatizada.

    Operação de LLMA partir de $50/mês

    Consolidada

    #176 de 4103
  • Braintrust

    braintrust.dev

    Plataforma de observabilidade que rastreia a execução de agentes, avalia resultados e descobre padrões em produção para melhorar a qualidade.

    Operação de LLMA partir de $249/mês

    Consolidadadesde 2022

    #263 de 4103
  • micro1

    micro1.ai

    Fornece dados humanos especializados, benchmarks de avaliação e ambientes de aprendizado por reforço para treinar e testar modelos de IA e agentes de ponta.

    RHFalar com vendas

    Consolidada

    #274 de 4103
  • Galileo

    galileo.ai

    Captura dados groundtruth, constrói e auto-ajusta avaliações, e as destila em guardrails de produção para agentes de IA e sistemas RAG.

    Operação de LLMA partir de $100/mês

    Consolidada

    #286 de 4103
  • Patronus

    patronus.ai

    Gera ambientes digitais simulados e benchmarks para treinar e avaliar agentes de IA.

    Operação de LLMA partir de $25/mês

    Consolidada

    #401 de 4103
  • FetchSandbox MCP

    fetchsandbox.com

    Executa testes determinísticos para agentes de codificação verificando que integrações de API falhem antes das correções e passem depois.

    ConsolidadaMantida ativamente

    #456 de 4103
  • Coasty

    coasty.ai

    Avalia agentes de uso de computador em sistemas operacionais reais com software real, classificados por resultados de tarefas.

    EmergenteMantida ativamente

    #658 de 4103
  • PromptQuorum

    promptquorum.com

    Envia um prompt simultaneamente para 25 modelos de IA e avalia as respostas quanto a consenso e risco de alucinação.

    EmergenteMantida

    #796 de 4103
  • Clinician AI Assist

    thepromoter.com

    Organiza achados do paciente e simula trajetórias clínicas para apoiar o raciocínio diagnóstico de profissionais de saúde.

    Emergente

    #824 de 4103
  • SearchQ

    searchq.com

    Roteia perguntas para modelos de IA ideais, verifica respostas em múltiplos modelos e sintetiza respostas verificadas com níveis de privacidade configuráveis.

    SegurançaPlano gratuito

    EmergenteMantida ativamente

    #1059 de 4103
  • Hlido

    hlido.eu

    Testa ferramentas de IA manualmente contra as afirmações dos fornecedores e publica evidências pontuadas.

    EmergenteMantida ativamente

    #1110 de 4103
  • Hemelion

    hemelion.com

    Guides decisions between options and tests whether repeated responses fit new situations.

    EmergenteMantida

    #1249 de 4103
  • Megaton

    megaton.ai

    Benchmarks and ranks video generation models across quality dimensions like physics, animation, and prompt adherence.

    EmergenteMantida ativamente

    #1275 de 4103
  • oqoqo

    oqoqo.ai

    Builds and runs evaluations for AI agents on real-world tasks in sandboxed cloud environments.

    Emergente

    #1323 de 4103
  • Agent Arena

    arena42.ai

    Hosts competitive benchmarking tournaments where autonomous AI agents compete on real-world tasks and earn rewards.

    EmergenteMantida ativamente

    #1377 de 4103
  • crixpix

    crixpix.com

    Reviews and compares AI tools with hands-on testing, benchmarks, and pricing breakdowns.

    EmergenteMantida ativamente

    #1422 de 4103
  • ProveIt Hiring Innovations Inc.

    proveit.me

    Sends code review and system design assessments to engineering candidates, scores submissions against role-specific rubrics.

    RHGrátis

    Emergente

    #1528 de 4103
  • Assessly

    assessly.app

    Creates custom assessments with video, code, and text questions, automatically scores responses, and provides candidate comparison analytics.

    EmergenteMantida ativamente

    #1562 de 4103
  • GlobalMatch

    globalmatch.tech

    Conducts video interviews tailored to candidate resumes and provides explainable skill scores with reskilling recommendations.

    EmergenteMantida ativamente

    #1566 de 4103
  • ClientCoded

    clientcoded.com

    Tests conversational agents with adversarial scenarios and monitors production conversations in real time.

  • PHBench

    phbench.com

    Predicts which Product Hunt launches will raise Series A funding using machine learning models trained on historical launch data.

    EmergenteMantida

    #1738 de 4103
  • kodwai

    kodwai.com

    Scores developers on how well they direct AI coding agents through real challenges, not test passage.

    EmergenteMantida ativamente

    #1807 de 4103
  • Agent Checker

    agentchecker.ai

    Audits websites to identify where AI agents fail to complete tasks like search, signup, and checkout.

    AutomaçãoA partir de £39/mês

    EmergenteMantida

    #2595 de 4103
  • Promptyx

    promptyx.tech

    Organizes, versions, and evaluates prompts and workflows across multiple language models.

    EmergenteMantida ativamente

    #2677 de 4103
  • CriteriaBot

    criteriabot.io

    Evaluates content against custom criteria using a consensus panel of AI models, returning true/false verdicts.

    Emergente

    #2755 de 4103
  • Aequitas AI

    aequitas.world

    Verifies AI decisions in regulated industries by checking claims mathematically and certifying verdicts or declining when confidence is insufficient.

    EmergenteMantida ativamente

    #2982 de 4103
  • Trend-Analytic

    trend-analytic.com

    Analyzes YouTube channels and influencers using AI to rank creators, measure engagement authenticity, and forecast growth.

    EmergenteMantida ativamente

    #3009 de 4103
  • InterviewSkool

    interviewskool.com

    Ainda sem descrição.

    EmergenteMantida

    #3059 de 4103
  • EasyEnv

    easyenv.io

    Evaluates engineering candidates through live and take-home coding interviews in real production environments.

    EmergenteMantida ativamente

    #3099 de 4103
  • AgentVet.ai

    agentvet.ai

    Discovers, benchmarks, and rates AI agents through independent testing and user reviews.

    EmergenteMantida ativamente

    #3279 de 4103
  • Atom Foundry

    atomfoundry.dev

    Measures how AI shopping agents discover, evaluate, and recommend e-commerce stores across product categories.

    EmergenteMantida ativamente

    #3389 de 4103
  • SecNav

    secnavpro.com

    Verifies security professionals through high-fidelity mission simulations and forensic telemetry tracking.

    EmergenteMantida ativamente

    #3416 de 4103
  • SmartAssess

    smartassess.in

    Conducts, evaluates, and ranks job candidates through automated AI interviews with real-time analytics and anti-cheating detection.

    Emergente

    #3668 de 4103
  • NoParrot

    noparrot.ai

    Checks factual claims in AI responses across multiple models and scores their accuracy.

    Emergente

    #3842 de 4103
  • CAFE

    cafe-ai.de

    Runs factorial experiments on RAG agents and LLM chains to identify which components drive quality.

    Emergente

    #3890 de 4103
  • Orinyx

    orinyx.io

    Verifies clinical AI medication recommendations against FDA labeling and clinical pharmacology before and after deployment.

    EmergenteMantida ativamente

    #3900 de 4103
  • Roleplay

    roleplay.sh

    Tests AI agents for vulnerability to social engineering attacks through simulated pressure, authority, and policy bypass scenarios.

    EmergenteMantida ativamente

    #3906 de 4103
  • TrueCode

    truecode.co.in

    Evaluates coding ability by monitoring real debugging work in an IDE, scoring judgment and verification rather than just test results.

    Emergente

    #3916 de 4103
  • Redline AI

    tryredlineai.co

    Red teams AI agents before release and blocks prompt injection and tool abuse in production.

    EmergenteMantida ativamente

    #3924 de 4103
  • CodeVerdict

    codeverdict.io

    Evaluates take-home coding assessments by running submitted code in a sandbox and scoring against requirements.

    EmergenteMantida ativamente

    #4035 de 4103
  • Agentic Diaries

    agenticdiaries.com

    Measures gaps between what AI agents know internally and what they communicate to users.

  • Alva Labs

    alvalabs.io

    Evaluates job candidates using structured assessments, psychometric tests, and interview tools to standardize hiring decisions.

    desde 2017

  • Arena AI: The Official AI Ranking & LLM Leaderboard

    arena.ai

    Ranks and compares large language models through crowdsourced blind battles.

  • Botate

    botate.bot

    Structures debates between AI models to reach decisions through analyst, critic, and judge roles.

    ainda não lida

  • Conversational AI Fluency Assessment

    aisa.to

    Assesses professionals' ability to work effectively with AI through conversational evaluation across five skill dimensions.

    ainda não lida

  • Empromptu AI

    empromptu.ai

    Builds production-ready AI features for regulated industries with accuracy monitoring and automatic model improvement.

  • Eval-X

    eval-x.com

    Evaluates software engineers on real-world coding tasks in full IDEs while monitoring their AI interactions and decision-making patterns.

Como lemos uma ferramenta

Sem votos, sem avaliações, sem alegações do fornecedor. Toda semana um rastreador lê o próprio site de cada ferramenta e alguns registros públicos, e as palavras no cartão são faixas sobre o que ele leu.

  • Uso: visitas ao site (estimadas), instalações do npm e do PyPI, presença no relatório de uso do Chrome.
  • Atividade: a versão mais recente no GitHub, npm ou PyPI; a página datada mais recente do site; vagas abertas em um quadro público.
  • Preço: a própria página de preços do fornecedor, lida com data. Um número só é impresso quando está naquela página.
  • A linha e os casos de uso são escritos por nós a partir da página inicial, linha a linha, e recusados quando repetem o marketing do fornecedor.

Como os assistentes de IA leem cada site — a leitura sobre a qual os fornecedores nos perguntam — está na página de visibilidade de cada ferramenta.