Avaliação53 de 5910 ferramentas
53 ferramentas com a tag Avaliação pelo que a própria página mostra, ordenadas por quem as usa entre as que continuam mantidas.
Uma tag é uma de cerca de trinta palavras de uma lista fechada, escolhida pelo mesmo leitor na mesma página que a linha; nunca uma palavra-chave fornecida pelo fornecedor.
Ordenadas por uso
Mercor
mercor.comConecta empresas com redes de especialistas para avaliar modelos de IA, gerar dados de treinamento e implantar agentes de IA.
Arize
arize.comObserva o comportamento do agente, avalia o desempenho com evals e sugere melhorias através de depuração automatizada.
Braintrust
braintrust.devPlataforma de observabilidade que rastreia a execução de agentes, avalia resultados e descobre padrões em produção para melhorar a qualidade.
micro1
micro1.aiFornece dados humanos especializados, benchmarks de avaliação e ambientes de aprendizado por reforço para treinar e testar modelos de IA e agentes de ponta.
Galileo
galileo.aiCaptura dados groundtruth, constrói e auto-ajusta avaliações, e as destila em guardrails de produção para agentes de IA e sistemas RAG.
Patronus
patronus.aiGera ambientes digitais simulados e benchmarks para treinar e avaliar agentes de IA.
FetchSandbox MCP
fetchsandbox.comExecuta testes determinísticos para agentes de codificação verificando que integrações de API falhem antes das correções e passem depois.
Coasty
coasty.aiAvalia agentes de uso de computador em sistemas operacionais reais com software real, classificados por resultados de tarefas.
PromptQuorum
promptquorum.comEnvia um prompt simultaneamente para 25 modelos de IA e avalia as respostas quanto a consenso e risco de alucinação.
Clinician AI Assist
thepromoter.comOrganiza achados do paciente e simula trajetórias clínicas para apoiar o raciocínio diagnóstico de profissionais de saúde.
SearchQ
searchq.comRoteia perguntas para modelos de IA ideais, verifica respostas em múltiplos modelos e sintetiza respostas verificadas com níveis de privacidade configuráveis.
Hlido
hlido.euTesta ferramentas de IA manualmente contra as afirmações dos fornecedores e publica evidências pontuadas.
Hemelion
hemelion.comGuides decisions between options and tests whether repeated responses fit new situations.
Megaton
megaton.aiBenchmarks and ranks video generation models across quality dimensions like physics, animation, and prompt adherence.
oqoqo
oqoqo.aiBuilds and runs evaluations for AI agents on real-world tasks in sandboxed cloud environments.
Agent Arena
arena42.aiHosts competitive benchmarking tournaments where autonomous AI agents compete on real-world tasks and earn rewards.
crixpix
crixpix.comReviews and compares AI tools with hands-on testing, benchmarks, and pricing breakdowns.
ProveIt Hiring Innovations Inc.
proveit.meSends code review and system design assessments to engineering candidates, scores submissions against role-specific rubrics.
Assessly
assessly.appCreates custom assessments with video, code, and text questions, automatically scores responses, and provides candidate comparison analytics.
GlobalMatch
globalmatch.techConducts video interviews tailored to candidate resumes and provides explainable skill scores with reskilling recommendations.
ClientCoded
clientcoded.comTests conversational agents with adversarial scenarios and monitors production conversations in real time.
PHBench
phbench.comPredicts which Product Hunt launches will raise Series A funding using machine learning models trained on historical launch data.
kodwai
kodwai.comScores developers on how well they direct AI coding agents through real challenges, not test passage.
Agent Checker
agentchecker.aiAudits websites to identify where AI agents fail to complete tasks like search, signup, and checkout.
Promptyx
promptyx.techOrganizes, versions, and evaluates prompts and workflows across multiple language models.
CriteriaBot
criteriabot.ioEvaluates content against custom criteria using a consensus panel of AI models, returning true/false verdicts.
Aequitas AI
aequitas.worldVerifies AI decisions in regulated industries by checking claims mathematically and certifying verdicts or declining when confidence is insufficient.
Trend-Analytic
trend-analytic.comAnalyzes YouTube channels and influencers using AI to rank creators, measure engagement authenticity, and forecast growth.
InterviewSkool
interviewskool.comAinda sem descrição.
EasyEnv
easyenv.ioEvaluates engineering candidates through live and take-home coding interviews in real production environments.
AgentVet.ai
agentvet.aiDiscovers, benchmarks, and rates AI agents through independent testing and user reviews.
Atom Foundry
atomfoundry.devMeasures how AI shopping agents discover, evaluate, and recommend e-commerce stores across product categories.
SecNav
secnavpro.comVerifies security professionals through high-fidelity mission simulations and forensic telemetry tracking.
SmartAssess
smartassess.inConducts, evaluates, and ranks job candidates through automated AI interviews with real-time analytics and anti-cheating detection.
NoParrot
noparrot.aiChecks factual claims in AI responses across multiple models and scores their accuracy.
CAFE
cafe-ai.deRuns factorial experiments on RAG agents and LLM chains to identify which components drive quality.
Orinyx
orinyx.ioVerifies clinical AI medication recommendations against FDA labeling and clinical pharmacology before and after deployment.
Roleplay
roleplay.shTests AI agents for vulnerability to social engineering attacks through simulated pressure, authority, and policy bypass scenarios.
TrueCode
truecode.co.inEvaluates coding ability by monitoring real debugging work in an IDE, scoring judgment and verification rather than just test results.
Redline AI
tryredlineai.coRed teams AI agents before release and blocks prompt injection and tool abuse in production.
CodeVerdict
codeverdict.ioEvaluates take-home coding assessments by running submitted code in a sandbox and scoring against requirements.
Agentic Diaries
agenticdiaries.comMeasures gaps between what AI agents know internally and what they communicate to users.
Alva Labs
alvalabs.ioEvaluates job candidates using structured assessments, psychometric tests, and interview tools to standardize hiring decisions.
desde 2017
Arena AI: The Official AI Ranking & LLM Leaderboard
arena.aiRanks and compares large language models through crowdsourced blind battles.
Botate
botate.botStructures debates between AI models to reach decisions through analyst, critic, and judge roles.
Conversational AI Fluency Assessment
aisa.toAssesses professionals' ability to work effectively with AI through conversational evaluation across five skill dimensions.
Empromptu AI
empromptu.aiBuilds production-ready AI features for regulated industries with accuracy monitoring and automatic model improvement.
Eval-X
eval-x.comEvaluates software engineers on real-world coding tasks in full IDEs while monitoring their AI interactions and decision-making patterns.
Como lemos uma ferramenta
Sem votos, sem avaliações, sem alegações do fornecedor. Toda semana um rastreador lê o próprio site de cada ferramenta e alguns registros públicos, e as palavras no cartão são faixas sobre o que ele leu.
- Uso: visitas ao site (estimadas), instalações do npm e do PyPI, presença no relatório de uso do Chrome.
- Atividade: a versão mais recente no GitHub, npm ou PyPI; a página datada mais recente do site; vagas abertas em um quadro público.
- Preço: a própria página de preços do fornecedor, lida com data. Um número só é impresso quando está naquela página.
- A linha e os casos de uso são escritos por nós a partir da página inicial, linha a linha, e recusados quando repetem o marketing do fornecedor.
Como os assistentes de IA leem cada site — a leitura sobre a qual os fornecedores nos perguntam — está na página de visibilidade de cada ferramenta.