Evaluación53 de 5910 herramientas
53 herramientas con la etiqueta Evaluación según lo que muestra su propia página, ordenadas por quién las usa entre las que siguen mantenidas.
Una etiqueta es una de unas treinta palabras de una lista cerrada, elegida por el mismo lector en la misma página que la línea; nunca una palabra clave aportada por el proveedor.
Ordenadas por uso
Mercor
mercor.comConecta empresas con redes de expertos para evaluar modelos de AI, generar datos de entrenamiento e implementar agentes de AI.
Arize
arize.comObserva el comportamiento del agente, evalúa el rendimiento con evals y sugiere mejoras mediante depuración automatizada.
Braintrust
braintrust.devPlataforma de observabilidad que rastrea la ejecución de agentes, evalúa resultados y descubre patrones en producción para mejorar la calidad.
micro1
micro1.aiProporciona datos humanos expertos, benchmarks de evaluación y entornos de aprendizaje por refuerzo para entrenar y probar modelos de IA y agentes de frontera.
Galileo
galileo.aiCaptura datos groundtruth, construye y auto-ajusta evaluaciones, y las destila en guardrails de producción para agentes de IA y sistemas RAG.
Patronus
patronus.aiGenera entornos digitales simulados y benchmarks para entrenar y evaluar agentes de IA.
FetchSandbox MCP
fetchsandbox.comEjecuta pruebas deterministas para agentes de codificación verificando que las integraciones de API fallen antes de las correcciones y pasen después.
Coasty
coasty.aiEvalúa agentes de uso de computadora en sistemas operativos reales con software real, calificados por resultados de tareas.
PromptQuorum
promptquorum.comEnvía un prompt simultáneamente a 25 modelos de IA y califica las respuestas por consenso y riesgo de alucinación.
Clinician AI Assist
thepromoter.comOrganiza hallazgos del paciente y simula trayectorias clínicas para apoyar el razonamiento diagnóstico de profesionales de la salud.
SearchQ
searchq.comEnruta preguntas a modelos de AI óptimos, verifica respuestas en múltiples modelos y sintetiza respuestas verificadas con niveles de privacidad configurables.
Hlido
hlido.euPrueba herramientas de IA manualmente contra las afirmaciones de los proveedores y publica evidencia puntuada.
Hemelion
hemelion.comGuides decisions between options and tests whether repeated responses fit new situations.
Megaton
megaton.aiBenchmarks and ranks video generation models across quality dimensions like physics, animation, and prompt adherence.
oqoqo
oqoqo.aiBuilds and runs evaluations for AI agents on real-world tasks in sandboxed cloud environments.
Agent Arena
arena42.aiHosts competitive benchmarking tournaments where autonomous AI agents compete on real-world tasks and earn rewards.
crixpix
crixpix.comReviews and compares AI tools with hands-on testing, benchmarks, and pricing breakdowns.
ProveIt Hiring Innovations Inc.
proveit.meSends code review and system design assessments to engineering candidates, scores submissions against role-specific rubrics.
Assessly
assessly.appCreates custom assessments with video, code, and text questions, automatically scores responses, and provides candidate comparison analytics.
GlobalMatch
globalmatch.techConducts video interviews tailored to candidate resumes and provides explainable skill scores with reskilling recommendations.
ClientCoded
clientcoded.comTests conversational agents with adversarial scenarios and monitors production conversations in real time.
PHBench
phbench.comPredicts which Product Hunt launches will raise Series A funding using machine learning models trained on historical launch data.
kodwai
kodwai.comScores developers on how well they direct AI coding agents through real challenges, not test passage.
Agent Checker
agentchecker.aiAudits websites to identify where AI agents fail to complete tasks like search, signup, and checkout.
Promptyx
promptyx.techOrganizes, versions, and evaluates prompts and workflows across multiple language models.
CriteriaBot
criteriabot.ioEvaluates content against custom criteria using a consensus panel of AI models, returning true/false verdicts.
Aequitas AI
aequitas.worldVerifies AI decisions in regulated industries by checking claims mathematically and certifying verdicts or declining when confidence is insufficient.
Trend-Analytic
trend-analytic.comAnalyzes YouTube channels and influencers using AI to rank creators, measure engagement authenticity, and forecast growth.
InterviewSkool
interviewskool.comAún sin descripción.
EasyEnv
easyenv.ioEvaluates engineering candidates through live and take-home coding interviews in real production environments.
AgentVet.ai
agentvet.aiDiscovers, benchmarks, and rates AI agents through independent testing and user reviews.
Atom Foundry
atomfoundry.devMeasures how AI shopping agents discover, evaluate, and recommend e-commerce stores across product categories.
SecNav
secnavpro.comVerifies security professionals through high-fidelity mission simulations and forensic telemetry tracking.
SmartAssess
smartassess.inConducts, evaluates, and ranks job candidates through automated AI interviews with real-time analytics and anti-cheating detection.
NoParrot
noparrot.aiChecks factual claims in AI responses across multiple models and scores their accuracy.
CAFE
cafe-ai.deRuns factorial experiments on RAG agents and LLM chains to identify which components drive quality.
Orinyx
orinyx.ioVerifies clinical AI medication recommendations against FDA labeling and clinical pharmacology before and after deployment.
Roleplay
roleplay.shTests AI agents for vulnerability to social engineering attacks through simulated pressure, authority, and policy bypass scenarios.
TrueCode
truecode.co.inEvaluates coding ability by monitoring real debugging work in an IDE, scoring judgment and verification rather than just test results.
Redline AI
tryredlineai.coRed teams AI agents before release and blocks prompt injection and tool abuse in production.
CodeVerdict
codeverdict.ioEvaluates take-home coding assessments by running submitted code in a sandbox and scoring against requirements.
Agentic Diaries
agenticdiaries.comMeasures gaps between what AI agents know internally and what they communicate to users.
Alva Labs
alvalabs.ioEvaluates job candidates using structured assessments, psychometric tests, and interview tools to standardize hiring decisions.
desde 2017
Arena AI: The Official AI Ranking & LLM Leaderboard
arena.aiRanks and compares large language models through crowdsourced blind battles.
Botate
botate.botStructures debates between AI models to reach decisions through analyst, critic, and judge roles.
Conversational AI Fluency Assessment
aisa.toAssesses professionals' ability to work effectively with AI through conversational evaluation across five skill dimensions.
Empromptu AI
empromptu.aiBuilds production-ready AI features for regulated industries with accuracy monitoring and automatic model improvement.
Eval-X
eval-x.comEvaluates software engineers on real-world coding tasks in full IDEs while monitoring their AI interactions and decision-making patterns.
Cómo leemos una herramienta
Sin votos, sin reseñas, sin afirmaciones del proveedor. Cada semana un rastreador lee el propio sitio de cada herramienta y unos pocos registros públicos, y las palabras de la tarjeta son bandas sobre lo que leyó.
- Uso: visitas al sitio (estimadas), instalaciones desde npm y PyPI, presencia en el informe de uso de Chrome.
- Actividad: la versión más reciente en GitHub, npm o PyPI; la página con fecha más reciente del sitio; vacantes abiertas en un tablón público.
- Precio: la propia página de precios del proveedor, leída con fecha. Una cifra se imprime solo cuando está en esa página.
- La línea y los casos de uso los escribimos nosotros a partir de la página de inicio, fila a fila, y se rechazan cuando repiten el marketing del proveedor.
Cómo leen los asistentes de IA cada sitio —la lectura por la que nos preguntan los proveedores— está en la página de visibilidad de cada herramienta.