Skip to content

Evaluación53 de 5910 herramientas

53 herramientas con la etiqueta Evaluación según lo que muestra su propia página, ordenadas por quién las usa entre las que siguen mantenidas.

Una etiqueta es una de unas treinta palabras de una lista cerrada, elegida por el mismo lector en la misma página que la línea; nunca una palabra clave aportada por el proveedor.

Ordenadas por uso

Por etiqueta
  • Mercor

    mercor.com

    Conecta empresas con redes de expertos para evaluar modelos de AI, generar datos de entrenamiento e implementar agentes de AI.

    Consolidadadesde 2023

    #151 de 4103
  • Arize

    arize.com

    Observa el comportamiento del agente, evalúa el rendimiento con evals y sugiere mejoras mediante depuración automatizada.

    Operación de LLMDesde $50/mes

    Consolidada

    #176 de 4103
  • Braintrust

    braintrust.dev

    Plataforma de observabilidad que rastrea la ejecución de agentes, evalúa resultados y descubre patrones en producción para mejorar la calidad.

    Operación de LLMDesde $249/mes

    Consolidadadesde 2022

    #263 de 4103
  • micro1

    micro1.ai

    Proporciona datos humanos expertos, benchmarks de evaluación y entornos de aprendizaje por refuerzo para entrenar y probar modelos de IA y agentes de frontera.

    RR. HH.Contactar ventas

    Consolidada

    #274 de 4103
  • Galileo

    galileo.ai

    Captura datos groundtruth, construye y auto-ajusta evaluaciones, y las destila en guardrails de producción para agentes de IA y sistemas RAG.

    Operación de LLMDesde $100/mes

    Consolidada

    #286 de 4103
  • Patronus

    patronus.ai

    Genera entornos digitales simulados y benchmarks para entrenar y evaluar agentes de IA.

    Operación de LLMDesde $25/mes

    Consolidada

    #401 de 4103
  • FetchSandbox MCP

    fetchsandbox.com

    Ejecuta pruebas deterministas para agentes de codificación verificando que las integraciones de API fallen antes de las correcciones y pasen después.

    ConsolidadaMantenida activamente

    #456 de 4103
  • Coasty

    coasty.ai

    Evalúa agentes de uso de computadora en sistemas operativos reales con software real, calificados por resultados de tareas.

    EmergenteMantenida activamente

    #658 de 4103
  • PromptQuorum

    promptquorum.com

    Envía un prompt simultáneamente a 25 modelos de IA y califica las respuestas por consenso y riesgo de alucinación.

    EmergenteMantenida

    #796 de 4103
  • Clinician AI Assist

    thepromoter.com

    Organiza hallazgos del paciente y simula trayectorias clínicas para apoyar el razonamiento diagnóstico de profesionales de la salud.

    Emergente

    #824 de 4103
  • SearchQ

    searchq.com

    Enruta preguntas a modelos de AI óptimos, verifica respuestas en múltiples modelos y sintetiza respuestas verificadas con niveles de privacidad configurables.

    SeguridadPlan gratuito

    EmergenteMantenida activamente

    #1059 de 4103
  • Hlido

    hlido.eu

    Prueba herramientas de IA manualmente contra las afirmaciones de los proveedores y publica evidencia puntuada.

    EmergenteMantenida activamente

    #1110 de 4103
  • Hemelion

    hemelion.com

    Guides decisions between options and tests whether repeated responses fit new situations.

    EmergenteMantenida

    #1249 de 4103
  • Megaton

    megaton.ai

    Benchmarks and ranks video generation models across quality dimensions like physics, animation, and prompt adherence.

    EmergenteMantenida activamente

    #1275 de 4103
  • oqoqo

    oqoqo.ai

    Builds and runs evaluations for AI agents on real-world tasks in sandboxed cloud environments.

    Emergente

    #1323 de 4103
  • Agent Arena

    arena42.ai

    Hosts competitive benchmarking tournaments where autonomous AI agents compete on real-world tasks and earn rewards.

    EmergenteMantenida activamente

    #1377 de 4103
  • crixpix

    crixpix.com

    Reviews and compares AI tools with hands-on testing, benchmarks, and pricing breakdowns.

    EmergenteMantenida activamente

    #1422 de 4103
  • ProveIt Hiring Innovations Inc.

    proveit.me

    Sends code review and system design assessments to engineering candidates, scores submissions against role-specific rubrics.

    RR. HH.Gratis

    Emergente

    #1528 de 4103
  • Assessly

    assessly.app

    Creates custom assessments with video, code, and text questions, automatically scores responses, and provides candidate comparison analytics.

    EmergenteMantenida activamente

    #1562 de 4103
  • GlobalMatch

    globalmatch.tech

    Conducts video interviews tailored to candidate resumes and provides explainable skill scores with reskilling recommendations.

    EmergenteMantenida activamente

    #1566 de 4103
  • ClientCoded

    clientcoded.com

    Tests conversational agents with adversarial scenarios and monitors production conversations in real time.

    Emergente

    #1702 de 4103
  • PHBench

    phbench.com

    Predicts which Product Hunt launches will raise Series A funding using machine learning models trained on historical launch data.

    EmergenteMantenida

    #1738 de 4103
  • kodwai

    kodwai.com

    Scores developers on how well they direct AI coding agents through real challenges, not test passage.

    EmergenteMantenida activamente

    #1807 de 4103
  • Agent Checker

    agentchecker.ai

    Audits websites to identify where AI agents fail to complete tasks like search, signup, and checkout.

    AutomatizaciónDesde £39/mes

    EmergenteMantenida

    #2595 de 4103
  • Promptyx

    promptyx.tech

    Organizes, versions, and evaluates prompts and workflows across multiple language models.

    EmergenteMantenida activamente

    #2677 de 4103
  • CriteriaBot

    criteriabot.io

    Evaluates content against custom criteria using a consensus panel of AI models, returning true/false verdicts.

    Emergente

    #2755 de 4103
  • Aequitas AI

    aequitas.world

    Verifies AI decisions in regulated industries by checking claims mathematically and certifying verdicts or declining when confidence is insufficient.

    EmergenteMantenida activamente

    #2982 de 4103
  • Trend-Analytic

    trend-analytic.com

    Analyzes YouTube channels and influencers using AI to rank creators, measure engagement authenticity, and forecast growth.

    EmergenteMantenida activamente

    #3009 de 4103
  • InterviewSkool

    interviewskool.com

    Aún sin descripción.

    EmergenteMantenida

    #3059 de 4103
  • EasyEnv

    easyenv.io

    Evaluates engineering candidates through live and take-home coding interviews in real production environments.

    EmergenteMantenida activamente

    #3099 de 4103
  • AgentVet.ai

    agentvet.ai

    Discovers, benchmarks, and rates AI agents through independent testing and user reviews.

    EmergenteMantenida activamente

    #3279 de 4103
  • Atom Foundry

    atomfoundry.dev

    Measures how AI shopping agents discover, evaluate, and recommend e-commerce stores across product categories.

    EmergenteMantenida activamente

    #3389 de 4103
  • SecNav

    secnavpro.com

    Verifies security professionals through high-fidelity mission simulations and forensic telemetry tracking.

    EmergenteMantenida activamente

    #3416 de 4103
  • SmartAssess

    smartassess.in

    Conducts, evaluates, and ranks job candidates through automated AI interviews with real-time analytics and anti-cheating detection.

    Emergente

    #3668 de 4103
  • NoParrot

    noparrot.ai

    Checks factual claims in AI responses across multiple models and scores their accuracy.

    Emergente

    #3842 de 4103
  • CAFE

    cafe-ai.de

    Runs factorial experiments on RAG agents and LLM chains to identify which components drive quality.

    Emergente

    #3890 de 4103
  • Orinyx

    orinyx.io

    Verifies clinical AI medication recommendations against FDA labeling and clinical pharmacology before and after deployment.

    EmergenteMantenida activamente

    #3900 de 4103
  • Roleplay

    roleplay.sh

    Tests AI agents for vulnerability to social engineering attacks through simulated pressure, authority, and policy bypass scenarios.

    EmergenteMantenida activamente

    #3906 de 4103
  • TrueCode

    truecode.co.in

    Evaluates coding ability by monitoring real debugging work in an IDE, scoring judgment and verification rather than just test results.

    Emergente

    #3916 de 4103
  • Redline AI

    tryredlineai.co

    Red teams AI agents before release and blocks prompt injection and tool abuse in production.

    EmergenteMantenida activamente

    #3924 de 4103
  • CodeVerdict

    codeverdict.io

    Evaluates take-home coding assessments by running submitted code in a sandbox and scoring against requirements.

    EmergenteMantenida activamente

    #4035 de 4103
  • Agentic Diaries

    agenticdiaries.com

    Measures gaps between what AI agents know internally and what they communicate to users.

  • Alva Labs

    alvalabs.io

    Evaluates job candidates using structured assessments, psychometric tests, and interview tools to standardize hiring decisions.

    desde 2017

  • Arena AI: The Official AI Ranking & LLM Leaderboard

    arena.ai

    Ranks and compares large language models through crowdsourced blind battles.

  • Botate

    botate.bot

    Structures debates between AI models to reach decisions through analyst, critic, and judge roles.

    aún no leída

  • Conversational AI Fluency Assessment

    aisa.to

    Assesses professionals' ability to work effectively with AI through conversational evaluation across five skill dimensions.

    aún no leída

  • Empromptu AI

    empromptu.ai

    Builds production-ready AI features for regulated industries with accuracy monitoring and automatic model improvement.

  • Eval-X

    eval-x.com

    Evaluates software engineers on real-world coding tasks in full IDEs while monitoring their AI interactions and decision-making patterns.

Cómo leemos una herramienta

Sin votos, sin reseñas, sin afirmaciones del proveedor. Cada semana un rastreador lee el propio sitio de cada herramienta y unos pocos registros públicos, y las palabras de la tarjeta son bandas sobre lo que leyó.

  • Uso: visitas al sitio (estimadas), instalaciones desde npm y PyPI, presencia en el informe de uso de Chrome.
  • Actividad: la versión más reciente en GitHub, npm o PyPI; la página con fecha más reciente del sitio; vacantes abiertas en un tablón público.
  • Precio: la propia página de precios del proveedor, leída con fecha. Una cifra se imprime solo cuando está en esa página.
  • La línea y los casos de uso los escribimos nosotros a partir de la página de inicio, fila a fila, y se rechazan cuando repiten el marketing del proveedor.

Cómo leen los asistentes de IA cada sitio —la lectura por la que nos preguntan los proveedores— está en la página de visibilidad de cada herramienta.