Diffbot
Extracts structured data from web pages and crawls entire sites into datasets without hallucinations.
Diffbot is a developer of machine learning and computer vision algorithms and public APIs for extracting data from web pages / web scraping to create a knowledge base.Primera frase del artículo de la Wikipedia en inglés
83/100
- Entidad25/25
- Legible por máquina21/35
- Acceso de recuperación20/20
- Huellasin leer
- Diffbot83
- mediana de Datosde 9 valoradas69
- mediana del Atlasde 537 valoradas61
- Bots de recuperaciónabiertoverificar
Si entran los bots que deciden las citas. Los bots de entrenamiento son una lista aparte y no cuentan aquí.
- llms.txtsíverificar
Un índice en texto plano en /llms.txt. Opcional; lo leen algunas herramientas.
- Schema Organizationno
Marcado schema.org Organization en la página de inicio, de donde un resolvedor lee el nombre y los enlaces de una empresa.
- Elemento en WikidataQ17052069Artículo en Wikipedia
Emparejado por el sitio oficial, nunca por el nombre. La base del grafo de conocimiento contra el que un motor resuelve nombres.
- Palabras del servidor409rastreado
Lo que un lector sin JavaScript recibe de la página de inicio.
- Índice de identidad60/100rastreado
La sección del analizador que solo lee el crawler, 0-100: archivos de identidad, schema, política de crawlers, sitemap. No es la nota del analizador.
- Fundada2011P571
- SedeMenlo ParkP159
- SectorInternetP452
60/100
índice de identidad
82
86
74
69
67
66
No medida con el analizador.
La ejecución completa pregunta a cuatro motores por esta empresa por su nombre. Se ejecuta a petición, no por calendario.
¿Qué es Diffbot?
Extracts structured data from web pages and crawls entire sites into datasets without hallucinations.
¿Cuál es la preparación Atlas de Diffbot?
83 de 100 el 2026-09-15, calculada a partir de cuatro partes — entidad, legibilidad por máquinas, acceso de búsqueda, huella — de 80 sobre 100 puntos — huella sin leer. Ocupa el #2 de 9 herramientas valoradas en Datos.
¿Diffbot deja entrar a los bots de búsqueda de IA?
Sí. El 2026-09-15, el robots.txt de diffbot.com no bloqueaba a ninguno de los rastreadores de búsqueda que comprobamos.
¿Diffbot publica un llms.txt?
Sí: diffbot.com/llms.txt estaba presente el 2026-09-15.
¿Diffbot es una entidad de Wikidata?
Sí: Q17052069, emparejada por su sitio web oficial.
Cómo leer una fila
- rastreado
- Leído por un crawler: HTTP y parsing, sin llamada a un modelo. Todas las filas, cada semana.
- medido
- La ejecución completa del analizador, preguntada a cuatro motores. Se muestra solo donde la empresa aceptó.
¿Puede un motor de búsqueda encontrar, resolver y citar este sitio? Cuatro partes, cada una leída por el rastreo, cada una mostrada junto al total.
Entidad 25 · Legible por máquina 35 · Acceso de recuperación 20 · Huella 20
Una parte que nunca se leyó queda fuera y el total se recalcula sobre lo leído. Nunca cuenta como cero.