En 30 segundos

Microsoft y Hugging Face presentan una evaluación que comprueba el resultado de las acciones y su consistencia durante veinte intentos.

Qué ha pasado

Microsoft y Hugging Face han publicado ThinkingBox, un entorno que evalúa agentes mediante el estado final de los registros y sus efectos secundarios. ThinkingBox-Bench reúne 507 tareas empresariales y repite cada una veinte veces.

Por qué importa

La evaluación permite distinguir una respuesta convincente de una acción correcta y repetible. Resulta útil para quienes desarrollan agentes que modifican pedidos, reservas o incidencias.

A quién afecta

Equipos que desarrollan y evalúan agentes con herramientas y bases de datos.

Qué ha pasado

ThinkingBox comprueba si el agente deja los registros en el estado solicitado. Una llamada válida a una herramienta o un mensaje de éxito no bastan para aprobar. Cada intento parte de un entorno aislado con el mismo estado inicial.

Las 507 tareas cubren comercio, seguros de automóvil, viajes, banca digital y consultoría. En 477 tareas, la evaluación depende únicamente del estado; las otras treinta añaden criterios sobre la respuesta. El entorno y el conjunto de evaluación están disponibles mediante Hugging Face.

Por qué importa

El artículo separa la tasa de acierto por intento, la capacidad de resolver una tarea al menos una vez y la proporción que supera los veinte intentos. Son medidas diferentes: resolver una operación ocasionalmente no demuestra que pueda ejecutarse de forma consistente.

Los autores proponen comprobar el estado final antes de dar una operación por terminada y distinguir errores recuperables de otros fallos. Indican expresamente que no han medido cuánto mejorarían esas medidas los resultados del benchmark.

Límites de la evaluación

Los resultados corresponden a estos escenarios y a la configuración descrita por los autores. Superar veinte intentos no garantiza fiabilidad universal. IARADIA no ha ejecutado ThinkingBox ni ha reproducido sus comparaciones de modelos. El adaptador publicado está orientado a evaluación; el entrenamiento requiere escenarios separados del benchmark.

Redactado con IA a partir de fuente oficial. Fuente consultada el 4 de octubre de 2026.

Fuentes y procedencia

Cómo verificamos y actualizamos este contenido