
Investigadores de IBM presentan VAKRA: el nuevo estándar que evalúa las debilidades de los agentes de inteligencia artificial en el sector corporativo
Un equipo de investigadores ha desarrollado VAKRA, una nueva métrica ejecutable diseñada para evaluar la capacidad de razonamiento y acción de los agentes de inteligencia artificial en escenarios empresariales complejos. A diferencia de las evaluaciones tradicionales, esta herramienta mide la lógica composicional a través de múltiples interfaces de programación de aplicaciones y documentos. Los resultados preliminares demuestran que los modelos actuales presentan un desempeño deficiente al intentar completar flujos de trabajo de múltiples pasos. Esta tecnología busca transformar la forma en que las empresas miden la fiabilidad de la automatización avanzada.










