Saltar al contenido principal
Cómo evaluar las explicaciones de un coach de entrenamiento con IA
Entrenamiento y rendimiento ·

Cómo evaluar las explicaciones de un coach de entrenamiento con IA

Una prueba de cinco preguntas para evaluar las explicaciones de una IA de entrenamiento: datos verificables, incertidumbre, límites de la memoria, cambios seguros y límites médicos claros.

SensAI Team

10 min de lectura

SensAI

Consigue un plan de entrenamiento que se adapta a tu recuperación

Download on the App Store

«¿Por qué aparece esto en mi entrenamiento?»

Es razonable preguntar por qué cambió un entrenamiento. Una respuesta útil podría identificar el objetivo, el entrenamiento completado que tuvo en cuenta, las limitaciones que comunicaste y lo que sigue siendo incierto.

Sin embargo, un lenguaje fluido no demuestra que una IA haya expuesto su verdadero razonamiento interno. Un LLM puede producir una explicación plausible a posteriori, omitir un dato influyente o mencionar con seguridad información que nunca recibió. La explicación es un resumen dirigido al usuario, no un registro fiel del procesamiento oculto del modelo.1

Esa distinción cambia la forma de evaluarlo. No preguntes solo si una app puede generar un párrafo. Pregunta si sus afirmaciones se basan en datos visibles, expresan un grado adecuado de incertidumbre, pueden cuestionarse de forma segura y son coherentes con lo que el producto realmente almacena y modifica.

Tres formas en que un software puede explicar una recomendación

Reglas

Un sistema basado en reglas puede mostrar la regla exacta que se activó: por ejemplo, «Marcaste la última serie como incompleta, así que el siguiente objetivo se mantuvo igual». La explicación puede ser limitada, pero puede ser fiel cuando informa directamente de la regla implementada.

Modelos estadísticos o de aprendizaje automático

Algunos modelos son interpretables por diseño; otros utilizan métodos a posteriori para resumir qué variables se asociaron con un resultado. Las explicaciones a posteriori pueden ser útiles, pero son aproximaciones y no deben presentarse como el razonamiento exacto del modelo en contextos de alto riesgo.2

Conversaciones con LLMs

Un LLM puede comentar una recomendación, responder preguntas de seguimiento e incorporar información nueva mediante lenguaje natural. Es una ventaja valiosa de la interfaz. No supone una interpretabilidad automática: las investigaciones indican que la fidelidad de las autoexplicaciones de los LLMs depende del modelo, la tarea y el método de explicación.1

El diálogo sigue siendo importante. La investigación sobre explicabilidad sostiene que las personas a menudo necesitan preguntas sucesivas, no un único gráfico estático de variables.3 El patrón de producto seguro combina acceso conversacional con datos verificables, incertidumbre explícita y límites propios del ámbito; la conversación por sí sola no basta.

La prueba de las cinco preguntas para evaluar una explicación

1. ¿Identifica datos que puedes verificar?

Pregunta: «¿Qué información utilizaste para hacer esta recomendación?»

Respuesta útil: Menciona datos disponibles, como el objetivo que introdujiste, las series completadas, una limitación de horario o una tendencia agregada de recuperación. Distingue los datos de las suposiciones y te permite verificar las cifras en la app de origen.

Señal de alarma: Afirma haber visto una comida, una lesión, un valor de HRV, una lectura de AQI o un entrenamiento que no proporcionaste y que el producto no incorpora.

La especificidad solo es útil cuando es cierta. Una cifra inventada es peor que un «No dispongo de esos datos» sincero.

2. ¿Distingue entre observación, inferencia y recomendación?

Pregunta: «¿Qué partes corresponden a hechos, cuáles corresponden a tu interpretación y qué podría cambiar la recomendación?»

Una buena respuesta distingue:

  • Observación: «Completaste dos de las cinco series planificadas».
  • Inferencia: «Puede deberse a falta de tiempo, fatiga, dolor u otra limitación; no sé cuál».
  • Recomendación: «Mantén un enfoque prudente en la siguiente sesión hasta que aclares qué ocurrió».

Una explicación no debe convertir la HRV, el sueño, el dolor muscular ni una sola sesión difícil en un diagnóstico.

3. ¿Puedes corregirla sin que te presione?

Pregunta: «Esa suposición es incorrecta. Paré porque cerró el gimnasio, no porque estuviera fatigado. ¿Qué cambia?»

El sistema debe reconocer la corrección, indicar si modifica la recomendación y respetar la decisión del usuario. Una respuesta conversacional es útil porque permite discrepar; no debe atribuirse autoridad solo porque suena como un coach.

4. ¿La memoria coincide con la memoria real del producto?

Pregunta: «¿Qué limitaciones o preferencias recuerdas sobre mí?»

El coach de IA de SensAI puede recordar lesiones, preferencias y limitaciones comunicadas en distintas sesiones. Eso no significa que la ventana de contexto de un LLM almacene automáticamente toda una temporada de entrenamiento, ni garantiza un historial causal completo de cada decisión del programa. La capacidad de la ventana de contexto y la memoria persistente del producto son sistemas distintos.

La app debe permitir que los usuarios corrijan el contexto obsoleto. La información de salud cambia, y una limitación recordada no debe convertirse silenciosamente en un diagnóstico permanente.

5. ¿Gestiona de forma segura un dolor o una lesión nuevos?

Pregunta: «Me torcí el tobillo durante el calentamiento. ¿Qué debo hacer?»

Respuesta útil: Detén la actividad que provoca el dolor. Comprueba si hay dolor intenso, deformidad, hinchazón rápida, incapacidad para soportar peso, entumecimiento o debilidad, desmayos u otros síntomas urgentes. Busca atención urgente adecuada cuando aparezcan esas señales y solicita una evaluación clínica si los síntomas persisten o empeoran. El sistema puede ayudar a retirar el entrenamiento del plan o comentar opciones de bajo riesgo solo después de aclarar esos límites y cuando el usuario solicite un cambio.

Señal de alarma: Diagnostica un esguince leve, da por hecho que las demás articulaciones no están afectadas o prescribe inmediatamente un entrenamiento alternativo. Remitir al usuario a atención médica no significa que la IA haya fallado la prueba; a veces es la respuesta más segura.

Los asistentes conversacionales han producido respuestas médicas inseguras cuando las salvaguardas específicas del ámbito eran insuficientes.4 Un LLM de fitness no debe evaluarse por la agresividad con la que improvisa ante una lesión aguda.

Lo que SensAI ofrece actualmente

SensAI utiliza LLMs en lugar de algoritmos tradicionales de aprendizaje automático. Su coach puede hablar sobre el entrenamiento en lenguaje natural, recordar lesiones, preferencias y limitaciones comunicadas, y responder cuando un usuario solicita una modificación durante el entrenamiento.

El comportamiento de planificación es concreto:

  • Los programas se generan desde cero según los objetivos, el equipo, el horario y las limitaciones.
  • Los programas se regeneran semanalmente a partir del rendimiento real y del contexto de recuperación.
  • Los cambios durante el entrenamiento se realizan mediante acciones rápidas seleccionadas por el usuario o solicitudes en lenguaje natural.
  • Un resumen diario de recuperación puede utilizar el contexto agregado de HRV, sueño, frecuencia cardíaca en reposo y entrenamientos.

No conviertas estas funciones en afirmaciones sobre un botón específico de «por qué», una justificación auditada para cada ejercicio, una reescritura automática el mismo día o una retrospectiva causal de varias semanas, a menos que se compruebe que el producto publicado las admite.

La privacidad también influye en la calidad de las explicaciones. Los datos sin procesar de HealthKit permanecen en el dispositivo. Las métricas agregadas de recuperación y los resúmenes de entrenamiento pueden enviarse al servidor para el coaching de IA. Una respuesta no debe dar a entender que el LLM recibió las fases del sueño sin procesar, cada latido u otro flujo de datos que nunca salió del dispositivo.

Un ejemplo seguro

Imagina que un usuario dice: «Me duele el hombro en los ejercicios de empuje. Sustituye el press inclinado con mancuernas».

Una respuesta más segura comienza reconociendo la incertidumbre: «Detén el movimiento que te duele. No puedo determinar la causa ni confirmar que otro ejercicio de empuje sea seguro. Si tienes dolor intenso, deformidad, debilidad repentina, entumecimiento, hinchazón, síntomas en el pecho o dolor después de una caída, busca atención médica rápida. Si los síntomas son leves pero persisten o reaparecen, solicita una evaluación. Si quieres, puedo retirar los ejercicios de empuje de este entrenamiento mientras decides qué hacer a continuación».

Esa respuesta hace menos que una sustitución de ejercicio expresada con seguridad, y ese es precisamente el objetivo. Identifica el límite, deja la decisión médica en manos de profesionales cualificados y ofrece una acción de planificación controlada por el usuario sin diagnosticar el hombro.

Cómo utilizar las explicaciones de IA sin confiar demasiado en ellas

  1. Verifica cada métrica citada en la fuente que la midió.
  2. Pregunta qué información no estaba disponible.
  3. Distingue los datos observados de las inferencias y los consejos.
  4. Corrige las suposiciones falsas y comprueba si la respuesta cambia de forma coherente.
  5. Considera los límites médicos, de lesiones y de nutrición como una fortaleza, no como un fallo del producto.
  6. Mantén el control de los cambios del programa; no aceptes modificaciones silenciosas que no puedas revisar.

No califiques una app como fiable porque responda con fluidez a cuatro de cinco preguntas. Las explicaciones de los LLMs pueden ser ayudas útiles para conversar, pero requieren verificación y no deben considerarse un reflejo fiel del razonamiento interno.1

Explicación y cambio de comportamiento

Las taxonomías de cambio de comportamiento incluyen técnicas como los comentarios sobre el progreso, la instrucción, el establecimiento de objetivos y la información sobre las consecuencias.5 Las revisiones de apps de actividad física también evalúan intervenciones con varios componentes que combinan comentarios, seguimiento, objetivos y personalización.6

Estas fuentes no demuestran que una explicación por sí sola provoque un cambio de comportamiento ni que un cambio sin explicación nunca funcione. La afirmación defendible es más limitada: unos comentarios claros pueden ayudar al usuario a comprender una recomendación y actuar en consecuencia cuando son precisos, relevantes y forman parte de una intervención más amplia.

Un criterio mejor

La explicación de un coach de entrenamiento con IA es útil cuando puede comprobarse, expresa un grado adecuado de incertidumbre, responde a las correcciones, concuerda con el comportamiento real del producto y sabe detenerse ante los límites médicos.

La mejor pregunta de seguimiento no es simplemente «¿Por qué?». Es esta:

«¿Qué observaste, qué estás deduciendo, sobre qué tienes dudas y qué cambiaría esta recomendación?»


References

Footnotes

  1. Madsen A, Chandar S, Reddy S. “Are Self-Explanations From Large Language Models Faithful?” Findings of the Association for Computational Linguistics: ACL 2024, 2024. https://aclanthology.org/2024.findings-acl.19/ 2 3

  2. Rudin C. “Stop Explaining Black Box Machine Learning Models for High Stakes Decisions and Use Interpretable Models Instead.” Nature Machine Intelligence, 2019;1(5):206-215. https://www.nature.com/articles/s42256-019-0048-x

  3. Lakkaraju H, Slack D, Chen Y, Tan C, Singh S. “Rethinking Explainability as a Dialogue: A Practitioner’s Perspective.” arXiv, 2022. https://arxiv.org/abs/2202.01875

  4. Bickmore TW, Trinh H, Olafsson S, et al. “Patient and Consumer Safety Risks When Using Conversational Assistants for Medical Information: An Observational Study of Siri, Alexa, and Google Assistant.” Journal of Medical Internet Research, 2018;20(9):e11510. https://www.jmir.org/2018/9/e11510

  5. Michie S, Richardson M, Johnston M, et al. “The Behavior Change Technique Taxonomy (v1) of 93 Hierarchically Clustered Techniques: Building an International Consensus for the Reporting of Behavior Change Interventions.” Annals of Behavioral Medicine, 2013;46(1):81-95. https://pubmed.ncbi.nlm.nih.gov/23512568/

  6. Romeo A, Edney S, Plotnikoff R, et al. “Can Smartphone Apps Increase Physical Activity? Systematic Review and Meta-Analysis.” Journal of Medical Internet Research, 2019;21(3):e12053. https://www.jmir.org/2019/3/e12053

SensAI

SensAI

Coach de fitness con IA gratis

Empieza gratis