1. BananaCal
  2. Blog
  3. Ciencia

Contar calorías con IA: la probamos con 68 platos pesados al gramo

Enviamos 68 platos pesados en laboratorio a dos modelos de IA, 3 veces cada uno. Uno sobrestimaba un 51% de media, el otro un 5%. Así falla aún con las raciones.

La mayoría de las pruebas de apps que cuentan calorías con IA usan un puñado de fotos y un valor “real” calculado a ojo. Nosotros queríamos una prueba más exigente: platos en los que cada ingrediente se pesó en un laboratorio, así que las calorías reales se conocen. Pasamos 68 de ellos por dos modelos de IA con visión, tres veces cada uno, y medimos cuánto se alejaban sus estimaciones.

La respuesta corta: el modelo más reciente que probamos (gpt-6-luna) fallaba un 31% de media y un 22% en un plato típico, casi sin sesgo general (+5%). El más antiguo (gpt-5.6-luna) sobrestimaba un 51% de media y respondía exactamente 520 kcal en el 8% de los platos, hubiera lo que hubiera en ellos. Los dos llevaban cada plato hacia una “comida media”: los tentempiés pequeños salían demasiado altos y los platos grandes demasiado bajos.

Cómo hicimos la prueba

  • Los platos. Tomamos 68 platos de Nutrition5k, un conjunto de datos público de Google Research. Cada plato se montó en un comedor pesando todos sus componentes, y sus calorías y macros se calcularon a partir de esos pesos. Nuestra muestra iba de 66 a 1051 kcal (mediana de 498 kcal), elegida para cubrir tanto tentempiés pequeños como platos grandes.
  • Las fotos. Usamos la foto de cada plato tomada desde arriba, comprimida como la envía una app desde el móvil.
  • Los modelos. Dos modelos de visión de OpenAI, gpt-5.6-luna y gpt-6-luna, con las mismas instrucciones que usa en producción una app para contar calorías: nombrar el plato, listar los ingredientes con su peso y dar las calorías y los macros.
  • Las repeticiones. Cada foto se envió 3 veces a cada configuración, para ver si la misma imagen da la misma respuesta.
  • La puntuación. En cada respuesta comparamos las calorías con el valor real medido con báscula: el error medio, el error en un plato típico (la mediana), el porcentaje de respuestas a menos del 20% y el sesgo (si el modelo tiende a pasarse o a quedarse corto).

Los resultados

Modelo más antiguo Modelo más reciente
Error medio 58% 31%
Error en un plato típico (mediana) 29% 22%
Respuestas dentro de ±20% del valor real 38% 46%
Sesgo medio +51% (demasiado alto) +5%
Error medio en kcal 156 kcal 111 kcal
Respuestas de exactamente 520 kcal 8% 0,5%
Cambio al reenviar la misma foto 4,7% 4,9%

El modelo más reciente redujo el error a la mitad y casi eliminó el sesgo. Su error medio del 31% está justo donde están los mejores resultados publicados: un estudio de 2025 encontró alrededor de un 36% para ChatGPT-4o y Claude 3.5 con 52 comidas de peso conocido.

Las cifras del modelo antiguo esconden un hábito revelador. En 204 respuestas usó solo 32 valores de calorías distintos, y 520 kcal apareció 17 veces, para platos que iban desde una ensalada pequeña hasta una comida completa. Más que estimar la ración, echaba mano de una cifra de “comida típica”.

La IA lleva cada plato hacia una comida media

Este es el error mediano según las calorías reales del plato:

Calorías reales del plato Modelo más antiguo Modelo más reciente
Menos de 200 kcal +139% +61%
De 200 a 350 kcal +74% +23%
De 350 a 500 kcal +24% -12%
De 500 a 700 kcal +11% -5%
Más de 700 kcal 0% -19%

El patrón es el mismo en los dos modelos, solo que más marcado en el antiguo: las raciones pequeñas se sobrestiman y las grandes se subestiman. Un tentempié de 150 kcal puede salir en 250. Un plato de 900 kcal puede salir en 730.

Coincide con lo que han visto los investigadores con otros modelos de IA, donde la subestimación crece a medida que aumenta la ración. La causa es la foto: desde arriba, el modelo no ve la profundidad ni puede pesar nada, así que se acerca al aspecto que suele tener una comida.

¿Misma foto, mismas calorías?

Casi siempre, sí. Al enviar de nuevo la misma foto, la estimación se movía de media alrededor de un 5% con cualquiera de los dos modelos. Es poco al lado del propio error.

La excepción es la foto ambigua. Una mostraba varios dónuts en un plato. El modelo más reciente solía leerla como unas 2100 kcal, pero en 1 intento de 12 vio un solo dónut y respondió 300 kcal. Pedirle al modelo que contara primero las piezas lo arregló: 0 errores de lectura en 17 intentos, con todas las respuestas entre 1740 y 2280 kcal.

Escribir los gramos gana a la foto

También escribimos las mismas 67 recetas como texto con los pesos exactos (“68 g de arroz integral, 21 g de ensalada variada, 3 g de aceite de oliva”), así que solo quedaba hacer la cuenta.

Configuración Error en un plato típico Respuestas dentro de ±20%
El modelo lee los gramos y da el total 10% 75%
El modelo da los gramos y los valores por 100 g, la app hace la suma 4,5% 88%

La primera configuración todavía comete errores que no esperarías. Para “200 g de yogur griego 0% con 30 g de miel” respondió 181 kcal. La respuesta correcta es de unas 209 kcal: unas 118 del yogur y 91 de la miel. Cuando el modelo solo tiene que saber los valores por 100 g y la cuenta la hace el código, esos fallos desaparecen.

Trucos que no sirvieron

  • Preguntar varias veces y quedarse con la respuesta del medio. Tres o cinco respuestas por foto y luego la mediana dieron el mismo error medio, del 31 al 33%, con un coste de dos a tres veces mayor.
  • Un formato detallado paso a paso para las fotos. Pedir cada ingrediente con sus valores por 100 g igualó al formato simple en precisión, pero la misma foto variaba más entre intentos (alrededor del 9,5% en lugar del 5%). La razón principal era el aceite de cocinar: en algunos intentos aparecía como un ingrediente aparte y en otros no.

Qué significa esto cuando registras una comida

  1. Tentempiés pequeños: revisa el número. Es más probable que la foto de un yogur o de una pieza de fruta se sobrestime que se subestime.
  2. Platos grandes: revisa la ración y añade lo que no se ve, como el aceite de cocinar y el aliño. Ahí es donde se pierden calorías.
  3. ¿Sabes el peso? Escríbelo. En nuestra prueba, una descripción con gramos fue unas cinco veces más precisa que una foto.
  4. ¿Varias piezas en el plato? Comprueba que el número sea correcto.
  5. Productos envasados: escanea el código de barras en lugar de hacer una foto. La etiqueta gana a cualquier estimación.

Si todavía no tienes un objetivo, empieza con nuestra calculadora de calorías. Para ver el panorama completo sobre la precisión, incluidos los estudios sobre lo que apuntamos a mano, lee si es fiable contar calorías con una foto, y para lo básico del registro consulta cómo contar calorías.

Los límites de esta prueba

  • Fotos de laboratorio. Los platos de Nutrition5k se fotografiaron desde arriba con un montaje fijo en unos pocos comedores de California. Las fotos hechas en casa, en ángulo y con otras cocinas se comportarán de otra manera.
  • 68 platos. Suficientes para ver patrones claros, no para clasificar todos los modelos con todos los tipos de comida.
  • Una instantánea. Son dos modelos concretos en octubre de 2026. Los modelos cambian a menudo, así que las cifras también cambiarán.
  • Quién la hizo. Desarrollamos BananaCal, una app para contar calorías, e hicimos esta prueba para elegir su configuración. Después, pasamos el análisis de fotos al modelo más reciente con el paso de contar las piezas, y el análisis de texto al método “valores por 100 g, suma en el código”. No tenemos ninguna relación con OpenAI más allá de pagar por su API.

Resumen

  • Con 68 platos pesados al gramo, el mejor modelo de IA fallaba un 31% de media y un 22% en un plato típico, casi sin sesgo.
  • Todos los modelos llevaban los platos hacia una comida media: los pequeños salían demasiado altos y los grandes demasiado bajos.
  • La misma foto daba casi siempre la misma respuesta, salvo en los platos ambiguos.
  • Escribir los gramos redujo el error típico a alrededor del 4,5%.
  • Preguntar más veces a la IA no la hizo más precisa.

Preguntas frecuentes

¿Cuánto se equivoca la IA al calcular las calorías de una foto?

En nuestra prueba con 68 platos pesados al gramo, el mejor modelo fallaba un 31% de media y un 22% en un plato típico. Está en línea con los estudios publicados, que encuentran errores medios de alrededor del 35% en los modelos de IA generales.

¿La IA sobrestima o subestima las calorías?

Las dos cosas, según el plato. Todos los modelos que probamos llevaban sus estimaciones hacia una comida media, así que los tentempiés pequeños salían demasiado altos y los platos grandes demasiado bajos.

¿Es más preciso describir la comida con palabras que hacerle una foto?

Si sabes los gramos, sí. Con los pesos escritos, el error típico bajó a alrededor del 4,5%, frente al 22% de la foto de un plato parecido.

¿La misma foto da siempre las mismas calorías?

Casi siempre. Al enviar otra vez la misma foto, la estimación cambiaba de media alrededor de un 5%, pero una foto ambigua a veces se interpreta de una forma completamente distinta.

Fuentes

  1. Thames Q et al. Nutrition5k: Towards Automatic Nutritional Understanding of Generic Food. CVPR, 2021
  2. Conjunto de datos Nutrition5k (Google Research, CC BY 4.0)
  3. Fridolfsson J et al. Performance Evaluation of 3 Large Language Models for Nutritional Content Estimation from Food Images. Curr Dev Nutr, 2025
  4. O'Hara C et al. An Evaluation of ChatGPT for Nutrient Content Estimation from Meal Photographs. Nutrients, 2025
  5. USDA FoodData Central (yogur griego natural 0%; miel)

Este artículo ofrece información general, no consejo médico. Si tienes algún problema de salud, estás embarazada o tomas medicación, consulta a tu médico o a un dietista-nutricionista antes de cambiar tu alimentación.