<!-- Machine-readable version of https://dorsi.ai/es/blog/apple-watch-deep-sleep-accuracy. noindex. -->
# Tu Apple Watch se equivoca sobre tu sueño profundo: por cuánto se desvía y en qué confiar en su lugar

> Updated: 2026-05-22 · Source: https://dorsi.ai/es/blog/apple-watch-deep-sleep-accuracy

Estudios recientes de PSG muestran que el Apple Watch sobreestima el sueño ligero y subestima el sueño profundo. Descubre por cuánto se desvía y qué utilizar para las decisiones de entrenamiento.

Te despiertas, echas un vistazo al gráfico de sueño del Apple Watch, ves 1 hora y 38 minutos de sueño profundo y te sientes satisfecho con tu recuperación. Esa cifra —específicamente el mosaico de sueño profundo— es casi con certeza errónea. No un poco errónea. Sistemática y estructuralmente errónea de una forma que importa si utilizas los datos de sueño para decidir si hoy debes entrenar duro.

Estudios recientes controlados mediante polisomnografía le han puesto cifra a esto. La comparativa directa de Berryhill et al. (2025) entre seis dispositivos vestibles frente a la PSG halló que la mayoría de los dispositivos, incluido el Apple Watch Series 8, diferían significativamente del patrón de referencia en el tiempo total de sueño, la eficiencia del sueño, el tiempo despierto tras el inicio del sueño y la clasificación del sueño ligero. El metaanálisis de 2025 del *Journal of Clinical Sleep Medicine* sobre 24 estudios y 798 pacientes confirmó la tendencia: los dispositivos vestibles sobreestiman el tiempo total de sueño y la eficiencia del sueño, subestiman el tiempo despierto tras el inicio del sueño y —específicamente en el caso del Apple Watch— sobreestiman significativamente el sueño ligero y subestiman el sueño profundo.

<div class="takeaways">
<h2>Puntos clave</h2>
<ul>
<li>El Apple Watch sobreestima sistemáticamente el sueño ligero y subestima el sueño profundo (N3) en comparación con la polisomnografía basada en EEG.</li>
<li>El error no es pequeño: los estudios muestran que el sueño profundo se puede infravalorar entre 20 y 40 minutos por noche, según el individuo y la arquitectura del sueño.</li>
<li>No se puede corregir ajustando más el reloj o durmiendo de otra manera. La limitación es física: la fotopletismografía (PPG) de muñeca + acelerómetro no puede separar de manera fiable el NREM ligero del NREM profundo.</li>
<li>El tiempo total de sueño y la tendencia de la HRV son señales más fiables procedentes del reloj. El desglose por fases es una orientación aproximada, no un valor calibrado.</li>
<li>Si utilizas el sueño profundo para decidir si entrenar duro o reducir el esfuerzo, estás optimizando en función de una señal con mucho ruido. Utiliza en su lugar una tendencia de varios días.</li>
</ul>
</div>

## ¿Por cuánto se desvía?

El estudio de Berryhill evaluó a 62 adultos (52 hombres, 10 mujeres, edad media de 46 años) en una sesión de PSG de una sola noche en el Hospital Universitario de Amberes. El Apple Watch Series 8 fue uno de los seis dispositivos vestibles comparados con la puntuación EEG sincronizada. El resultado: el Apple Watch sobreclasificó significativamente el sueño ligero (N1 + N2) y subclasificó el sueño profundo (N3). El error absoluto medio para el sueño profundo no se publicó como una cifra única en el resumen, pero el patrón fue consistente en toda la categoría de dispositivos.

El metaanálisis de JCSM agrupó 24 estudios y 798 pacientes. La tendencia fue unánime: los dispositivos de muñeca sobreestiman el tiempo total de sueño y la eficiencia del sueño, subestiman el tiempo despierto tras el inicio del sueño y clasifican de forma errónea las fases del sueño, siendo el error más consistente la sobreestimación del sueño ligero y la subestimación del sueño profundo. Específicamente para el Apple Watch, el metaanálisis lo señaló como significativamente peor que algunos competidores en la clasificación por fases, aunque sigue siendo mejor que la actigrafía pura.

La comparativa directa de Brigham and Women's de 2024 enfrentó al Apple Watch, Fitbit y Oura Ring contra la PSG en un entorno de laboratorio único. Tanto el Apple Watch como Fitbit sobreestimaron significativamente el sueño ligero y subestimaron el sueño profundo. El Oura Ring no mostró diferencias significativas con la PSG en el tiempo total de sueño, tiempo despierto, sueño ligero, profundo, REM o eficiencia del sueño; sin embargo, Oura utiliza una ubicación de sensor diferente (dedo frente a muñeca) y un algoritmo distinto. La física de medir el flujo sanguíneo en el dedo es más sencilla que en la muñeca, donde los artefactos de movimiento y la variabilidad de la perfusión son mayores.

## Por qué el reloj se equivoca

El Apple Watch infiere las fases del sueño a partir de una combinación de acelerómetro (movimiento), frecuencia cardíaca óptica (PPG) y variabilidad de la frecuencia cardíaca (HRV). La PSG utiliza el EEG para puntuar N1, N2 y N3 directamente a partir de la actividad eléctrica cerebral. Esta brecha no es algo que una actualización de software pueda solucionar por completo.

La PPG más el movimiento pueden detectar razonablemente bien el estado de "dormido frente a despierto". No obstante, no puede separar de manera fiable el NREM ligero del NREM profundo, porque las diferencias fisiológicas subyacentes —actividad EEG de onda lenta, tono muscular, patrones específicos de actividad autonómica— no son visibles en la muñeca. El reloj detecta un cuerpo inmóvil con una frecuencia cardíaca estable y una HRV baja. Ese patrón podría ser sueño profundo, o bien sueño ligero en una persona que no se mueve mucho. El algoritmo presupone una fase y estima "sueño ligero" más a menudo de lo que debería.

El tiempo despierto clasificado erróneamente como sueño ligero, y el sueño profundo agrupado dentro del sueño ligero: ambos impulsan en la misma dirección. El reloj registra mucho "sueño ligero" porque agrupa el sueño ligero real, parte del sueño profundo y parte de la vigilia tranquila. La cifra de sueño profundo que ves es el remanente tras ese agrupamiento, y es sistemáticamente baja.

## Qué significa esto para las decisiones de entrenamiento

Si utilizas la cifra de sueño profundo para decidir si entrenar duro o reducir la intensidad, estás optimizando en función de una señal con mucho ruido. La lectura del sueño profundo de una sola noche puede desviarse entre 20 y 40 minutos. A lo largo de una semana, el error se acumula de forma desproporcionada: algunas noches el reloj calcula con mayor precisión, otras se aleja más, y no hay manera de distinguir cuál es cuál.

La información de alta confianza en la muñeca es el tiempo total en cama y la tendencia de la HRV. Estas son las [cifras del Apple Watch que cambian el entrenamiento](/es/blog/apple-watch-numbers-that-change-training). El tiempo total en cama se correlaciona razonablemente bien con el tiempo total de sueño medido por PSG (aunque todavía lo sobreestima ligeramente). La tendencia de la HRV, medida de manera constante cada mañana, refleja la recuperación autonómica de una forma que el desglose por fases no logra hacer.

El desglose por fases —especialmente el mosaico de sueño profundo— debe tratarse como una orientación aproximada, no como un valor calibrado. Si tu reloj muestra 30 minutos de sueño profundo durante tres noches consecutivas, es probable que no estés obteniendo suficiente sueño profundo. Si muestra 1 hora y 40 minutos, puede que estés bien o que estés en la misma situación. La tendencia a lo largo de una semana supera a cualquier noche individual.

## En qué confiar en su lugar

La señal más aplicable de tu reloj para el entrenamiento no es el gráfico circular de fases del sueño. Es la combinación de:

- **Tiempo total de sueño**: ¿Cuántas horas pasaste realmente durmiendo en la cama? Este es el mejor predictor individual de la recuperación del día siguiente para la mayoría de las personas que levantan pesas.
- **Tendencia de la HRV**: El promedio móvil de 7 días de tu HRV matutina, medida de forma constante. Esto refleja el equilibrio autonómico mejor que el desglose por fases de cualquier noche individual. Si observas una tendencia a la baja, esa es una señal real para [reducir el volumen de entrenamiento](/es/blog/low-hrv-training-guide).
- **Sensación subjetiva**: ¿Cómo te levantaste? El reloj no puede medir esto. Si te sientes fatigado y el reloj indica que dormiste estupendamente, confía en lo que sientes.

El desglose por fases es un elemento secundario, no indispensable. Es la parte del panel de control del sueño que parece la más informativa y que, en realidad, es la menos fiable.

## El problema del dispositivo vestible como panel de control

Existe un problema más profundo aquí que va más allá del Apple Watch. La industria de los dispositivos vestibles de consumo nos ha acostumbrado a mirar un panel lleno de números —fases de sueño, puntuaciones de preparación, porcentajes de recuperación— y a tratarlos como definitivos. Las cifras se colorean de verde, amarillo y rojo. Vienen acompañadas de mensajes de felicitación o pequeños recordatorios. La experiencia de usuario está diseñada para hacerte sentir informado, no para que cuestiones los datos.

Este es el [problema de memoria de Whoop](/es/blog/whoop-memory-and-the-context-problem) aplicado al sueño: el dispositivo recuerda la puntuación de la noche anterior, te la muestra con una flecha de tendencia y tomas una decisión basándote en ella. Sin embargo, la puntuación se construye sobre un modelo que presenta debilidades conocidas y documentadas. El componente del sueño profundo es la parte más débil de ese modelo.

El mejor enfoque consiste en utilizar el reloj como una entrada de datos para un sistema que entienda sus limitaciones, y no como un panel que debas interpretar tú mismo. El reloj recopila datos brutos. Una capa de coaching que sepa qué señales son fiables (tiempo total de sueño, tendencia de la HRV) y cuáles tienen ruido (desglose por fases) puede tomar mejores decisiones que tú observando el gráfico circular.

Ahí es donde se sitúa Dorsi. Leo tus datos de sueño —tiempo total, HRV, la tendencia— y no te muestro el desglose por fases porque no es lo suficientemente fiable como para actuar en consecuencia. La decisión sobre la intensidad del entrenamiento de hoy se toma antes de que abras la aplicación. Tú aportas la constancia; yo me encargo de interpretar el reloj.

## La versión resumida

Si solo recuerdas algunas cosas de esto:

- El Apple Watch sobreestima el sueño ligero y subestima el sueño profundo. El error está documentado en estudios controlados con PSG: Berryhill 2025 (n=62), metaanálisis JCSM 2025 (24 estudios, 798 pacientes) y la comparativa directa de Brigham and Women's 2024.
- La limitación es física, no de software. La PPG de muñeca más el acelerómetro no pueden separar con fiabilidad el NREM ligero del NREM profundo.
- Confía en el tiempo total de sueño y en la tendencia de la HRV por encima del desglose por fases. Utiliza la tendencia a lo largo de una semana, no una sola noche.
- Si te sientes fatigado y el reloj indica que dormiste estupendamente, confía en lo que sientes.
- El mejor uso de los datos de sueño es aquel en el que no tienes que fijar la vista: cuando moldea en silencio la sesión de hoy en segundo plano.

Enfócate en los factores de entrada —constancia en la hora de acostarse, entorno de sueño, gestión del estrés— y las cifras de sueño mejorarán a su propio ritmo. Si persigues directamente la cifra de sueño profundo, pasarás un año optimizando un gráfico mientras el verdadero trabajo de recuperación se queda sin hacer.

## Fuentes

La comparativa directa de Berryhill et al. en *SLEEP Advances* (2025) entre seis dispositivos vestibles frente a la polisomnografía es el conjunto de datos reciente más claro sobre la precisión en la puntuación de fases, con 62 adultos evaluados en un entorno de laboratorio controlado. El metaanálisis de 2025 del *Journal of Clinical Sleep Medicine*, que agrupó 24 estudios y 798 pacientes, confirma la tendencia: los dispositivos de muñeca para el consumidor sobreestiman el sueño ligero y subestiman el sueño profundo, señalando específicamente al Apple Watch por un error de clasificación significativo. El trabajo de Brigham and Women's de 2024 añade la comparativa directa con Oura que sugiere dónde se simplifica la física: la PPG basada en el dedo supera a la de muñeca en la clasificación por fases, aunque la brecha sigue siendo considerable para todos los dispositivos de muñeca.
