The Fort Worth Press - Clockwork.io lanza primer compromiso contractual para eliminar el desperdicio de GPU en entrenamiento de IA

USD -
AED 3.672504
AFN 64.000368
ALL 80.660025
AMD 364.155001
ANG 1.790365
AOA 918.000367
ARS 1524.750402
AUD 1.417435
AWG 1.8
AZN 1.70397
BAM 1.716593
BBD 2.014833
BDT 123.096502
BGN 1.683441
BHD 0.377145
BIF 3013.033747
BMD 1
BND 1.278097
BOB 12.259622
BRL 5.188104
BSD 1.000307
BTN 95.794093
BWP 13.621802
BYN 3.022425
BYR 19600
BZD 2.011937
CAD 1.41495
CDF 2340.000362
CHF 0.828271
CLF 0.024357
CLP 961.770396
CNY 6.71325
CNH 6.734304
COP 3348.488173
CRC 454.820731
CUC 1
CUP 24.008426
CVE 96.778865
CZK 21.384404
DJF 178.136657
DKK 6.562804
DOP 59.49006
DZD 133.78604
EGP 51.914688
ERN 15
ETB 162.282003
EUR 0.87791
FJD 2.24725
FKP 0.754991
GBP 0.754689
GEL 2.61504
GGP 0.754991
GHS 11.618906
GIP 0.754991
GMD 73.503851
GNF 8797.998859
GTQ 7.639444
GYD 209.30355
HKD 7.84345
HNL 26.849519
HRK 6.613804
HTG 130.916751
HUF 320.61504
IDR 17914.1
ILS 3.04806
IMP 0.754991
INR 95.817504
IQD 1310.484048
IRR 1374575.000352
ISK 120.260386
JEP 0.754991
JMD 158.265678
JOD 0.70904
JPY 157.28504
KES 129.644095
KGS 87.448204
KHR 4068.10901
KMF 433.00035
KPW 900.000318
KRW 1355.185039
KWD 0.30864
KYD 0.833633
KZT 443.156186
LAK 22438.232325
LBP 89581.428007
LKR 330.293588
LRD 172.063018
LSL 16.32106
LTL 2.95274
LVL 0.60489
LYD 6.395752
MAD 9.599596
MDL 17.756616
MGA 4416.553298
MKD 54.043972
MMK 2099.795344
MNT 3598.18988
MOP 8.082152
MRU 40.243999
MUR 47.530378
MVR 15.450378
MWK 1734.585509
MXN 17.679204
MYR 4.074104
MZN 63.910377
NAD 16.32106
NGN 1326.380377
NIO 36.810462
NOK 9.50785
NPR 153.270725
NZD 1.749629
OMR 0.385571
PAB 1.000307
PEN 3.395971
PGK 4.456927
PHP 62.347038
PKR 277.197262
PLN 3.83775
PYG 5896.344407
QAR 3.646377
RON 4.629204
RSD 103.085092
RUB 84.346338
RWF 1478.474569
SAR 3.752852
SBD 8.000512
SCR 13.902664
SDG 601.503676
SEK 9.91775
SGD 1.277904
SHP 0.755002
SLE 24.650371
SLL 20969.491881
SOS 571.729495
SRD 37.667504
STD 20697.981008
STN 21.503489
SVC 8.753236
SYP 13002.000254
SZL 16.317198
THB 33.375038
TJS 9.228244
TMT 3.51
TND 2.961425
TOP 2.40776
TRY 48.942504
TTD 6.803879
TWD 31.728704
TZS 2654.934831
UAH 44.794751
UGX 3918.023434
UYU 40.075482
UZS 11839.206565
VES 852.43145
VND 25976
VUV 118.485868
WST 2.745655
XAF 575.871484
XAG 0.015553
XAU 0.000233347179
XCD 2.70255
XCG 1.80287
XDR 0.707052
XOF 575.871484
XPF 104.673717
YER 236.650363
ZAR 16.304245
ZMK 9001.203584
ZMW 19.513758
ZWL 321.999592
SSP 5712.5919
MXV 2.00344
Clockwork.io lanza primer compromiso contractual para eliminar el desperdicio de GPU en entrenamiento de IA
Clockwork.io lanza primer compromiso contractual para eliminar el desperdicio de GPU en entrenamiento de IA

Clockwork.io lanza primer compromiso contractual para eliminar el desperdicio de GPU en entrenamiento de IA

La garantía "You Only Compute Once" (YOCO) se compromete a resolver el 90 % de los fallos durante el entrenamiento de modelos de IA sin pérdida de progreso; en caso contrario, los clientes recibirán una compensación económica

Tamaño del texto:

PALO ALTO (California, EE. UU.) / ACCESS Newswire / 1 de julio de 2026 / Clockwork.io, pionera en Software-Driven AI Fabrics™ y la empresa responsable de TorchPass, su solución de tolerancia a fallos para IA, anunció hoy la Garantía YOCO, el primer compromiso contractual del sector destinado a reducir drásticamente el coste oculto y acumulativo que provocan los fallos durante el entrenamiento de modelos de inteligencia artificial a gran escala. El anuncio marca un punto de inflexión en la forma en que la industria mide la fiabilidad de la infraestructura de IA, alejándose de las métricas tradicionales de disponibilidad ("uptime") diseñadas para una era anterior y centrándose en lo que realmente valoran los equipos de IA: que el entrenamiento finalice a tiempo y sin pérdida de trabajo.

En virtud de la garantía YOCO (You Only Compute Once), Clockwork.io se compromete a que al menos el 90 % de los fallos de entrenamiento en cargas de trabajo TorchPass compatibles se resolverán mediante la migración en caliente de las GPU, sin pérdida del progreso del entrenamiento, sin necesidad de volver al último punto de control ("checkpoint") y sin tener que recomputar el trabajo ya realizado. Si Clockwork.io no cumple este compromiso durante cualquier año de contrato, los clientes recibirán un crédito del 25 % aplicable a la siguiente renovación o ampliación de TorchPass.

"Desarrollamos TorchPass para que los fallos durante el entrenamiento dejaran de ser un problema", afirmó Suresh Vasudevan, director ejecutivo de Clockwork.io. "La garantía YOCO queda reflejada en el propio contrato. Ponemos en juego nuestra propia credibilidad porque sabemos que TorchPass cumple lo que promete, y queremos que nuestros clientes también lo sepan".

El coste oculto del progreso en IA
Todas las organizaciones que entrenan modelos de IA a gran escala se enfrentan al mismo problema: los clústeres de GPU fallan constantemente y cada fallo obliga a reiniciar un costoso ciclo de recuperación. Según una investigación publicada por Meta FAIR en HPCA 2025, un clúster de 1.024 GPU presenta un tiempo medio entre fallos de apenas 7,9 horas, mientras que en un clúster de 16.384 GPU esa cifra se reduce a 1,8 horas. Cada fallo obliga a asignar nuevos nodos, restaurar el entrenamiento desde el último punto de control y volver a calcular todos los pasos realizados desde entonces. Ese trabajo recomputado supone un coste completo de GPU: capacidad de cálculo que ya se había pagado y que debe volver a ejecutarse desde cero. Habitualmente, cada incidente implica la pérdida de tres o más horas de progreso, acumulándose estas pérdidas día tras día.

Como consecuencia, los clústeres actuales de GPU funcionan de forma efectiva entre un 30 % y un 50 % de su rendimiento teórico, no porque el hardware sea lento, sino porque el modelo de fiabilidad sobre el que se construye nunca fue diseñado para cargas de trabajo de esta naturaleza, duración y escala.

"Los equipos de IA necesitan que sus modelos se completen, no simplemente que sus nodos permanezcan activos. Durante años, el sector ha medido la disponibilidad de los nodos y la ha llamado fiabilidad. YOCO nos hace responsables de lo único que realmente importa: que el modelo termine de entrenarse", añadió Vasudevan.

El impacto económico es considerable. En una implementación típica de 2.048 GPU H200, los reinicios provocados por fallos generan más de 6 millones de dólares anuales en capacidad de cálculo desperdiciada, con cientos de miles de horas de GPU perdidas debido a reintentos encadenados, tiempos de recuperación y recomputación del entrenamiento. Para quienes desarrollan IA, la verdadera unidad de valor no es el tiempo de disponibilidad de las GPU, sino el tiempo necesario para obtener un modelo entrenado. Sin embargo, los contratos de infraestructura que adquieren garantizan la disponibilidad de los nodos, no la continuidad de los trabajos de entrenamiento. Para los operadores de IA ocurre algo similar: cuando el entrenamiento de un cliente falla, se reinicia y pierde días de progreso, la percepción es de falta de fiabilidad, independientemente de lo que establezca el acuerdo de nivel de servicio (SLA).

"La recomputación y los reinicios constituyen el impuesto oculto del entrenamiento de IA a gran escala", señaló Vasudevan. "La mayoría de los equipos lo consideran inevitable. No lo es".

La garantía YOCO cambia ese planteamiento contractual.

TorchPass: la fiabilidad redefinida mediante software
La respuesta de Clockwork.io consiste en convertir la fiabilidad en una propiedad definida por software, en lugar de depender de la disponibilidad del hardware, mediante un replanteamiento arquitectónico que desvincula la continuidad del entrenamiento de la tasa de fallos de cualquier componente individual.

TorchPass aborda los fallos desde su origen mediante la migración en caliente de GPU. Cuando se produce una incidencia, la solución transfiere todo el estado almacenado en memoria del entrenamiento -incluidos los pesos del modelo, los gradientes y el estado del optimizador- a un nodo de reserva operativo. El entrenamiento continúa exactamente donde se había detenido y, por lo general, la recuperación se completa en aproximadamente tres minutos, sin restaurar puntos de control, sin recomputar y sin pérdida de progreso.

TorchPass gestiona tres tipos de incidencias: migración no planificada para fallos repentinos y graves, como bloqueos del kernel, cortes de suministro eléctrico o averías de GPU; migración preventiva, activada por señales tempranas como el aumento de errores ECC o determinados umbrales térmicos; y migración planificada para tareas de mantenimiento, actualizaciones de seguridad o firmware. En los tres casos, el entrenamiento continúa sin interrupciones.

Disponibilidad
La garantía YOCO estará disponible para los nuevos clientes de TorchPass y para las renovaciones a partir del 3 de agosto de 2026. Los clientes actuales podrán ponerse en contacto con su equipo comercial de Clockwork.io para incorporar la garantía a sus contratos vigentes. Más información en clockwork.io/yoco.

Clockwork.io estará presente en RAISE Summit, que se celebrará en París (Francia) los días 8 y 9 de julio, en el stand 27A. Además, Suresh Vasudevan, director ejecutivo de Clockwork.io, participará el 8 de julio, a las 10:40 horas (hora local), en la mesa redonda "Infrastructure as Destiny: The Compute-Capital-Cloud Trinity", que tendrá lugar en el escenario principal.

Contacto:

Dana Trismen
[email protected]
650-269-7478

SOURCE: Clockwork

G.George--TFWP