The Fort Worth Press - Clockwork.io führt die branchenweit erste vertragliche Verpflichtung zur Beendigung von GPU-Verschwendung beim KI-Training ein

USD -
AED 3.672502
AFN 65.506901
ALL 80.542786
AMD 365.404028
AOA 917.999947
ARS 1490.933797
AUD 1.416631
AWG 1.8025
AZN 1.704684
BAM 1.694742
BBD 2.013422
BDT 123.409934
BHD 0.376932
BIF 2988.332445
BMD 1
BND 1.280355
BOB 11.871288
BRL 5.174302
BSD 0.999614
BTN 95.355034
BWP 13.493408
BYN 2.963637
BYR 19600
BZD 2.010476
CAD 1.392785
CDF 2274.999813
CHF 0.811735
CLF 0.023224
CLP 914.020134
CNY 6.745297
CNH 6.74767
COP 3137.03
CRC 453.271291
CUC 1
CUP 26.5
CVE 95.544878
CZK 21.02415
DJF 178.017322
DKK 6.479402
DOP 58.290116
DZD 132.998787
EGP 50.179803
ERN 15
ETB 161.696178
EUR 0.86671
FJD 2.21245
FKP 0.739377
GBP 0.740346
GEL 2.615021
GGP 0.739377
GHS 11.761444
GIP 0.739377
GMD 73.502808
GNF 8778.535005
GTQ 7.626087
GYD 209.359254
HKD 7.846499
HNL 26.793985
HRK 6.5302
HTG 130.704343
HUF 316.521009
IDR 17864
ILS 2.997301
IMP 0.739377
INR 95.42005
IQD 1309.573325
IRR 1374700.000461
ISK 123.070381
JEP 0.739377
JMD 158.156744
JOD 0.709021
JPY 159.423999
KES 129.330412
KGS 87.449818
KHR 4050.066938
KMF 427.000292
KRW 1417.544958
KWD 0.30891
KYD 0.832994
KZT 466.161244
LAK 22554.384323
LBP 89518.610465
LKR 334.287955
LRD 180.434905
LSL 16.22219
LTL 2.95274
LVL 0.60489
LYD 6.374968
MAD 9.261597
MDL 17.36399
MGA 4301.39206
MKD 53.312479
MMK 2099.437721
MNT 3594.800745
MOP 8.079183
MRU 39.955635
MUR 47.039473
MVR 15.449606
MWK 1733.381281
MXN 17.064503
MYR 4.093802
MZN 63.399706
NAD 16.220855
NGN 1361.770302
NIO 36.783342
NOK 9.491104
NPR 152.566385
NZD 1.703855
OMR 0.384495
PAB 0.999614
PEN 3.379519
PGK 4.485921
PHP 61.317007
PKR 277.479994
PLN 3.72915
PYG 5952.056011
QAR 3.644076
RON 4.539801
RSD 101.716976
RUB 82.449298
RWF 1472.472911
SAR 3.747756
SBD 8.065041
SCR 13.894089
SDG 600.502876
SEK 9.528796
SGD 1.28069
SLE 24.497323
SOS 571.29488
SRD 37.946011
STD 20697.981008
STN 21.229307
SVC 8.746664
SZL 16.212539
THB 33.119716
TJS 9.211859
TMT 3.51
TND 2.935103
TRY 47.757302
TTD 6.769484
TWD 32.211699
TZS 2654.997973
UAH 44.852497
UGX 3719.156864
UYU 40.24973
UZS 11886.069807
VES 760.265199
VND 26127.5
VUV 118.84778
WST 2.733733
XAF 568.398113
XAG 0.015209
XAU 0.000227
XCD 2.70255
XCG 1.801671
XDR 0.706905
XOF 568.398113
XPF 103.341305
YER 237.200169
ZAR 16.18805
ZMK 9001.200395
ZMW 18.743474
ZWL 321.999592
  • Goldpreis

    13.0000

    4454.1

    +0.29%

  • EUR/USD

    -0.0008

    1.1538

    -0.07%

  • MDAX

    -26.2500

    32224.89

    -0.08%

  • SDAX

    30.6000

    18571.14

    +0.16%

  • Euro STOXX 50

    15.6000

    6551.22

    +0.24%

  • TecDAX

    22.7600

    4090.18

    +0.56%

  • DAX

    67.5400

    26391.42

    +0.26%

Clockwork.io führt die branchenweit erste vertragliche Verpflichtung zur Beendigung von GPU-Verschwendung beim KI-Training ein
Clockwork.io führt die branchenweit erste vertragliche Verpflichtung zur Beendigung von GPU-Verschwendung beim KI-Training ein

Clockwork.io führt die branchenweit erste vertragliche Verpflichtung zur Beendigung von GPU-Verschwendung beim KI-Training ein

„You Only Compute Once" (YOCO) garantiert, 90 % der Fehler beim KI-Training ohne Verlust des Fortschritts zu beheben - andernfalls erhalten Kunden eine Gutschrift

Textgröße:

PALO ALTO, Kalifornien / ACCESS Newswire / 1. Juli 2026 / Clockwork.io, Pionier im Bereich Software-Driven AI Fabrics und Entwickler der TorchPass-KI-Fehlertoleranz, hat heute die YOCO Guarantee vorgestellt - die branchenweit erste vertragliche Verpflichtung, die versteckten, sich summierenden Kosten von Trainingsfehlern in groß angelegten KI-Infrastrukturen drastisch zu senken. Die Ankündigung markiert einen Wendepunkt in der Art und Weise, wie die KI-Branche die Zuverlässigkeit von Infrastrukturen misst - weg von Verfügbarkeitskennzahlen, die für eine frühere Ära konzipiert waren, hin zu den Zielen, die KI-Teams am meisten schätzen: ob der Trainingsjob pünktlich und ohne Datenverlust abgeschlossen wird.

Im Rahmen der YOCO (You Only Compute Once) Guarantee verpflichtet sich Clockwork.io, dass mindestens 90 % der Trainingsausfälle bei unterstützten TorchPass-Workloads durch eine Live-GPU-Migration behoben werden - ohne Verlust des Trainingsfortschritts, ohne Rollback auf einen Checkpoint und ohne erneute Berechnung. Sollte Clockwork.io diese Verpflichtung in einem Vertragsjahr nicht erfüllen, erhalten Kunden eine Gutschrift in Höhe von 25 % auf ihre nächste TorchPass-Verlängerung oder -Erweiterung.

„Wir haben TorchPass entwickelt, um Trainingsfehler irrelevant zu machen", sagte Suresh Vasudevan, CEO von Clockwork.io. „Die YOCO Guarantee ist eine Klausel im Vertrag. Wir gehen ins Risiko, weil wir wissen, dass TorchPass hält, was es verspricht, und wir möchten, dass unsere Kunden das auch wissen."

Die versteckte Steuer auf den KI-Fortschritt

Jedes KI-Unternehmen, das in großem Maßstab trainiert, sieht sich mit derselben brutalen Realität konfrontiert: GPU-Cluster fallen ständig aus, und jeder Ausfall löst einen kostspieligen Neustartzyklus aus. Laut einer von Meta FAIR auf der HPCA 2025 veröffentlichten Studie beträgt die mittlere Zeit bis zum Ausfall bei einem Cluster mit 1.024 GPUs nur 7,9 Stunden - und bei 16.384 GPUs sinkt dieser Wert auf 1,8 Stunden. Jeder Ausfall zwingt die Teams dazu, Ersatzknoten bereitzustellen, den Zustand des letzten Checkpoints wiederherzustellen und jeden Trainingsschritt seit diesem Checkpoint neu zu berechnen. Diese Neuberechnung kostet den vollen Preis der GPUs - Rechenleistung, für die Sie bereits bezahlt haben, wird von Grund auf neu ausgeführt. Der Zyklus kostet typischerweise drei oder mehr Stunden Fortschritt pro Ausfallereignis, wobei sich die Verluste täglich summieren.

Die Folge ist, dass aktuelle GPU-Cluster effektiv nur mit 30-50 % ihrer theoretischen Leistung arbeiten - nicht, weil die Hardware langsam ist, sondern weil das sie steuernde Zuverlässigkeitsframework nie für Workloads dieser Art, Dauer oder Größenordnung konzipiert wurde.

„KI-Teams brauchen fertige Modelle, nicht Knoten, die in Betrieb sind. Die Branche hat bisher die Betriebszeit der Knoten gemessen und dies als Zuverlässigkeit bezeichnet. YOCO macht uns für das einzig Wichtige verantwortlich - Ihr fertiges Modell", sagte Vasudevan.

Die finanziellen Folgen sind gravierend. In einer typischen H200-Bereitstellung mit 2.048 GPUs verursachen ausfallbedingte Neustarts jährlich über 6 Millionen Dollar an verschwendeter Rechenleistung - Hunderttausende von GPU-Stunden gehen durch kaskadierende Wiederholungsversuche, Leerlaufzeiten bei der Wiederherstellung und neu berechnete Trainingsschritte verloren. Für KI-Entwickler ist die eigentliche Werteinheit nicht die GPU-Verfügbarkeit, sondern die Zeit bis zum trainierten Modell - doch der Vertrag für die Infrastruktur, den sie abschließen, garantiert die Verfügbarkeit der Knoten, nicht die Kontinuität der Jobs. Für KI-Betreiber ist diese Lücke ebenso kostspielig: Wenn der Trainingsjob eines Kunden fehlschlägt, neu gestartet wird und Tage an Fortschritt verloren gehen, entsteht der Eindruck von Unzuverlässigkeit - unabhängig davon, was das SLA technisch vorsieht.

„Neuberechnung und Neustart sind die versteckten Kosten des groß angelegten Trainings", sagte Vasudevan. „Die meisten Teams betrachten dies als unvermeidbar. Das ist es aber nicht."

Die YOCO Guarantee ändert diesen Vertrag.

TorchPass: Zuverlässigkeit in der Software neu definiert

Die Antwort von Clockwork.io besteht darin, Zuverlässigkeit zu einer softwaredefinierten Eigenschaft zu machen, anstatt sie von der Verfügbarkeit der Hardware abhängig zu machen - ein grundlegendes architektonisches Umdenken, das die Kontinuität von Jobs von der Ausfallrate einzelner Komponenten entkoppelt.

TorchPass bekämpft Ausfälle an der Wurzel durch Live-GPU-Migration - wenn ein Fehler auftritt, überträgt TorchPass den vollständigen In-Memory-Zustand des Trainingsjobs, einschließlich Modellgewichten, Gradienten und Optimiererstatus, auf einen funktionsfähigen Ersatzknoten. Das Training wird genau dort fortgesetzt, wo es unterbrochen wurde, wobei die Wiederherstellung in der Regel in etwa drei Minuten abgeschlossen ist. Keine Wiederherstellung von Checkpoints. Keine Neuberechnung. Kein Verlust des Fortschritts.

TorchPass bewältigt drei Arten von Ausfällen: ungeplante Migration bei plötzlichen, katastrophalen Fehlern - Kernel-Abstürze, Stromausfälle, GPU-Ausfälle -, bei denen der Zustand aus fehlerfreien Replikaten rekonstruiert wird; präventive Migration, ausgelöst durch Frühwarnsignale wie steigende ECC-Fehlerraten oder thermische Schwellenwerte, die eine kontrollierte Übergabe ermöglichen, bevor ein Ausfall eintritt; sowie geplante Migration für proaktive Wartung, Sicherheitspatches und Firmware-Updates, die eine Infrastrukturpflege ohne Unterbrechung des Trainings ermöglicht. In allen drei Szenarien wird der Job niemals unterbrochen.

Dieser Ansatz reduziert den Verlust an Trainingsfortschritt um 90 % und senkt die Ausfallzeit in einem Cluster mit 1.024 GPUs von etwa drei Stunden pro Tag auf unter zehn Minuten - was bedeutet, dass Forschungsteams nicht mehr feststellen müssen, dass stundenlange Fortschritte unbemerkt verloren gegangen sind, und dass die Zeitpläne für die Veröffentlichung von Modellen vorhersehbar statt nur probabilistisch werden.

In unabhängigen Tests, die von SemiAnalysis, einem führenden Forschungsunternehmen für KI-Infrastruktur, durchgeführt wurden, übertraf TorchPass jedes konkurrierende Fehlertoleranz-Framework - es ist die einzige Lösung, die „die gleiche Trainingsleistung wie Jobs ohne Fehlertoleranz aufrechterhält".

TorchPass ist zu 100 % softwarebasiert, läuft in Cloud- und On-Premises-Umgebungen und unterstützt gängige Trainings-Frameworks wie TorchTitan, Megatron-LM und DeepSpeed auf Schedulern wie Kubernetes und Slurm. Es funktioniert sowohl auf NVIDIA- als auch auf AMD-Hardware sowie über InfiniBand-, RoCE- und Ethernet-Fabrics - ohne jegliche Hardware-Bindung.

Warum die Garantie den Markt verändert

Für KI-Entwickler definiert sie die SLA neu, die sie einfordern sollten. Die Frage lautet nicht mehr „Wie hoch ist die Verfügbarkeit Ihrer Knoten?", sondern „Wie viel Prozent meiner Trainingsfehler werden behoben, ohne dass der Fortschritt verloren geht?" - eine Kennzahl, die direkt mit dem GPU-ROI verknüpft ist, und nicht eine Verfügbarkeitsrate, die in der Vergangenheit kaum einen Einfluss darauf hatte, ob Modelle rechtzeitig trainiert wurden. Die YOCO Guarantee macht diese Frage beantwortbar und überprüfbar.

Für KI-Betreiber legt sie die Messlatte im Wettbewerb höher. KI-Cloud-Betreiber und Infrastrukturanbieter, die Kontinuitätsgarantien auf Job-Ebene anbieten können - gestützt durch vertragliche Gutschriften -, werden Premiumpreise durchsetzen, Kunden gewinnen, die durch Neustarts verursachte Verluste geschädigt wurden, und ihre Margen schützen, indem sie die Leerlaufzeit ihrer GPUs drastisch reduzieren. Diejenigen, die dazu nicht in der Lage sind, werden sich in einem sich zunehmend standardisierten Markt nur noch über den reinen GPU-Preis im Wettbewerb behaupten müssen.

Und für die Branche insgesamt setzt sie einen neuen Standard für die Rechenschaftspflicht. Der Markt für KI-Infrastruktur hat die Behauptungen der Anbieter zur Fehlertoleranz lange Zeit ungeprüft hingenommen, ohne dass dahinter vertragliche Verpflichtungen standen. Die YOCO Guarantee - messbar und vertraglich abgesichert - führt einen Standard ein, von dem der Markt zunehmend erwarten wird, dass andere ihn erfüllen oder erklären, warum sie dazu nicht in der Lage sind.

„Es besteht ein großer Unterschied zwischen einem Anbieter, der eine Folie erstellt, auf der steht, dass sein Produkt funktioniert, und einem, der dies in einen Vertrag aufnimmt", sagte Jordan Nanos, technischer Mitarbeiter und Hauptautor von ClusterMAX bei SemiAnalysis. „In unseren Tests lieferte TorchPass bei einem GPT-OSS-120B-Trainingslauf auf einem 64x-H200-Cluster die schnellste und effizienteste fehlertolerante Leistung im Vergleich zu Checkpoint-Restart, gemessen an der Job-Abschlusszeit. TorchPass übertraf bei diesem Job auch TorchFT (gemessen an MFU und Tokens/Sek./GPU), während die Wiederherstellungszeit gleich blieb. Die YOCO Guarantee spiegelt lediglich wider, was wir in den Tests festgestellt haben, und verankert dies vertraglich."

„Jedes Unternehmen, das groß angelegte KI-Trainings durchführt, kennt die Kosten eines fehlgeschlagenen Jobs: verlorene Arbeitsstunden, in Rechnung gestellte Neuberechnungen, Verzögerungen im Modellzeitplan. Jede Produktentscheidung, die wir bei Scaleway treffen, läuft auf eine Frage hinaus: Machen wir die Ergebnisse unserer Kunden vorhersehbarer? Die Verfügbarkeit der Knoten beantwortet eine ganz andere Frage. Die YOCO Guarantee ist die erste Infrastrukturzusage, die wir kennen, die auf der richtigen Kennzahl basiert - nämlich darauf, ob der Fortschritt gesichert ist und die Jobs bis zum Abschluss weiterlaufen, und nicht darauf, ob die Hardware in Betrieb bleibt. Das ist das Modell der Rechenschaftspflicht, das dem KI-Infrastrukturmarkt bisher gefehlt hat", sagte Fred Bardolle, Leiter für Produkte und KI bei Scaleway.

Verfügbarkeit

Die YOCO Guarantee steht neuen und verlängernden TorchPass-Kunden ab dem 3. August 2026 zur Verfügung. Bestehende TorchPass-Kunden sollten sich an ihr Clockwork.io-Kundenteam wenden, um die Aufnahme der Garantie in ihren aktuellen Vertrag zu besprechen. Um mehr zu erfahren oder loszulegen, besuchen Sie clockwork.io/yoco.

Clockwork.io ist vom 8. bis 9. Juli auf dem RAISE Summit in Paris, Frankreich, am Stand Nr. 27A vertreten. Suresh Vasudevan, CEO von Clockwork.io, wird außerdem am 8. Juli um 10:40 Uhr Ortszeit auf der Hauptbühne an der Podiumsdiskussion „Infrastruktur als Schicksal: Die Compute-Capital-Cloud-Trinität" teilnehmen.

Über Clockwork.io

Clockwork.io ist Vorreiter bei Software-Driven AI Fabrics - einer programmierbaren Schicht zwischen Hardware und Workload, die nanosekundengenaue Telemetrie, KI-Fehlertoleranz und Leistungsoptimierung über alle Beschleuniger, Netzwerke und Bereitstellungsmodelle hinweg bietet. Moderne KI-Workloads erfordern, dass der gesamte Cluster wie eine einzige Maschine agiert, doch Ausfälle und Infrastrukturengpässe beeinträchtigen die Effizienz erheblich. Die FleetIQ-Plattform von Clockwork.io stellt diese verlorene Kapazität wieder her und ermöglicht es Unternehmen, die anspruchsvollsten KI-Workloads der Welt schneller, zuverlässiger und kostengünstiger zu trainieren, bereitzustellen und auszuführen - über jede Ethernet-, RoCE- oder InfiniBand-Struktur hinweg, ohne Hardware-Bindung. TorchPass, das KI-Fehlertoleranzprodukt von Clockwork.io, wurde von SemiAnalysis in unabhängigen Benchmarks als einzige Lösung bewertet, die bei Ausfällen den vollen Trainingsdurchsatz aufrechterhält und dabei Checkpoint-Restart sowie führende Open-Source-Frameworks übertrifft. Uber, Wells Fargo, DCAI, Nebius, NScale und White Fiber vertrauen auf Clockwork.io zur Unterstützung ihrer KI-Infrastruktur. Erfahren Sie mehr unter www.clockwork.io

© 2026 Clockwork Systems Inc. TorchPass und YOCO Guarantee sind Marken von Clockwork Systems Inc. Alle anderen Marken sind Eigentum ihrer jeweiligen Inhaber.

Medienkontakt

Dana Trismen
[email protected]
650-269-7478

QUELLE: Clockwork

Hinweis/Disclaimer zur Übersetzung (inkl. KI-Unterstützung): Die Originalmeldung in der Ausgangssprache (in der Regel Englisch) ist die einzige maßgebliche, autorisierte und rechtsverbindliche Fassung. Diese deutschsprachige Übersetzung/Zusammenfassung dient ausschließlich der leichteren Verständlichkeit und kann gekürzt oder redaktionell verdichtet sein. Die Übersetzung kann ganz oder teilweise mithilfe maschineller Übersetzung bzw. generativer KI (Large Language Models) erfolgt sein und wurde redaktionell geprüft; trotzdem können Fehler, Auslassungen oder Sinnverschiebungen auftreten. Es wird keine Gewähr für Richtigkeit, Vollständigkeit, Aktualität oder Angemessenheit übernommen; Haftungsansprüche sind ausgeschlossen (auch bei Fahrlässigkeit), maßgeblich ist stets die Originalfassung. Diese Mitteilung stellt weder eine Kauf- noch eine Verkaufsempfehlung dar und ersetzt keine rechtliche, steuerliche oder finanzielle Beratung. Bitte beachten Sie die englische Originalmeldung bzw. die offiziellen Unterlagen auf www.sedarplus.ca, www.sec.gov, www.asx.com.au oder auf der Website des Emittenten; bei Abweichungen gilt ausschließlich das Original.

S.Rocha--TFWP