Publicado 05/10/2026 17:42
- Comunicado -

Clockwork.io recauda 31 millones de dólares (2)

(Información remitida por la empresa firmante)

-Clockwork.io recauda 31 millones de dólares; LinkedIn, Together AI y WhiteFiber adoptan su software de resiliencia para evitar el desperdicio de horas de GPU

LinkedIn evita decenas de miles de horas de inactividad de la GPU mensualmente; las nuevas innovaciones de TorchPass preservan el progreso de la carga de trabajo de IA sin cambios de código y aceleran el aprendizaje por refuerzo.

PALO ALTO, California, 5 de octubre de 2026 /PRNewswire/ -- Clockwork.io, cuyo software de tolerancia a fallos mantiene en funcionamiento las cargas de trabajo de entrenamiento de IA, aprendizaje por refuerzo e inferencia ante fallos de infraestructura, anunció hoy una nueva financiación de 31 millones de dólares, despliegues en producción en LinkedIn y Together AI, y una mayor adopción por parte de WhiteFiber.

La empresa también presentó dos nuevas funcionalidades para su solución TorchPass, cada una de las cuales captura el estado de una tarea de IA distribuida en ejecución. Las instantáneas de plataforma multimodo, una primicia en el sector para la formación, guardan la tarea completa en todos los nodos sin necesidad de modificar el código de entrenamiento y la preservan para su posterior recuperación. Por su parte, los puntos de control de aplicación rápidos y asíncronos, que se realizan en segundo plano mientras la tarea está en curso, aceleran el aprendizaje por refuerzo. Estos suministran pesos del modelo actualizados a las réplicas de inferencia encargadas de generar los rollouts, los ejemplos a partir de los cuales aprende el modelo, lo que permite que dichas réplicas pasen menos tiempo esperando o trabajando con un modelo desactualizado.

La tolerancia a fallos se ha convertido en un requisito para la IA a gran escala

Las grandes cargas de trabajo de IA distribuida pueden abarcar miles de GPU que deben mantenerse sincronizadas: el fallo de una sola GPU, la interrupción de un enlace o el bloqueo de un servidor pueden paralizar la tarea por completo. Meta informó de interrupciones inesperadas con una frecuencia media aproximada de una cada tres horas durante un periodo de 54 días de entrenamiento de Llama 3 utilizando 16.384 GPU.

La respuesta habitual consiste en recargar un punto de control, es decir, una copia guardada del progreso de la tarea. El proceso de recuperación puede durar hasta 90 minutos, deja inactivas las GPU que funcionan correctamente y obliga a repetir el trabajo realizado desde dicho punto de control. Los clientes pagan por GPU ociosas y por cálculos redundantes, y los modelos tardan más en completarse. A medida que las tareas aumentan de tamaño, cada reinicio pone en riesgo una mayor cantidad de tiempo de uso de las GPU.

A esta escala, garantizar la continuidad del trabajo útil a pesar de los fallos es un requisito de infraestructura. Clockwork.io satisface esta necesidad mediante un conjunto de herramientas de tolerancia a fallos que los equipos de plataforma despliegan como una capa intermedia entre el hardware y la carga de trabajo. LinkPass redirige el tráfico para evitar el enlace averiado, de modo que la tarea no llega a detectar el fallo. TorchPass transfiere la carga de trabajo de una GPU defectuosa a una operativa, permitiendo que el entrenamiento continúe sin necesidad de retroceder a un estado anterior. Ambas soluciones están ya en fase de producción. La nueva funcionalidad de snapshots de plataforma de TorchPass, anunciada hoy, captura el estado de una tarea distribuida en ejecución; esto permite restaurar la tarea completa cuando el fallo es demasiado grave para solucionarlo mediante una simple migración.

"Los fallos son inevitables a la escala de la IA; perder horas de trabajo útil debido a ellos no debería ocurrir", afirmó Suresh Vasudevan, consejero delegado de Clockwork.io. "La tolerancia a fallos actúa como un multiplicador del rendimiento útil: permite que las GPU sigan realizando trabajo productivo en lugar de esperar a procesos de recuperación o repetir tareas ya completadas. Desarrollamos nuestro software en colaboración con empresas y proveedores de nube que operan algunas de las mayores flotas de GPU, por lo que es capaz de gestionar los fallos que realmente experimentan. Esa protección debe formar parte de la infraestructura de la que dependen a diario dichas empresas y proveedores".

La adopción se extiende a empresas, hiperescaladores y neoclouds

Las empresas que gestionan sus propias flotas de GPU, así como los hiperescaladores y los proveedores de "neocloud", están adoptando Clockwork.io por la misma razón: logran que una mayor parte de sus horas de GPU se destine a trabajo útil.

LinkedIn ha implementado la tolerancia a fallos de red LinkPass en toda su flota de infraestructura de IA, evitando así la pérdida de decenas de miles de horas de GPU por inactividad cada mes.

"A escala de infraestructura de IA, un único problema de red nunca debería dejar fuera de servicio a GPUs que funcionan correctamente ni interrumpir las cargas de trabajo en ejecución. Antes de Clockwork.io, una oscilación en InfiniBand NIC podía retirar del servicio un servidor con ocho GPU, mientras que una oscilación en el puerto de un conmutador podía dejar inoperativo un segundo servidor, duplicando el impacto a 16 GPU", afirmó Raghu Hiremagalur, vicepresidente sénior y director de tecnología de Infraestructura en LinkedIn. "Clockwork.io ayudó a transformar ese modelo operativo. Su tecnología de tolerancia a fallos de red redirige automáticamente el tráfico hacia rutas operativas, permitiendo que las tareas continúen sin interrupciones mientras se reparan los fallos en enlaces, componentes ópticos, cables o tarjetas de red. En conjunto, Clockwork.io evita decenas de miles de horas de inactividad de GPU al mes en toda nuestra flota. Al convertir lo que antes eran incidentes operativos disruptivos en eventos de mantenimiento manejables, Clockwork.io ha contribuido a mejorar la utilización de la infraestructura y la eficiencia operativa".

Together AI lanza TorchPass al mercado como un servicio en sus clústeres de GPU. Durante la conferencia PyTorch, ambas empresas realizarán una demostración en vivo de una tarea de entrenamiento multinodo que continúa ejecutándose —sin necesidad de reinicio— a pesar de la introducción deliberada de fallos en la red y en las GPU.

"Nuestros clientes nos evalúan en función del goodput, es decir, la proporción de sus horas de GPU que realmente hacen avanzar el modelo", afirmó Pavneet Ahluwalia, responsable de producto de Together AI. "La función de reparación de nodos ya detecta fallos y aprovisiona capacidad de sustitución de forma automática. Las soluciones TorchPass y LinkPass de Clockwork.io se basan en esa infraestructura y están diseñadas para mantener la ejecución de las tareas a pesar de los fallos de GPU y de enlace, preservando así el progreso realizado. Las estamos lanzando al mercado como la siguiente capa de resiliencia de la plataforma".

WhiteFiber (NASDAQ: WYFI), cliente actual de la compañía, está ampliando el uso del software de Clockwork.io en su creciente infraestructura global de GPU como servicio.

"Someter a pruebas de estrés la fiabilidad de un clúster antes de que pase a producción es fundamental, ya que el cliente que recibe un sistema con un fallo oculto en la red de interconexión acaba pagando las consecuencias en forma de trabajos fallidos y horas de GPU perdidas", afirmó Tom Sanfilippo, director de tecnología de WhiteFiber. "Componentes ópticos de calidad marginal, tarjetas de red (NIC) mal configuradas y enlaces que superan una prueba básica pero se degradan bajo carga pueden pasar desapercibidos. La auditoría automatizada de flotas de Clockwork.io valida simultáneamente cada enlace y nodo, localiza fallos en cuestión de minutos y nos permite corregirlos antes de la entrega. Ponemos los clústeres en marcha con mayor rapidez, de modo que la primera ejecución de entrenamiento del cliente se realiza sobre una red validada de extremo a extremo, y no simplemente sobre un sistema encendido. Dada la vertiginosa demanda del mercado, ofrecer a los clientes capacidad validada con rapidez es crucial para nuestro negocio; por eso estamos implementando Clockwork.io en todos nuestros clústeres".

Las nuevas funcionalidades de TorchPass ponen la protección de las cargas de trabajo en manos de los equipos de plataforma

Clockwork.io ha ampliado las capacidades de TorchPass más allá de la migración de GPU, incorporando dos funciones de las que los equipos de plataforma carecían hasta ahora: la posibilidad de generar ellos mismos una instantánea de todo un trabajo distribuido y puntos de control de la aplicación lo suficientemente rápidos como para ejecutarse en segundo plano.

En el caso del entrenamiento, las instantáneas de la plataforma guardan el estado de ejecución de un trabajo en curso en todos sus nodos, permitiendo así restaurarlo tras una interrupción. Los equipos de plataforma e ingenieros de infraestructura de IA implementan esta solución para cargas de trabajo compatibles sin necesidad de que los propietarios de las aplicaciones modifiquen su código o añadan lógica de puntos de control. Los equipos empresariales pueden proteger los trabajos de entrenamiento en toda su flota mediante un único mecanismo, y los proveedores de nube pueden proteger los trabajos de los clientes cuyo código no controlan. Cuando los equipos implementan puntos de control a nivel de aplicación, la rapidez de los puntos de control de TorchPass permite realizarlos con mayor frecuencia; de este modo, se pierde menos progreso y se repite menos trabajo de cómputo tras un fallo.

En cuanto a la inferencia, los modelos de gran tamaño se ejecutan en dos o más servidores, por lo que un fallo en un enlace puede inutilizar una réplica completa e interrumpir una sesión de usuario o una tarea de agente en plena ejecución. LinkPass permite que dichas réplicas multiservidor sigan operativas a pesar de los fallos en los enlaces.

El aprendizaje por refuerzo depende tanto del entrenamiento como de la inferencia. Varias copias del modelo generan secuencias de ejecución, el sistema de entrenamiento aprende de ellas y los pesos actualizados deben llegar a las copias antes de que estas puedan generar resultados con la versión más reciente. Los puntos de control de aplicación de TorchPass transfieren los pesos actualizados a las réplicas de ejecución con mayor rapidez, mientras que LinkPass mantiene dichas réplicas en funcionamiento a pesar de los fallos en los enlaces.

"La tolerancia a fallos en clústeres solía ser un problema exclusivo del entrenamiento; ahora es también un problema de inferencia", afirmó Dylan Patel, fundador, consejero delegado y analista principal de SemiAnalysis, empresa cuyas clasificaciones ClusterMAX evalúan a los proveedores de servicios en la nube basados en GPU. "En nuestras pruebas ClusterMAX, TorchPass reduce la pérdida de rendimiento efectivo durante el entrenamiento del 14 % a menos del 3 % en un proveedor neocloud con calificación "oro". El aprendizaje por refuerzo (RL) vincula ambos procesos: las réplicas de inferencia generan simulaciones, el sistema de entrenamiento aprende de ellas y los pesos actualizados regresan a las réplicas. Clockwork.io permite que las réplicas sigan operando a pesar de las fluctuaciones de enlace y los fallos de red. Sus puntos de control ultrarrápidos aceleran la transferencia de pesos de vuelta a la flota de inferencia, evitando así que el proceso se detenga en cualquiera de las dos direcciones. La solución debe implementarse mediante una capa de tolerancia a fallos común para el entrenamiento, la inferencia y el aprendizaje por refuerzo".

Los equipos de plataformas empresariales y los proveedores de servicios en la nube pueden ponerse en contacto con Clockwork.io para evaluar el software en sus cargas de trabajo o explorar oportunidades de colaboración.

La ronda de financiación y su destino

La ronda fue coliderada por Premji Invest, Wing Venture Capital y Seligman Ventures, con la participación de los inversores actuales NEA y e& Capital. Con esto, la financiación total de Clockwork.io alcanza los 73 millones de dólares. La empresa utilizará el capital para acelerar el despliegue de su conjunto de herramientas de tolerancia a fallos —aplicable a las fases de entrenamiento, inferencia y aprendizaje por refuerzo—, ampliar su adopción empresarial y escalar la entrega a través de socios en la nube.

"Lo único que escala a la perfección es la falta de fiabilidad: basta con instalar suficientes GPU en una máquina para que siempre haya algo fallando", afirmó Greg Papadopoulos, socio de capital riesgo de NEA. "El método tradicional —detener la tarea y recargar un punto de control— carece de sentido a la escala actual. Clockwork considera el fallo como el estado habitual: TorchPass migra en tiempo real el entrenamiento desde una GPU que presenta errores y ahora permite capturar el estado de toda una tarea en ejecución sin necesidad de modificar el código. Ya está ahorrando decenas de miles de horas de GPU al mes. Apostamos por Clockwork.io en 2021 y estamos encantados de seguir apoyándolos mientras definen la capa de rendimiento de los clústeres de IA".

Acerca de Clockwork.io

Clockwork.io es pionera en Software-Driven AI Fabrics™, una capa programable situada entre el hardware y la carga de trabajo que permite que los clústeres de GPU sean observables, tolerantes a fallos y aprovechen al máximo su capacidad, independientemente del acelerador, la red o la nube utilizados. Las cargas de trabajo de IA requieren que todo el clúster funcione como una única máquina; sin embargo, los fallos y los cuellos de botella dejan las GPU inactivas. La plataforma FleetLens de Clockwork.io recupera esa capacidad perdida: gracias a una telemetría con precisión de nanosegundos, identifica exactamente qué GPU, nodo o enlace está ralentizando o bloqueando una tarea y valida los clústeres antes de su puesta en marcha. Además, mediante LinkPass y TorchPass, garantiza la continuidad de las cargas de trabajo —desde el entrenamiento hasta la inferencia— incluso ante fallos o degradaciones de la infraestructura. Según pruebas comparativas independientes realizadas por SemiAnalysis, TorchPass supera a los principales marcos de trabajo de código abierto y a los métodos tradicionales de punto de control y reinicio en cuanto a la velocidad de recuperación ante fallos. Empresas como LinkedIn, Together AI, WhiteFiber, Wells Fargo, Nebius, NScale y DCAI confían en Clockwork.io para impulsar su infraestructura de IA. Más información en www.clockwork.io.

Contador

Contenido patrocinado