opción
Hogar
Noticias
La expansión de la IA agencial exige sistemas de memoria avanzados

La expansión de la IA agencial exige sistemas de memoria avanzados

23 de febrero de 2026
205

La IA agencial supone un cambio significativo, pasando de los simples chatbots a la gestión de flujos de trabajo complejos, y su escalabilidad exige un nuevo enfoque de la arquitectura de la memoria.

A medida que los modelos básicos crecen hasta alcanzar billones de parámetros y las ventanas de contexto se amplían a millones de tokens, el coste computacional de conservar el historial está superando nuestra capacidad para procesarlo de forma eficaz.

Las organizaciones que implementan estos sistemas se enfrentan ahora a un cuello de botella en el que el inmenso volumen de «memoria a largo plazo» (técnicamente, la caché de clave-valor (KV)) supera las capacidades de los diseños de hardware actuales.

La infraestructura existente ofrece opciones limitadas: almacenar el contexto de inferencia en la escasa memoria de GPU de alto ancho de banda (HBM) o trasladarlo a un almacenamiento más lento y de uso general. La primera opción resulta demasiado costosa para contextos grandes, mientras que la segunda introduce una latencia que hace que las interacciones agenticas en tiempo real sean poco prácticas.

Para salvar esta brecha creciente que dificulta la escalabilidad de la IA agencial, NVIDIA ha lanzado la plataforma Inference Context Memory Storage (ICMS) dentro de su arquitectura Rubin, introduciendo un nuevo nivel de almacenamiento creado específicamente para las demandas temporales y de alta velocidad de la memoria de IA.

«La IA está transformando toda la pila informática y, ahora, el almacenamiento», afirmó Huang. «La IA ha evolucionado más allá de los chatbots de respuesta única hasta convertirse en colaboradores inteligentes que comprenden el mundo físico, razonan durante largos periodos de tiempo, se basan en hechos, utilizan herramientas para tareas prácticas y mantienen la memoria a corto y largo plazo».

El problema operativo principal se deriva del funcionamiento de los modelos basados en transformadores. Para evitar tener que recalcular toda una conversación por cada nueva palabra generada, los modelos guardan los estados anteriores en la caché KV. En los flujos de trabajo agenticos, esta caché sirve como memoria persistente entre herramientas y sesiones, y se expande en proporción directa a la longitud de la secuencia.

Esto crea una categoría de datos única. A diferencia de los registros financieros o los registros de clientes, la caché KV es un dato derivado; es crucial para el rendimiento inmediato, pero no necesita las sólidas garantías de durabilidad de los sistemas de archivos empresariales. Los sistemas de almacenamiento de uso general, que funcionan con CPU estándar, consumen energía en la gestión y replicación de metadatos, de lo que no se benefician las cargas de trabajo agenticas.

La jerarquía existente, que va desde la GPU HBM (G1) hasta el almacenamiento compartido (G4), está demostrando ser cada vez más ineficiente:

(Crédito: NVIDIA)

A medida que los datos de contexto se trasladan de la GPU (G1) a la RAM del sistema (G2) y, finalmente, al almacenamiento compartido (G4), la eficiencia disminuye significativamente. La transferencia del contexto activo al nivel G4 introduce retrasos de milisegundos y aumenta el coste energético por token, lo que deja las costosas GPU inactivas mientras esperan los datos.

Para las empresas, esto se traduce en un mayor coste total de propiedad (TCO), ya que la energía se consume en la sobrecarga de la infraestructura en lugar de en tareas de razonamiento activas.

Un nuevo nivel de memoria para la fábrica de IA

La solución del sector consiste en añadir una capa personalizada a esta jerarquía. La plataforma ICMS crea un nivel «G3.5», una capa de almacenamiento flash conectada a Ethernet diseñada específicamente para la inferencia a gran escala.

Este método integra el almacenamiento directamente en el pod de computación. Al aprovechar el procesador de datos NVIDIA BlueField-4, la plataforma traslada la gestión de estos datos contextuales fuera de la CPU del host. El sistema ofrece petabytes de capacidad compartida por pod, lo que mejora la escalabilidad de la IA agencial al permitir que los agentes almacenen grandes cantidades de historial sin consumir costosa HBM.

La ventaja operativa es cuantificable tanto en rendimiento como en consumo energético. Al almacenar el contexto relevante en este nivel intermedio, que es más rápido que el almacenamiento estándar pero más asequible que la HBM, el sistema puede «precargar» la memoria en la GPU con antelación. Esto reduce el tiempo de inactividad del decodificador de la GPU, lo que permite hasta 5 veces más tokens por segundo (TPS) en cargas de trabajo de contexto largo.

Desde el punto de vista energético, las ventajas son igualmente significativas. Dado que la arquitectura elimina la sobrecarga de los protocolos de almacenamiento de uso general, consigue una eficiencia energética cinco veces superior a la de los enfoques convencionales.

Integración del plano de datos

La implementación de esta arquitectura requiere un cambio en la forma en que los equipos de TI perciben las redes de almacenamiento. La plataforma ICMS depende de NVIDIA Spectrum-X Ethernet para proporcionar la conectividad de alto ancho de banda y baja fluctuación necesaria para tratar el almacenamiento flash casi como si fuera memoria local.

Para los equipos de infraestructura empresarial, el punto clave de integración es la capa de orquestación. Marcos como NVIDIA Dynamo y la biblioteca de transferencia de inferencias (NIXL) gestionan el movimiento de bloques KV entre diferentes niveles.

Estas herramientas funcionan con la capa de almacenamiento para garantizar que el contexto correcto se cargue en la memoria de la GPU (G1) o en la memoria del host (G2) precisamente cuando el modelo de IA lo necesita. El marco NVIDIA DOCA lo respalda aún más al proporcionar una capa de comunicación KV que trata la caché de contexto como un recurso primario.

Los principales proveedores de almacenamiento ya están adoptando esta arquitectura. Empresas como AIC, Cloudian, DDN, Dell Technologies, HPE, Hitachi Vantara, IBM, Nutanix, Pure Storage, Supermicro, VAST Data y WEKA están desarrollando plataformas con BlueField-4. Se prevé que estas soluciones estén disponibles en la segunda mitad de este año.

Redefinición de la infraestructura para escalar la IA agencial

La adopción de un nivel de memoria contextual dedicado influye en la planificación de la capacidad y el diseño del centro de datos.

  • Reclasificación de datos: los directores de informática deben reconocer la caché KV como un tipo de datos distinto. Es «temporal pero sensible a la latencia», a diferencia de los datos de cumplimiento «duraderos y fríos». El nivel G3.5 gestiona los primeros, lo que permite que el almacenamiento G4 duradero se concentre en registros y artefactos a largo plazo.
  • Madurez de la orquestación: el éxito depende de un software que pueda asignar las cargas de trabajo de forma inteligente. El sistema utiliza una orquestación sensible a la topología (a través de NVIDIA Grove) para colocar los trabajos cerca de su contexto almacenado en caché, lo que reduce el movimiento de datos a través de la red.
  • Densidad de potencia: al incluir más capacidad útil en el mismo espacio de rack, las organizaciones pueden prolongar la vida útil de sus instalaciones actuales. Sin embargo, esto aumenta la densidad de cálculo por metro cuadrado, lo que requiere una planificación cuidadosa de la refrigeración y la distribución de energía.

El paso a la IA agencial requiere un rediseño físico del centro de datos. La práctica habitual de separar completamente la computación del almacenamiento lento y persistente no es adecuada para los requisitos de recuperación en tiempo real de los agentes con memorias extensas.

Al introducir un nivel de contexto especializado, las empresas pueden separar el crecimiento de la memoria del modelo del coste de la GPU HBM. Esta arquitectura de IA agencial permite que varios agentes compartan un gran pool de memoria de bajo consumo, lo que reduce el coste de gestionar consultas complejas y mejora la escalabilidad al admitir un razonamiento de alto rendimiento.

A medida que las organizaciones se preparan para su próxima ronda de inversión en infraestructura, evaluar la eficiencia de la jerarquía de memoria será tan importante como elegir la propia GPU.

Véase también: La guerra de los chips de IA en 2025: lo que los líderes empresariales aprendieron sobre la realidad de la cadena de suministro

¿Quiere saber más sobre la IA y el big data de la mano de los líderes del sector? Eche un vistazo a la AI & Big Data Expo que se celebra en Ámsterdam, California y Londres. Este completo evento forma parte de TechEx y se celebra junto con otros eventos tecnológicos de primer orden. Haga clic aquí para obtener más información.

AI News está impulsado por TechForge Media. Explore aquí otros eventos y seminarios web sobre tecnología empresarial que se celebrarán próximamente.

Artículo relacionado
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Recomendaciones de temas especiales relacionados
Análisis de datos Mejores herramientas de IA para la detección de anomalías en el monitoreo de KPIs para equipos de SaaS y comercio electrónico
Mejores herramientas de IA para la detección de anomalías en el monitoreo de KPIs para equipos de SaaS y comercio electrónico

¡Las mejores herramientas de detección de anomalías con IA de 2026, más valoradas y destacadas para el monitoreo de KPI en equipos de SaaS y comercio electrónico! XIX.AI ha recopilado una poderosa colección transformadora basada en rigurosas pruebas del mundo real y clasificaciones actualizadas semanalmente. Encontrarás comparaciones detalladas entre versiones gratuitas y de pago que te ayudarán a identificar la solución imprescindible para aumentar la productividad y desbloquear tu ventaja con IA. ¡Explora ahora!

10 herramientas
xix.ai
escribiendo Los mejores generadores de esquemas basados en IA para artículos largos optimizados para SEO
Los mejores generadores de esquemas basados en IA para artículos largos optimizados para SEO

Los mejores generadores de esquemas con IA mejor valorados de 2026 para artículos largos optimizados para SEO, seleccionados minuciosamente por XIX.AI. Estas potentes herramientas ofrecen una ayuda revolucionaria a la hora de crear contenido de alta calidad rápidamente, lo que aumenta considerablemente la eficiencia a la hora de escribir. Consigue una comparación entre las versiones gratuitas y de pago, junto con pruebas en condiciones reales y clasificaciones detalladas, que te ayudarán a encontrar la opción imprescindible que mejor se adapte a tus necesidades. Explora ahora para descubrir las ventajas que te ofrece la IA.

8 herramientas
xix.ai
Educación y aprendizaje Herramientas de estudio basadas en IA para los deberes y la preparación de exámenes
Herramientas de estudio basadas en IA para los deberes y la preparación de exámenes

¡Las mejores herramientas de IA de 2026 para hacer los deberes y prepararse para los exámenes! XIX.AI ha elaborado una lista con las herramientas mejor valoradas, potentes y revolucionarias que ayudan a los estudiantes a aumentar su productividad, agilizar la realización de los deberes y sacar sobresaliente en los exámenes gracias a pruebas reales. Consigue una comparación entre versiones gratuitas y de pago, clasificaciones detalladas y opciones imprescindibles para sacar el máximo partido a la IA. ¡Explora ahora!

10 herramientas
xix.ai
composicion musical Herramientas de demostración vocal con IA para compositores, ganchos, melodías principales y sesiones de borrador multilingüe
Herramientas de demostración vocal con IA para compositores, ganchos, melodías principales y sesiones de borrador multilingüe

¡Las mejores herramientas de demostración vocal con IA de 2026 para compositores, creadores de ganchos y equipos de contenido multilingüe! XIX.AI ha recopilado una lista de herramientas poderosas y transformadoras, rigurosamente probadas en el mundo real. Encontrarás datos detallados de comparación entre versiones gratuitas y de pago, clasificaciones completas y opciones imprescindibles para ayudarte a aumentar tu eficiencia de escritura y desbloquear todo tu potencial creativo. ¡Explora ahora para descubrir la herramienta perfecta para todas tus necesidades de contenido!

9 herramientas
xix.ai
Negocio Las mejores herramientas de investigación competitiva basadas en IA para pequeñas empresas
Las mejores herramientas de investigación competitiva basadas en IA para pequeñas empresas

¡Las mejores herramientas de investigación competitiva basadas en IA mejor valoradas de 2026 para pequeñas empresas! XIX.AI ha seleccionado una colección revolucionaria y muy potente, que se actualiza semanalmente con rigurosas pruebas en el mundo real y clasificaciones detalladas. Encontrarás una comparación exhaustiva entre las opciones gratuitas y las de pago que te ayudará a identificar las herramientas imprescindibles que impulsarán tu productividad y te proporcionarán una ventaja competitiva. ¡Explora ahora mismo y descubre la herramienta perfecta para ti!

9 herramientas
xix.ai
Edición de imágenes Herramientas de retoque con IA de Photoshop para ropa de comercio electrónico, limpieza de piel y consistencia del color
Herramientas de retoque con IA de Photoshop para ropa de comercio electrónico, limpieza de piel y consistencia del color

¡Las mejores herramientas de retoque con IA de Photoshop de 2026 para ropa de comercio electrónico, limpieza de piel y consistencia de color! Esta lista curada de alta calificación presenta soluciones poderosas que cambian las reglas del juego, que ayudan a aumentar la eficiencia de redacción, optimizar la creación de contenido y lograr resultados visuales perfectos sin esfuerzo. Cada herramienta ha pasado por pruebas en el mundo real a través de clasificaciones actualizadas semanalmente, con detalles completos de comparación entre versiones gratuitas y de pago. Respaldado por XIX.AI, es la guía imprescindible para cualquier persona que aspire a desbloquear su ventaja con IA. ¡Explora ahora!

10 herramientas
xix.ai
comentario (0)
0/500
OR