Tecnologia AI90 Revoluciona Desempenho de Inferência em GPUs com SSDs

A GenStorAIGE apresenta a plataforma AI90, que transforma o desempenho de inferência de GPUs RTX 5090, utilizando SSDs para expandir a capacidade de memória efetiva.

Tecnologia AI90 Revoluciona Desempenho de Inferência em GPUs com SSDs

A GenStorAIGE revelou sua nova plataforma de aceleração de inferência, chamada AI90, durante o WAIC 2026. Esta tecnologia promete transformar o desempenho de oito GPUs RTX 5090, fazendo com que funcionem como se fossem um cluster de 46 GPUs em tarefas de inferência.

A inovação se baseia na utilização de SSDs ultra-rápidos para expandir a capacidade de memória efetiva, superando as limitações tradicionais da memória de alta largura de banda (HBM) das GPUs.

A plataforma AI90 adota uma abordagem centrada no armazenamento, integrando unidades de estado sólido (SSDs) PCIe Gen5 diretamente na hierarquia de memória. Isso permite que partes do cache de chave-valor (KV Cache) utilizado por modelos de linguagem grandes sejam armazenadas fora da memória da GPU, aumentando assim a eficiência e a capacidade de processamento.

A importância dessa tecnologia reside na sua capacidade de lidar com cargas de trabalho de inferência exigentes, reduzindo a pressão sobre a memória da GPU e permitindo o processamento de contextos muito maiores. A arquitetura de memória em três camadas da AI90 combina HBM, DRAM do sistema e SSDs, proporcionando uma estrutura unificada que melhora significativamente o desempenho.

Os resultados são impressionantes: a GenStorAIGE afirma que a AI90 pode reduzir a latência do primeiro token de vários segundos para menos de um segundo em configurações suportadas. Além disso, a plataforma oferece um aumento de até 50 vezes na velocidade de resposta e uma melhoria de 5,1 vezes na taxa de transferência, ao mesmo tempo em que reduz o uso de memória da GPU em cerca de 39%.

Com a comunicação inteligente entre GPUs, a AI90 pode acelerar a inferência em até 5,8 vezes em sistemas que utilizam oito placas Nvidia GeForce RTX 5090. Essa capacidade de multiplicação efetivamente transforma uma configuração de oito placas em um sistema que se comporta como um cluster de 46 GPUs durante tarefas de inferência sustentadas.

Outro aspecto notável da AI90 é sua capacidade de suportar janelas de contexto que excedem 128.000 tokens, permitindo o processamento de documentos muito maiores e a gestão de conversas complexas sem esgotar a memória disponível. Essa característica é crucial para aplicações que exigem um alto nível de detalhe e continuidade nas interações.

Para suportar as demandas intensivas de gravação geradas pelas atualizações constantes do KV Cache, a GenStorAIGE desenvolveu o SSD PT200Z. Este SSD, construído com flash NAND pSLC e conectado através de uma interface PCIe Gen5 x4, oferece velocidades de leitura sequencial de até 14,8 GB/s. Além disso, o desempenho de leitura aleatória atinge aproximadamente 3,1 milhões de IOPS, com latências de leitura e gravação extremamente baixas.

A durabilidade do PT200Z é projetada para suportar até 100 gravações diárias, tornando-o adequado para cargas de trabalho de IA em ambientes empresariais que exigem dados em constante mudança. Essa abordagem reflete uma tendência mais ampla na infraestrutura de IA, onde a escalabilidade da memória se torna cada vez mais crítica à medida que os modelos de linguagem grandes superam os limites práticos da HBM das GPUs.

Integrar armazenamento SSD extremamente rápido nas pipelines de inferência é uma estratégia eficaz para aumentar a capacidade de contexto sem a necessidade de adicionar mais GPUs ou aumentar as configurações de HBM. No entanto, a validade das alegações de desempenho ainda precisa ser verificada em condições de teste independentes, uma vez que os números apresentados são provenientes diretamente da GenStorAIGE.

Os executivos e profissionais de tecnologia devem observar essas inovações com atenção, pois elas podem redefinir as expectativas em relação ao desempenho de inferência em sistemas de IA. A capacidade de processar grandes volumes de dados de forma rápida e eficiente pode abrir novas oportunidades em diversos setores, desde o atendimento ao cliente até a análise de dados complexos.

A AI90 representa um avanço significativo na forma como as cargas de trabalho de IA são geridas, destacando a importância de soluções que vão além das limitações tradicionais da memória de GPU. À medida que a demanda por inteligência artificial continua a crescer, tecnologias como essa podem se tornar fundamentais para empresas que buscam se manter competitivas.

Em resumo, a GenStorAIGE está na vanguarda de uma mudança paradigmática na infraestrutura de IA, oferecendo soluções que não apenas melhoram o desempenho, mas também ampliam as capacidades de processamento de dados. A AI90 é um exemplo claro de como a inovação tecnológica pode transformar o cenário da inteligência artificial, proporcionando às empresas ferramentas mais poderosas para enfrentar os desafios do futuro.

A adoção de tecnologias como a AI90 pode ser um divisor de águas para empresas que dependem de inferência em tempo real e processamento de grandes volumes de dados. A capacidade de escalar eficientemente sem a necessidade de investimentos massivos em hardware adicional é uma vantagem competitiva que não pode ser subestimada.

Portanto, a GenStorAIGE não apenas introduziu uma nova tecnologia, mas também lançou um novo padrão para o que é possível em termos de desempenho de inferência em inteligência artificial. As implicações para o mercado são vastas, e as empresas que adotarem essas inovações estarão melhor posicionadas para prosperar em um ambiente cada vez mais orientado por dados.