Morgan Stanley: Escassez de memória para IA deve durar vários anos; três caminhos para superar o impasse; armazenamento e computação heterogênea apresentam oportunidades estruturais
Morgan Stanley publicou um relatório de pesquisa sobre o setor de semicondutores, apontando que a escassez de memória DRAM irá persistir ao longo deste ciclo da indústria de IA, e a expansão da capacidade de processamento de IA não irá aguardar a construção e entrada em operação de novas fábricas de wafers.
De acordo com o aplicativo de notícias financeiras Zhihu Caijing em Brazilian Portuguese, o Morgan Stanley divulgou um relatório de pesquisa sobre o setor de semicondutores, destacando que a escassez de memória DRAM persistirá durante todo este ciclo da indústria de IA, e a expansão da capacidade de computação de IA não aguardará a construção de novas fábricas de wafers. O setor está contornando o gargalo de memória por meio de três principais caminhos tecnológicos: redução do hardware, desacoplamento da arquitetura de inferência e pool de memórias CXL, promovendo continuamente a construção da capacidade de computação sob restrições de oferta. O banco continua otimista em relação aos líderes em armazenamento, como Micron (MU.US) e SanDisk (SNDK.US), e também sobre as oportunidades crescentes nos segmentos de interconexão CXL e inferência heterogênea, recomendando Astera Labs (ALAB.US), Marvell (MRVL.US), Cerebras (CBRS.US) e Nvidia (NVDA.US).
Morgan Stanley enfatiza que a atual escassez de memória de IA não é uma perturbação de curto prazo, mas uma contradição estrutural em que o crescimento do desempenho computacional supera em muito a velocidade de oferta de memória. O tamanho dos principais modelos de IA dobra a cada seis meses, a janela de contexto dos principais modelos aumenta 5-6 vezes por ano, e isso, combinado com o aumento contínuo da demanda por inferência paralela, faz com que a capacidade e a largura de banda da memória explodam em demanda. Por outro lado, a construção de fábricas de DRAM leva anos e a elasticidade da oferta é extremamente baixa, então o cenário de escassez continuará por vários anos. O CEO da Nvidia, Jensen Huang, também afirmou publicamente que a indústria precisa mudar sua abordagem, enfrentando as restrições de memória com inovação em arquitetura, e não apenas esperando pela expansão de capacidade.
Frente à escassez de HBM e memória principal, a resposta mais direta do setor é reduzir seletivamente as especificações de memória por dispositivo (De-speccing). Tomando como exemplo a arquitetura Rubin da Nvidia, a capacidade LPDDR5 por nó foi reduzida de 54TB originalmente planejados para 28TB, e a capacidade HBM por GPU foi reduzida de 288GB para 192GB, garantindo assim a quantidade total de máquinas despachadas por meio da redução da altura de empilhamento da memória. Morgan Stanley aponta que a redução de especificações não elimina o gargalo da memória, apenas transfere a pressão entre diferentes níveis de memória: ao reduzir a memória local de alta velocidade, dados de baixa frequência, como caches KV, migram para armazenamento NAND, enquanto a interação de dados entre GPUs aumenta, impulsionando a demanda por largura de banda de interconexão de rede. Essencialmente, isso significa complementar a memória de alta largura de banda escassa com interconexão de rede mais rápida e recursos de armazenamento de menor custo.
O segundo caminho para contornar os desafios é o desacoplamento da arquitetura de inferência (Disaggregation). A inferência em IA inclui duas etapas distintas: pré-preenchimento (Prefill) e decodificação (Decode): o Prefill consome principalmente poder de computação, enquanto o Decode depende fortemente da largura de banda da memória. Arquiteturas tradicionais usam o mesmo acelerador para ambas as tarefas, resultando em baixa utilização de recursos. Atualmente, o setor está avançando rapidamente para a inferência heterogênea, subdividindo esses dois estágios em diferentes hardwares: tarefas intensivas em computação, como Prefill, ficam a cargo de GPUs genéricas, enquanto o Decode, que exige alta largura de banda de memória, é realizado por chips aceleradores dedicados com grandes quantidades de SRAM on-chip.
Exemplos típicos incluem o engine em escala de wafer da Cerebras e a arquitetura Groq LPU, adquirida pela Nvidia, ambos capazes de oferecer uma eficiência de largura de banda de memória muito superior à de GPUs tradicionais durante o estágio de decodificação. Morgan Stanley acredita que a inferência heterogênea se tornará uma direção importante para a evolução da infraestrutura de IA, e empresas especializadas em computação para a etapa de decodificação terão um mercado incremental claro.
O terceiro caminho é a reconstrução do sistema de memória usando tecnologia CXL. O CXL (Compute Express Link - Interconexão Computacional de Alta Velocidade) permite a expansão, compartilhamento e pooling de memórias através de alta velocidade, liberando a memória da associação exclusiva a um único processador, tornando-se assim um caminho essencial para superar as restrições de capacidade de memória. Morgan Stanley estima que a demanda de IA impulsionará o mercado de CXL e chips de memória relacionados para cerca de 6 bilhões de dólares até 2030, superando de longe o tamanho do mercado tradicional de expansão de memória para CPUs. Seu valor central reside na construção de uma arquitetura de memória em camadas: dados de frequência mais alta ficam no HBM, dados de média frequência vão para o pool de memórias CXL, e dados frios de baixa frequência descem para o NAND, alinhando o custo do recurso à frequência de acesso aos dados.
Em relação às principais linhas de investimento, Morgan Stanley reafirma três direções: primeiro, continuar com superalocação em Micron e SanDisk, já que a redução das especificações decorre da escassez de oferta e não da fraqueza da demanda; a demanda de IA por memória permanece em alta no longo prazo e o déficit de oferta continuará absorvendo a capacidade; segundo, posicionar-se nos líderes em CXL e interconexão scale-up, como Astera Labs e Marvell; e terceiro, observar os beneficiários da inferência heterogênea, como Cerebras, além da Nvidia, que aprimorou sua disposição heterogênea com a aquisição da Groq.
Riscos: O crescimento da demanda por capacidade computacional em IA pode ser inferior ao esperado; a implementação da tecnologia CXL pode ser mais lenta do que o previsto; a expansão da capacidade de memória pode superar as expectativas.
Aviso Legal: o conteúdo deste artigo reflete exclusivamente a opinião do autor e não representa a plataforma. Este artigo não deve servir como referência para a tomada de decisões de investimento.
Talvez também goste
Quase metade dos sistemas de segurança de endpoints empresariais ainda precisa ser atualizada! CrowdStrike (CRWD.US) mira expansão de participação de mercado; BNP Paribas afirma que metas de crescimento de longo prazo podem ser conservadoras
A empresa de segurança cibernética CrowdStrike acredita que, à medida que as empresas eliminam gradualmente os sistemas de segurança tradicionais, ainda há um espaço significativo para expansão de participação de mercado da empresa no segmento de detecção e resposta em endpoints.
Atividade do setor de serviços dos EUA atinge o ritmo mais rápido em mais de cinco anos! PMI de setembro sobe para 58,8; Pressão inflacionária aumenta novamente diante de forte demanda
A atividade do setor de serviços nos Estados Unidos acelerou significativamente em setembro, com o índice PMI de atividade comercial dos serviços subindo de 56,5 em agosto para 58,8. Este é o quarto mês consecutivo de aumento e o sexto mês seguido em zona de expansão, marcando o ritmo de expansão mais rápido desde julho de 2021.
Morgan Stanley: Faltam 34% de capacidade elétrica nos data centers dos EUA; principais fabricantes de chips permanecem imunes, enquanto setores intermediários e inferiores estão sob pressão
No entanto, o relatório destaca que Nvidia e Broadcom, devido à sua presença global, maior produção de poder de computação por unidade de energia e clara visibilidade da cadeia de suprimentos, não estão temporariamente sujeitas ao impacto das restrições de energia nas orientações de desempenho para 2027. Os segmentos intermediários e inferiores, como ASIC, armazenamento, módulos ópticos e dispositivos de simulação, enfrentarão um risco maior de volatilidade na demanda.
