Morgan Stanley: Escassez de memória para IA deve durar vários anos; três caminhos para superar o impasse; armazenamento e computação heterogênea apresentam oportunidades estruturais
Morgan Stanley publicou um relatório de pesquisa sobre o setor de semicondutores, apontando que a escassez de memória DRAM irá persistir ao longo deste ciclo da indústria de IA, e a expansão da capacidade de processamento de IA não irá aguardar a construção e entrada em operação de novas fábricas de wafers.
De acordo com o aplicativo de notícias financeiras Zhihu Caijing em Brazilian Portuguese, o Morgan Stanley divulgou um relatório de pesquisa sobre o setor de semicondutores, destacando que a escassez de memória DRAM persistirá durante todo este ciclo da indústria de IA, e a expansão da capacidade de computação de IA não aguardará a construção de novas fábricas de wafers. O setor está contornando o gargalo de memória por meio de três principais caminhos tecnológicos: redução do hardware, desacoplamento da arquitetura de inferência e pool de memórias CXL, promovendo continuamente a construção da capacidade de computação sob restrições de oferta. O banco continua otimista em relação aos líderes em armazenamento, como Micron (MU.US) e SanDisk (SNDK.US), e também sobre as oportunidades crescentes nos segmentos de interconexão CXL e inferência heterogênea, recomendando Astera Labs (ALAB.US), Marvell (MRVL.US), Cerebras (CBRS.US) e Nvidia (NVDA.US).
Morgan Stanley enfatiza que a atual escassez de memória de IA não é uma perturbação de curto prazo, mas uma contradição estrutural em que o crescimento do desempenho computacional supera em muito a velocidade de oferta de memória. O tamanho dos principais modelos de IA dobra a cada seis meses, a janela de contexto dos principais modelos aumenta 5-6 vezes por ano, e isso, combinado com o aumento contínuo da demanda por inferência paralela, faz com que a capacidade e a largura de banda da memória explodam em demanda. Por outro lado, a construção de fábricas de DRAM leva anos e a elasticidade da oferta é extremamente baixa, então o cenário de escassez continuará por vários anos. O CEO da Nvidia, Jensen Huang, também afirmou publicamente que a indústria precisa mudar sua abordagem, enfrentando as restrições de memória com inovação em arquitetura, e não apenas esperando pela expansão de capacidade.
Frente à escassez de HBM e memória principal, a resposta mais direta do setor é reduzir seletivamente as especificações de memória por dispositivo (De-speccing). Tomando como exemplo a arquitetura Rubin da Nvidia, a capacidade LPDDR5 por nó foi reduzida de 54TB originalmente planejados para 28TB, e a capacidade HBM por GPU foi reduzida de 288GB para 192GB, garantindo assim a quantidade total de máquinas despachadas por meio da redução da altura de empilhamento da memória. Morgan Stanley aponta que a redução de especificações não elimina o gargalo da memória, apenas transfere a pressão entre diferentes níveis de memória: ao reduzir a memória local de alta velocidade, dados de baixa frequência, como caches KV, migram para armazenamento NAND, enquanto a interação de dados entre GPUs aumenta, impulsionando a demanda por largura de banda de interconexão de rede. Essencialmente, isso significa complementar a memória de alta largura de banda escassa com interconexão de rede mais rápida e recursos de armazenamento de menor custo.
O segundo caminho para contornar os desafios é o desacoplamento da arquitetura de inferência (Disaggregation). A inferência em IA inclui duas etapas distintas: pré-preenchimento (Prefill) e decodificação (Decode): o Prefill consome principalmente poder de computação, enquanto o Decode depende fortemente da largura de banda da memória. Arquiteturas tradicionais usam o mesmo acelerador para ambas as tarefas, resultando em baixa utilização de recursos. Atualmente, o setor está avançando rapidamente para a inferência heterogênea, subdividindo esses dois estágios em diferentes hardwares: tarefas intensivas em computação, como Prefill, ficam a cargo de GPUs genéricas, enquanto o Decode, que exige alta largura de banda de memória, é realizado por chips aceleradores dedicados com grandes quantidades de SRAM on-chip.
Exemplos típicos incluem o engine em escala de wafer da Cerebras e a arquitetura Groq LPU, adquirida pela Nvidia, ambos capazes de oferecer uma eficiência de largura de banda de memória muito superior à de GPUs tradicionais durante o estágio de decodificação. Morgan Stanley acredita que a inferência heterogênea se tornará uma direção importante para a evolução da infraestrutura de IA, e empresas especializadas em computação para a etapa de decodificação terão um mercado incremental claro.
O terceiro caminho é a reconstrução do sistema de memória usando tecnologia CXL. O CXL (Compute Express Link - Interconexão Computacional de Alta Velocidade) permite a expansão, compartilhamento e pooling de memórias através de alta velocidade, liberando a memória da associação exclusiva a um único processador, tornando-se assim um caminho essencial para superar as restrições de capacidade de memória. Morgan Stanley estima que a demanda de IA impulsionará o mercado de CXL e chips de memória relacionados para cerca de 6 bilhões de dólares até 2030, superando de longe o tamanho do mercado tradicional de expansão de memória para CPUs. Seu valor central reside na construção de uma arquitetura de memória em camadas: dados de frequência mais alta ficam no HBM, dados de média frequência vão para o pool de memórias CXL, e dados frios de baixa frequência descem para o NAND, alinhando o custo do recurso à frequência de acesso aos dados.
Em relação às principais linhas de investimento, Morgan Stanley reafirma três direções: primeiro, continuar com superalocação em Micron e SanDisk, já que a redução das especificações decorre da escassez de oferta e não da fraqueza da demanda; a demanda de IA por memória permanece em alta no longo prazo e o déficit de oferta continuará absorvendo a capacidade; segundo, posicionar-se nos líderes em CXL e interconexão scale-up, como Astera Labs e Marvell; e terceiro, observar os beneficiários da inferência heterogênea, como Cerebras, além da Nvidia, que aprimorou sua disposição heterogênea com a aquisição da Groq.
Riscos: O crescimento da demanda por capacidade computacional em IA pode ser inferior ao esperado; a implementação da tecnologia CXL pode ser mais lenta do que o previsto; a expansão da capacidade de memória pode superar as expectativas.
Aviso Legal: o conteúdo deste artigo reflete exclusivamente a opinião do autor e não representa a plataforma. Este artigo não deve servir como referência para a tomada de decisões de investimento.
Talvez também goste
Venda de títulos do Tesouro dos EUA impulsiona rendimentos a níveis mais altos em décadas; Citadel: crescimento econômico e investimentos em IA intensificam a competição por capital
A Citadel Securities acredita que a recente venda de títulos do governo dos EUA, com os rendimentos atingindo níveis máximos em décadas, não é impulsionada principalmente pela preocupação do mercado com a deterioração adicional da inflação. Em vez disso, é resultado do crescimento econômico contínuo dos EUA, dos investimentos em inteligência artificial (IA) e do aumento do déficit governamental, que intensificam a disputa por capital.
A incerteza fiscal e política na França abala o setor financeiro! Os principais indicadores de risco de crédito dos três maiores bancos sobem, com aumento significativo no custo do seguro contra inadimplência de títulos
À medida que as preocupações do mercado sobre a situação fiscal e o cenário político da França se espalham para o mercado de crédito, os indicadores de risco de crédito dos títulos de grandes bancos franceses aumentaram significativamente.
Os títulos soberanos europeus soam o alarme, mas o mercado de ações continua resiliente! O diferencial entre França e Alemanha registra o maior aumento semanal em mais de 30 anos, e o Deutsche Bank alerta que esse descompasso pode não durar.
O mercado de títulos soberanos europeus enfrentou uma pressão significativa na semana passada, mas os mercados acionários europeus e o mercado de crédito corporativo reagiram de forma discreta, resultando em uma rara divergência entre diferentes classes de ativos.
Quase metade dos sistemas de segurança de endpoints empresariais ainda precisa ser atualizada! CrowdStrike (CRWD.US) mira expansão de participação de mercado; BNP Paribas afirma que metas de crescimento de longo prazo podem ser conservadoras
A empresa de segurança cibernética CrowdStrike acredita que, à medida que as empresas eliminam gradualmente os sistemas de segurança tradicionais, ainda há um espaço significativo para expansão de participação de mercado da empresa no segmento de detecção e resposta em endpoints.
