Pular para conteúdo

Gimlet Labs leva Cerebras à nuvem e promete inferência de IA a 3.000 tokens por segundo

Lucas Montarroios
Lucas Montarroios

29 de setembro de 2026

A Gimlet Labs vai integrar a computação wafer-scale da Cerebras à sua nuvem de inferência, prometendo velocidades de até 3.000 tokens por segundo em nuvem ou on-premises.

Carregando áudio…
Gimlet Labs leva Cerebras à nuvem e promete inferência de IA a 3.000 tokens por segundo

A Gimlet Labs vai integrar a computação wafer-scale da Cerebras à sua nuvem de inferência, com a promessa de entregar velocidades de até 3.000 tokens por segundo. O anúncio, publicado pela própria Cerebras, coloca a Gimlet Cloud como uma plataforma dedicada à inferência de IA de alto desempenho, disponível tanto em nuvem quanto em ambiente on-premises.

O que a Gimlet Labs oferece para inferência de IA na prática

A Gimlet Cloud é uma infraestrutura voltada especificamente para inferência — a etapa em que um modelo de IA já treinado responde a perguntas e executa tarefas. Ao adicionar hardware da Cerebras, a empresa passa a oferecer capacidade dedicada para clientes que não conseguem rodar suas aplicações em GPUs de uso geral sem sacrificar latência.

O diferencial da proposta está no modelo de entrega. Além da nuvem, a Gimlet oferece a mesma infraestrutura em instalações on-premises, opção relevante para organizações que precisam manter dados dentro do próprio perímetro. O anúncio pode ser lido na íntegra no press release da Cerebras.

Por que 3.000 tokens por segundo é o número central da inferência de IA

Token é a unidade básica que um modelo de IA processa — aproximadamente uma fração de palavra. A taxa de tokens por segundo define quanta informação o sistema entrega por unidade de tempo, e isso se traduz em duas coisas: velocidade de resposta percebida pelo usuário e custo por requisição.

Em aplicações de agentes de IA, que encadeiam várias chamadas ao modelo para concluir uma tarefa, a vazão acumulada pesa mais do que em um chatbot simples: quanto maior a taxa sustentada, mais sessões simultâneas cabem no mesmo hardware. Os 3.000 tokens por segundo são o principal argumento comercial das empresas — e o ponto que ainda precisa ser confirmado em cargas reais de produção.

Wafer-scale: o que torna o chip da Cerebras diferente para inferência de IA

A Cerebras ficou conhecida por construir processadores em escala de wafer, em vez de fatiar o silício em muitos chips menores. A abordagem mantém memória e núcleos de computação no mesmo componente, reduzindo o vai e vem de dados que costuma limitar a velocidade da inferência.

Não é a primeira vez que a fabricante aparece em movimentos desse tipo. A empresa já havia anunciado uma solução conjunta de inferência com a AMD, voltada a latência ultrabaixa — veja em AMD e Cerebras lançam solução conjunta de inferência IA com latência ultrabaixa. O padrão se repete: a Cerebras busca posicionar seu hardware como camada especializada dentro de nuvens de terceiros, em vez de vender apenas máquinas isoladas.

O que muda para desenvolvedores e empresas no Brasil com inferência de IA acelerada

Para times brasileiros, a pergunta prática é onde essa capacidade estará hospedada. Quanto mais distante o data center, maior a latência de rede — e ganhos de milissegundos no processamento podem ser engolidos pelo tempo de viagem dos dados. A opção on-premises resolve parte desse problema, mas exige investimento próprio em hardware.

Há também a dimensão regulatória. Cargas que envolvem dados pessoais sob a LGPD costumam favorecer ambientes controlados pela própria organização, o que dá peso à oferta local. O mercado de infraestrutura para IA caminha na mesma direção, como mostra o avanço de iniciativas de computação de IA em escala para fábricas multi-inquilino.

O que o anúncio de inferência de IA ainda não responde

O comunicado não detalha preços, prazos de disponibilidade, regiões atendidas, modelos compatíveis nem acordos de nível de serviço. Também não há indicação de clientes que já usam a plataforma ou de benchmarks independentes que confirmem os 3.000 tokens por segundo em condições reais.

Até que esses pontos apareçam, a parceria deve ser lida como uma aposta de posicionamento: a Cerebras ampliando canais de distribuição e a Gimlet diferenciando sua nuvem pela velocidade.

Perguntas Frequentes sobre inferência de IA com Cerebras

A Gimlet Labs está substituindo GPUs pelos chips da Cerebras?

Não necessariamente. O anúncio descreve uma adição de capacidade especializada em inferência, e não a troca completa da infraestrutura existente. GPUs seguem sendo a base para treinamento e para boa parte das cargas de inferência.

O que significa oferecer a solução on-premises?

Significa que a mesma infraestrutura pode ser instalada dentro das dependências do cliente, em vez de rodar apenas nos data centers da Gimlet. Isso interessa a quem precisa controlar onde os dados ficam.

Quando a oferta estará disponível e quanto vai custar?

O press release não informa datas de disponibilidade geral nem preços. Essas informações devem vir em anúncios posteriores ou em contato comercial direto com as empresas.

Compartilhar:
Lucas Montarroios

Escrito por

Lucas Montarroios

Sou Lucas Montarroios e dediquei os últimos 15 anos à linha de frente de operações de telecom e data centers. Minha carreira sempre foi pautada por um foco implacável: transformar tecnologia e cenários críticos em oportunidades reais de negócio. No novidades.ia.br, trago essa visão executiva para o universo da IA. Especialista em produtos, mercado e ferramentas práticas de IA. Minha missão aqui é filtrar o ruído do mercado, analisando benchmarks, estratégias de grandes empresas e ferramentas práticas.

Artigos relacionados