Case: como um banco no Leste Europeu foi de 33 para 43 tok/s
Um banco no Leste Europeu enfrentava um problema comum a instituições financeiras que operam IA em ambiente regulado: precisava de mais velocidade de inferência, sem abrir mão de manter os dados sob seu próprio controle.
Uma BigTech, atuando a partir de um laboratório em Luxemburgo, havia levado dois meses de trabalho para levar a operação a 33 tokens por segundo (tok/s) — o ritmo em que o modelo gera respostas. Era um resultado funcional, mas ainda distante do que o hardware disponível poderia entregar.
Aplicando computação heterogênea — orquestrando os aceleradores disponíveis na infraestrutura do banco em vez de depender de um único vetor de processamento — a MultiCortex elevou o desempenho para 43 tok/s.
Esse salto de 33 para 43 tok/s representa um ganho de produtividade de 30% na mesma infraestrutura, sem substituição de hardware e sem abrir mão do controle dos dados pelo banco.
O case ilustra bem o que a MultiCortex se propõe a fazer: extrair o máximo de cada chip já instalado, em vez de empurrar mais compra de hardware como única resposta para performance.