Inferux
Equipes de engenharia
depoimentos

O que equipes técnicas dizem sobre o trabalho

Relatos de engenheiros e líderes técnicos que passaram por engajamentos com a Inferux e documentaram o antes e depois.

← Página inicial
/ depoimentos

Relatos de clientes

LP
Leonardo Pires
Eng. de ML — São Paulo, SP

Contratamos o Inference Tune-Up para um modelo de classificação que estava com latência alta em picos de tráfego. O processo foi direto — a equipe entendeu o contexto rapidamente e o sumário entregue foi bem mais detalhado do que eu esperava para o escopo. Configuramos continuous batching seguindo as recomendações e a latência p95 caiu bastante.

Maio de 2026
AC
Ana Carvalho
Tech Lead — Campinas, SP

Passamos pelo Optimization Engagement com três modelos diferentes em produção. O que achei mais útil foi o guia de técnicas — não é um documento genérico, é específico para o nosso stack. Houve um workload onde a melhoria foi pequena, e a equipe foi honesta sobre isso em vez de inflar os números. Isso gera confiança.

Maio de 2026
RS
Rodrigo Souza
Diretor de Plataforma — Recife, PE

Iniciamos com o serviço contínuo porque temos actualizações de modelo frequentes e precisávamos de acompanhamento sistemático. Os relatórios de ciclo são objetivos e o formato de revisão em sessão funciona bem para a equipe. Boa parte do valor está em ter baselines rastreados — quando algo muda, sabemos exatamente o que foi.

Abril de 2026
MO
Mariana Oliveira
Engenheira de Infraestrutura — Porto Alegre, RS

Nossa equipe não tem expertise aprofundada em otimização de GPU — somos bons em infraestrutura mas o detalhe do stack de serving é novo para nós. O Tune-Up foi uma boa forma de entrar sem comprometer muito tempo interno. A sessão técnica foi clara e o sumário escrito está sendo usado até hoje como referência.

Junho de 2026
FB
Felipe Bastos
CTO — Belo Horizonte, MG

Usamos o Optimization Engagement antes de uma expansão de capacidade. Queríamos entender se conseguíamos extrair mais do hardware atual antes de comprar mais GPUs. O trabalho mostrou que havia espaço considerável na configuração de batching que não estávamos usando. Isso mudou nossa decisão de compra.

Abril de 2026
JN
Juliana Neves
Eng. de Dados Sênior — Curitiba, PR

O que me convenceu foi a abordagem sem exagero nas expectativas. Desde o início ficou claro que o trabalho dependia do contexto e que nem toda alavanca geraria ganho expressivo no nosso setup específico. Esse realismo é raro em serviços de consultoria técnica e tornou o engajamento muito mais produtivo.

Maio de 2026
/ casos de uso

Histórias detalhadas

caso 01 / tune-up

Plataforma de busca semântica — redução de latência em pico de tráfego

Contexto

Equipe com modelo de embedding rodando em uma única A100 para busca semântica em tempo real. Latência p95 ficava acima de 180ms em momentos de tráfego elevado — acima do limite aceitável para a experiência do produto.

Trabalho realizado

Tune-Up com foco em configuração de batching e revisão do uso de memória. Identificamos que o servidor de inferência estava rodando com batching fixo de tamanho pequeno, sem adaptive ou continuous batching habilitado.

Resultado documentado

Após ativação de continuous batching e ajuste de configurações de memória, a latência p95 em pico caiu para ~95ms. A utilização média da GPU subiu de 34% para 61%, aproveitando melhor o hardware existente.

Duração: 7 dias úteis | Modalidade: Inference Tune-Up
caso 02 / engagement

Produto SaaS com múltiplos modelos — revisão de stack antes de escalar

Contexto

Startup com produto de IA com três modelos em produção (LLM para geração, modelo de classificação e modelo de visão para análise de documentos). A empresa queria entender o estado do stack antes de tomar decisões de escalonamento de infraestrutura.

Trabalho realizado

Optimization Engagement cobrindo os três modelos. Para o LLM, revisão de KV-cache e configurações de token gerado. Para os modelos menores, análise de quantização INT8 e throughput em batch. Guia de técnicas produzido ao final.

Resultado documentado

O LLM teve melhoria marginal (contexto já bem configurado). Os modelos menores com INT8 reduziram o consumo de memória em ~38%, permitindo que mais instâncias rodassem no mesmo hardware — impactando positivamente a decisão de escala.

Duração: 4 semanas | Modalidade: Optimization Engagement
caso 03 / contínuo

Operadora digital — rastreamento de performance entre releases de modelo

Contexto

Empresa com pipeline de atendimento automatizado rodando LLM em produção. Atualizações de modelo ocorrem a cada 3 a 5 semanas. Sem monitoramento estruturado, variações de latência após cada release passavam despercebidas por dias.

Trabalho realizado

Continuous Optimization Service com ciclos de revisão quinzenais. Baselines estabelecidos na versão corrente do modelo. A cada release, medição comparativa e relatório de variação. Dois ajustes de configuração realizados no período de acompanhamento.

Resultado documentado

Em um dos releases, identificamos degradação de 22% no throughput em comparação com a versão anterior. A causa foi relacionada a mudança no tamanho de contexto padrão. Ajuste feito em menos de 48h após a detecção — sem que afetasse o SLA do produto.

Duração: contrato de 3 meses | Modalidade: Continuous Service
/ números

Um histórico em construção

38+

Workloads avaliados

12

Equipes atendidas

4,8

Avaliação média (5,0)

100%

Com documentação escrita

/ contato

Fale com a equipe

+55 92 3614-8075
Seg–Sex 9h–18h BRT
Resposta em 1 dia útil
Manaus, AM
Av. Djalma Batista 1661
Seg–Sex 9h–18h
Sáb 9h–13h (BRT)
próximo passo

Adicione o seu workload a essa lista

Entre em contato e avaliamos juntos se existe encaixe. Sem compromisso antes do alinhamento de escopo.

Solicitar avaliação