Três formatos. Um objetivo: inferência melhor medida.
Cada modalidade foi pensada para um estágio diferente de maturidade operacional — do time que quer uma revisão rápida ao que precisa de acompanhamento estruturado em produção.
← Página inicialComo conduzimos cada engajamento
A base do trabalho é a mesma nas três modalidades: medir primeiro, ajustar com contexto, documentar o resultado.
Alinhamento de escopo
Entendemos o stack, os modelos e as métricas atuais antes de qualquer trabalho.
Baseline de métricas
Latência, throughput e utilização de GPU registrados antes de qualquer mudança.
Análise e ajustes
Identificação das alavancas aplicáveis e trabalho colaborativo com a equipe técnica.
Documentação entregue
Sumário técnico com comparativo de métricas e guia de técnicas aplicadas.
Inference Tune-Up
R$ 770
Revisão concentrada do serving de um único modelo — identificação de ajustes práticos de latência e throughput, com comparativo antes/depois documentado. Desenvolvido para equipes com um workload prioritário que precisam de uma visão clara e acionável.
O que está incluído
- Análise de configuração de serving (batching, precisão, memória)
- Baseline e medição pós-ajuste
- Sessão de trabalho incluída
- Sumário técnico escrito com comparativo documentado
Processo
Alinhamento de contexto: stack, modelo, métricas atuais
Coleta de baseline de latência e throughput
Identificação e aplicação colaborativa dos ajustes
Medição pós-ajuste e entrega do sumário escrito
Prazo típico: 5 a 10 dias úteis após alinhamento inicial
Solicitar Tune-UpOptimization Engagement
R$ 2.850
Engajamento mais abrangente cobrindo batching, escolhas de precisão, layout de memória e configuração de servidor em múltiplos modelos. Pensado para equipes com vários workloads de inferência simultâneos que precisam de cobertura sistemática.
O que está incluído
- Análise de múltiplos modelos e workloads
- Cobertura de batching, precisão numérica, KV-cache e serving
- Guia de técnicas específico por engajamento
- Resultados medidos e documentados por workload
Processo
Mapeamento de todos os workloads em escopo
Baseline de métricas por modelo
Análise de cada alavanca: batching, precisão, memória, serving
Sessões de trabalho colaborativo por área
Entrega do guia de técnicas e comparativo final
Prazo típico: 3 a 6 semanas dependendo do número de workloads
Solicitar Engagement
Continuous Optimization Service
R$ 5.380
Serviço de acompanhamento de longo prazo que rastreia performance de inferência em produção entre atualizações de modelo e variações de tráfego. Inclui ajustes periódicos, relatórios e sessões de revisão — para organizações que rodam inferência em escala.
O que está incluído
- Baselines mantidos e atualizados periodicamente
- Rastreamento entre atualizações de modelo e variações de tráfego
- Ajustes periódicos com documentação por ciclo
- Sessões de revisão incluídas no ciclo
Ciclo de revisão
Estabelecimento de baselines no início do contrato
Monitoramento de métricas entre atualizações
Ajustes quando variações relevantes são detectadas
Relatório de situação e sessão de revisão periódica
Contrato de vigência definida com ciclos periódicos de revisão
Solicitar serviço contínuoQual modalidade se encaixa no seu contexto?
Use a tabela abaixo para identificar qual formato atende melhor à situação atual da sua equipe.
| Recurso | Tune-Up R$ 770 |
Engagement R$ 2.850 |
Contínuo R$ 5.380 |
|---|---|---|---|
| Número de workloads | 1 | Múltiplos | Todos em produção |
| Baseline de métricas | |||
| Guia de técnicas escrito | Sumário | ||
| Rastreamento contínuo | |||
| Sessões de revisão periódicas | |||
| Melhor para | 1 workload prioritário | Múltiplos modelos simultâneos | Produção em escala |
Protocolos compartilhados em todas as modalidades
NDA antes de começar
Acordo de confidencialidade assinado antes de qualquer troca de informações técnicas sobre a arquitetura do cliente.
Sem acesso a dados de produção
Trabalhamos com metadados de configuração e métricas de performance — sem acesso a dados de usuários finais ou conteúdo sensível.
Escopo definido por escrito
Antes de iniciar, o escopo exato do engajamento — modelos cobertos, alavancas analisadas, entregáveis — é formalizado por escrito.
Trabalho colaborativo
As análises e ajustes são conduzidos em conjunto com a equipe técnica do cliente — não como entrega unilateral, mas como processo compartilhado.
Entregáveis retidos pelo cliente
Toda documentação técnica produzida permanece com o cliente — guias, comparativos e baselines são ativos da equipe, não do fornecedor.
Comunicação em português
Todas as sessões, documentações e relatórios são conduzidos em português, adequados ao contexto técnico de cada equipe brasileira.
Valores fixos, escopo definido
Sem cobrança por hora. O valor de cada modalidade é definido com antecedência junto com o escopo de trabalho.
Inference Tune-Up
R$ 770
por engajamento
- 1 modelo em foco
- Baseline e medição pós-ajuste
- Sessão de trabalho
- Sumário técnico escrito
Optimization Engagement
R$ 2.850
por engajamento
- Múltiplos modelos
- 4 alavancas de otimização
- Guia de técnicas
- Resultados medidos por workload
Continuous Service
R$ 5.380
por ciclo
- Acompanhamento de produção
- Baselines mantidos
- Relatórios periódicos
- Sessões de revisão inclusas
Não tem certeza por qual modalidade começar?
Entre em contato e descrevemos as opções com base no seu contexto. Nenhum compromisso antes do alinhamento de escopo.
Falar com a equipe