Inferux
Stack de inferência em produção
soluções

Três formatos. Um objetivo: inferência melhor medida.

Cada modalidade foi pensada para um estágio diferente de maturidade operacional — do time que quer uma revisão rápida ao que precisa de acompanhamento estruturado em produção.

← Página inicial
/ metodologia

Como conduzimos cada engajamento

A base do trabalho é a mesma nas três modalidades: medir primeiro, ajustar com contexto, documentar o resultado.

01

Alinhamento de escopo

Entendemos o stack, os modelos e as métricas atuais antes de qualquer trabalho.

02

Baseline de métricas

Latência, throughput e utilização de GPU registrados antes de qualquer mudança.

03

Análise e ajustes

Identificação das alavancas aplicáveis e trabalho colaborativo com a equipe técnica.

04

Documentação entregue

Sumário técnico com comparativo de métricas e guia de técnicas aplicadas.

Inference Tune-Up
modalidade 01

Inference Tune-Up

R$ 770

Revisão concentrada do serving de um único modelo — identificação de ajustes práticos de latência e throughput, com comparativo antes/depois documentado. Desenvolvido para equipes com um workload prioritário que precisam de uma visão clara e acionável.

O que está incluído

  • Análise de configuração de serving (batching, precisão, memória)
  • Baseline e medição pós-ajuste
  • Sessão de trabalho incluída
  • Sumário técnico escrito com comparativo documentado

Processo

1

Alinhamento de contexto: stack, modelo, métricas atuais

2

Coleta de baseline de latência e throughput

3

Identificação e aplicação colaborativa dos ajustes

4

Medição pós-ajuste e entrega do sumário escrito

Prazo típico: 5 a 10 dias úteis após alinhamento inicial

Solicitar Tune-Up
modalidade 02

Optimization Engagement

R$ 2.850

Engajamento mais abrangente cobrindo batching, escolhas de precisão, layout de memória e configuração de servidor em múltiplos modelos. Pensado para equipes com vários workloads de inferência simultâneos que precisam de cobertura sistemática.

O que está incluído

  • Análise de múltiplos modelos e workloads
  • Cobertura de batching, precisão numérica, KV-cache e serving
  • Guia de técnicas específico por engajamento
  • Resultados medidos e documentados por workload

Processo

1

Mapeamento de todos os workloads em escopo

2

Baseline de métricas por modelo

3

Análise de cada alavanca: batching, precisão, memória, serving

4

Sessões de trabalho colaborativo por área

5

Entrega do guia de técnicas e comparativo final

Prazo típico: 3 a 6 semanas dependendo do número de workloads

Solicitar Engagement
Optimization Engagement
Continuous Optimization Service
modalidade 03

Continuous Optimization Service

R$ 5.380

Serviço de acompanhamento de longo prazo que rastreia performance de inferência em produção entre atualizações de modelo e variações de tráfego. Inclui ajustes periódicos, relatórios e sessões de revisão — para organizações que rodam inferência em escala.

O que está incluído

  • Baselines mantidos e atualizados periodicamente
  • Rastreamento entre atualizações de modelo e variações de tráfego
  • Ajustes periódicos com documentação por ciclo
  • Sessões de revisão incluídas no ciclo

Ciclo de revisão

1

Estabelecimento de baselines no início do contrato

2

Monitoramento de métricas entre atualizações

3

Ajustes quando variações relevantes são detectadas

4

Relatório de situação e sessão de revisão periódica

Contrato de vigência definida com ciclos periódicos de revisão

Solicitar serviço contínuo
/ comparação

Qual modalidade se encaixa no seu contexto?

Use a tabela abaixo para identificar qual formato atende melhor à situação atual da sua equipe.

Recurso Tune-Up
R$ 770
Engagement
R$ 2.850
Contínuo
R$ 5.380
Número de workloads 1 Múltiplos Todos em produção
Baseline de métricas
Guia de técnicas escrito Sumário
Rastreamento contínuo
Sessões de revisão periódicas
Melhor para 1 workload prioritário Múltiplos modelos simultâneos Produção em escala
Dica: muitas equipes começam com o Tune-Up para ter uma visão rápida do estado atual e depois decidem expandir. Não há necessidade de compromisso de longo prazo no primeiro engajamento.
/ padrões técnicos

Protocolos compartilhados em todas as modalidades

NDA antes de começar

Acordo de confidencialidade assinado antes de qualquer troca de informações técnicas sobre a arquitetura do cliente.

Sem acesso a dados de produção

Trabalhamos com metadados de configuração e métricas de performance — sem acesso a dados de usuários finais ou conteúdo sensível.

Escopo definido por escrito

Antes de iniciar, o escopo exato do engajamento — modelos cobertos, alavancas analisadas, entregáveis — é formalizado por escrito.

Trabalho colaborativo

As análises e ajustes são conduzidos em conjunto com a equipe técnica do cliente — não como entrega unilateral, mas como processo compartilhado.

Entregáveis retidos pelo cliente

Toda documentação técnica produzida permanece com o cliente — guias, comparativos e baselines são ativos da equipe, não do fornecedor.

Comunicação em português

Todas as sessões, documentações e relatórios são conduzidos em português, adequados ao contexto técnico de cada equipe brasileira.

/ preços

Valores fixos, escopo definido

Sem cobrança por hora. O valor de cada modalidade é definido com antecedência junto com o escopo de trabalho.

tune-up

Inference Tune-Up

R$ 770

por engajamento

  • 1 modelo em foco
  • Baseline e medição pós-ajuste
  • Sessão de trabalho
  • Sumário técnico escrito
Solicitar
engajamento

Optimization Engagement

R$ 2.850

por engajamento

  • Múltiplos modelos
  • 4 alavancas de otimização
  • Guia de técnicas
  • Resultados medidos por workload
Solicitar
contínuo

Continuous Service

R$ 5.380

por ciclo

  • Acompanhamento de produção
  • Baselines mantidos
  • Relatórios periódicos
  • Sessões de revisão inclusas
Solicitar
próximo passo

Não tem certeza por qual modalidade começar?

Entre em contato e descrevemos as opções com base no seu contexto. Nenhum compromisso antes do alinhamento de escopo.

Falar com a equipe