Inferux
Equipe Inferux
empresa

Trabalho técnico orientado a medições

A Inferux existe para ajudar equipes de engenharia a entenderem, com clareza, onde o desempenho de inferência pode ser melhorado — e o que muda depois do trabalho.

← Página inicial
/ quem somos

Por que a Inferux foi criada

A Inferux surgiu de uma percepção direta: muitas equipes de engenharia em empresas brasileiras implantam modelos de linguagem e visão em produção sem ter um processo estruturado para medir e ajustar o desempenho de inferência ao longo do tempo.

O hardware Nvidia — da linha A100 à H100 — oferece uma série de opções de configuração que afetam latência e throughput de formas nem sempre intuitivas. Batching dinâmico, quantização de pesos, layout de memória KV-cache, configurações de servidor: cada camada tem espaço para ajuste, e esse espaço raramente é explorado de forma sistemática.

A Inferux preenche essa lacuna. Não como uma consultoria de TI generalista, mas como uma equipe técnica que entra no detalhe do seu stack, mede o que está acontecendo e documenta o que muda depois de cada intervenção.

Missão

Tornar o processo de ajuste de inferência acessível e documentado para equipes técnicas no Brasil — com foco em resultados verificáveis, não em promessas.

Visão

Ser a referência técnica para equipes de IA em produção que precisam de orientação prática sobre performance de inferência em GPUs Nvidia no mercado nacional.

Valores

Clareza técnica, medições antes e depois, documentação que permanece útil para a equipe e sem exagero nas afirmações sobre o que o trabalho entrega.

/ equipe

Quem faz o trabalho

Profissionais com formação em sistemas distribuídos, ML engineering e infraestrutura de GPU.

RC

Rafael Costa

Fundador & Eng. de Inferência

Trabalhou com sistemas de serving em larga escala antes de fundar a Inferux. Especialidade em TensorRT-LLM e configurações de batching dinâmico.

MF

Marina Figueiredo

Engenheira de ML Systems

Experiência em quantização de modelos, análise de memória e profiling de GPU. Contribui para os guias técnicos e entregáveis escritos dos engajamentos.

TM

Thiago Mendes

Engenheiro de Infraestrutura

Foco em configurações de servidor de inferência (vLLM, Triton), rede e armazenamento. Apoia a parte de monitoramento do serviço contínuo.

/ padrões de trabalho

Como conduzimos cada engajamento

Baseline antes de tudo

Todo engajamento começa com medições do estado atual — latência p50/p95, throughput e utilização de GPU — para que as mudanças tenham uma referência clara.

Privacidade de dados

Não acessamos dados de produção dos clientes. O trabalho é conduzido com base em metadados de configuração e métricas de performance, sem contato com conteúdo sensível.

Documentação escrita

Cada engajamento produz documentação técnica — sumário de achados, técnicas aplicadas e comparativo de métricas — que a equipe do cliente retém após a conclusão.

Iteração colaborativa

As sessões de trabalho envolvem a equipe de engenharia do cliente. As mudanças são discutidas antes de implementadas, não impostas unilateralmente.

Acordos de confidencialidade

Engajamentos incluem acordo de não divulgação para proteger informações técnicas e arquiteturais compartilhadas durante o trabalho.

Escopo claro desde o início

Antes de começar, alinhamos em detalhes o que será coberto, quais modelos e workloads serão avaliados, e qual o formato dos entregáveis.

/ contexto técnico

Otimização de inferência no Brasil: onde estamos e o que fazemos

A adoção de modelos de linguagem de grande escala (LLMs) e modelos de visão em produção acelerou significativamente no Brasil nos últimos dois anos. Equipes de engenharia em empresas de tecnologia, financeiras e de saúde digital estão operando workloads de inferência que precisam de latência previsível e throughput adequado para sustentar produtos de IA em funcionamento real.

A Inferux atua especificamente nessa interseção: entre o modelo treinado e o usuário final. Nosso trabalho cobre a camada de serving — onde configurações de batching, precisão numérica (FP16, INT8, FP8), layout de cache de atenção e parâmetros de servidor determinam a diferença entre um serviço funcional e um serviço que escala com qualidade.

Com base em Manaus, AM, trabalhamos de forma remota com equipes em todo o território nacional. Nosso modelo de engajamento foi desenhado para times que já possuem infraestrutura operando, mas que precisam de revisão técnica externa e documentação estruturada para tornar o processo de ajuste de performance parte da rotina de engenharia.

Não oferecemos treinamento de modelos, MLOps generalista ou desenvolvimento de aplicações. Nosso foco é estrito: desempenho de inferência em hardware Nvidia, com metodologia documentada e medições verificáveis.

próximo passo

Conheça o trabalho na prática

Uma conversa de 30 minutos é suficiente para entender se existe encaixe entre o que a Inferux faz e o que sua equipe precisa.

Falar com a equipe