Administramos esta empresa com base em um grafo direcionado que permanece entre sessões e gerações de modelos, com o estado, a proveniência e a governança registrados no próprio grafo, e não na janela. O modelo é um componente que substituímos. O grafo é a empresa.
A prova não é arquitetural, é histórica: o mesmo grafo já conduziu esta empresa por lançamentos do motor e por mudanças do modelo subjacente, mantendo intactos o trabalho em andamento, sua proveniência e sua governança.
Um assistente de chat responde à solicitação que está diante dele. Esse é o formato certo para uma pergunta com resposta e o formato errado para um trabalho que dura semanas: a janela se fecha e o estado desaparece, nada se move a menos que uma pessoa digite, e a decomposição, onde está a maior parte do julgamento, permanece com a pessoa. O assistente é rápido em cada etapa e ausente da sequência.
Nós construímos a sequência. O motor amplia padrões de grafo restritos à sessão para um grafo operacional persistente que sobrevive entre sessões, lançamentos e gerações de modelos, e é uma extensão direta do trabalho em que se baseia: o raciocínio estruturado em grafos e árvores publicado por grupos de pesquisa desde 2023 e os padrões de infraestrutura de execução publicados por laboratórios de ponta em 2025 e 2026. Grande parte desse trabalho se concentra no raciocínio ou na orquestração dentro de uma execução delimitada. O nosso persiste entre execuções.
Os nós são unidades de trabalho, decisões, verificações e eventos, cada um com um responsável declarado. As arestas são condições: um nó se torna elegível quando suas dependências são satisfeitas, não quando chega o momento de um agendamento. Nós verificadores ficam diante de tudo o que conta como resultado, de modo que um relatório que falha em uma pré-verificação determinística nunca chega a um integrador. Os pontos de convergência são explícitos, o que impede a falha clássica de agentes paralelos que todos ficam esperando atrás do mais lento.
Duas direções importam mais do que velocidade. Para trás: de qualquer resultado, você pode percorrer o grafo até a decisão, a regra e a função que o produziram. Para frente: de uma meta, você pode percorrer o grafo até as ramificações que realmente a estão impulsionando e até aquelas que silenciaram. Um conselho que não consegue fazer as duas coisas não está governando; está apenas trabalhando.
O ganho é mensurável, e nós o medimos. Substituir uma transferência programada por uma aresta de evento reduziu, em produção, em 2 de agosto de 2026, o tempo entre a conclusão de uma unidade de trabalho e a integração de seu resultado de um ciclo de sondagem de sessenta minutos para quarenta e um segundos. Os watchdogs de sondagem permaneceram como rede de segurança e contabilizam o que detectam; a meta desse contador é zero.
Toda ação é registrada no livro-razão antes de ser executada, e o livro-razão é encadeado por hash. O registro informa quem agiu, em qual função, sob qual regra, e a cadeia torna alterações retroativas silenciosas detectáveis, em vez de apenas desestimuladas. A memória segue a mesma disciplina: os fatos são armazenados para que possam ser encontrados pelo significado, e não pelo nome do arquivo; cada um informa quem o declarou e com base em quê; e uma verificação noturna marca fatos substituídos como desatualizados, em vez de deixar duas versões da verdade lado a lado.
Ramos recorrentes são executados dentro de um wrapper carimbado que registra a identidade da tarefa, o resultado e a duração em cada execução. Isso inverte o erro usual de monitoramento: em vez de alertar sobre linhas antigas de log, alertamos sobre a ausência de um carimbo. Uma tarefa que nunca foi iniciada não deixa nenhum log para parecer antigo.
O motor é versionado e liberado como software, com reversão para qualquer tag anterior e um manifesto que informa divergências entre o que está em execução e o que foi declarado. E-mails de vendas enviados externamente, publicações e implantações passam por uma etapa de controle antes de sair do sistema. As alterações são classificadas por risco, e uma alteração de alto risco é interrompida até que o proprietário a aprove do próprio celular, protegido por bloqueio de dispositivo. Esse canal de confirmação mantém seu próprio segredo, separado da telemetria do sistema: uma chave de telemetria vazada não concede o direito de aprovar uma alteração.
Vale declarar publicamente uma regra comportamental, porque a aprendemos da forma mais cara: a verificação e a liberação nunca estão na mesma cadeia de chamadas. Um veredito é lido e, só então, uma liberação é decidida como uma etapa separada. Isso também vale às quatro da manhã.
Seis membros do conselho operam este motor, cada um responsável por um domínio: estratégia, finanças, comércio, produto, integridade e marketing. O trabalho é encaminhado ao responsável pelo domínio ao qual pertence; um crítico separado o analisa em relação ao registro antes que conte como decidido; e as entregas são avaliadas depois com base no que realmente aconteceu. Essa última parte é o que torna uma versão posterior melhor, e não apenas mais nova, e é a diferença entre um sistema que funciona e um sistema que melhora.
Como o conselho é dono do motor, o motor muda a si próprio. As descobertas de suas próprias auditorias se transformam em trabalho especificado, com critérios mensuráveis e uma condição de reversão, e as correções são liberadas pelos mesmos controles que todo o restante.
O motor é revisado por um revisor externo de IA de outra família de modelos, com base em um briefing delimitado que não contém credenciais, caminhos de arquivos nem dados de clientes e sem acesso ao sistema. Um crítico interno detecta desvios em relação a uma constituição escrita, mas não consegue detectar uma premissa falsa que compartilha.
As conclusões do revisor retornam como tarefas com linhas de base, critérios de aceitação e uma condição de reversão anexados, o que transforma uma auditoria em trabalho, em vez de uma lista de opiniões.
Salas de pensamento. Uma camada de deliberação delimitada, aberta por questão em vez de executada por padrão. A pesquisa é inequívoca quanto ao motivo: o debate multiagente com entradas idênticas não melhora a correção esperada; participantes mais fracos se conformam à maioria em vez de sustentar uma visão minoritária correta; e a autorreflexão deixa de produzir conhecimento novo quando um modelo está confiante em sua primeira resposta. O design decorre disso. Enquadramentos heterogêneos e informações assimétricas para cada participante; um juiz que protege o sinal minoritário; dissenso obrigatório e uma análise prévia de falhas em toda decisão significativa; e exploração em forma de árvore, com poda e retrocesso em decisões de alto risco. A saída da sala vai para um repositório delimitado, não para o backlog geral: um gerador de ideias conectado a um sistema que já cria trabalho mais rápido do que o conclui ampliaria exatamente a coisa errada.
Um modelo local de identidade. Um modelo pequeno em nosso próprio hardware, cuja tarefa não é produzir trabalho, mas preservar a continuidade: quem somos, o que decidimos, no que acreditamos e com base em quais evidências. Uma identidade que depende da geração de modelos de um único fornecedor é alugada, não é nossa. Este espera pelo hardware, e o hardware espera pela receita.
Fontes realmente usadas na construção do que é descrito acima. Somente fontes de acesso aberto. A arquitetura acima amplia este trabalho; ela não o repete.
Raciocínio estruturado em grafos e árvores, e orquestração de agentes
Besta et al., "Graph of Thoughts: Solving Elaborate Problems with Large Language Models" (AAAI 2024, arXiv:2308.09687).
Yao et al., "Tree of Thoughts: Deliberate Problem Solving with Large Language Models" (Princeton / Google DeepMind, 2023, arXiv:2305.10601).
Anthropic, fluxos de trabalho dinâmicos e projeto de infraestruturas de execução para sistemas agentivos (2025-2026): referência industrial para subagentes paralelos e uma verificação antes da entrega do resultado. Grande parte do trabalho publicado se concentra no raciocínio ou na orquestração dentro de uma execução delimitada; a nossa é uma organização permanente, portanto os padrões são transferíveis, não copiáveis.
O debate entre profissionais em 2026 sobre engenharia de grafos para agentes: disciplina de nós e arestas, o teste de aresta falsa, nós verificadores, grafos estáticos versus dinâmicos, topologia como alavanca de custo.
Deliberação e seus modos de falha documentados
Du et al., "Improving Factuality and Reasoning in Language Models through Multiagent Debate" (2023, arXiv:2305.14325).
Liang et al., "Encouraging Divergent Thinking in Large Language Models through Multi-Agent Debate" (Degeneration-of-Thought, arXiv:2305.19118).
Zheng et al., "Take a Step Back: Evoking Reasoning via Abstraction in Large Language Models" (Google DeepMind, arXiv:2310.06117).
Zhou et al., "Self-Discover: Large Language Models Self-Compose Reasoning Structures" (Google DeepMind, arXiv:2402.03620).
Memória, estrutura e precedentes
Sumers et al., "Cognitive Architectures for Language Agents" (CoALA, 2023, arXiv:2309.02427).
Swanson et al., o Virtual Lab: uma equipe de agentes de IA com um agente principal, especialistas e um agente crítico, produzindo resultados reais de pesquisa (Nature, 2024).
UC Berkeley RDI, Agentic AI F25 (outono de 2025): estruturas multiagente, memória de agentes, implantação em produção, design de avaliação.
Governança e segurança
NIST AI RMF 1.0 e o Perfil de IA Generativa (NIST-AI-600-1).
OWASP Top 10 para Aplicações LLM 2025, em particular injeção de prompt, autonomia excessiva e fragilidades em vetores e embeddings.
Regulamento de IA da UE (Regulamento (UE) 2024/1689), artigo 50 sobre transparência.
Detalhes da arquitetura, mecanismos internos dos processos, horários das operações automatizadas e qualquer coisa que permitiria a replicação direta do sistema. O teste antes de qualquer divulgação: um concorrente poderia construir a mesma coisa com estas informações? Se sim, isso não é divulgado.
Nossos produtos são a prova visível. O motor concebe, desenvolve, lança e dá suporte a software real, de ponta a ponta. O que está por baixo é mais geral do que qualquer produto isolado. Um sistema agêntico que lê os próprios dados de uma empresa, de forma contínua e completa, diretamente da fonte, vê o que revisões anuais baseadas em amostras não conseguem ver.
Isso aponta para algo maior do que software de locação. Direcione o mesmo motor aos sistemas financeiros e operacionais de uma empresa, e ele faz continuamente, com todos os dados, o que a due diligence e a análise de negócios tentam fazer uma vez por ano com uma amostra: uma leitura permanente e independente de como uma empresa realmente está se saindo e onde está o risco. Já administramos a própria Offsite dessa forma.
Financiamos isso com o que nossos produtos geram. Não estamos captando recursos, e o motor não está à venda. Construímos abertamente.
Fontes e uma descrição geral: metodologia.