merkleset

$ sha256sum chunks.jsonl confere com o manifesto

Dados prontos para RAG.
Procedência verificável.

Conjuntos de dados criptograficamente verificáveis e licenciados para IA, coletados de fontes primárias. Cada registro com hash, cada versão com seu Merkle root, cada ID estável entre versões — para que sua camada de retrieval se apoie em dados que você consegue defender.

o acesso às amostras abre em breve · cadeia de procedência completa em cada registro · apenas fontes primárias

us-federal-procurement@2026.08.10 / manifest.jsonverificável
4b1d9e2cc7a01f8eab52630de9f42d7b8c3a5e91f04d7ba6d2c83a6f9f2c
merkle_root9f2c41ab…c135e41aversão verificável

"why_merkleset":

Dados que você pode levar ao seu time jurídico

Procedência verificável

Cada registro carrega sua URL de origem, o horário da coleta e o SHA-256. Cada versão sai com um manifesto que traz um Merkle root sobre cada hash de chunk — recalcule a raiz a partir dos arquivos que você baixou e cheque você mesmo qualquer registro.

source_url · fetched_at · sha256

Licenciado para RAG

Uma licença explícita de uso em RAG e embeddings em vez de uma zona cinzenta, com indenização nos planos Pro e Enterprise. Sua revisão jurídica tem uma página, não quarenta.

embedding_use: permitted

IDs estáveis entre versões

record_id é um UUID v5 do conjunto de dados mais a chave natural; chunk_id é um endereço de conteúdo. O mesmo chunk em duas versões carrega o mesmo ID e o mesmo hash, então você mesmo pode comparar versões e refazer os embeddings só do que mudou.

record_id · chunk_id · stable across releases

Dois corpus no ar, cinco no mapa

Compras públicas federais dos EUA e regulatório já saem hoje; tribunais, documentos SEC e e-commerce estão no roadmap. Tudo coletado de fontes primárias — nunca feeds revendidos de terceiros.

procurement ✓ regulatory ✓ courts · sec · ecommerce

"how_it_works":

Pipeline, não promessa

  1. 01 collect

    Coletamos de fontes primárias

    Arquivos oficiais em lote e APIs públicas — SAM.gov e Federal Register hoje. Cada resposta bruta é guardada como seu próprio registro de evidência e recebe hash no momento da coleta.

  2. 02 normalize

    Normalizamos e dividimos em chunks com IDs estáveis

    Limpo, estruturado e dividido em chunks para retrieval. Os chunk IDs são endereços de conteúdo, então um chunk que não muda mantém seu ID entre versões.

  3. 03 release

    Você baixa versões pela API

    JSONL mais um manifesto por versão, com o SHA-256 de cada arquivo e o Merkle root. Recalcule a raiz antes de um único byte entrar no seu índice.

"catalog":

Dois nichos no ar, três previstos. Um contrato.

"pricing":

Preços na página, por conjunto de dados

preços completos

demo

US$ 0

acesso às amostras em breve

  • Amostra de avaliação, em breve
  • Cadeia de procedência completa em cada registro
  • Merkle root sobre cada hash de chunk
  • O mesmo JSONL que os planos pagos entregam
Fale sobre uma amostra

starter

US$ 99/mês

por conjunto de dados / mês

  • Novas versões toda semana
  • JSONL + manifesto com Merkle root
  • Campos de procedência por registro
  • Suporte por e-mail
Entre em contato para assinar
mais popular

pro

US$ 299/mês

por conjunto de dados / mês

  • Novas versões todo dia
  • IDs de registro e de chunk estáveis entre versões
  • Licença de RAG/embeddings com indenização
  • Suporte prioritário
Entre em contato para assinar

enterprise

Sob medida

contrato sob medida

  • Todos os conjuntos de dados que publicamos
  • Condições de atualização e de suporte no contrato
  • Nichos e conectores sob medida
  • Suporte dedicado
Entre em contato

"faq":

Perguntas que os compradores realmente fazem

Posso legalmente gerar embeddings e fazer retrieval sobre esses dados?

Sim — é justamente esse o ponto. Todo conjunto de dados sai com uma licença explícita que permite uso em RAG, embeddings e retrieval. As licenças Pro e Enterprise incluem indenização. Sem zonas cinzentas de scraping: coletamos de fontes primárias, respeitamos robots.txt e as recusas de uso, e filtramos os dados pessoais de cada registro antes de calcular o hash.

Como eu verifico a procedência?

Cada registro carrega sua URL de origem, o horário da coleta e o SHA-256 da resposta bruta. Cada versão sai com um manifesto que traz o SHA-256 de cada arquivo e um Merkle root sobre os hashes de chunk ordenados. Recalcule os hashes dos arquivos, reconstrua a raiz a partir do chunks.jsonl e compare — algumas linhas do seu próprio código, nenhuma do nosso. Nós rodamos exatamente isso contra uma versão com o histórico completo, usando uma implementação independente, e as raízes bateram.

Com que frequência os conjuntos de dados são atualizados?

A cadência é por conjunto de dados e por plano: o Starter publica versões semanais, o Pro publica diariamente. Cada versão é numerada e, como os IDs de registro e de chunk se mantêm estáveis entre versões, você mesmo pode comparar duas quaisquer e ver exatamente o que mudou.

Em quais formatos vocês entregam?

JSONL para registros e chunks prontos para retrieval, mais um manifest.json por versão com o SHA-256 e o tamanho em bytes de cada arquivo, as contagens de registros e de chunks, métricas de qualidade e o Merkle root sobre os hashes de chunk ordenados.

Posso testar antes de pagar?

Hoje não por meio de um conjunto de dados de amostra — o acesso às amostras está fechado enquanto o corpus cresce, e abre em breve. Enquanto isso, diga qual corpus você está avaliando: mostramos uma versão real — o manifesto, o SHA-256 de cada arquivo e o Merkle root — e você recalcula a raiz com seu próprio código antes de pagar qualquer coisa.

Vocês constroem nichos sob medida?

No plano Enterprise construímos nichos e conectores sob medida a partir da sua lista de fontes, com as condições de atualização acordadas no contrato. Conte pelo formulário de contato o que falta na sua camada de retrieval.