"pricing":
Pague por conjunto de dados. Verifique antes de pagar nada.
Os planos pagos são por conjunto de dados, mensais, sem amarração de longo prazo. O acesso às amostras abre em breve — até lá, fale com a gente e mostramos a cadeia de procedência em uma versão real.
demo
US$ 0
acesso às amostras em breve
A amostra de avaliação ainda não está aberta. Fale com a gente enquanto isso e mostramos uma versão real.
- Amostra de avaliação, em breve
- Cadeia de procedência completa em cada registro
- Merkle root sobre cada hash de chunk
- O mesmo JSONL que os planos pagos entregam
starter
US$ 99/mês
por conjunto de dados / mês
Um corpus de produção, atualizado toda semana.
- Novas versões toda semana
- JSONL + manifesto com Merkle root
- Campos de procedência por registro
- Suporte por e-mail
pro
US$ 299/mês
por conjunto de dados / mês
Versões diárias com IDs estáveis — refaça os embeddings só do que mudou.
- Novas versões todo dia
- IDs de registro e de chunk estáveis entre versões
- Licença de RAG/embeddings com indenização
- Suporte prioritário
enterprise
Sob medida
contrato sob medida
Todos os conjuntos de dados, seus nichos, nosso pipeline.
- Todos os conjuntos de dados que publicamos
- Condições de atualização e de suporte no contrato
- Nichos e conectores sob medida
- Suporte dedicado
todo plano inclui
Cadeia de procedência completa por registro
Merkle root sobre cada hash de chunk
JSONL + SHA-256 por arquivo
Verificável com o seu próprio código
Precisa de todos os nichos, ou de um que não temos?
O Enterprise cobre todos os conjuntos de dados que publicamos, nichos e conectores sob medida, suporte dedicado e condições de atualização acordadas no contrato. A cobrança passa por contrato, não por checkout.
"faq":
Perguntas que os compradores realmente fazem
Posso legalmente gerar embeddings e fazer retrieval sobre esses dados?
Sim — é justamente esse o ponto. Todo conjunto de dados sai com uma licença explícita que permite uso em RAG, embeddings e retrieval. As licenças Pro e Enterprise incluem indenização. Sem zonas cinzentas de scraping: coletamos de fontes primárias, respeitamos robots.txt e as recusas de uso, e filtramos os dados pessoais de cada registro antes de calcular o hash.
Como eu verifico a procedência?
Cada registro carrega sua URL de origem, o horário da coleta e o SHA-256 da resposta bruta. Cada versão sai com um manifesto que traz o SHA-256 de cada arquivo e um Merkle root sobre os hashes de chunk ordenados. Recalcule os hashes dos arquivos, reconstrua a raiz a partir do chunks.jsonl e compare — algumas linhas do seu próprio código, nenhuma do nosso. Nós rodamos exatamente isso contra uma versão com o histórico completo, usando uma implementação independente, e as raízes bateram.
Com que frequência os conjuntos de dados são atualizados?
A cadência é por conjunto de dados e por plano: o Starter publica versões semanais, o Pro publica diariamente. Cada versão é numerada e, como os IDs de registro e de chunk se mantêm estáveis entre versões, você mesmo pode comparar duas quaisquer e ver exatamente o que mudou.
Em quais formatos vocês entregam?
JSONL para registros e chunks prontos para retrieval, mais um manifest.json por versão com o SHA-256 e o tamanho em bytes de cada arquivo, as contagens de registros e de chunks, métricas de qualidade e o Merkle root sobre os hashes de chunk ordenados.
Posso testar antes de pagar?
Hoje não por meio de um conjunto de dados de amostra — o acesso às amostras está fechado enquanto o corpus cresce, e abre em breve. Enquanto isso, diga qual corpus você está avaliando: mostramos uma versão real — o manifesto, o SHA-256 de cada arquivo e o Merkle root — e você recalcula a raiz com seu próprio código antes de pagar qualquer coisa.
Vocês constroem nichos sob medida?
No plano Enterprise construímos nichos e conectores sob medida a partir da sua lista de fontes, com as condições de atualização acordadas no contrato. Conte pelo formulário de contato o que falta na sua camada de retrieval.