merkleset

$ sha256sum chunks.jsonl corrisponde al manifest

Dati pronti per RAG.
Provenienza verificabile.

Dataset verificabili crittograficamente e licenziati per l'AI, raccolti da fonti primarie. Ogni record con il suo hash, ogni release ancorata a un Merkle root, ogni ID stabile tra le release — così il livello di retrieval poggia su dati difendibili.

l'accesso agli esempi apre a breve · catena di provenienza completa su ogni record · solo fonti primarie

us-federal-procurement@2026.08.10 / manifest.jsonverificabile
4b1d9e2cc7a01f8eab52630de9f42d7b8c3a5e91f04d7ba6d2c83a6f9f2c
merkle_root9f2c41ab…c135e41arelease verificabile

"why_merkleset":

Dati da mettere sul tavolo dell'ufficio legale

Provenienza verificabile

Ogni record porta con sé URL di origine, momento del prelievo e SHA-256. Ogni release include un manifest con un Merkle root su ogni hash di chunk — lo ricalcoli dai file che ha scaricato e verifichi da sé qualsiasi record.

source_url · fetched_at · sha256

Licenza per RAG

Una licenza esplicita per uso RAG ed embedding invece di una zona grigia, con indennizzo su Pro ed Enterprise. La revisione legale sta in una pagina, non in quaranta.

embedding_use: permitted

ID stabili tra le release

record_id è una UUID v5 del dataset più la chiave naturale, chunk_id è un indirizzo di contenuto. Lo stesso chunk in due release ha lo stesso ID e lo stesso hash, quindi può confrontare da sé due release e rigenerare gli embedding solo di ciò che è cambiato.

record_id · chunk_id · stable across releases

Due corpora attivi, cinque sulla mappa

Appalti federali USA e regolamentazione sono già disponibili; tribunali, documenti SEC ed e-commerce sono nella roadmap. Tutto raccolto da fonti primarie — mai feed di fornitori rivenduti.

procurement ✓ regulatory ✓ courts · sec · ecommerce

"how_it_works":

Pipeline, non promesse

  1. 01 collect

    Raccogliamo da fonti primarie

    File bulk ufficiali e API pubbliche — oggi SAM.gov e il Federal Register. Ogni risposta grezza viene conservata come record di evidenza a sé stante e sottoposta ad hash al momento del prelievo.

  2. 02 normalize

    Normalizziamo e suddividiamo in chunk con ID stabili

    Puliti, strutturati, suddivisi in chunk per il retrieval. I chunk ID sono indirizzi di contenuto: un chunk invariato mantiene il suo ID tra le release.

  3. 03 release

    Le release versionate si scaricano via API

    JSONL più un manifest per ogni release, con lo SHA-256 di ciascun file e il Merkle root. Ricalcoli la radice prima che un solo byte entri nell'indice.

"catalog":

Due nicchie attive, tre previste. Un solo contratto.

"pricing":

Prezzi sulla pagina, per dataset

tutti i prezzi

demo

0 USD

accesso agli esempi a breve

  • Campione di valutazione, a breve
  • Catena di provenienza completa su ogni record
  • Merkle root su ogni hash di chunk
  • Lo stesso JSONL dei piani a pagamento
Parliamo di un campione

starter

99 USD/mese

per dataset / mese

  • Aggiornamenti settimanali delle release
  • JSONL + manifest con Merkle root
  • Campi di provenienza per ogni record
  • Supporto via email
Contattaci per attivare l'abbonamento
il più scelto

pro

299 USD/mese

per dataset / mese

  • Aggiornamenti giornalieri delle release
  • ID di record e chunk stabili tra le release
  • Licenza RAG/embedding con indennizzo
  • Supporto prioritario
Contattaci per attivare l'abbonamento

enterprise

Su misura

accordo su misura

  • Tutti i dataset che pubblichiamo
  • Condizioni di freschezza e supporto nel contratto
  • Nicchie e connettori su misura
  • Supporto dedicato
Contattaci

"faq":

Le domande che i clienti fanno davvero

È lecito usare questi dati per embedding e retrieval?

Sì — è esattamente il punto. Ogni dataset viene fornito con una licenza esplicita che consente uso RAG, embedding e retrieval. Le licenze Pro ed Enterprise includono l'indennizzo. Nessuna zona grigia di scraping: raccogliamo da fonti primarie, rispettiamo robots.txt e le esclusioni, e filtriamo i dati personali da ogni record prima di calcolarne l'hash.

Come si verifica la provenienza?

Ogni record porta con sé URL di origine, momento del prelievo e SHA-256 della risposta grezza. Ogni release include un manifest con uno SHA-256 per ogni file e un Merkle root sugli hash dei chunk in ordine. Ricalcoli gli hash dei file, ricostruisca la radice da chunks.jsonl, confronti — poche righe di codice suo, nessuna riga nostra. Abbiamo fatto esattamente questo su una release con lo storico completo, usando un'implementazione separata, e le radici corrispondevano.

Con quale frequenza vengono aggiornati i dataset?

La frequenza dipende dal dataset e dal piano: Starter pubblica release settimanali, Pro giornaliere. Ogni release è versionata e, poiché gli ID di record e chunk restano stabili tra le release, può confrontarne da sé due qualsiasi e vedere esattamente cosa è cambiato.

Quali formati fornite?

JSONL per i record e i chunk pronti per il retrieval, più un manifest.json per ogni release con lo SHA-256 e la dimensione in byte di ciascun file, il numero di record e di chunk, le metriche di qualità e il Merkle root sugli hash dei chunk in ordine.

Si può provare prima di pagare?

Oggi non con un dataset di esempio — l'accesso agli esempi è chiuso mentre il corpus cresce, e aprirà a breve. Nel frattempo ci dica quale corpus sta valutando: le mostriamo una release reale — il manifest, lo SHA-256 di ogni file e il Merkle root — e lei ricalcola la radice con il suo codice prima di pagare qualsiasi cosa.

Realizzate nicchie su misura?

Con il piano Enterprise realizziamo nicchie e connettori su misura a partire dal suo elenco di fonti, con condizioni di freschezza concordate nel contratto. Ci dica dal modulo di contatto cosa manca al suo livello di retrieval.