$ sha256sum chunks.jsonl ✓ corrisponde al manifest
Dati pronti per RAG. Provenienza verificabile.
Dataset verificabili crittograficamente e licenziati per l'AI, raccolti da fonti primarie. Ogni record con il suo hash, ogni release ancorata a un Merkle root, ogni ID stabile tra le release — così il livello di retrieval poggia su dati difendibili.
Ogni record porta con sé URL di origine, momento del prelievo e SHA-256. Ogni release include un manifest con un Merkle root su ogni hash di chunk — lo ricalcoli dai file che ha scaricato e verifichi da sé qualsiasi record.
source_url · fetched_at · sha256
Licenza per RAG
Una licenza esplicita per uso RAG ed embedding invece di una zona grigia, con indennizzo su Pro ed Enterprise. La revisione legale sta in una pagina, non in quaranta.
embedding_use: permitted
ID stabili tra le release
record_id è una UUID v5 del dataset più la chiave naturale, chunk_id è un indirizzo di contenuto. Lo stesso chunk in due release ha lo stesso ID e lo stesso hash, quindi può confrontare da sé due release e rigenerare gli embedding solo di ciò che è cambiato.
record_id · chunk_id · stable across releases
Due corpora attivi, cinque sulla mappa
Appalti federali USA e regolamentazione sono già disponibili; tribunali, documenti SEC ed e-commerce sono nella roadmap. Tutto raccolto da fonti primarie — mai feed di fornitori rivenduti.
File bulk ufficiali e API pubbliche — oggi SAM.gov e il Federal Register. Ogni risposta grezza viene conservata come record di evidenza a sé stante e sottoposta ad hash al momento del prelievo.
→
02normalize
Normalizziamo e suddividiamo in chunk con ID stabili
Puliti, strutturati, suddivisi in chunk per il retrieval. I chunk ID sono indirizzi di contenuto: un chunk invariato mantiene il suo ID tra le release.
→
03release
Le release versionate si scaricano via API
JSONL più un manifest per ogni release, con lo SHA-256 di ciascun file e il Merkle root. Ricalcoli la radice prima che un solo byte entri nell'indice.
"catalog":
Due nicchie attive, tre previste. Un solo contratto.
È lecito usare questi dati per embedding e retrieval?
Sì — è esattamente il punto. Ogni dataset viene fornito con una licenza esplicita che consente uso RAG, embedding e retrieval. Le licenze Pro ed Enterprise includono l'indennizzo. Nessuna zona grigia di scraping: raccogliamo da fonti primarie, rispettiamo robots.txt e le esclusioni, e filtriamo i dati personali da ogni record prima di calcolarne l'hash.
Come si verifica la provenienza?
Ogni record porta con sé URL di origine, momento del prelievo e SHA-256 della risposta grezza. Ogni release include un manifest con uno SHA-256 per ogni file e un Merkle root sugli hash dei chunk in ordine. Ricalcoli gli hash dei file, ricostruisca la radice da chunks.jsonl, confronti — poche righe di codice suo, nessuna riga nostra. Abbiamo fatto esattamente questo su una release con lo storico completo, usando un'implementazione separata, e le radici corrispondevano.
Con quale frequenza vengono aggiornati i dataset?
La frequenza dipende dal dataset e dal piano: Starter pubblica release settimanali, Pro giornaliere. Ogni release è versionata e, poiché gli ID di record e chunk restano stabili tra le release, può confrontarne da sé due qualsiasi e vedere esattamente cosa è cambiato.
Quali formati fornite?
JSONL per i record e i chunk pronti per il retrieval, più un manifest.json per ogni release con lo SHA-256 e la dimensione in byte di ciascun file, il numero di record e di chunk, le metriche di qualità e il Merkle root sugli hash dei chunk in ordine.
Si può provare prima di pagare?
Oggi non con un dataset di esempio — l'accesso agli esempi è chiuso mentre il corpus cresce, e aprirà a breve. Nel frattempo ci dica quale corpus sta valutando: le mostriamo una release reale — il manifest, lo SHA-256 di ogni file e il Merkle root — e lei ricalcola la radice con il suo codice prima di pagare qualsiasi cosa.
Realizzate nicchie su misura?
Con il piano Enterprise realizziamo nicchie e connettori su misura a partire dal suo elenco di fonti, con condizioni di freschezza concordate nel contratto. Ci dica dal modulo di contatto cosa manca al suo livello di retrieval.