Birincil kaynaklardan toplanan, kriptografik olarak doğrulanabilir ve AI kullanımı için lisanslı veri setleri. Her kayıt hash'lenir, her sürümün bir Merkle root'u vardır, her ID sürümler arasında sabit kalır — böylece retrieval katmanınız savunabileceğiniz bir verinin üzerinde durur.
Her kayıt kendi kaynak URL'sini, çekilme zamanını ve SHA-256 değerini taşır. Her sürüm, her chunk hash'i üzerinde bir Merkle root içeren bir manifest ile gelir — indirdiğiniz dosyalardan kökü yeniden hesaplayın ve istediğiniz kaydı kendiniz kontrol edin.
source_url · fetched_at · sha256
RAG için lisanslı
Gri alan yerine açık bir RAG/embedding kullanım lisansı; Pro ve Enterprise'da tazminat teminatı da var. Hukuk incelemeniz kırk sayfa değil, bir sayfa.
embedding_use: permitted
Sürümler arasında sabit ID'ler
record_id, veri seti ile doğal anahtardan üretilen bir UUID v5'tir; chunk_id ise bir içerik adresidir. İki sürümdeki aynı chunk aynı ID'yi ve aynı hash'i taşır; böylece sürümleri kendiniz karşılaştırıp yalnızca değişeni yeniden embed edersiniz.
record_id · chunk_id · stable across releases
İki korpus yayında, beş alan haritada
ABD federal tedariki ve mevzuat bugün yayında; mahkemeler, SEC dosyalamaları ve e-ticaret yol haritasında. Tümü birincil kaynaklardan toplanır — asla yeniden satılan sağlayıcı beslemelerinden değil.
Resmî toplu dosyalar ve kamuya açık API'ler — bugün SAM.gov ve Federal Register. Her ham yanıt kendi kanıt kaydı olarak saklanır ve çekildiği anda hash'lenir.
→
02normalize
Sabit ID'lerle normalize edip parçalarız
Temizlenmiş, yapılandırılmış, retrieval için chunk'lanmış. Chunk ID'leri içerik adresidir; değişmeyen bir chunk sürümler boyunca ID'sini korur.
→
03release
Numaralı sürümleri API ile çekersiniz
Her sürüm için JSONL ve her dosyanın SHA-256 değerini ve Merkle root'u taşıyan bir manifest. Index'inize tek bir byte girmeden önce kökü yeniden hesaplayın.
"catalog":
İki alan yayında, üç alan planlanıyor. Tek sözleşme.
Bu veriyi yasal olarak embed edip retrieval'da kullanabilir miyim?
Evet — bütün amaç bu. Her veri seti, RAG, embedding ve retrieval kullanımına açıkça izin veren bir lisansla gelir. Pro ve Enterprise lisansları tazminat teminatı içerir. Scraping'in gri bölgesi yok: birincil kaynaklardan toplarız, robots.txt ve opt-out'lara uyarız ve kişisel veriyi hash'lenmeden önce her kayıttan ayıklarız.
Kökeni nasıl doğrularım?
Her kayıt kaynak URL'sini, çekilme zamanını ve ham yanıtın SHA-256 değerini taşır. Her sürüm, her dosya için bir SHA-256 ve sıralı chunk hash'leri üzerinde bir Merkle root içeren bir manifest ile gelir. Dosya hash'lerini yeniden hesaplayın, kökü chunks.jsonl'den yeniden kurun, karşılaştırın — kendi kodunuzdan birkaç satır, bizim kodumuzdan hiç. Bunu tam geçmişi içeren bir sürüm üzerinde ayrı bir implementasyonla birebir çalıştırdık ve kökler eşleşti.
Veri setleri ne sıklıkla güncellenir?
Sıklık veri setine ve plana göre değişir: Starter haftalık sürümler yayınlar, Pro günlük. Her sürüm numaralıdır ve kayıt ile chunk ID'leri sürümler arasında sabit olduğu için istediğiniz iki sürümü kendiniz karşılaştırıp neyin oynadığını tam olarak görebilirsiniz.
Hangi formatlarda teslim ediyorsunuz?
Kayıtlar ve retrieval'a hazır chunk'lar için JSONL; ayrıca her sürüm için her dosyanın SHA-256 değerini ve byte sayısını, kayıt ve chunk sayılarını, kalite metriklerini ve sıralı chunk hash'leri üzerindeki Merkle root'u taşıyan bir manifest.json.
Ödemeden önce deneyebilir miyim?
Bugün örnek bir veri seti üzerinden değil — derlem büyürken örnek erişimi kapalı ve yakında açılıyor. Bu arada hangi derlemi değerlendirdiğinizi yazın: gerçek bir sürümü birlikte gezelim — manifest, dosya başına SHA-256 ve Merkle root — kökü kendi kodunuzla, tek kuruş ödemeden yeniden hesaplayın.
Özel alanlar geliştiriyor musunuz?
Enterprise planında, sizin kaynak listenize göre özel alanlar ve konnektörler geliştiriyoruz; tazelik koşulları sözleşmede belirlenir. Retrieval katmanınızda neyin eksik olduğunu iletişim formundan yazın.