merkleset

$ sha256sum chunks.jsonl zgodny z manifestem

Dane gotowe do RAG.
Pochodzenie można zweryfikować.

Kryptograficznie weryfikowalne zbiory danych ze źródeł pierwotnych, z licencją na użycie w AI. Każdy rekord zahashowany, każde wydanie z własnym Merkle root, każde ID stabilne w kolejnych wydaniach — żeby warstwa RAG stała na danych, które da się obronić.

dostęp do próbek już wkrótce · pełny łańcuch pochodzenia w każdym rekordzie · wyłącznie źródła pierwotne

us-federal-procurement@2026.08.10 / manifest.jsonweryfikowalne
4b1d9e2cc7a01f8eab52630de9f42d7b8c3a5e91f04d7ba6d2c83a6f9f2c
merkle_root9f2c41ab…c135e41aweryfikowalne wydanie

"why_merkleset":

Dane, które można pokazać działowi prawnemu

Weryfikowalne pochodzenie

Każdy rekord ma źródłowy URL, znacznik czasu pobrania i SHA-256. Do każdego wydania dołączony jest manifest z Merkle root po hashach wszystkich chunków — przelicz go z pobranych plików i sprawdź dowolny rekord samodzielnie.

source_url · fetched_at · sha256

Licencja na RAG

Wyraźna licencja na użycie w RAG i embeddingach zamiast szarej strefy, z ochroną odszkodowawczą w planach Pro i Enterprise. Analiza prawna to jedna strona, nie czterdzieści.

embedding_use: permitted

Stabilne ID w kolejnych wydaniach

record_id to UUID v5 ze zbioru danych i klucza naturalnego; chunk_id to adres oparty na treści. Ten sam chunk w dwóch wydaniach ma to samo ID i ten sam hash, więc sam porównasz wydania i przeliczysz embeddingi tylko dla tego, co się ruszyło.

record_id · chunk_id · stable across releases

Dwa korpusy dostępne, pięć na mapie

Federalne zamówienia w USA i regulacje są dostępne dziś; sądy, raporty SEC i e-commerce są w planach. Wszystko zbierane ze źródeł pierwotnych — nigdy z odsprzedawanych feedów dostawców.

procurement ✓ regulatory ✓ courts · sec · ecommerce

"how_it_works":

Pipeline, nie obietnice

  1. 01 collect

    Zbieramy ze źródeł pierwotnych

    Oficjalne pliki zbiorcze i publiczne API — dziś SAM.gov i Federal Register. Każda surowa odpowiedź trafia do własnego rekordu dowodowego i jest hashowana w momencie pobrania.

  2. 02 normalize

    Normalizujemy i dzielimy na chunki ze stabilnymi ID

    Wyczyszczone, ustrukturyzowane, podzielone na chunki pod wyszukiwanie. ID chunka to adres oparty na treści, więc niezmieniony chunk zachowuje swoje ID w kolejnych wydaniach.

  3. 03 release

    Wersjonowane wydania pobiera się przez API

    JSONL plus manifest do każdego wydania, z SHA-256 każdego pliku i Merkle root. Przelicz korzeń, zanim do indeksu wejdzie choćby jeden bajt.

"catalog":

Dwie nisze dostępne, trzy w planach. Jeden kontrakt.

"pricing":

Ceny na stronie, za zbiór danych

pełny cennik

demo

0 USD

dostęp do próbek wkrótce

  • Próbka ewaluacyjna, wkrótce
  • Pełny łańcuch pochodzenia w każdym rekordzie
  • Merkle root po hashach wszystkich chunków
  • Ten sam JSONL co w planach płatnych
Porozmawiajmy o próbce

starter

99 USD/mies.

za zbiór danych / miesiąc

  • Cotygodniowe wydania
  • JSONL + manifest z Merkle root
  • Pola pochodzenia w każdym rekordzie
  • Wsparcie e-mailowe
Napisz, aby wykupić subskrypcję
najpopularniejszy

pro

299 USD/mies.

za zbiór danych / miesiąc

  • Codzienne wydania
  • Stabilne ID rekordów i chunków w kolejnych wydaniach
  • Licencja na RAG i embeddingi z ochroną odszkodowawczą
  • Wsparcie priorytetowe
Napisz, aby wykupić subskrypcję

enterprise

Indywidualnie

umowa indywidualna

  • Wszystkie zbiory danych, które publikujemy
  • Aktualność i wsparcie ustalone w umowie
  • Własne nisze i konektory
  • Dedykowane wsparcie
Skontaktuj się z nami

"faq":

Pytania, które naprawdę zadają kupujący

Czy można legalnie tworzyć embeddingi i wyszukiwać po tych danych?

Tak — o to właśnie chodzi. Każdy zbiór danych ma wyraźną licencję zezwalającą na użycie w RAG, embeddingach i wyszukiwaniu. W planach Pro i Enterprise licencja obejmuje ochronę odszkodowawczą. Żadnych szarych stref scrapingu: zbieramy ze źródeł pierwotnych, respektujemy robots.txt i sygnały opt-out, a dane osobowe odfiltrowujemy z każdego rekordu, zanim policzymy jego hash.

Jak zweryfikować pochodzenie?

Każdy rekord ma źródłowy URL, znacznik czasu pobrania i SHA-256 surowej odpowiedzi. Do każdego wydania dołączony jest manifest z SHA-256 każdego pliku i Merkle root po uporządkowanych hashach chunków. Przelicz hashe plików, odtwórz korzeń z chunks.jsonl i porównaj — to kilka linii twojego własnego kodu, nie naszego. Zrobiliśmy dokładnie to na wydaniu z pełną historią, osobną implementacją — korzenie się zgodziły.

Jak często aktualizowane są zbiory danych?

Częstotliwość zależy od zbioru danych i planu: w Starterze wydania są cotygodniowe, w Pro — codzienne. Każde wydanie ma wersję, a ponieważ ID rekordów i chunków są stabilne w kolejnych wydaniach, sam porównasz dowolne dwa i zobaczysz, co dokładnie się ruszyło.

W jakich formatach dostarczane są dane?

JSONL dla rekordów i gotowych do wyszukiwania chunków oraz manifest.json do każdego wydania — z SHA-256 i rozmiarem w bajtach każdego pliku, licznikami rekordów i chunków, metrykami jakości oraz Merkle root po uporządkowanych hashach chunków.

Czy można wypróbować przed zapłatą?

Dziś nie na próbce zbioru danych — dostęp do próbek jest zamknięty, dopóki korpus rośnie, i otworzy się wkrótce. W międzyczasie napisz, który korpus oceniasz: przejdziemy z tobą prawdziwe wydanie — manifest, SHA-256 każdego pliku i Merkle root — a korzeń przeliczysz własnym kodem, zanim zapłacisz cokolwiek.

Czy budujecie własne nisze?

W planie Enterprise budujemy własne nisze i konektory pod twoją listę źródeł, a warunki aktualności ustalamy w umowie. Napisz przez formularz kontaktowy, czego brakuje twojej warstwie RAG.