Криптографически проверяемые датасеты из первоисточников, с лицензией для ИИ. Каждая запись захеширована, у каждого релиза есть Merkle root, каждый ID стабилен во всех релизах — чтобы ваш RAG-слой стоял на данных, которые вы сможете защитить.
Каждая запись несёт исходный URL, время загрузки и SHA-256. С каждым релизом идёт манифест с Merkle root по хешам всех чанков — пересчитайте его из скачанных файлов и проверьте любую запись сами.
source_url · fetched_at · sha256
Лицензия для RAG
Явная лицензия на использование в RAG и эмбеддингах вместо серой зоны, с возмещением убытков на Pro и Enterprise. Юридическая проверка — одна страница, а не сорок.
embedding_use: permitted
Стабильные ID во всех релизах
record_id — это UUID v5 от датасета и естественного ключа; chunk_id — адрес по содержимому. Один и тот же чанк в двух релизах несёт тот же ID и тот же хеш, так что вы сами сравните релизы и пересчитаете эмбеддинги только для изменившегося.
record_id · chunk_id · stable across releases
Два корпуса доступны, пять на карте
Федеральные закупки США и регулирование доступны сегодня; суды, отчётность SEC и электронная коммерция — в плане развития. Всё собирается из первоисточников — никогда не перепроданные фиды вендоров.
Официальные массовые выгрузки и публичные API — сегодня SAM.gov и Federal Register. Каждый сырой ответ сохраняется отдельной записью-доказательством и хешируется в момент загрузки.
→
02normalize
Нормализуем и режем на чанки со стабильными ID
Очищено, структурировано, нарезано на чанки для поиска. ID чанка — адрес по содержимому, поэтому неизменившийся чанк сохраняет свой ID во всех релизах.
→
03release
Вы забираете версионированные релизы через API
JSONL плюс манифест на каждый релиз, с SHA-256 каждого файла и Merkle root. Пересчитайте корень, прежде чем в ваш индекс попадёт хоть один байт.
Можно ли легально строить эмбеддинги и поиск по этим данным?
Да — в этом и смысл. Каждый датасет поставляется с явной лицензией, которая разрешает использование в RAG, эмбеддингах и поиске. В Pro и Enterprise лицензия включает возмещение убытков. Никаких серых зон со скрейпингом: мы собираем из первоисточников, соблюдаем robots.txt и opt-out-сигналы и отфильтровываем персональные данные из каждой записи до того, как считается её хеш.
Как проверить происхождение?
Каждая запись несёт исходный URL, время загрузки и SHA-256 сырого ответа. С каждым релизом идёт манифест с SHA-256 каждого файла и Merkle root по упорядоченным хешам чанков. Пересчитайте хеши файлов, соберите корень заново из chunks.jsonl и сравните — это несколько строк вашего собственного кода, не нашего. Мы сами прогнали эту проверку на релизе с полной историей, отдельной реализацией — корни совпали.
Как часто обновляются датасеты?
Частота зависит от датасета и плана: на Starter релизы выходят раз в неделю, на Pro — ежедневно. У каждого релиза есть версия, а поскольку ID записей и чанков стабильны во всех релизах, вы сами сравните любые два и увидите, что именно изменилось.
В каких форматах вы поставляете данные?
JSONL для записей и готовых к поиску чанков плюс manifest.json на каждый релиз — с SHA-256 и размером в байтах каждого файла, счётчиками записей и чанков, метриками качества и Merkle root по упорядоченным хешам чанков.
Можно ли попробовать до оплаты?
Сегодня — не через образец датасета: доступ к образцам закрыт, пока растёт корпус, и откроется скоро. А пока напишите, какой корпус вы оцениваете: мы разберём с вами реальный релиз — манифест, SHA-256 каждого файла и Merkle root — и вы пересчитаете корень своим кодом до любой оплаты.
Делаете ли вы кастомные ниши?
На плане Enterprise мы собираем кастомные ниши и коннекторы по вашему списку источников, а условия по свежести данных фиксируем в договоре. Напишите через форму, чего не хватает вашему RAG-слою.