Датасеты
Каталог из 15 датасетов для обучения и оценки моделей в сети AETRON: лицензия, объём, формат и с какими типами задач датасет сочетается.
- FineWeb · Hugging Face
Англоязычный веб-корпус на 15T токенов из 96 срезов CommonCrawl — открытый стандарт для предобучения.
- OpenAssistant Conversations 2 (OASST2) · OpenAssistant / LAION
Написанные людьми диалоги с ассистентом на 35 языках с оценками качества, включая русский.
- Tulu 3 SFT Mixture · Allen Institute for AI (Ai2)
Смесь Ai2 из 939 тысяч примеров SFT, на которой построена Tulu 3 — открытый рецепт постобучения уровня SOTA.
- UltraFeedback · OpenBMB / Tsinghua
64 тысячи запросов и 256 тысяч ответов с разметкой GPT-4 — стандартный набор предпочтений для DPO.
- HH-RLHF · Anthropic
Пары предпочтений Anthropic по полезности и безвредности плюс диалоги красной команды.
- MMLU · CAIS / Dan Hendrycks
Бенчмарк с выбором ответа по 57 предметам — фактический экзамен на знания для LLM.
- GSM8K · OpenAI
8.5 тысячи школьных текстовых задач по математике с пошаговыми решениями — базовый бенчмарк на рассуждения.
- MS MARCO · Microsoft
Корпус Bing на миллион вопросов и ответов с ранжированием фрагментов — для поиска и RAG.
- Common Voice 17.0 · Mozilla Foundation
Краудсорсинговый речевой корпус Mozilla — 31 тысяча часов, более 120 языков, лицензия CC0.
- LibriSpeech ASR · OpenSLR
Тысяча часов начитанных английских аудиокниг — классический бенчмарк распознавания речи.
- LJ Speech 1.1 · Keith Ito / LibriVox
13.1 тысячи фрагментов речи одного английского диктора — стандартный корпус для синтеза речи.
- COCO 2017 · COCO Consortium
123 тысячи изображений с подписями, рамками объектов и масками сегментации.
- ImageNet-1K (ILSVRC 2012) · ImageNet (Stanford / Princeton)
Канонический бенчмарк классификации: 1.28 миллиона изображений, 1000 классов. Только для исследований.
- DiffusionDB · Georgia Tech / Polo Club
14 миллионов изображений Stable Diffusion вместе с точными запросами, по которым они получены.
- LLaVA-Instruct-150K · LLaVA Team (Liu et al.)
158 тысяч визуальных инструкций, сгенерированных GPT-4 по изображениям COCO. Только для исследований.