Датасеты

Каталог из 15 датасетов для обучения и оценки моделей в сети AETRON: лицензия, объём, формат и с какими типами задач датасет сочетается.

  • FineWeb · Hugging Face

    Англоязычный веб-корпус на 15T токенов из 96 срезов CommonCrawl — открытый стандарт для предобучения.

  • OpenAssistant Conversations 2 (OASST2) · OpenAssistant / LAION

    Написанные людьми диалоги с ассистентом на 35 языках с оценками качества, включая русский.

  • Tulu 3 SFT Mixture · Allen Institute for AI (Ai2)

    Смесь Ai2 из 939 тысяч примеров SFT, на которой построена Tulu 3 — открытый рецепт постобучения уровня SOTA.

  • UltraFeedback · OpenBMB / Tsinghua

    64 тысячи запросов и 256 тысяч ответов с разметкой GPT-4 — стандартный набор предпочтений для DPO.

  • HH-RLHF · Anthropic

    Пары предпочтений Anthropic по полезности и безвредности плюс диалоги красной команды.

  • MMLU · CAIS / Dan Hendrycks

    Бенчмарк с выбором ответа по 57 предметам — фактический экзамен на знания для LLM.

  • GSM8K · OpenAI

    8.5 тысячи школьных текстовых задач по математике с пошаговыми решениями — базовый бенчмарк на рассуждения.

  • MS MARCO · Microsoft

    Корпус Bing на миллион вопросов и ответов с ранжированием фрагментов — для поиска и RAG.

  • Common Voice 17.0 · Mozilla Foundation

    Краудсорсинговый речевой корпус Mozilla — 31 тысяча часов, более 120 языков, лицензия CC0.

  • LibriSpeech ASR · OpenSLR

    Тысяча часов начитанных английских аудиокниг — классический бенчмарк распознавания речи.

  • LJ Speech 1.1 · Keith Ito / LibriVox

    13.1 тысячи фрагментов речи одного английского диктора — стандартный корпус для синтеза речи.

  • COCO 2017 · COCO Consortium

    123 тысячи изображений с подписями, рамками объектов и масками сегментации.

  • ImageNet-1K (ILSVRC 2012) · ImageNet (Stanford / Princeton)

    Канонический бенчмарк классификации: 1.28 миллиона изображений, 1000 классов. Только для исследований.

  • DiffusionDB · Georgia Tech / Polo Club

    14 миллионов изображений Stable Diffusion вместе с точными запросами, по которым они получены.

  • LLaVA-Instruct-150K · LLaVA Team (Liu et al.)

    158 тысяч визуальных инструкций, сгенерированных GPT-4 по изображениям COCO. Только для исследований.