nvidia / Nemotron-Personas-El-Salvador
萨尔瓦多西班牙语合成人格数据,基于真实分布
下载 1.4k · 收藏 31 · 1个月前更新
- py from datasets import load_dataset ds = load_dataset("nvidia/Nemotron-Personas-El-Salvador")
萨尔瓦多西班牙语合成人格数据,基于真实分布
下载 1.4k · 收藏 31 · 1个月前更新
合成编码智能体会话轨迹,远程模型与本地模型配对
下载 1.6k · 收藏 23 · 1个月前更新
人类偏好数据,用于RLHF训练帮助性和无害性
下载 37k · 收藏 1.8k · 3年前更新
作为 RLHF 早期开源基准被广泛引用,但社区实际使用中发现标注质量参差不齐,部分样本的偏好标签存在明显错误。
GitHub - anthropics/hh-rlhfRLHF-Aligned Open LLMs: A Comparative Survey - Preprints.orgAnthropic RLHF Dataset: Human Preference Data (+ errors I found)
截至 2026-06-20
从CommonCrawl清洗去重的英文网络文本数据
下载 992k · 收藏 2.9k · 1年前更新
大规模网页预训练语料(15 万亿 token),在同等规模数据集中表现领先
FineWeb: decanting the web for the finest text data at scaleFineWeb-Edu: How to Make a Very High-Quality Dataset to Pre-train ...lmmx/bbcfw: Exploring the BBC News subset of the FineWeb dataset ...
截至 2026-06-20
增强FLAN数据,对齐Orca论文的指令数据
下载 25k · 收藏 1.6k · 1年前更新
OpenOrca 是微软 Orca 论文思路的开源复现,用 GPT-4 生成指令数据训练小模型,社区反馈模型能力有提升但会「以为自己是 ChatGPT」。
Open Orca Dataset Released! : r/LocalLLaMA - RedditJust tried Mistral-7B-OpenOrca-GGUF. It's impressive - Hacker NewsOpen-Orca-Platypus is out! a 13b that surpasses llama65b!? - Reddit
截至 2026-06-20
多语言人类助手对话语料,含质量评级
下载 23k · 收藏 1.5k · 3年前更新
社区众包收集的大规模对话数据集,带有人工质量/毒性/创意等多维标注,但项目已于2023年10月终止,被oasst2取代。
OpenAssistant/oasst1 · Datasets at Hugging FaceIt was fully released, no? https://huggingface.co/datasets ...OpenAssistant RELEASED! The world's best open-source Chat AI!
截至 2026-06-20
已被取代 oasst2 · oasst1 为 2023 年 4 月的中期快照,oasst2 为数据收集结束后的最终版本
AI提示词社区收集的提示词数据集
下载 27k · 收藏 9.7k · 1个月前更新
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索