SummFlow 2026-06-08 Hugging Face

nvidia / Nemotron-Personas-Vietnam

基于越南人口分布生成的合成人物画像数据集

10.0万行 · 123 MB

  • 多模态
  • 文本生成
  • cc-by-4.0 · 可商用

下载 1.5k · 收藏 25 · 1个月前更新

社区实测

由FPT与NVIDIA联合发布的面向越南的合成人物画像数据集,约90万条,开放且允许商用,定位服务于越南及东南亚的主权AI与本地化应用开发。

  • 为越南及东南亚的本地化/主权AI开发提供开放可商用的数据基础
  • 覆盖越南语言、文化、劳动力及经济条件的人物画像,支撑更贴合本地场景的AI系统构建
  • 数据集为合成(synthetic)生成,非真实人群采样,在真实场景中的分布代表性未经独立验证

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("nvidia/Nemotron-Personas-Vietnam")

allenai / dolma

用于语言模型预训练研究的大规模英文开放语料库

6.1 TB

  • >1T
  • 文本生成
  • odc-by · 可商用

下载 4.4k · 收藏 1.0k · 2年前更新

社区实测

Dolma 是当时规模最大的开放预训练语料库,主要服务于 OLMo 模型训练,社区认可其透明度但实际使用中存在工程与合规摩擦。

  • 提供可公开获取、可审计的预训练数据,使研究者能间接研究闭源模型的训练数据构成
  • 覆盖网页、学术文献、代码、书籍、百科等多领域内容
  • 使用 AI2 Impact License 而非标准开放许可
  • HuggingFace 讨论区有用户标记法律合规问题
  • v1.7 存在重复文档
  • 已被 Dolma 3 取代,v1.x 不再是最新版本
  • 下载与存储工程门槛高,wget 脚本有覆盖/跳过问题
  • 流式访问报错,开箱体验不稳定

截至 2026-06-20

已被取代 Dolma 3 Dolmino · Dolma v1 已被 Dolma 3 Dolmino 取代,后者是 OLMo 3 第二阶段退火训练使用的高质量数据池。

databricks / databricks-dolly-15k

由Databricks员工生成的指令跟随数据集,涵盖多种任务类别

1.5万行 · 267 MB

  • 文本
  • 问答
  • 摘要
  • cc-by-sa-3.0 · 可商用

下载 32k · 收藏 982 · 3年前更新

社区实测

首个开放商用许可的人工生成指令数据集,但因规模小(15k条)且存在标注噪声、毒性内容等质量问题,已被更大更干净的数据集替代

  • 提供明确允许商用的开源指令微调数据集许可
  • 以人工众包方式生成指令-回复对,区别于纯合成数据路线
  • Cleanlab清洗版分析显示原始数据存在毒性评分高达0.99、非英语内容评分达0.91等质量问题
  • 部分回复含时效性事实陈述(如'曼联现任主帅是滕哈格'),已过时
  • 存在空回复(null)条目
  • 社区讨论质疑该数据集当前是否仍有价值

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("databricks/databricks-dolly-15k")

Nerfgun3 / bad_prompt

用于稳定扩散的负面提示词嵌入训练数据集

1 行 · 14 MB

  • 图像
  • creativeml-openrail-m · 可商用

下载 2.6k · 收藏 947 · 3年前更新

社区实测

能简化负面提示词编写并提升画质,但会显著改变画面艺术风格,使用前需权衡。

  • 将负面提示词统一为单个嵌入词,简化负面提示编写
  • 提升图像质量
  • 会完全改变画面艺术风格,非纯质量增强型嵌入
  • 文件名与触发词命名存在混淆(bad_prompt_v2 与 bad_prompt_version2)

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("Nerfgun3/bad_prompt")