MCG-NJU / VideoChat3-Academic2M
学术视频指令数据,用于视频字幕、问答和动作理解
下载 2.0k · 收藏 20 · 1天前更新
- py from datasets import load_dataset ds = load_dataset("MCG-NJU/VideoChat3-Academic2M")
来自 HuggingFace · 能训练、能接地的数据集 · 最近 14 天 · 共 44 个数据集
学术视频指令数据,用于视频字幕、问答和动作理解
下载 2.0k · 收藏 20 · 1天前更新
从CommonCrawl清洗去重后的英文网页文本数据集
下载 626k · 收藏 3.0k · 1年前更新
大规模网页预训练语料(15 万亿 token),在同等规模数据集中表现领先
FineWeb: decanting the web for the finest text data at scaleFineWeb-Edu: How to Make a Very High-Quality Dataset to Pre-train ...lmmx/bbcfw: Exploring the BBC News subset of the FineWeb dataset ...
截至 2026-06-20
来自GitHub的代码文件,覆盖32种编程语言
下载 5.7M · 收藏 406 · 3年前更新
人类偏好数据,用于训练帮助性和无害性奖励模型
下载 32k · 收藏 1.8k · 3年前更新
作为 RLHF 早期开源基准被广泛引用,但社区实际使用中发现标注质量参差不齐,部分样本的偏好标签存在明显错误。
GitHub - anthropics/hh-rlhfRLHF-Aligned Open LLMs: A Comparative Survey - Preprints.orgAnthropic RLHF Dataset: Human Preference Data (+ errors I found)
截至 2026-06-20
增强的FLAN指令数据集,用于对齐训练
下载 17k · 收藏 1.6k · 1年前更新
OpenOrca 是微软 Orca 论文思路的开源复现,用 GPT-4 生成指令数据训练小模型,社区反馈模型能力有提升但会「以为自己是 ChatGPT」。
Open Orca Dataset Released! : r/LocalLLaMA - RedditJust tried Mistral-7B-OpenOrca-GGUF. It's impressive - Hacker NewsOpen-Orca-Platypus is out! a 13b that surpasses llama65b!? - Reddit
截至 2026-06-20
多语言人类助手对话数据集,包含质量评分
下载 18k · 收藏 1.6k · 3年前更新
社区众包收集的大规模对话数据集,带有人工质量/毒性/创意等多维标注,但项目已于2023年10月终止,被oasst2取代。
OpenAssistant/oasst1 · Datasets at Hugging FaceIt was fully released, no? https://huggingface.co/datasets ...OpenAssistant RELEASED! The world's best open-source Chat AI!
截至 2026-06-20
已被取代 oasst2 · oasst1 为 2023 年 4 月的中期快照,oasst2 为数据收集结束后的最终版本
AI提示词(prompts)的社交平台镜像数据集
下载 32k · 收藏 9.8k · 今天更新
由 awesome-chatgpt-prompts 演进而来的开源提示词集合,社区视其为从静态列表升级为可自托管工具的延续
GitHub - f/prompts.chat: f.k.a. Awesome ChatGPT Prompts. Share, discover, and collect prompts from the community. Free and open source — self-host for your organization with complete privacy. · GitHubprompts.chat: Free and Open Source Prompt Collection Tool - Redditfka/prompts.chat · Datasets at Hugging FaceUpdate prompts.csv · fka/prompts.chat at 25a2a44
截至 2026-06-20
小学数学应用题,需多步算术推理。
下载 926k · 收藏 1.4k · 3个月前更新
GSM8K 是多步算术推理评测的事实标准之一,被主流实验室广泛采用,但原始的结果导向评分方式对推理过程质量的区分度有限。
GitHub - openai/grade-school-mathHow Surge AI Built OpenAI's GSM8K Dataset of 8,500 Math ProblemsGSM8K - Epoch AIMR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation
截至 2026-06-20
168款游戏的PC/主机屏幕录制,仅保留操作和菜单等游戏内内容
下载 29k · 收藏 176 · 20天前更新
ARC-AGI-3推理任务的AI模型行为轨迹与事件日志
下载 0 · 收藏 16 · 4天前更新
软件工程智能体指令微调的agent轨迹数据集
下载 8.0k · 收藏 53 · 4天前更新
多来源开源蒸馏数据集,涵盖代码、教学等8类内容
下载 4.5k · 收藏 17 · 13天前更新
来自DeepSeek、Qwen等模型的推理链,用于训练小语言模型
下载 95 · 收藏 13 · 10天前更新
Fable 5 编程智能体轨迹数据,用于策略学习与推理动作蒸馏
下载 74k · 收藏 604 · 21天前更新
唯一公开捕获了 Fable-5 绕过反蒸馏分类器的思维链痕迹的数据集,但仅覆盖约 4 天窗口期的 4659 条编码轨迹,规模有限。
Claude Fable 5 distilled : r/LocalLLMClaude Fable 5 distilled : r/LocalLLaMAClaude Fable 5 distilled : r/LLMDevs
截至 2026-06-20
Claude Fable 5 智能体原始轨迹,与 Fable-5-traces 内容相同
下载 18k · 收藏 305 · 1个月前更新
社区普遍认为 Fable 5 在编程任务上仅处于中游水平,并非 Anthropic 所宣传的颠覆性突破。
Claude Fable 5: mid-tier results on coding tasks : r/hackernewsClaude Fable 5 it's slow, generates insecure code, its guardrails are easily bypassed and is a shameless cheater. : r/theprimeagenClaude Fable 5 | Hacker News
截至 2026-06-20
UltraX 函数调用精炼框架的预览数据集,用于预训练数据自适应编辑
下载 651 · 收藏 22 · 8天前更新
arXiv 论文 LaTeX 源文件全量语料,预处理格式化为 Parquet
下载 33k · 收藏 72 · 7天前更新
土耳其语的指令微调对话数据
下载 4 · 收藏 15 · 8天前更新
GLM-5.2生成的Agent跟踪数据,含工具模式
下载 2.6k · 收藏 40 · 19天前更新
将长推理链转化为简短摘要的数据集
下载 168 · 收藏 15 · 15天前更新
用于分层扩散视频编辑的内容保持视频数据集
下载 12k · 收藏 20 · 21天前更新
基于真实环境轨迹的语言世界模型评估基准
下载 2.2k · 收藏 76 · 16天前更新
用于统一视觉理解与几何任务的大规模多模态视觉语料
下载 1.8k · 收藏 14 · 10天前更新
俄罗斯IT博客habr.com的帖子与评论数据
下载 528 · 收藏 72 · 3个月前更新
基于FABLE.5/Claude的推理轨迹数据,经来源清理
下载 7.5k · 收藏 87 · 13天前更新
使用grug简短思考风格的Agent对话数据
下载 301 · 收藏 15 · 11天前更新
大规模四川话语料,带丰富标注的语音数据集
下载 432 · 收藏 142 · 13天前更新
千小时高精度光学动捕数据,覆盖多场景多任务与物体6D位姿
下载 1.2k · 收藏 16 · 13天前更新
合成4D多视角视频、深度与物体跟踪数据集
下载 14k · 收藏 11 · 12天前更新
面向antidoom风格生成和偏好数据的仅提示训练混合
下载 86 · 收藏 23 · 13天前更新
从Common Crawl CC-News提取的多语言新闻语料
下载 30k · 收藏 18 · 19天前更新
用于负面提示的文本嵌入/嵌入文件
下载 1.7k · 收藏 952 · 3年前更新
能简化负面提示词编写并提升画质,但会显著改变画面艺术风格,使用前需权衡。
Nerfgun3/bad_prompt · Datasets at Hugging FaceNerfgun3/bad_prompt · Confuse: What's the right prompt I should use?New Negative Embedding ~ negative_hand : r/StableDiffusion
截至 2026-06-20
开放语料库,用于语言模型预训练研究
下载 4.1k · 收藏 1.1k · 2年前更新
Dolma 是当时规模最大的开放预训练语料库,主要服务于 OLMo 模型训练,社区认可其透明度但实际使用中存在工程与合规摩擦。
Dolma: An Open Corpus of 3 Trillion Tokens for Language Model ...Ai2 Dolma: 3 trillion token open corpus for language model pretrainingOlmo 3: Charting a path through the model flow to lead open-source AIallenai/dolma · Discussions
截至 2026-06-20
已被取代 Dolma 3 Dolmino · Dolma v1 已被 Dolma 3 Dolmino 取代,后者是 OLMo 3 第二阶段退火训练使用的高质量数据池。
由人工生成的指令跟随数据集,覆盖多种任务类型
下载 42k · 收藏 995 · 3年前更新
首个开放商用许可的人工生成指令数据集,但因规模小(15k条)且存在标注噪声、毒性内容等质量问题,已被更大更干净的数据集替代
Dolly: Open Instruction-Tuned LLM | Databricks BlogCleanlab/databricks-dolly-15k-cleanset · Datasets at Hugging Face[D] Databricks Dolly 15k - Creating Synthetic Variants - Reddit
截至 2026-06-20
GPT生成的小词汇表短故事数据集
下载 85k · 收藏 1.1k · 1年前更新
社区普遍认可其为小模型研究与架构实验的有效基准数据集,尤其适合在消费级硬件上快速验证新想法。
TinyStories: How Small Can Language Models Be and Still Speak Coherent English | OpenReviewThe Smallest GPT with Coherent English (by Microsoft) : r/LocalLLaMAroneneldan/TinyStories-33M Free Chat Online - skywork.ai - SkyworkFor small models this is for sure the way forward ... - Hacker News
截至 2026-06-20
由OpenAI引擎生成的指令和演示数据集
下载 80k · 收藏 1.0k · 3年前更新
早期有影响力的指令微调数据集,全量合成自 Self-Instruct,但因数据质量问题和底层模型许可限制,实际落地使用有限。
截至 2026-06-20
过滤和去重后的英文CommonCrawl网页数据集
下载 15k · 收藏 932 · 3年前更新
发布时 Falcon 凭此数据集登顶 Open LLM Leaderboard,证明了大规模过滤去重的纯网页数据路线可行,但 CommonCrawl 快照陈旧,如今已非首选。
tiiuae-falcon-7b - AI Model Catalog | Microsoft Foundry Models[2306.01116] The RefinedWeb Dataset for Falcon LLM - ar5ivtiiuae/falcon-refinedweb · Datasets at Hugging Face[N] Abu Dhabi's TTI releases open-source Falcon-7B and -40B LLMs : r/MachineLearning
截至 2026-06-20
模仿Claude Mythos的合成SFT数据集,涵盖网络安全等多个领域。
下载 3.9k · 收藏 143 · 2个月前更新
HF 安全扫描标记可疑 · VirusTotal 1/74· 低比例多为数据内含代码触发的误报,查看报告自行判断查看报告
包含用户历史行为与内容元数据的跨域推荐数据集。
下载 18k · 收藏 13 · 19天前更新
维基百科清洗后的文章数据集,覆盖所有语言。
下载 197k · 收藏 1.3k · 2年前更新
Wikipedia 被社区视为不可或缺的公共知识基础设施,界面干净无广告追踪,但面临 AI 摘要导致的流量下滑和偶发的安全事件挑战。
[MEGATHREAD] Wikimedia wikis locked / Accounts compromisedWikipedia says traffic is falling due to AI search summaries and social video | Hacker NewsOpinion on donating to Wikipedia? : r/BuyFromEUWikipedia/Wikimedia is worth hundreds of dollars per year to me. I ...
截至 2026-06-20
基于可验证医疗问题的推理链SFT数据集,来自Deepseek-R1蒸馏。
下载 11k · 收藏 1.1k · 1年前更新
HuatuoGPT-o1 的 SFT 训练数据集,由 GPT-4o 生成的带复杂思维链的医疗问答题,Apache 2.0 许可,社区主要将其用于医疗 LLM 推理能力微调。
截至 2026-06-20
从FineWeb中筛选的教育类网页数据集,使用LLM分类器。
下载 382k · 收藏 1.2k · 1年前更新
社区认可其开放透明(脚本完整公开)与教育子集的高质量,认为技术报告为预训练数据构建提供了宝贵参考
FineWeb: Decanting the web for the finest text data at scale | Hacker NewsFineWeb-Edu: How to Make a Very High-Quality Dataset to Pre-train ...
截至 2026-06-20
用于Stable Diffusion的负面嵌入,基于Counterfeit模型训练。
下载 19k · 收藏 1.2k · 3年前更新
SD 1.5 生态中广泛使用的负向嵌入,对抑制单色、重复图案有效,但与 SDXL/Pony/Illustrious 不兼容且会大幅改变画面风格。
A simple comparison of Easy Negative and Bad Prompt v2 - RedditI can't figure out why my easynegative embedding isn't workingeasynegative changes styles too much : r/StableDiffusion - RedditHow are some people able to use EasyNegative on PonyDiffusion ...
截至 2026-06-20
完全开源的LLaMa数据集复现(RedPajama)。
下载 2.1k · 收藏 1.2k · 2年前更新
RedPajama-1T是LLaMA训练数据配方的早期开源复现,已被RedPajama-V2取代
RedPajama-Data-v2: An open dataset with 30 trillion tokens for training large language modelsGitHub - togethercomputer/RedPajama-Data: The RedPajama-Data repository contains code for preparing large datasets for training large language models. · GitHub
截至 2026-06-20
已被取代 RedPajama-Data-V2 · V2 将规模从 1.2T 扩展到 30T tokens,覆盖 84 个 CommonCrawl 快照,是官方推荐的后续版本
查看全部数据集 归档 →
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索