空间 / 全部
Space 体验目录
246 个永久空间及当前运行状态。按名称、作者或运行模型检索,按状态或用途筛选。
显示 246 / 246 个空间
用途筛选仅覆盖已核验条目;尚未核验的空间仍可在「全部用途」和文本搜索中找到。
- enzostvs / deepsite DeepSite 是一个 Vibe Coding 平台,利用生成式 AI 编写代码并生成应用程序;资料同时给出 DeepSeek-V3-0324 的 API 温度映射、文件上传与联网搜索提示词格式。
- open-llm-leaderboard / open_llm_leaderboard Open LLM 排行榜:跟踪、排名和评估开放大语言模型与聊天机器人,提供 React 前端、后端 API 与 Docker 容器化部署,用于可复现地对比模型。
- jbilcke-hf / ai-comic-factory 通过单条提示词生成漫画,结合大语言模型与 SDXL 模型进行图像生成,项目开源。
- Kwai-Kolors / Kolors-Virtual-Try-On 快手 Kolors 团队的虚拟试衣 demo,上传人物与服装图即可生成上身效果,底层基于 Kolors 扩散模型。
- black-forest-labs / FLUX.1-dev Black Forest Labs 开发的 120 亿参数 rectified flow transformer 文本到图像生成模型,开源权重,非商业许可。
- mteb / leaderboard 面向文本、图像、音频或视频的嵌入模型排行榜,用于评估和选择嵌入模型。
- dalle-mini / dalle-mini DALL·E Mini 的演示:根据文本提示生成图像,面向研究与个人使用;其中 DALL·E Mega 是最大版本,可用于创意等下游场景。
- AP123 / IllusionDiffusion IllusionDiffusion 是一个图像生成 demo,用于生成高质量的幻觉/视错觉艺术图像。资料未说明具体输入方式与模型细节。
- black-forest-labs / FLUX.1-schnell FLUX.1 [schnell] 的文本生成图像演示:12B 参数 rectified flow Transformer,经潜在对抗扩散蒸馏,1 至 4 步生成图像,Apache-2.0 许可,可商用。
- facebook / MusicGen Facebook Research 的 AudioCraft 音频生成库,包含 MusicGen 与 AudioGen 两个模型,提供高质量音频生成、训练与推理代码,依赖 Python 3.9 和 PyTorch 2.0。
- lmarena-ai / arena-leaderboard LMArena(原 LMSYS Chatbot Arena)的大模型匿名对战排行榜,由众包 pairwise 投票按 Elo / Bradley–Terry 为主流开闭源模型排名。
- nanotron / ultrascale-playbook 该 Space 是超大规模训练手册:面向大型 GPU 集群训练 LLM 的指南,包含本地安装与运行说明,采用 npm 构建与 HTML 片段加载。
- KlingTeam / LivePortrait LivePortrait 的官方 PyTorch 实现:将驱动视频中的人脸运动迁移到静态人像上,实现人像动画,具备拼接与重定向控制;仓库提供预训练权重和使用说明。
- mrfakename / Z-Image-Turbo Z-Image(造相)是一个 6B 参数图像生成模型,采用 Scalable Single-Stream DiT(S3-DiT)架构,支持照片级图像生成、中英文双语文字渲染、提示词增强与图像编辑。
- InstantX / InstantID InstantID 是一个免调参的保持身份一致性的图像生成 demo,输入单张人脸图像即可生成保持该身份的图像,支持多种下游任务;底层使用 SDXL、ControlNet 和 IP-Adapter,并搭配人脸编码器。
- hexgrad / Kokoro-TTS Kokoro-TTS 的演示空间,已升级至 v1.0,提供文本转语音(TTS)的在线生成能力。
- zerogpu-aoti / wan2-2-fp8da-aoti-faster 输入一张图片和一段文本提示,生成视频。演示基于 Wan 2.2 的 FP8 推理配置,属于图像到视频生成的人工智能应用。
- tencent / Hunyuan3D-2 腾讯推出的文本/图像到 3D 资产生成系统,包含形状生成模型 Hunyuan3D-DiT 与纹理合成模型 Hunyuan3D-Paint,基于扩散 Transformer。
- akhaliq / anycoder AnyCoder 是一个全栈 AI 代码生成应用,用户用自然语言描述需求即可生成应用,支持多种 AI 模型与多个语言,并可一键部署到 Hugging Face Spaces;前端 React/TypeScript,后端 FastAPI,许可证 Modified-MIT。
- HuggingFaceTB / smol-training-playbook 该 Space 是交互式科学写作模板,以网页形式呈现 LLM 训练手册,支持交互图表、数学、代码和可检查实验,采用 CC BY 4.0 许可。
- r3gm / wan2-2-fp8da-aoti-preview 输入图片和文本提示,生成对应视频,属于图生视频(image-to-video)生成任务。
- mukaist / Midjourney 基于 RealVisXL_Turbo 的高分辨率写实(IRL)图像生成 demo,标签为 MidJour。
- pharmapsychotic / CLIP-Interrogator 图像反推提示词工具,结合 CLIP 与 BLIP 分析图片,输出可复现该图风格的文本 prompt,常用于扩散模型的提示词逆向。
- not-lain / background-removal 图像抠图去背景 demo,基于 BRIA RMBG 分割模型一键分离前景主体并输出透明背景。
- mrfakename / E2-F5-TTS F5-TTS 与 E2-TTS 的非官方演示:零样本声音克隆,利用 Flow Matching 合成语音;本地需放置对应预训练检查点,相关代码与论文见 GitHub。
- sanchit-gandhi / whisper-jax Whisper 的 JAX 实现,借助 TPU 与批处理大幅提升长音频转写吞吐,相较原版 PyTorch 推理快数十倍。
- openai / whisper OpenAI 开源的 encoder–decoder Transformer 通用语音识别与翻译模型,68 万小时多语言多任务弱监督训练,在嘈杂、多口音与跨语言转写上鲁棒性强。
- HumanAIGC / OutfitAnyone 阿里 HumanAIGC 的虚拟试衣 demo,输入人物照与服装图,经两阶段扩散合成对应穿着效果,支持多体型与姿态。
- prithivMLmods / Qwen-Image-Edit-2511-LoRAs-Fast 该空间是 Qwen 图像编辑 LoRA 集合的演示,用于展示多个 Qwen 图像编辑 LoRA 模型在图像编辑任务上的具体应用效果。
- multimodalart / qwen-image-multiple-angles-3d-camera 基于 Qwen-Image 的多视角生成 demo,从单张图生成不同机位与 3D 相机视角的图像。
- selfit-camera / Omni-Image-Editor 提供图像编辑、文生图、图像放大、去水印等功能的图像处理demo。
- AI4Editing / MagicQuill 智能交互式图像编辑系统MagicQuill的演示,基于论文实现,支持用户对图像进行交互式编辑。
- r3gm / wan2-2-fp8da-aoti-preview-2c 此演示输入一张图像和一个文本提示词,模型基于二者生成视频,属于文本引导的图像到视频生成任务。
- Qwen / Qwen3-TTS
- microsoft / TRELLIS.2 从图像生成高保真3D模型的demo。
- DontPlanToEnd / UGI-Leaderboard 名为 UGI-Leaderboard 的排行榜 Space,展示 Uncensored General Intelligence 的排名。
- r3gm / wan2-2-fp8da-aoti-preview-2 输入图像和文本提示,生成对应视频。
- prithivMLmods / FireRed-Image-Edit-1.0-Fast 基于 Transformers 的图像编辑 demo,结合 FireRed-Image-Edit 和 Qwen-Image-Edit-Rapid。
- FrameAI4687 / Omni-Video-Factory 该演示对应 Omni-Video-Factory,属于视频生成/编辑工具,支持文本生成视频、图像生成视频以及视频延长三类输入输出。
- k2-fsa / OmniVoice 基于扩散语言模型的多语言零样本语音合成模型,支持600+语言,实现语音克隆与设计,推理速度快。
- kulkas2pintu / wan555 给定一张图像和一句文本提示,生成对应视频的 demo,属于文本引导的图像转视频生成任务。
- black-forest-labs / FLUX.2-dev
- prithivMLmods / Qwen-Image-Edit-2509-LoRAs-Fast 该空间展示 Qwen 图像编辑 LoRA 集合,演示多个 LoRA 模型在图像编辑任务上的具体应用效果。
- IndexTeam / IndexTTS-2-Demo 自回归零样本TTS,支持精确时长控制与文本情感指令
- agent-memory-leaderboard / leaderboard
- openbmb / VoxCPM-Demo VoxCPM2语音模型的Gradio演示,基于Nano-vLLM推理引擎,提供实验性推理接口。
- lerobot / visualize_dataset LeRobot数据集可视化工具,支持交互式浏览和分析机器人数据集,同步回放视频与传感器数据图表,面向机器人研究人员。开发方为lerobot。
- smolagents / hf-realtime-voice 基于WebSocket的语音对话demo,连接Hugging Face语音转语音后端,输入PCM16 16kHz麦克风音频,输出音频与转录。
- pliny-the-prompter / obliteratus OBLITERATUS 是一个带聊天界面的开源工具包,用于识别并移除大语言模型的内容拒绝行为(abliteration),无需微调,支持 PCA、均值差分等多种提取策略,并收集匿名基准数据用于分布式研究。
- nvidia / LocateAnything 输入图像或视频与自然语言描述,定位其中任意物体,基于论文arxiv.org/abs/2605.27365。
- linoyts / Flux2-Klein-Face-Swap 基于Flux.2 Klein 9B LoRA的人脸交换应用,输入人脸图像和参考图像,输出换脸结果。
- webml-community / bonsai-webgpu-kernels 在浏览器中通过WebGPU运行1-bit 27B大语言模型,使用二进制transformer权重(每权重1.125比特),实现在地推理。
- smolagents / ml-intern 基于Hugging Face生态的自主ML代理,能研究、编写并发布高质量ML代码,支持交互式会话和单次提词模式。
- M3st3rJ4k3l / FLUX.2-Klein-Multi-LoRA 该 Demo 允许同时使用多个 FLUX.2-Klein LoRA 模块,加载到 FLUX 模型中进行图像生成,属于实验性应用。
- baidu / Unlimited-OCR 基于Transformer的文档解析OCR模型,支持单页和多页PDF/图片输入,输出解析结果,可配置base size等参数。
- TencentARC / Pixal3D 从单张图像生成高保真3D资产的工具,采用像素反投影建立像素到3D对应,输出包含详细几何和 PBR 纹理的 GLB 网格。
- webml-community / bonsai-image-webgpu 基于三元权重(1.58-bit)的文本到图像扩散Transformer,在浏览器中运行,支持Apple Silicon,模型大小为1.21GB(相对FP16压缩6.4倍)。
- MiniMaxAI / MiniMax-H3-Turbo-Lora MiniMax-H3 视频生成 demo:单次去噪生成带同步音轨的视频,bfloat16 无量化运行,含 61.73 GiB transformer 与两个自编码器,Qwen3-VL 条件模型经 Gradio API 调用;支持最高 2K、15 秒。
- multimodalart / minimax-h3 MiniMax-H3 的视频生成演示:单次去噪过程联合生成视频与同步音轨,模型总权重 195.9 GiB bfloat16、无量化。本 Space 为去噪部分,运行 61.73 GiB Transformer 与两个自编码器;条件模型 Qwen3-VL 由另一 Space 经 G
- webml-community / gemma-4-webgpu-kernels Google DeepMind 开发的 Gemma 4 多模态开放权重模型,支持文本与图像输入(特定版本支持音频),输出文本。提供 Dense 和 MoE 架构,5 种尺寸(E2B 至 31B),上下文窗口达 256K 令牌,支持 140+ 语言。该空间展示 WebGPU 内核。
- Onise / Qwen-Image-Edit-2509-LoRAs-Fast2 Qwen 图像编辑 LoRA 系列集合的演示空间,展示这些 LoRA 在图像编辑任务上的效果。属于人工智能与机器学习模型应用。
- VAST-AI / TripoSplat 输入单张2D图像,输出可变数量的3D高斯表示,用于三维场景重建,由TripoAI开发。
- Saravutw / WAN2.2_I2V_LIGHTNING_4-8step_custom
- victor / LongCat-Video-Avatar-1.5 音频驱动说话头视频生成:上传参考图像+音频+文本提示,输出5秒唇形同步视频。基于美团LongCat-Video-Avatar 1.5,INT8量化DiT,DMD2蒸馏8步LoRA,ZeroGPU xlarge运行。
- obsxrver / wan22-i2v-omni-lora Wan2.2 I2V Blink Effect的demo,通过私有仓库中的LoRA模型实现图像到视频的眨眼效果。
- webml-community / bonsai-webgpu 在浏览器中通过WebGPU运行1-bit Bonsai大语言模型,实现本地推理。
- techfreakworm / LTX2.3-Studio 集成 Lightricks 22B 视频生成模型 LTX-2.3 的 Gradio 应用,提供文本/图像/音频/唇同步/关键帧/风格六种生成模式,并支持 IC-LoRA 细节增强。
- ideogram-ai / ideogram4 该空间提供Ideogram 4模型演示,该模型为文生图模型,采用开源权重,输入文本生成图像。
- HuggingFaceBio / carbon-demo HuggingFaceBio 的 DNA 序列续写 demo:输入一段 DNA 序列前缀,由 carbon-3B-hybrid-loss-1T-mix2-v1 基因组语言模型流式续写后续碱基。以 Docker Space 部署,推理走需授权 token 的远程 endpoint。
- Supertone / supertonic-3 轻量级文本转语音系统,完全本地运行(ONNX Runtime),无需云端,支持31种语言,改进阅读稳定性,提供预设语音风格,开源权重。
- krea / Krea-2 Krea 2文本到图像生成demo,提供Raw和Turbo蒸馏版本,运行在ZeroGPU上。
- conradlocke / krea2-identity-edit 基于Krea 2 Turbo(12.9B单流MMDiT)和社区LoRA的指令图像编辑demo。输入图像和自然语言指令,编辑时保持未指定区域不变(包括人物身份),使用Qwen3-VL文本编码器。非Krea官方产品。
- Alissonerdx / charactersheet-lora-demo 上传一张角色图片,生成包含脸部特写和正面、侧面、背面全身像的多视角角色设定图(1536×1024)。基于 FLUX.2 Klein 9B 的 CharacterSheet QuadView LoRA,训练数据约 300 张角色设定图。
- victor / gemma-avatar 实时语音对话demo,使用Gemma 4 31B模型(Google DeepMind)进行推理,结合Silero-VAD、Parakeet STT、Qwen3-TTS,驱动3D头像实现嘴唇同步、表情和手势。
- mrfakename / minimax-h3-ultra-fast MiniMax-H3 的视频与同步音频生成演示,在单块 96GB Blackwell ZeroGPU 上通过 NVFP4 量化与块缓存加速推理,支持最高 2K 分辨率、最长 15 秒的原生立体声视频生成。
- HiDream-ai / HiDream-O1-Image 基于像素级统一Transformer(UiT)的图像生成基础模型,无需外部VAE或文本编码器,支持文本到图像、图像编辑和主体驱动个性化,最高2048×2048分辨率,内置推理驱动提示代理。
- Lynote / free-ai-humanizer Lynote 免费 AI 人味化器落地页,当前为静态入口。页面说明可粘贴 ChatGPT、Claude、Gemini、DeepSeek 生成的文本,输出自然的人类风格文字;仓库内待启用 demo 为双语规则编辑器,去除 AI 套话并保护数字、URL、路径、代码与引号。
- Danny-Lynote / humanizer-lite
- Lynote / free-ai-detector Lynote 免费 AI 检测器落地页,当前为静态入口。页面说明可粘贴文本或上传文件,返回 AI 生成、人类写作、混合得分,并按句高亮 ChatGPT、GPT-5、Gemini、Claude 等;仓库内 demo 为双语统计检测器,基于突发性、公式化短语密度、重复 n-gram
- LiquidAI / prompt-routing 这个演示使用 LFM2.5 Encoder 在 CPU 上执行提示词路由,输入提示词后,由该编码器决定应路由到的下游模型或流程。
- jasfn / LTX-2.3-10Eros LTX 2.3图像转视频模型,支持原生音频生成,基于Comfy工作流运行,可控制目标模式。
- build-small-hackathon / PITCHFIGHT_AI PitchFight AI 是一个 AI 驱动的创业路演练习平台,学生创始人可模拟路演并接受评委式提问,获得评分与改进建议。基于 Hugging Face Gradio Space 构建。
- build-small-hackathon / llm-cinema 基于4B参数MiniCPM3微调的电影生成模型,从单一概念自动编写故事、绘制ASCII角色与场景,并逐帧播放约90秒的短片,支持离线本地运行。
- rikunarita / Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive_GGUF-Q6_K_P Qwen3.6-35B-A3B未经审查模型的GGUF量化版聊天demo,0拒绝,支持KP量化优化,兼容llama.cpp等运行时。
- gemma-challenge / gemma-dashboard Google DeepMind Gemma 4模型(多模态、256K上下文、支持140+语言)推理速度挑战排行榜,展示参赛者在固定GPU上的TPS与PPL。
- OpenMOSS-Team / MOSS-transcribe-diarize MOSS-Transcribe-Diarize 0.9B端到端音频理解模型,联合语音转录和说话人分离,生成带时间戳和匿名说话人标签的结构化转录,适用于会议、通话等长时多说话人录音。
- ysharma / fast-image-studio 基于FireRed Image Edit 1.1的图像编辑演示,使用gr.Server和ZeroGPU,支持通过Gradio Client和MCP工具调用。
- shootstuff / flux-img2img-uncensored 基于FLUX.1-dev的图像到图像生成demo,搭载Uncensored V2 LoRA。
- aet256 / Qwen-Image-Edit-Rapid-AIO-Loras-Experimental
- Lynote / free-ai-image-detector Lynote 免费 AI 图像检测工具:上传或粘贴图片,给出 AI 生成概率评分;底层是第三方图像分类检查点,基于 CIFAKE 数据集微调的 Vision Transformer。
- pollen-robotics / microduck-simulator Microduck机器人仿真器:真实训练的RL策略在浏览器中运行,MuJoCo编译为WebAssembly模拟物理,onnxruntime-web以50Hz执行策略网络;支持腿行和轮滑两种模式。
- SageBio / rare-disease-real-kid-mva-hackathon-2026
- ResembleAI / Dramabox 提示驱动的TTS模型,支持语音克隆,基于LTX-2.3 3.3B音频模型的IC-LoRA微调,通过提示控制说话人身份、情感、笑叹暂停等,可选10秒参考音频克隆音色,峰值显存约24GB。
- build-small-hackathon / small-talk Reachy Mini机器人主持的AI对AI播客,使用Qwen3-TTS生成语音,机器人自主编写脚本、设计服饰,通过WebRTC实时对话,3D数字孪生同步动作。
- LPX55 / Qwen-Image-Edit-2511-Turbo-Lightning
- HiDream-ai / HiDream-O1-Image-Dev 基于像素级统一 Transformer (UiT) 的图像生成基础模型,无需外部 VAE,原生处理像素、文本与条件,支持文生图、编辑和个性化,分辨率达 2048×2048。
- build-small-hackathon / jawbreaker Jawbreaker诈骗信息检测工具,输入可疑文本/邮件/私信,使用MiniCPM5-1B + LoRA模型推理,输出诈骗分析卡片(冒充类型、压力策略、目标、安全建议)。
- JitRoy2024 / Qwen_Img_Space Pro Realism Edit Studio 图像编辑 demo:基于 Qwen-Image-Edit-2511 与 Rapid-AIO v18 加速 transformer,4 步推理。支持上传一张或两张图像并输入提示词进行编辑;含匿名使用数据收集仪表盘。
- burtenshaw / open-weights-breakout
- hugging-apps / firered-tts3 FireRedTTS3语音生成与编辑模型的交互演示,支持语音克隆、语音设计和语音编辑;模型采用Qwen3-1.7B骨干与流匹配头,基于连续音频自编码器输出24kHz语音,支持多语言。
- ibm-research / cuga-apps IBM Research 开发的 CUGA 应用启动器,提供 20 多个由 CUGA(开放模型与代码)驱动的 AI 代理应用,通过路径路由链接到 IBM Code Engine 服务。
- FINAL-Bench / open-discovery-challenge
- zai-org / OpenVuln
- Pepe104 / MiniMax-H3-Turbo-Lora-UNCENSORED 基于MiniMax-H3的视频与同步音轨联合生成demo,单次去噪生成,支持至2K分辨率、15秒时长;文本编码器由外部Qwen3-VL条件模型提供,使用bfloat16无量化权重。
- multimodalart / h3-acceleration-arena
- OpenMOSS-Team / MOSS-TTS-v1.5 MOSS-TTS v1.5文本到语音模型,支持零样本声音克隆、长文本生成、多语言(31种语言)及拼音/IPA发音控制。
- Saravutw / Omni-Video-Factory-Iframe-API 视频生成流水线 demo,以 iframe / API 形式封装,串联多模型从文本或图像产出短视频。
- huggingface / physics-intern Hugging Face 官方开源的面向理论物理与高数问题的多代理研究框架 / harness,用来把底层 LLM(Anthropic、OpenAI、Gemini、HF Inference Provider 等)包起来,自动做题目分解、推导、代码验证和结果审查,在 CritPt 这种研究级物理基准上能显著抬高原始模型的得分。
- multimodalart / follow-the-mean 基于FLUX.2-klein-4B的参考均值引导生成demo,无需训练,通过参考集偏置图像生成方向,支持文本到图像和多参考编辑。
- someone-in-the-world / FireRed-Experimental-Turbo 文本引导的图像编辑 demo,利用 QwenImageEditPlusPipeline 和快速 Transformer,通过 Gradio 界面接受原始图像与文本指令,输出编辑后图像。
- 2i / pornmaster-krea2
- ICML-2026-agent-repro / challenge 社区复现挑战:参与者使用智能体复现ICML 2026每篇论文的主要结果,通过Trackio logbook记录实验痕迹,前750名参与者获GPU积分奖励,最佳复现作品另有$4000积分。
- acvlab / abot-world-interactive 从单张起始图像实时生成可交互导航的虚拟世界,支持WASD/IJKL键盘控制视角移动,基于ABot-World-0-5B扩散模型。
- Ryiys / media-processor-service AI语音与视频套件,支持视频合并、YouTube安全剪辑和AI视频生成,通过Flask+FFmpeg+edge-tts实现。
- Audio8 / Audio8-TTS-Preview-0.6b
- victor / DeepSeek-V4-Flash-0731-free-endpoint 该空间是一个仿经典 Mac 风格的指南页面,介绍 DeepSeek-V4-Flash-0731 免费公共推理端点的使用方式,内容涵盖该端点的访问与调用说明。
- victor / Qwen3.8-27B-free-endpoint
- dayona / I2V-EXTENDED 基于 FastAPI 与 Uvicorn 的 API 服务器:提供文本/图像生成视频的提示增强(Wan 2.1/2.2)、InsightFace 换脸(含性别过滤)及 GFPGAN v1.4 人脸修复。
- hugging-apps / sbgrid-storyboard
- microsoft / mage-vl-demo Mage-VL 4B编解码器原生视觉语言模型,用于视频与图像理解,通过仅保留关键帧和运动区域补丁减少75%以上视觉token。
- multimodalart / Boogu-Image 基于指令的图像编辑 demo,模型为 Boogu-Image-0.1,Apache-2.0 开源,支持文本到图像生成、快速生成、图像编辑及中英文文本渲染。
- victor-demos / marlin-2b-video-understanding 生成密集视频字幕并支持时间戳搜索
- webml-community / lfm2-webgpu-kernels 运行Liquid AI的LFM2.5-230M通用文本模型,采用自定义WebGPU内核,适用于数据提取和轻量级设备端代理任务。
- wxDai / joyai-video-edit 基于JoyAI Video Edit DiT与流式VAE的实时摄像头视频编辑演示,运行在ZeroGPU上;通过WebSocket字节管道双向传输H.264,支持MJPEG回退。
- Alissonerdx / ltx-best-face-id ltx-best-face-id 是一个身份保持的视频生成 demo,输入一张正面人像照片和文本描述,利用 LTX-2.3(22B)模型和 LTX-Best-Face-ID LoRA,通过重叠参考条件与 TASS-RoPE 技术生成保持该人物身份的视频。
- hugging-apps / ardy 交互式文本生成 3D 动作演示:输入自然语言提示并选择人类或机器人骨架,生成 3D 动作片段,可在 Three.js 播放器中查看。基于 NVIDIA ARDY(自回归扩散与混合表示)参考实现。
- hugging-apps / sensenova-sensenova-u1-5-8b-mot SenseNova-U1.5-8B-MoT 统一文生图/图像编辑 demo:输入文本生成图像,或上传图像加编辑指令编辑。模型 18B 参数、bf16,基于 NEO-unify 架构,默认 28 步,编辑提示词经 ncii-guard-v02 过滤。
- t-tech / t-search-blog T-Search 是一个开放权重的代理式检索器,输入查询后对固定语料库进行多轮搜索,返回按 Recall@10 排序的证据片段排名列表,而不是直接给出答案。
- victor / MiniMax-Music3-Jam 输入英文歌曲描述,LLM 生成标题、带标签歌词和结构化描述,再由 MiniMax Music 3 生成最长 5 分钟、32kHz 立体声的完整带人声歌曲;模型结合 8B 全局 LLM、0.6B 局部 LLM 与 Flow Matching/Flow-VAE。
- feyninc / pulpie 210M参数的编码器模型,从HTML中提取主要内容,单次前向传播标记每个块为内容或模板,速度比0.6B解码器快约20倍(ROUGE-5 F1 0.862)。
- Lakonik / AsymFLUX.2-klein 在像素空间中生成逼真图像,基于Asymmetric Flow Models论文,来自斯坦福大学。
- UmutKocasari / FaceAnything 4D人脸重建与跟踪工具,从图像序列或视频前40帧中一次前馈预测深度和面部坐标,输出带跟踪的点云,支持两种推理模式。
- facebook / vggt-omega VGGT-Ω是前馈相机与深度重建模型:输入图像或短视频,输出3D点云及估计相机位姿,由牛津VGG组和Meta AI开发,采用FAIR非商业研究许可。
- PLUS-WAVE / InfiniSplat 从单张图像重建3D高斯场景表示,支持RGB-only及RGB-深度引导两种模式,提供交互式查看器与PLY下载。
- apathy-exe / Qwen3.8-27B
- mrfakename / anima-v1 2B 参数的文生图模型,由 CircleStone Labs 与 Comfy Org 合作开发,专注动漫及非写实艺术风格,训练数据为真实动漫与艺术图像。
- owensong / Inflect-v2 文本到语音合成模型Inflect v2,提供Micro(<10M参数)和Nano(<4M参数)两个版本,支持生成长文本并输出WAV,使用确定性种子可复现。
- LiquidAI / LFM2.5-8B-A1B Liquid AI的8B参数文本模型LFM2.5-8B-A1B,支持代理工作流、工具使用、结构化输出,适合设备端部署和多语言助手应用。
- jimmycarter / krea2-turbo-bbox-canvas 基于 Krea 2 微调与 Turbo 蒸馏合并的布局控制漫画 demo,提供可拖拽 bbox 画布,用 [x0,y0,x1,y1] 显式坐标框放置面板、角色、物体和文字,支持多格漫画与普通提示,8 步采样、无 CFG。
- kulkas2pintu / QWEN_EDIT_IMAGE Qwen-Image-Edit-2511 的提示词图像编辑 demo,提供多种 LoRA 适配器:多角度、照片转动漫、光照迁移、风格迁移、放大、去模糊等;支持保持人物身份、高清输出与防畸形手选项。
- MiniMaxAI / MiniMax-Music3 MiniMax Music 3 音乐生成 demo:输入歌词与结构化音乐描述,生成最长五分钟完整歌曲,输出 32kHz/16-bit 立体声 WAV;使用 8B 全局 LLM、0.6B 局部 LLM 和 Flow Matching/Flow-VAE。
- hugging-apps / wan2-2-animate-2-14b
- multimodalart / scenema-audio 零样本表现力语音克隆与生成,支持情感、语速和呼吸控制,基于音频扩散 Transformer,需下载约 38GB 模型权重。
- tencent / Hy3 腾讯混元团队开发的Hy3多轮流式对话demo,295B参数MoE模型(21B活跃),支持函数调用,在推理、智能体、长上下文任务中表现优异。
- AlexWortega / my_pi_agent 聊天机器人 demo,运行 Qwen3.5-4B 混合线性注意力模型 GGUF,通过 llama-cpp-python 推理,支持 ZeroGPU 和 WebGPU 两种部署方式。
- FINAL-Bench / VKUE 效率排行榜:测量27B以上模型在达到指定质量(GPQA Diamond)所需的最小硬件规格,公开量化配置与基准数据,引擎内部细节未开源。
- deepreinforce-ai / Ornith-1.0-9B 多模态(图像-文本到文本)推理模型Ornith-1.0-9B的聊天demo,约9B参数,支持链式推理流式输出,可单GPU部署。
- huggingface-projects / rf-detr-realtime-webcam RF-DETR目标检测与实例分割的实时网络摄像头和上传demo,兼容ZeroGPU。
- multimodalart / z-image-6b-pixel-space 基于L2P迁移范式的6B参数像素空间扩散模型,无需VAE,支持1K分辨率图像生成,利用预训练潜在扩散模型知识。
- BreezeBlue / breeze-tts-2-demo 开放权重的英中双语文本转语音模型,支持实时交互、自然语言指令控制、免参考声音设计与参考音频克隆,在Artificial Analysis TTS排行榜开源模型中排名第一。
- CohereLabs / North-Mini-Code-1.0 该空间演示Cohere Labs的North-Mini-Code-1.0模型(30B-A3B参数),生成Python/HTML/JS代码并在沙箱中执行,适用于智能编码和终端任务。
- LiquidAI / LFM2.5-VL-3B-WebGPU
- hugging-apps / 4danyone-multiview-demo 4DAnyone 交互式 demo:输入单目人物视频,输出同步多视角视频,供 4D 高斯泼溅重建。流程含 GVHMR 恢复动作、BiRefNet 抠像、Wan2.2-TI2V-5B 派生的时空 DiT 联合去噪,固定 121 帧。
- hugging-apps / unise-speech-enhancement 基于解码器自回归语言模型的统一语音增强与分离框架,使用WavLM提取特征并通过BiCodec编解码器生成音频。
- nineninesix / gepard 基于Qwen3.5骨干和Q-Former的自回归语音合成模型,支持语音克隆和文本CFG控制,使用NeMo nano编解码器将参考音频压缩为8个前缀token。
- AlexWortega / same-data-different-losses 基于Qwen3-4B(attention-only LoRA)的六种离线推理损失(SFT、RFT、DFT、RIFT、Offline GRPO、DPO)在相同数学rollouts上训练的交互式权重空间几何可视化,支持浏览36层transformer并观察几何响应。
- Saravutw / Omni-videos-custom
- akhaliq / MiniMax-H3-Turbo-Lora MiniMax-H3 的演示:文本等条件经 Qwen3-VL 编码后,由 61.73 GiB Transformer 与双自动编码器单次去噪生成带同步立体声的视频,最高 2K、15 秒;bfloat16 无量化,权重公开。
- cinderholm / wan-i2v
- multimodalart / Cosmos3-Nano NVIDIA 的 16B 参数全模态世界模型 demo,支持文本或图像生成视频及同步音频,基于 Diffusers Cosmos3OmniPipeline。
- multimodalart / ZONOS2 ZONOS2是Zyphra的多语言文本转语音模型,支持高保真语音克隆,基于MoE架构,在超600万小时多语言语音上训练,使用ECAPA-TDNN嵌入与DAC token生成。
- multimodalart / minimax-h3-reference MiniMax-H3参考demo,接受最多9图、3视频、3音频作为条件,经单次去噪联合生成视频与音轨,以bfloat16无量化运行。
- stabilityai / stable-audio-3 文本到音频生成demo,运行Stable Audio 3系列模型,提供Medium、Small Music、Small SFX三个变体,通过单选按钮切换。
- Lightricks / LTX-2.5
- LiquidAI / LFM2.5-2.6B-WebGPU 通过WebGPU在设备端运行LFM2.5研究代理。LFM2.5为基于LFM2架构的混合模型,经扩展预训练与强化学习,并提供了Q4/Q8等量化ONNX格式。
- Photoroom / PRX-Pixel PRX-Pixel 是一个文本到图像生成 demo,输入文字即可生成对应图像。基于 7B 参数的 PRXTransformer2DModel,使用 Qwen3-VL 文本编码器与像素空间去噪(无 VAE),Apache 2.0 许可。
- dayona / Morphix-Studio-Client Morphix Studio Client 是一个交互式客户端 demo,支持图像到视频(I2V)与图像到图像(I2I)两种生成任务;输入一张图片,输出对应生成的视频或图像。
- dream2589632147 / Dream-wan2-2-fp8da-aoti-preview-2 基于Wan2.2的图像转视频demo,支持单张图片或首尾帧引导生成视频,使用Lightning检查点,推荐4-8步推理。
- ginigen-ai / Metacognition-Leaderboard-Space 展示33个LLM在元认知陷阱测试上的排行榜,指标为陷阱率,越低表示元认知能力越强。
- hugging-apps / midashenglm-gen
- nvidia / Nemotron-Labs-Audex NVIDIA 开发的统一音频-文本 LLM,基于 MoE 架构(30B 参数,3B 激活),支持音频理解、语音识别、翻译、文本推理、TTS 和语音到语音生成。
- JonathanColetti / Qwen3.8-27B-Uncensored-Demo 未审查版 Qwen3.8-27B 的文本与视觉对话演示,支持文字和图像输入,可调整采样参数与推理强度,采用 bf16 运行于 ZeroGPU。
- Kaikaku / epicure-explorer 基于Epicure食材嵌入(Cooc/Core/Chem)的交互式厨师demo,提供食材搭配、有监督/无监督语义旋转操作,嵌入模型基于4.14M多语言食谱训练。
- Loie / spotsound-temporal-grounding
- WepeNerd / ltx-ripple-demo
- hugging-apps / bs-roformer-leap-audio-separator 基于BS-Roformer(频段分割Transformer)的音频源分离工具,上传音频文件即可提取人声或乐器音轨,支持四种模型变体。
- huggingface-projects / gemma-4-12b-it
- victor / Qwen3.8-Flash-Next-free-endpoint
- victor / lingbot-video LingBot-Video演示,首个开源大规模MoE视频生成模型(30B参数,约3B活跃),支持文生视频、图生视频、文生图,用于具身智能。
- witcherderivia / TeleStyleV2
- yijunwang2 / krea2-outpaint 图像外绘demo,基于Krea 2 Turbo(8步蒸馏流匹配)和秩32 LoRA,上传图片并指定画布位置,模型填充扩展区域并保留原像素。
- hugging-apps / kroma-krea2-lora-demo 该demo展示Kroma风格LoRA在Krea 2 Turbo文生图模型上的应用,输入文本提示生成对应风格图像。
- prism-ml / Ternary-Bonsai-27B-Demo 27B参数三元权重大模型(权重取-1/0/1,约1.71 bits/weight)的聊天demo,通过Hugging Face推理API运行,支持流式生成文本。
- prithivMLmods / PiD-Image-Upscaler 一款图像上采样工具,基于 Pixel Diffusion Decoder 架构。输入低分辨率图像,输出高分辨率结果。
- sensenova / SenseNova-Vision
- EilamSha / glee-competition-leaderboard
- HuggingAI4Engineering / CADGenBench AI驱动的CAD生成排行榜,将机械零件的文本或视觉描述转换为几何正确的3D模型(STEP格式),支持提交评估并查看排名。
- HumeAI / rw-voice-eq 语音模型排行榜,包含文本转语音、语音转语音、语音理解、语音识别等模态的热力图排名,数据来自HuggingFace数据集。
- build-small-hackathon / dukaan-saathi 面向小型kirana商店的印地语语音与照片库存管理及赊账助手,使用faster-whisper进行语音识别、Surya OCR和Gemma 12B(视觉)进行工具调用与决策,所有模型开源且<32B。
- bytedance-research / Lance Lance是一个3B参数的原生统一多模态模型,支持图像与视频的理解、生成和编辑,由字节跳动研究团队开发。
- huggingface-projects / diffusiongemma-codegen 扩散语言模型代码生成演示,输入网站描述,实时生成自包含 HTML 文档,支持编辑和实时预览,采用 DiffusionGemma 架构。
- kulibinai / cadena-stepwise-cad 输入 3D 网格,逐步逆向为参数化 CadQuery 程序的 Gradio demo。策略基于 Qwen2-VL-2B,每步读取八视图拼图输出下一条 CAD 操作,OpenCASCADE 执行后按体积 IoU 决定是否保留该步。
- microsoft / vibevoice-asr-bitnet-demo
- rednote-hilab / dots.tts dots.tts 文本转语音 Demo,基于 Gradio,支持 Hugging Face ZeroGPU,用户可指定本地目录或模型仓库 ID 加载模型进行语音合成。
- ATH-MaaS / OvisOCR2 一个0.8B参数的端到端文档解析模型,从图片或PDF生成结构化Markdown,保留阅读顺序,支持LaTeX公式、HTML表格和视觉区域裁剪。
- CohereLabs / command-a-plus-05-2026 开源多模态大模型Command A+,25B活跃参数/218B总参数,支持图像输入,针对代理任务、多语言和推理优化,由Cohere开发。
- HuggingFaceM4 / encoder-free-vlm 该空间提供无编码器视觉语言模型(VLM)的训练教程(预算约$100),同时包含交互式科学论文模板,支持引用、数学公式、PDF导出等功能。
- build-small-hackathon / kirana-saathi 针对印度小商店的AI助手,通过印地语语音或照片管理库存和赊账,使用MiniCPM-V等开源模型。
- google / gemma4_vision_token_budget 客户端可视化工具,展示Gemma 4的按宽高比保留图像缩放与token预算,输入图像和Nmax值,实时显示不同预算下的分辨率与token数。
- joonion / pdf-rag-chatbot
- linoyts / sun-direction-flux2-klein 户外照片重光照工具,通过交互式3D球拖动太阳方向,两遍生成(阴天去除阴影+太阳方向匹配)实现重光照。
- magenta-community / magenta-rt-jam 实时音乐生成Demo,通过MIDI键盘输入音符,驱动Magenta RealTime 2模型生成音乐,基于PyTorch。
- rl-llm-wiki / rl-wiki RL-for-LLMs 知识库的阅读器,支持 LaTeX、表格、代码块和引用跳转,单页静态应用。
- multimodalart / MisoTTS 文本转语音与声音克隆,8B参数,基于Sesame CSM架构,使用Llama 3.2风格骨干和自回归音频解码器,生成Mimi音频码。
- treble-technologies / ffasr 远场语音识别(ASR)基准测试,支持清晰、噪声、混响三种场景,可播放预渲染片段或上传音频评估。
- ltx-community / ltx2-lora-trainer 在Hugging Face基础设施上从用户视频训练LTX-2.3的LoRA/IC-LoRA,使用OAuth登录,自动处理bucket创建、任务提交、Gemma编码器下载及LoRA推送。
- LiquidAI / colbert-tool-selection 多语言检索模型的Demo,采用350M参数的ColBERT架构(基于LFM2.5-350M-Base),支持11种语言短文本检索,用于工具预选。
- joelniklaus / harness-optimization 在 Harvey's LAB 上进化智能体的 harness 而非模型本身。提供交互式科学论文模板,支持图表、数学公式、引用、暗模式及 PDF 导出。
- multimodalart / krea2-lora-trainer multimodalart 提供的 LoRA 训练器,通过 Hugging Face Jobs 在用户图像上训练 DreamBooth-LoRA,支持风格或物体/角色训练,自动生成触发词与标注,训练后使用 Krea 2 Turbo 渲染示例图像并推送到 Hub。
- rl-llm-wiki / rl-dashboard 一个多智能体协作构建专家级知识库的仪表板,包含实时排行榜、聊天和配置界面。
- zsaxcdssdf / wan2.2_wip 根据输入图片和文本提示生成视频的演示。
- Soofi-Project / Pretraining-Tech-Report 展示Soofi S 30B-A3B预训练技术报告的项目页面,提供PDF下载。
- hugging-apps / krea2-identity-edit 基于Krea 2 Turbo与社区LoRA的身份保持指令图像编辑demo,输入图像与自然语言指令,编辑并保留人物形象。
- fffiloni / SCAIL-2 一个统一受控角色动画的演示,具体技术细节未说明。
- wank3r / wan2-2-i2v-v3-WOW
- wank3r / Wan_2.2_I2V_14B-Clean
- cinderholm / wan2-2-i2v-v3
- Sneak-Moose / Pro-Realism-Edit-Studio 基于Qwen-Image-Edit-2511和Rapid-AIO加速变压器的图像编辑工具,支持单张或两张输入图像,通过提示词生成高质量编辑结果。
- mikeee / qwen-7b-chat Gemma 4 E4B-IT的无审查版本,模型完全解锁不会拒绝提示,使用importance matrix量化保留质量,支持llama.cpp等运行时。
- signsur4739379373 / LTX-2.3-Finetuned-I2V 基于LTX 2.3微调的图像到视频生成模型,支持身份和声音条件控制。
- cruisewagner2220 / Qwen-Image-Edit-Rapid-AIO-Loras-Experimental-neo Qwen图像编辑LoRA集合的演示demo,展示多种图像编辑LoRA模型效果。
- Fighterdan / LTX-2.3-10Eros_I2V 基于LTX 2.3改进的图像到视频生成demo,支持原生音频输出,使用10Eros。
- EldMans / wan2.2_14b_i2v_480p_lightning_nsfw_diffusers 输入图片和文本提示,生成视频。
- loveseries / wanmanlove 基于WAN2.2模型的图像到视频生成演示。
- pnemrow / Qwen-Image-Edit-Rapid-AIO-Loras-Experimental-neo 该 demo 展示一组 Qwen 图像编辑 LoRA 的集合用法;用户输入图像和编辑指令,选择不同 LoRA,可得到对应的图像编辑结果。
- kongyiji / face-swap
- SeedOfEvil / Pro-Realism-Edit-Studio 基于Qwen-Image-Edit-2511的图像编辑demo,支持单/双图输入,使用Rapid-AIO v18加速转换器实现4步推理。
- ReverseFaceSearch / Reverse-Face-Search
- huuyfytryr / Jigarrzz 集成视频合并、安全剪辑、AI视频生成和语音生成的工具,支持多种语言和风格。
- build-small-hackathon / claim-ready ClaimReady 是一个基于 Gemma 3 12B 模型的健康保险理赔预检工具,输入理赔文件,输出缺失、不完整或不合规文档的反馈,帮助医院减少理赔驳回。
- FINAL-Bench / POCKET-26B-CPU
- Sneak-Moose / FireRed-Image-Edit-Stripped FireRed-Image-Edit-Stripped 是一个基于 Gradio 的高分辨率(2K)图像编辑 demo,使用 FireRed-Image-Edit-1.1 与 Qwen-Image-Edit-Rapid-AIO Transformer,支持多图输入和提示驱动的编辑
- FINAL-Bench / POCKET-35B-CPU POCKET-35B是稀疏MoE模型(34.66B总参,约3B活跃/词元),量化至Q2K(13GB),在CPU上运行并与Bonsai-27B对比演示。基于Darwin-36B-Opus进化繁殖,Apache-2.0开源。
- thornmaze / reel-lab 名为 reel-lab 的 HuggingFace Space,资料仅注明为内部工具,未说明具体功能。
- wank3r / Wan_2.2_I2V_14B_Custom_Lora_Wow
- chrisssut / testground2 LTX 2.3的改进版图像到视频生成demo,支持10eros与原生音频。输入图像后生成视频,视频包含音频,属于AI视频生成应用。
- dayona / I2V-VIP 图像转视频生成平台,基于 Wan 2.2 14B 基础模型,支持 1080p 全高清超分辨率、RIFE 32/64/128 FPS 插帧,节省 70% 以上 ZeroGPU 配额,并能进行人脸替换。
- mpasila / Krea-2-Turbo_I2I 通过 headless ComfyUI 运行 Krea 2 Turbo,支持文生图与图像编辑,可加载多种基座检查点、LoRA 目录及自定义 Hugging Face 模型,编辑模式使用专用 identity edit 权重。
- vatsbjn / nsfw-img2img
- ibuildproducts / wan22-i2v-v4-demo Omni-Blink LoRA 演示demo
- amisima / Wan_2.2_I2V_14B_Custom_Lora
- build-small-hackathon / OpenMythos 输入代码库,AI安全代理进行多级漏洞分析、依赖风险可视化并生成热修复补丁。
- microsoft / mage-flow 微软开发的 Mage-Flow,4B 参数图像生成与编辑基础模型,支持文本到图像生成和基于指令的图像编辑,原生分辨率,使用 Turbo 变体实现快速推理。
- signsur4739379373 / LTX-2.3-10Eros 图片转视频,支持原生音频生成,基于LTX 2.3 audio-video模型和fp8 checkpoint,运行Comfy工作流,可关闭音频输出静音MP4。
- NodeLinker / Qwen-3.8-27B-H200
- prism-ml / Bonsai-Image-Demo 三元权重(1.58-bit)文本到图像扩散变压器在GPU上的共享demo,模型压缩约6.4倍,大小1.21 GB。
没有匹配的空间,试试应用名称、作者或运行模型。