🖼️selfit-camera / Omni-Image-Editor
一个多功能的图像编辑工具,支持文本生成图像、图像放大、去水印等操作。
来自 HuggingFace · 即刻体验模型效果 · 最近 14 天 · 共 64 个空间
一个多功能的图像编辑工具,支持文本生成图像、图像放大、去水印等操作。
文生图模型,6B参数,采用Scalable Single-Stream DiT架构,支持逼真的图像生成、中英文本渲染、提示增强推理和创意图像编辑。
语音模型排行榜,包含文本转语音、语音转语音、语音理解、语音识别等模态的热力图排名,数据来自HuggingFace数据集。
从单张图像生成高保真3D模型,由微软提供。
在浏览器中通过WebGPU运行1-bit Bonsai大语言模型,实现本地推理。
文本嵌入模型排行榜,用于评估不同嵌入模型的性能。
Qwen图像编辑LoRA集合的演示demo,用于图像编辑任务。
基于FLUX.1-dev的图像到图像生成demo,搭载Uncensored V2 LoRA。
输入图片和文本提示,生成对应视频,属于图生视频(image-to-video)生成任务。
输入图片和文本提示,生成视频。
210M参数的编码器模型,从HTML中提取主要内容,单次前向传播标记每个块为内容或模板,速度比0.6B解码器快约20倍(ROUGE-5 F1 0.862)。
输入图片和文本提示,生成对应视频。
基于Qwen3.5骨干和Q-Former的自回归语音合成模型,支持语音克隆和文本CFG控制,使用NeMo nano编解码器将参考音频压缩为8个前缀token。
基于WebSocket的语音对话demo,连接Hugging Face语音转语音后端,输入PCM16 16kHz麦克风音频,输出音频与转录。
基于Wan2.2的图像转视频demo,支持单张图片或首尾帧引导生成视频,使用Lightning检查点,推荐4-8步推理。
运行模型 TestOrganizationPleaseIgnore/WAMU-Merge-MotionBoost_WAN2.2_I2V_LIGHTNING
LingBot-Video演示,首个开源大规模MoE视频生成模型(30B参数,约3B活跃),支持文生视频、图生视频、文生图,用于具身智能。
腾讯混元团队开发的Hy3多轮流式对话demo,295B参数MoE模型(21B活跃),支持函数调用,在推理、智能体、长上下文任务中表现优异。
运行模型 tencent/Hy3
社区复现挑战:参与者使用智能体复现ICML 2026每篇论文的主要结果,通过Trackio logbook记录实验痕迹,前750名参与者获GPU积分奖励,最佳复现作品另有$4000积分。
基于4B参数MiniCPM3微调的电影生成模型,从单一概念自动编写故事、绘制ASCII角色与场景,并逐帧播放约90秒的短片,支持离线本地运行。
效率排行榜:测量27B以上模型在达到指定质量(GPQA Diamond)所需的最小硬件规格,公开量化配置与基准数据,引擎内部细节未开源。
在浏览器中使用WebGPU运行1-bit 27B大语言模型,权重为单符号位加共享FP16缩放因子,有效比特率1.125比特/权重,较FP16压缩约14.2倍。
基于解码器自回归语言模型的统一语音增强与分离框架,使用WavLM提取特征并通过BiCodec编解码器生成音频。
一个0.8B参数的端到端文档解析模型,从图片或PDF生成结构化Markdown,保留阅读顺序,支持LaTeX公式、HTML表格和视觉区域裁剪。
运行模型 ATH-MaaS/OvisOCR2
根据输入图片和文本提示生成视频的演示。
基于LTX 2.3的图像到视频生成demo,支持10张图片输入并合成视频,包含原生音频。
基于WAN2.2的图像到视频生成demo,输入图像,输出视频。
输入一张图片和文本提示词,生成对应视频,属于文生视频任务。
输入图像或视频与自然语言描述,定位其中任意物体,基于论文arxiv.org/abs/2605.27365。
展示Soofi S 30B-A3B预训练技术报告的项目页面,提供PDF下载。
基于Krea 2 Turbo与社区LoRA的身份保持指令图像编辑demo,输入图像与自然语言指令,编辑并保留人物形象。
运行模型 krea/Krea-2-Turbo
InstantID 是一种无需微调的身份保持图像生成方法,仅需单张人脸图像即可生成保持身份特征的新图像,支持多种下游任务,由 InstantX 开发。
运行模型 InstantX/InstantID
AnyCoder 是一个全栈 AI 代码生成工具,用户可用自然语言描述需求,生成包含前端和后端的完整应用,支持多种 AI 模型,并可一键部署到 HuggingFace Spaces。
图像反推提示词工具,结合 CLIP 与 BLIP 分析图片,输出可复现该图风格的文本 prompt,常用于扩散模型的提示词逆向。
IllusionDiffusion 是一个图像生成演示,输入文本提示,输出高质量的幻视艺术作品。
Whisper 的 JAX 实现,借助 TPU 与批处理大幅提升长音频转写吞吐,相较原版 PyTorch 推理快数十倍。
百度Unlimited-OCR模型,基于Transformer架构,支持单页与多页文档OCR,可处理图片和PDF,输出解析结果。
运行模型 baidu/Unlimited-OCR
LTX 2.3图像转视频模型,支持原生音频生成,基于Comfy工作流运行,可控制目标模式。
Facebook AudioCraft库中的MusicGen音乐生成模型,基于PyTorch,支持高质量音频的生成与训练。
开源LLM排行榜,用于追踪、排名和评估大型语言模型,提供前端React界面和后端API。
基于RealVisXL_Turbo的高分辨率图像生成模型,用于生成类似Midjourney风格的图片。
阿里 HumanAIGC 的虚拟试衣 demo,输入人物照与服装图,经两阶段扩散合成对应穿着效果,支持多体型与姿态。
基于DeepSeek-V3-0324的Vibe Coding平台,通过生成式AI辅助应用开发,支持文件上传与网页搜索。
基于Qwen-Image-Edit-2511和Rapid-AIO加速变压器的图像编辑工具,支持单张或两张输入图像,通过提示词生成高质量编辑结果。
Krea 2文本到图像生成demo,提供Raw和Turbo蒸馏版本,运行在ZeroGPU上。
MOSS-Transcribe-Diarize 0.9B端到端音频理解模型,联合语音转录和说话人分离,生成带时间戳和匿名说话人标签的结构化转录,适用于会议、通话等长时多说话人录音。
4D人脸重建与跟踪工具,从图像序列或视频前40帧中一次前馈预测深度和面部坐标,输出带跟踪的点云,支持两种推理模式。
户外照片重光照工具,通过交互式3D球拖动太阳方向,两遍生成(阴天去除阴影+太阳方向匹配)实现重光照。
LivePortrait肖像动画工具,将驱动视频的运动转移到静态人像上,支持拼接和重定向控制。
DALL·E Mini文本生成图像模型,基于文本提示生成图像,支持创意和幽默内容生成。
FLUX.1-schnell 12B参数整流流变压器文本到图像模型,经潜在对抗扩散蒸馏训练,1-4步生成高质量图像,Apache-2.0许可。
一个实验性空间,支持加载多个 FLUX.2-Klein LoRA 进行图像生成,可能记录上传的图像用于性能监控,图片7天后自动删除。
一个统一受控角色动画的演示,具体技术细节未说明。
基于 Qwen-Image 的多视角生成 demo,从单张图生成不同机位与 3D 相机视角的图像。
运行模型 Qwen/Qwen-Image
黑森林实验室的FLUX.1 [dev]模型,120亿参数rectified flow transformer,从文本描述生成图像,采用引导蒸馏训练,开源权重,可个人、科研和商业使用(非商业许可)。
腾讯的Hunyuan3D 2.0,大规模3D合成系统,支持文本和图像生成高分辨率带纹理的3D资产,包含基于流扩散Transformer的形状生成模型和纹理合成模型。
运行模型 tencent/Hunyuan3D-2
AI漫画工厂,通过单个提示生成漫画,开源,依赖LLM(如Zephyr-7B-β)和SDXL等组件进行渲染。
LMArena(原 LMSYS Chatbot Arena)的大模型匿名对战排行榜,由众包 pairwise 投票按 Elo / Bradley–Terry 为主流开闭源模型排名。
非官方演示F5-TTS和E2-TTS,实现零样本语音克隆,基于Flow Matching技术,可从参考音频合成目标语音。
运行模型 SWivid/F5-TTS
基于扩散语言模型的多语言零样本语音合成模型,支持600+语言,实现语音克隆与设计,推理速度快。
运行模型 k2-fsa/OmniVoice
图像抠图去背景 demo,基于 BRIA RMBG 分割模型一键分离前景主体并输出透明背景。
运行模型 briaai/RMBG-2.0
文本转语音模型,已升级至v1.0版本,具体能力未详细说明。
运行模型 hexgrad/Kokoro-82M
快手 Kolors 团队的虚拟试衣 demo,上传人物与服装图即可生成上身效果,底层基于 Kolors 扩散模型。
运行模型 Kwai-Kolors/Kolors
查看全部空间 归档 →
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索