此页是 2026-07-31 的观测快照,查看该模型当前信息 → /m/nanthasit__sakthai-vision-7b/
归档 / 2026-07-31 / sakthai-vision-7b (Nanthasit)
sakthai-vision-7b (Nanthasit)
LLaVA-1.5-7B GGUF 量化,本地图像描述与视觉问答
- 入选理由
- LLaVA-1.5-7B 的 GGUF Q4_K_M 量化版,提供 HF Space 在线试用和完整 llama.cpp 示例,适合在 CPU 上本地运行图像描述与视觉问答。
- 对位
- 对位 LLaVA-1.5-7B、Qwen-VL-Chat 7B
- 适合
- 隐私敏感本地图像问答 / 截图与照片描述生成
- 不适合
- 非英文图像理解
- 规模
- 7B · 4k · Q4 ~4.6GB / FP16 ~17GB
- 授权
- LLaMA 2 Community · 需自查
- 框架
- llama.cpp / ollama
- 血统
- 量化自 LLaVA-1.5-7b
- 可信度
- 基于 LLaVA-1.5-7B,Q4_K_M 量化,上游 VQAv2 准确率 78.5%
评分详情
- Q1
- 今天能接上用吗 5 / 5
- Q2
- 有可信证据吗 1 / 5
- Q3
- 是新东西吗 1 / 5
- 总分
- 7
HuggingFace 原始数据 (抓取于 2026-07-31)
- 作者
- Nanthasit
- 推理库
- transformers
- 下载
- 186
- 点赞
- 1
- 许可证
- LLaMA 2 Community
- 标签
- transformers, gguf, vision, llava, multimodal, image-to-text, visual-question-answering, image-captioning, llama-cpp, sakthai, house-of-sak, edge, cpu-inference, local-ai, offline, privacy, quantized, clip, vicuna, finetune, safetensors, dataset:liuhaotian/LLaVA-Instruct-150K, dataset:liuhaotian/LLaVA-Pretrain, arxiv:2310.03744, license:other, eval-results, endpoints_compatible, region:us, conversational
探索
源链接