此页是 2026-07-31 的观测快照,查看该模型当前信息 → /m/nanthasit__sakthai-vision-7b/

归档 / 2026-07-31 / sakthai-vision-7b (Nanthasit)

sakthai-vision-7b (Nanthasit)

LLaVA-1.5-7B GGUF 量化,本地图像描述与视觉问答

入选理由
LLaVA-1.5-7B 的 GGUF Q4_K_M 量化版,提供 HF Space 在线试用和完整 llama.cpp 示例,适合在 CPU 上本地运行图像描述与视觉问答。
对位
对位 LLaVA-1.5-7B、Qwen-VL-Chat 7B
适合
隐私敏感本地图像问答 / 截图与照片描述生成
不适合
非英文图像理解
规模
7B · 4k · Q4 ~4.6GB / FP16 ~17GB
授权
LLaMA 2 Community · 需自查
框架
llama.cpp / ollama
血统
量化自 LLaVA-1.5-7b
可信度
基于 LLaVA-1.5-7B,Q4_K_M 量化,上游 VQAv2 准确率 78.5%

评分详情

Q1
今天能接上用吗   5 / 5
Q2
有可信证据吗   1 / 5
Q3
是新东西吗   1 / 5
总分
7

HuggingFace 原始数据 (抓取于 2026-07-31)

作者
Nanthasit
任务类型
image-to-text
推理库
transformers
下载
186
点赞
1
许可证
LLaMA 2 Community
标签
transformers, gguf, vision, llava, multimodal, image-to-text, visual-question-answering, image-captioning, llama-cpp, sakthai, house-of-sak, edge, cpu-inference, local-ai, offline, privacy, quantized, clip, vicuna, finetune, safetensors, dataset:liuhaotian/LLaVA-Instruct-150K, dataset:liuhaotian/LLaVA-Pretrain, arxiv:2310.03744, license:other, eval-results, endpoints_compatible, region:us, conversational

探索

源链接