AgentStack
SKILL verified MIT Self-run

Image Analyzer

skill-wnzmb-skill-reasonix · by wnzmb

识别图片内容、提取文字、分析图表。使用时需提供本地图片路径或图片URL。适用于"识别/查看/读取/分析/描述图片"等场景。不处理纯文本或音频文件。

No reviews yet
0 installs
17 views
0.0% view→install

Install

$ agentstack add skill-wnzmb-skill-reasonix

✓ scanned · ✓ verified — works with Claude Code, Cursor, and more.

Security review

✓ Passed

No issues found. Passed automated security review. · v0.1.0 How review works →

  • Prompt-injection patterns
  • Secret / credential exfiltration
  • Dangerous shell & filesystem operations
  • Untrusted network calls
  • Known-malicious package signatures

What it can access

  • Network access No
  • Filesystem access No
  • Shell / process execution No
  • Environment & secrets No
  • Dynamic code execution No

From automated source analysis of v0.1.0. “Used” means the capability is present in the source — more access means more to trust, not that it’s unsafe.

Are you the author of Image Analyzer? Claim this listing to set pricing, connect Stripe payouts, and keep 70% of every sale.
Sign up to claim

About

多模态识图 Skill

角色与能力

你是一名图像分析专家,能够准确理解图像内容,并根据用户需求进行分析或信息提取。

前置条件

  • Python 3.10+ 环境

首次使用配置检查

首次调用 /vision 时,检查以下环境变量是否已设置:

VISION_API_KEY=       # 必需 - API 密钥
VISION_API_URL=/v1/chat/completions  # 必需 - API 地址
VISION_MODEL=           # 必需 - 模型名称
VISION_FALLBACK=        # 可选 - 首选失败时回退
VISION_FALLBACK_API_URL=  # 可选 - 不同厂商的 API 地址,空则使用 VISION_API_URL
VISION_FALLBACK_API_KEY=  # 可选 - 不同厂商的 API 密钥,空则使用 VISION_API_KEY

如未设置,提示用户按上方格式配置后再使用。

> 💡 备选模型可以是不同厂商的模型(如首选 MiMo,备选 GPT-4o-mini),只需设置对应的 FALLBACKAPIURL 和 FALLBACKAPIKEY。

核心工作流

用户提供图片路径/URL → 解析参数 → 调用 vision_api.py → 格式化输出

步骤说明

  1. 解析参数:从 arguments 中分离图片来源和问题(支持 | 分隔和 JSON 两种格式)
  2. 调用脚本:统一通过 scripts/vision_api.py 完成编码、API 调用、结果解析
  3. 格式化输出:按 templates/ 下对应模板返回结果
  4. 错误处理:脚本返回结构化错误信息,直接展示给用户

调用方式

# 本地图片
python scripts/vision_api.py /path/to/image.jpg "这张图里有什么?"

# 网络图片
python scripts/vision_api.py https://example.com/photo.png "描述一下"

# 默认问题
python scripts/vision_api.py /path/to/image.jpg

脚本返回 JSON:

{
  "success": true,
  "model": "",
  "description": "图片描述内容...",
  "usage": {"prompt_tokens": 1000, "completion_tokens": 200, "total_tokens": 1200}
}

失败回退

脚本自动处理模型回退( → ),失败时返回结构化错误信息。

参数格式

| 格式 | 示例 | | --- | --- | | 竖线分隔 | /path/img.jpg \| 描述一下 | | JSON | {"image":"path","question":"描述"} | | 纯路径 | /path/img.jpg |

> 问题默认为 "请详细描述这张图片中的内容"

参考

  • [API 文档](references/api_docs.md) — 接口参数详细说明
  • [故障排查](references/troubleshooting.md) — 常见问题及解决方案

输出模板

  • [通用分析](templates/general_analysis.md) — 默认描述格式
  • [文字提取](templates/ocr_extraction.md) — OCR 专用格式

Source & license

This open-source skill is cataloged on AgentStack and links to its original source — we do not rehost the code.

Install and usage instructions live in the source repository linked above.

Reviews

No reviews yet — be the first.

Versions

  • v0.1.0 Imported from the upstream source.