Vision MCP Server
Click on "Install Server".
Wait a few minutes for the server to deploy. Once ready, it will show a "Started" state.
In the chat, type
@followed by the MCP server name and your instructions, e.g., "@Vision MCP ServerAnalyze the image at ~/Downloads/sample.png for objects and text."
That's it! The server will respond to your query, and you can continue using it as needed.
Here is a step-by-step guide with screenshots.
Vision MCP Server
Ein MCP-Server, der einem LLM Augen für Bilder gibt — vollständig lokal, ohne API-Key, ohne Cloud.
Objekterkennung (YOLOv8) und Texterkennung (EasyOCR), aufbereitet zu Aussagen, mit denen ein Sprachmodell tatsächlich arbeiten kann: Wo liegt was, wie groß ist es, ist es zentriert, wie weit ist es von etwas anderem entfernt?
Warum Markdown statt JSON?
Die meisten Vision-Tools geben Koordinaten zurück und überlassen dem Modell das Rechnen. Dieser Server dreht das um und liefert fertige Sätze:
Text „Jetzt anmelden" liegt 276px unterhalb von person.
person — Konfidenz: high (0.91)
Position: x=310, y=120 | Größe: 280×410 px | 24.3% des Bildes
Horizontal: zentriert (1.2% Abweichung)
Vertikal: off-center, 88px nach oben (14.7%)Ein LLM verarbeitet „liegt 276px unterhalb von" zuverlässiger als vier verschachtelte Bounding-Box- Zahlen, aus denen es die Beziehung erst selbst ableiten müsste. Jeder Bericht trägt eine Fußnote mit Koordinatensystem- und Konfidenz-Legende, damit die Zahlen ohne Zusatzkontext richtig gedeutet werden.
Related MCP server: VisionPower
Tools
Tool | Beantwortet die Frage |
| Welche Objekte sind im Bild — wo, wie groß, zentriert? |
| Welcher Text steht wo im Bild? (OCR) |
| Wie weit sind zwei Elemente voneinander entfernt? Überlappen sie? |
| Ist dieses eine Element zentriert — und wie stark daneben? |
| Gesamtüberblick in einem Aufruf: Objekte + Texte + Beziehungen |
Als Bildquelle wird ein lokaler Pfad (~ wird aufgelöst) oder eine http(s)-URL akzeptiert.
Elemente werden über ihren Namen angesprochen — eine YOLO-Klasse wie person oder ein Textinhalt
wie Jetzt anmelden, auch als Teilstring.
Installation
pip install -r requirements.txt
python3 server.py --selftest # Windows: python server.py --selftestDer Selbsttest prüft die Abhängigkeiten, lädt die Modelle vor und analysiert ein Testbild. Sagt er „Alles bereit", ist der Server einsatzfähig.
Dann in ~/.claude.json eintragen:
{
"mcpServers": {
"vision_mcp": {
"type": "stdio",
"command": "python3",
"args": ["/absoluter/pfad/zu/vision_mcp/server.py"]
}
}
}Beim ersten Start werden die Modelle automatisch geladen (YOLO ~6 MB, EasyOCR ~100 MB) — danach läuft alles offline. Kein API-Key, kein Cloud-Konto: Es verlässt kein Bild den Rechner, was den Server auch für vertrauliches Material brauchbar macht.
Grenzen — bitte vorher lesen
YOLOv8 erkennt nur die ~80 COCO-Klassen (person, car, dog, laptop, bottle …), also keine UI-Elemente: keine Buttons, Logos, Icons, keine Design-Shapes. Ein Creative auf „ist der Button mittig?" prüft man über den Text des Buttons (OCR), nicht über Objekterkennung.
OCR versagt bei stark stilisierten Schriften, Handschrift und sehr kleinem oder kontrastarmem Text; die Wortgruppierung entspricht nicht immer der menschlichen Erwartung.
Läuft auf der CPU. Der erste Aufruf ist langsam, weil die Modelle lazy geladen werden.
Konfiguration
Alles optional — ohne jede Variable läuft der Server mit sinnvollen Defaults.
Variable | Bedeutung | Default |
| YOLO-Gewichte ( |
|
| OCR-Sprachen, kommagetrennt |
|
| Cache-Verzeichnis der Gewichte |
|
Dokumentation
Vollständige Setup-, Konfigurations- und Betriebsdoku: AGENTS.md.
Lizenz
MIT © Herbert Walde
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
Alicense-qualityFmaintenanceAn MCP server that exposes HuggingFace computer vision models for zero-shot object detection, enabling LLMs to detect and analyze objects in images.Last updated61MIT- AlicenseAqualityAmaintenanceA portable image-understanding MCP server that lets agents analyze local images, URLs, or base64 images via an OpenAI-compatible vision model.Last updated133912MIT
- Alicense-qualityCmaintenanceAn MCP server that enables any LLM to describe images from file paths, URLs, or base64 data by forwarding them to a supported vision provider such as OpenAI, Anthropic, or local Ollama models.Last updated2,0836MIT
- AlicenseAqualityCmaintenanceA TypeScript MCP server that gives text-only LLMs image understanding through StepFun vision models.Last updated72,083MIT
Related MCP Connectors
MCP server for AI dialogue using various LLM models via AceDataCloud
Hosted MCP server connecting claude.ai, ChatGPT and other AI apps to your own computer
MCP server for Hailuo (MiniMax) AI video generation
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/hwalde/vision-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server