OpenMac 是运行在macOS本地的HTTP服务,全部能力依托mac原生系统框架实现,无需第三方模型,完全免费,对外提供统一API接口,非常适合给本地AI Agent调用。默认本地地址 [http://localhost:8080](http://localhost:8080),所有接口返回统一JSON结构。
统一返回格式
{
"success": true,
"timeCost": 42,
"data": { ... },
"message": ""
}
timeCost 单位毫秒;失败时 success=false,data为空对象,message携带错误说明。图像相关接口(OCR/人脸/二维码)三选一入参:url / base64 / 本地文件绝对路径。
全部API能力清单
1. OCR 图像文字识别 /api/ocr
依托Vision框架识别图片文本,支持图片URL、Base64、本地文件传入。返回按行拆分的文本数组和合并后的完整文本。
2. 翻译 /api/translate
macOS 15+原生翻译框架,支持自动识别源语言,指定目标语言代码(zh、ja、fr等),GET/POST两种调用方式。
3. 网页内容渲染 /api/web-content
基于WKWebView无头浏览器加载页面,返回渲染完成后的完整HTML。支持等待策略domcontentloaded / networkidle0 / networkidle2,可自定义超时时间,适合抓取JS动态网页。
4. 网页搜索 /api/search
调用系统配置里启用的搜索引擎(Bing、Google、DuckDuckGo、Brave,可选维基百科、arXiv),最多并行3个引擎,自动合并结果;单个引擎超时不会破坏整体返回。
5. 人脸检测 /api/face
Vision人脸识别,输出人脸归一化框、头部俯仰/偏航角、面部特征点、特征向量。开启draw=true可返回带标注框的Base64图片。坐标原点在左下角,和Apple Vision规范保持一致。
6. 二维码/条码识别 /api/qrcode
识别图片内QR、EAN13等条码,返回解码内容、条码类型与包围盒。
7. 文本转语音 /api/tts
调用AVSpeechSynthesizer,输出Base64编码WAV音频;支持指定音色ID、语速、音高、音量,支持中文、英文等多语言。
设计特点
- 完全本地:底层都是macOS自带系统能力,不需要云端API,无调用计费
- 标准化接口:一套统一JSON返回,GET/POST双支持,极易接入Agent、MCP工具
- 独立能力:各个接口互不依赖,按需启用
- 内置文档页:
[http://localhost:8080/SKILL.md](http://localhost:8080/SKILL.md),可直接给大模型读取作为工具描述
适用场景
本地开发Agent、MCP工具集、自动化脚本,把mac原生视觉/翻译/网页抓取能力封装成API,不需要额外部署OCR模型、TTS模型。
注意事项
- 翻译接口最低要求macOS 15
- 网页渲染依赖WebKit,页面加载超时可自定义timeout
- 图片接口读取本地文件需要服务拥有对应文件权限










