边指边说
把轨迹编译为 AI 指令
移动中语音位置绑定 · 词级时间戳对齐 · Codex MCP 插件 · Chrome 扩展双形态
打字表达不了空间位置,截图画圈表达不了即时意图。iMouse 让你在指着、圈选、画线的同时自然说话,毫秒级把轨迹与语音对齐为结构化证据包,直接驱动 AI 改图、改代码与网页交互。
轨迹时空对齐 · 结构化指令编译 · Codex MCP 插件 · SenseVoice 离线 ASR
「把这个按钮颜色调浅一点……还有,这一块整体挪到左边」
{ "action": "adjust_color",
"target": { "shape": "circle" },
"hint": "颜色调浅" }
{ "action": "move_block",
"target": { "arrow": "→ left" } }核心技术与交互架构
专为高精度视觉人机协作打造的技术壁垒
移动中的语音位置绑定
无需停下鼠标打字。在鼠标拖动、划线、圈选的连续过程中持续说话,轨迹与语音毫秒级时空绑定。
结构化指令编译器
内置形状识别(圈选/箭头/下划线)与停留热点提取算法,把原始路径编译为富含上下文的结构化证据包。
Codex MCP 原生插件闭环
与 Codex 无缝协同,自动拉取指令、视口截图与轨迹参数,完成代码修改或图像生成并自动双向回传结果。
Chrome 浏览器扩展双形态
支持在任意真实网页按住 Alt 画线语音交互,提供侧边栏独立 AI 问答模式与协同 Codex 模式两种形态。
三级 ASR 语音识别矩阵
优先 OpenAI 词级时间戳端点,支持本地离线 SenseVoice int8 模型(完全私密零延迟)与 Apple Speech 兜底。
纯前端分层架构与零原生依赖
采用 Pointer Capture → Instruction Compiler → Agent Adapter 三层清晰解耦架构,稳定高效且易于扩展。
为什么需要 iMouse?
传统的 AI 对话界面停留在「打字聊天」模式,当我们面对设计稿、网页或代码界面想告诉 AI「把这一块挪到那里、这个按钮颜色调浅」时,需要频繁切换窗口、停下鼠标打字描述坐标,效率极其低下。
人与人交流时最自然的动作是「用手指着说话」。iMouse 捕捉鼠标运动轨迹并与本地 SenseVoice / Whisper 词级语音时间戳进行几何与时空融合,将你的手势与声音编译成 AI 读得懂的确定性指令,开启所指即所得的下一代人机交互。
打破图文割裂,所指即所言,所言即所得。