轨迹与语音时空对齐编译器

边指边说
把轨迹编译为 AI 指令

移动中语音位置绑定 · 词级时间戳对齐 · Codex MCP 插件 · Chrome 扩展双形态

打字表达不了空间位置,截图画圈表达不了即时意图。iMouse 让你在指着、圈选、画线的同时自然说话,毫秒级把轨迹与语音对齐为结构化证据包,直接驱动 AI 改图、改代码与网页交互。

移动中的语音位置绑定结构化指令编译器Codex MCP 原生插件Chrome 网页扩展双形态

轨迹时空对齐 · 结构化指令编译 · Codex MCP 插件 · SenseVoice 离线 ASR

design-review.png

「把这个按钮颜色调浅一点……还有,这一块整体挪到左边」

编译产物 · 结构化证据包
{ "action": "adjust_color",
  "target": { "shape": "circle" },
  "hint": "颜色调浅" }
{ "action": "move_block",
  "target": { "arrow": "→ left" } }

核心技术与交互架构

专为高精度视觉人机协作打造的技术壁垒

L1

移动中的语音位置绑定

无需停下鼠标打字。在鼠标拖动、划线、圈选的连续过程中持续说话,轨迹与语音毫秒级时空绑定。

L2

结构化指令编译器

内置形状识别(圈选/箭头/下划线)与停留热点提取算法,把原始路径编译为富含上下文的结构化证据包。

L3

Codex MCP 原生插件闭环

与 Codex 无缝协同,自动拉取指令、视口截图与轨迹参数,完成代码修改或图像生成并自动双向回传结果。

Chrome 浏览器扩展双形态

支持在任意真实网页按住 Alt 画线语音交互,提供侧边栏独立 AI 问答模式与协同 Codex 模式两种形态。

三级 ASR 语音识别矩阵

优先 OpenAI 词级时间戳端点,支持本地离线 SenseVoice int8 模型(完全私密零延迟)与 Apple Speech 兜底。

纯前端分层架构与零原生依赖

采用 Pointer Capture → Instruction Compiler → Agent Adapter 三层清晰解耦架构,稳定高效且易于扩展。

为什么需要 iMouse?

传统的 AI 对话界面停留在「打字聊天」模式,当我们面对设计稿、网页或代码界面想告诉 AI「把这一块挪到那里、这个按钮颜色调浅」时,需要频繁切换窗口、停下鼠标打字描述坐标,效率极其低下。

人与人交流时最自然的动作是「用手指着说话」。iMouse 捕捉鼠标运动轨迹并与本地 SenseVoice / Whisper 词级语音时间戳进行几何与时空融合,将你的手势与声音编译成 AI 读得懂的确定性指令,开启所指即所得的下一代人机交互。

打破图文割裂,所指即所言,所言即所得。