搓了一个 typeless 平替,可能是最强平替

查看 39|回复 4
作者:dday198990   
Why 为什么做 vokie
👉 https://vokie.com
这是我和两个小伙伴搓的语音助手,已经开放公测了,如果恰巧你愿意试试我们万分荣幸。

最早接触到 AI 语音产品是 2025 年的 Wispr Flow 。这类产品让我思考 —— 在 Agent 时代我们和机器的交互方式是否有新的可能性。
说话是最自然的人类表达,还不识字的婴儿就会说话。不可否认,键盘是一个伟大的发明,它把我们的思维和机器连接在一起。即使 LLM 极大推动了 ASR 等技术的发展,我也不认为打字和语音输入是替代的关系。
一个有意思的变化是,从 ClaudeCode CLI 开始,我们和 Agent 的沟通量级指数级上升。对 Agent 来说,略显啰嗦的人类口喷,恰恰是最重要的 context
vokie 就是要把最自由的表达,还给所有人。想说就说,不用打腹稿、理思路,直接喷给 Agent !
Different 有什么不同
语音输入最核心的,是理解并尊重用户的语义,在此基础上做文本的整理和润色才有意义。
接住口语表达习惯,比如各类口语词、重复、口癖,甚至是对之前表达的口头修改。
越用越懂你,自动识别热词并学习,改一次下次就能识别准确,并且支持配置常用语。

每个人的习惯不同,在不同场景的诉求也不同。因此我们做了表达场,将自由度还给用户。

除了语音输入,vokie 拓展了记录、实时翻译等场景,帮助大家记录、理解重要的语音内容。
( 比如,一个全局的录音记录工具,不像飞书妙记那么重,又不依赖腾讯会议等客户端)

语音不只是说完即抛的内容,也是重要的上下文。当我们需要的时候,应该可以随时方便的调用

Challenge 碰到的挑战
首先,是很多用户还在旧有的习惯里,不愿意尝试语音,或者浅尝辄止。诚然,在办公场域里,开口天然指向社交尴尬。如果有专用的口喷硬件,是否能够缓解大家的社交尴尬?
( 硬件探索方面:如果你有 AppleTV 遥控器, 你想用它口喷。vokie 内置了对它的支持,连上 mac 就能用 )

其次,是巨量的低质量的竞品,其中包括“大厂出品”的“毛坯”和个人开发者几天时间 vibe 出来的“ 玩具”。我们乐见百花齐放,但是当大量的低品质的产品喂国人吃 *,和增加用户的选择成本,其实并不是一个好的生态。我想其他产品可能也有类似的困境,何解?
最后,是如何增长?目前通过 X 、口碑传播等,已经有了一定的用户基础。我们希望 vokie 能够将更多用户带入语音工作流时代,自由奔放的创造。这是 vokie 的初心,其次才是商业价值。
以上是目前让我们头疼的几个点,欢迎大家吐槽或者帮忙出出主意。
👉 https://vokie.com
欢迎感兴趣的小伙伴下载试用,也欢迎加群唠唠
(我们准备了一些质感很棒的 vokie 周边,可以找我来要)



语音, Agent, 表达

dday198990
OP
  
回复评论的小伙伴,欢迎联系我送周边
FanyFull   
算半个同行,我是做 Windows 的输入法的,键盘+语音全链路。想问问你们做 macOS 语音输入法的为什么不把键盘的功能也做进去呢?目前我只看到豆包把语音输入法的当前的流式识别做到了 inline preedit 里面去,这个感觉是最符合直觉的,你们有没有考虑过这一点呢?
有一点你说得不错,就是,现在包括大厂和个人开发的一些输入法产品,都是粗制滥造的毛坯,比如豆包和千问目前的 Windows 版本的输入法。
watzds   
不错
dday198990
OP
  
@FanyFull 确实,inline preedit 是语音输入最符合直觉的形态之一:识别结果直接出现在光标位置,边说边看、随时修正,比悬浮窗识别完再上屏自然很多。豆包这一点做得值得研究,我们也认真考虑过。
目前 Vokie 还没有把自己做成一套完整的键盘输入法,主要是阶段性的产品取舍。完整 IME 不只是增加键盘输入,还要长期处理词库、候选、学习排序、中英文混输,以及不同编辑器的兼容性。对一个小团队来说,很容易把精力摊得太薄。我们现阶段更想先把语音链路做好,包括低延迟、稳定上屏、AI 润色和跨应用体验。
不过从长期形态看,我也认同你的判断:语音不应该只是一个外挂按钮,而应该和键盘输入共享同一个编辑上下文。inline preedit ,以及语音和键盘之间的无缝接续,都是很值得做的方向。
你在做 Windows 键盘+语音全链路,应该踩过不少这方面的坑。也很好奇你们在 partial result 抖动、光标移动、用户键入打断,以及不同编辑器兼容上是怎么处理的,欢迎交流。
您需要登录后才可以回帖 登录 | 立即注册

返回顶部