Gaiya Lab
EN

文章3 分钟读完

默认本地,以及这个决定的账单

Gaiya Lab 有两款产品把神经网络模型放在你自己的设备上跑,而不是服务器上。这是那个决定的代价,和为什么还是照付。

我做过的四个东西里,有两个把神经网络模型放在用户自己的硬件上跑。iRead 的语音合成完全在手机上完成。Anelo 用 whisper 做语音识别、qwen2.5 做润色,两个都在你的笔记本上。

这两个都不是省事的选择。调 API 开发更快、体积更小、在老设备上表现更好。下面是这笔交易的两面。

代价是什么

要么包变大,要么第一次启动变慢。 神经网络语音不是个小文件。你要么把它打进应用里,眼看着下载体积往上涨;要么第一次启动时再拉,然后向用户解释他刚装好的东西为什么还不能用。两个方案都比一个 40KB 的 API 客户端难看。

老设备会受罪。 服务端模型对所有人表现一致。设备端模型的表现取决于它跑在什么设备上。当年的旗舰和五年前的机器之间那道差距,是软件补不上的,它最终会变成一封开头写着"它是不是本来就该这么慢"的邮件。

没法背着用户改进。 服务器上换个模型,当天下午所有人就都用上了更好的版本。设备端的改进只能跟着应用更新走,也就是说,要等审核,再等大家什么时候想起来更新。

排查问题更难。 别人机器上转写出错时,我看不到输入。我手上没有。这正是全部意义所在,同时也确实很不方便。

换来了什么

没网也能用。 iRead 在飞机上照样朗读。Anelo 在地下室照样转写。这不是一条营销卖点,而是"能依赖的工具"和"有脾气的工具"之间的区别。

每个用户的推理成本是零。 这才是 iRead 能做一次买断而不是订阅、Anelo 能免费而不是免费增值的原因。背后没有一笔按请求累积的成本在悄悄长大、最后必须从某个人身上收回来。定价是从架构里长出来的。

隐私不再是一个承诺。 这是真正重要的部分。一份写着"我们不存储你的音频"的隐私政策,说的是意图、留存周期和访问控制——这些都需要你选择相信。而"音频从没离开过这台机器"说的是网络流量,任何足够较真的人都能用抓包工具自己验证。

这是两类不同性质的声明。前者依赖于我持续守规矩、我的托管商守规矩、以及将来可能收购我们任何一方的人也守规矩。后者根本不依赖我。

让它成立的那条规矩

如果软件在本地路径不方便时会悄悄回退到服务器,上面这些就全都不作数。所以 Anelo 有一条规矩:

本地模型没就绪,它就失败。它不会静默走云端。

云端转写是可用的——Groq、OpenAI、Gemini,用你自己的 API Key——对一部分人来说那是更划算的选择。但它默认关闭,打开它是你在设置里做的一次明确选择,而不是趁你没看的时候替你完成的回退。

一个在压力下会悄悄失效的默认值,不叫默认值。那叫一句留了后门的营销话术。

线画在哪儿

我在这件事上并不教条。MindBloom 是要联服务器的,因为一个需要承载几个月上下文的日记伙伴,确实需要比手机上跑得动的更大的模型。WearWhat 要生成图像,2026 年这件事在本地做不到值得发布的质量。

规矩不是"什么都放设备上"。而是:质量在设备上够好,就在设备上跑;不够好的时候,把它跑在哪儿明明白白说出来。

联系

发现问题,或者想聊聊?

hello@gaiya.cc