尽管以 Typeless 为代表的新型语音输入工具,通过大语言模型优化,宣称能实现完美的语音转文字,但对于需要深思熟虑的内容创作而言,打字仍然是不可替代的方式。写作本质上是一个不断推敲和修改的思考过程,而非追求速度的任务。语音输入试图将这个过程线性化和外包,反而剥夺了创作者的思考空间,因此在创作领域无法取代键盘的核心地位。
新型语音工具的承诺与现实
近期,以 Typeless 和 Wispr Flow 为代表的语音输入工具引发了新的讨论。它们宣称“语音才是人类的原生输入方式”,并通过大语言模型技术解决了传统语音输入的诸多痛点。
- 移除口水词: 自动过滤掉“嗯、啊、这个、那个”等无意义的词语。
- 理解指令: 能够识别并执行如“啊,不是,刚才说的应该是……”这类修改指令。
- 润色输出: 对最终的文本进行打磨,使其看起来干净利落。
然而,在实际的内容创作场景中,这些看似美好的功能却带来了问题。除了在公共场合使用会打扰他人之外,更核心的问题在于,它剥夺了写作者的思考流程。
真正的麻烦在于,我觉得 Typeless 这类语音输入工具,正在剥夺我的思考流程。
速度的陷阱:创作并非竞速
这类语音输入工具的核心卖点是“说话比打字快”,并通过打字比赛等营销活动来强化这一观念。但这忽略了内容创作的本质。
对于快速回复客户的律师朋友来说,语音输入能在短时间内生成详尽专业的答复,是极为高效的工具。但对于内容创作者,情况完全不同。
创作本就不是一个“速度为先”的行为。一个典型的写作过程充满了停顿、修改和回溯:
- 思考如何准确表达一个观点。
- 打出文字后,发现用词不当,需要选中、删除、替换。
- 写到一半,返回前文审视,寻找更凝练的表达方式,或修正病句。
- 完成初稿后,从头通读,反复修改不满意的地方。
打字,本质上是一个思考的过程。 我们通过输入文字,再回头审视,来确认它是否合适。而语音输入强迫我们将这个复杂的、非线性的思考过程,变成一个线性的、无法回溯的表达过程,一旦思路混乱,输出的文本便会一塌糊涂。
思考的外包与创作的本质
当尝试使用 Typeless 分享附注时,因为需要边说边组织思路,结果是错误频出,口水词不断,最终工具也无法从混沌的语言中整理出合理的句子。这证明,语音输入强迫使用者将思考过程外包给了算法,这对于需要深度脑力劳动的创作来说是不可接受的。
键盘输入之所以不可替代,是因为它给了我们修改和深思的自由。正如一段引文所说,写作是我们可以反复修改,直到自己满意的唯一方式。
因为我认为人们在使用语言时习惯于一般化且随心所欲或漫不经心,对此我却不能容忍。……我尽量少开口讲话,宁愿用手写。因为写的时候我可以多次修改,不能说一直改到我对自己的言语满意时为止,至少可以改得令我看不出有什么不满意的理由。文学——我指的是名副其实的文学——是一片乐土,只有在这片乐土上语言才会现出本来的面貌。