人的价值#
我打字比 LLM 慢,LLM 读的书比我多,后训练阶段还专门为语言的严谨性和表达效率做过强化学习,那个量级的监督信号我一辈子都难望其项背。
我自诩为文学爱好者,语文一直是我 12 年中小学教育里最喜欢的学科。但是翻开我以前写的东西,可能的确有点个人特色,但论严谨和准确性,远不如 LLM。而且大学这几年,我的语言和修辞水平还在继续退化。
那么,作为人,我们还剩下什么?
一是外界反馈 我们暴露在外界的语言的和非语言的高密度的多模态的反馈。比如我说我想要做一个 PPT 明天去介绍我自己。但是 AI 并不清楚地知道我有什么能力,我的偏好是什么,领导的偏好是什么,我处在什么位置,社会的偏好是什么。只能根据它权重里面的分布给我一个训练数据里面的「大概也许」的分布。
二是内部潜意识的存在和多模态的协同 我们对自己的潜意识没有可靠的内省通道。精神分析,对人大脑的可解释性研究还处在早期阶段,不可证明也不可证伪。潜意识是语言和行为背后的阴影。
我们已经能够画出果蝇的全脑连接组,但是画出接线图不等于理解。我们不理解果蝇是怎么让触觉、嗅觉视觉等信号协同工作的,是怎么完成生命周期这一长程任务的。
总之,LLM 是模仿智能的人工造物,而我们就是智能本身。 保守地说,在 AGI 到来之前,我们可以和 LLM 协同互补。
这也是我记录和表达的动力之一。
为什么用语音输入#
信号密度是有阶梯的: 写信 < 短信 < 语音电话 < 视频 < 面对面 < 长期面对面。越往上越丰富,越往下越稀疏。人的语言和行为是多模态的,文字只是其中一部分。
书上流传的文字,都是网状思维的线性投影。我们在 latent space 里想出来的东西,最后还是要投影到线性的文字中,从 latent 到 language 的转换是我们认知的负担。
当我们面对面说话时,从 latent 到 language 的转换与纠错压力不必全部由文字承担。词对了,怎么倒装人都听得懂;再加上表情、停顿、身体语言的纠错。包括语气助词也是信息——我卡住的时候会”就是那个""是吧”,那是流式输出的占位,它把我的快慢和迟疑一起记下来了,还原了信息重点和置信度。说话时,我们可以专注于脑内网状想法的输出。
所以语音很适合保持思考的高熵状态。
如何剪枝:从语音到成稿#
上一节提到了语音输入的好处及保持网状的思路,但是线性化相对于网状有逻辑的先后关系。当你把想法线性化,本身就是一种检验:什么是可并行无前提条件的,什么是不可并行的。
所以,我们就可以借助 AI 的力量,从我们的语音转写初稿里面提取出:
- 判断句(也就是观点句)
- 论证句
- 论据句
对于所有的论据,所有的可核实的事实,我们要做到最保守。即使是最 mean 的审查者,也要对我们无能为力。
而对于不可核查的判断,或者说依赖于个人 taste 的判断,我们要诚实地遵循我们内心的想法。 这种判断我们无需严格遵照 AI 的提醒,因为它在目前条件下是局部不可证真、不可证伪的。AI 在后训练上被要求避免犯错,它会让你的表述更加严谨,但是也会以严谨之名扼杀你的创新。
和 AI 进行辩论之后,判断好要删掉哪些、留下哪些、更改哪些、坚持哪些,就可以让 AI 再吐出一版本新的文章。
这篇文章一定是很有 AI 味的,因为它的措辞已经是这样了。这个时候,我们可以用我们自己的语言,再把这篇文章认真地朗读一遍,这篇文章就属于我们自己了。 不但是 insight 还有取舍上面,而且在语言和句段结构上,都属于我们自己。
关于附件和其他内容,可以移步 AI 时代去 AI 味写作的一些想法与实践。