Font size
Worksheets8、9课回顾
Total questions: 10
Worksheet time: 8mins
1️⃣ (多选)
推理模型相比普通大语言模型,多了哪些典型特征?
A. 在给出最后答案前,会主动生成一串中间推导步骤
B. 完全不再依赖“根据上文预测下一个词”的接龙机制
C. 会把复杂问题拆成多个简单的中间子问题再逐个解决
D. 只要题目见过一次,以后永远直接背出答案,不再推导
2️⃣ 关于“思维链(Chain of Thought,CoT)”(多选)
下列哪些说法准确描述了“思维链”在推理模型中的作用?
A. 思维链是一串由模型自动生成的中间推理步骤,用来自我“拆题”
B. 思维链的存在,使得模型在复杂题目上更容易“举一反三”
C. 有了思维链之后,模型就不再需要任何训练数据
D. 思维链可以看作是模型为自己制造的、更细颗粒度的提示词序列
3️⃣ “泛化”与推理能力的关系(多选)
关于第八课里的“泛化”概念,下列说法哪些是合理的?
A. 泛化指模型在从未见过的新题目上,仍能保持和训练集相近的表现
B. 推理模型通过拆解问题,有助于把已学过的简单模式组合成对新问题的解法
C. 只要训练数据足够多,就一定会自动获得良好的泛化能力
D. 没有泛化能力的模型,只能在训练集原题上给出正确答案
4️⃣ 推理模型真的在“思考”吗?(多选)
从第八课的讨论来看,下列哪些说法体现了对“推理模型是否真在思考”的深入理解?
A. 推理模型的推导步骤仍然是基于统计接龙,只是接的是“步骤句子”而不是最终答案
B. 即使外观看起来像在认真算题,本质上仍然是对大量示例推导过程的模式模仿
C. 只要能完美模仿人类推理文字,就和真正的思考在本质上完全相同
D. 这个问题触及“意识”和“心智”的哲学争议,目前没有统一答案
5️⃣ 三种“增强推理”的方法(多选)
第八课提到提升 AI 推理能力的其他方法,下列对应关系哪些是正确的?
A. 程序增强推理:把模型和外部代码、计算器等工具结合,让模型把部分推理交给程序执行
B. 自洽性推理:让模型多次生成不同的推理路径,再从中选择彼此结论一致的答案
C. 搜索增强推理:在推理过程中结合搜索引擎或知识库,查找额外信息辅助判断
D. 这三种方法都不再依赖大语言模型,只依赖传统手写规则
6️⃣ Token 的本质含义(多选)
根据第九课的定义,Token 具有什么核心特点?
A. 是语言在实际使用中出现的“最小语义单位”
B. 可以是单字、单词、标点、短语或其他有语法功能的字符串片段
C. 必须严格等同于我们平时说的“一个词”,不能比词更短或更长
D. 是大语言模型内部处理、计数和收费的基础单位
7️⃣ 大脑中的“词块”和模型中的 Token(多选)
第九课用识字小游戏说明了人脑和 Token 的类比,下列说法哪些是恰当的?
A. 人脑在阅读时会把常见词语当成一个整体“词块”处理,而不是逐字拆开
B. 大语言模型会把经常一起出现的字词组合打包成一个 Token,类似人脑的“词块”
C. 这个类比说明 Token 只可能是两个字组成的固定结构
D. 类比的重点在于:无论是人还是模型,都倾向于用“重复出现的小单元”来减轻处理负担
8️⃣ Token 粒度与模型效率(多选)
关于“为什么要把文本拆成 Token”,下面哪些说法是正确的?
A. 把连续文字拆成合适的 Token,可以减少模型每次需要处理的步骤数量
B. 如果逐字当作一个 token,同一句话会被拆得更多,计算次数明显增加
C. 设计合理的 Token 粒度,可以在“表达能力”和“计算成本”之间取得平衡
D. Token 粒度越细越好,只要拆得足够碎,模型效率就一定最高
9️⃣ Token 与“按字数数长度”的冲突(多选)
第九课举例说有些模型“连 20 字文案都数不准”,这与 Token 的哪些特性有关?
A. 模型在内部是按 Token 个数而不是按“字数”来工作的
B. 不同 Token 包含的字数不同,同一句话在 Token 视角和“字数视角”不一致
C. 只要把一句话拆成 Token,模型就完全失去了对原始字数的任何感知
D. 当用户要求精确到“多少个字”时,模型需要在 Token 层面做近似估计,因此很难做到严格精确
🔟 综合:推理模型 + Token 视角(多选)
结合第 8、9 课的内容,下列哪些说法准确体现了“推理模型在 Token 层面工作的特点”?
A. 推理模型生成的“思维链”本质上也是一长串 Token,只是这些 Token 组成的是推导步骤而非直接答案
B. 推理过程中的每一步“子问题”和“中间结论”,都会被编码成 Token 序列再交给模型继续接龙
C. 只要在提示词里写上“请一步一步思考”,模型就自动拥有真正的人类逻辑能力,而不再受 Token 机制限制
D. 思维链和 Token 机制结合在一起,使得模型可以在离散的小语义单元上模拟出“分步推理”的效果
