Token 是什么
Token 是模型处理文本的基本单位,可以理解为“字/词/子词”的混合切分。模型收费、上下文长度、推理速度通常都与 Token 数相关。
上下文窗口是什么
上下文窗口决定模型一次能看到多少信息。长上下文适合处理长文档、代码库、会议记录,但窗口越长,成本和延迟通常也越高。
幻觉是什么
幻觉指模型生成看似合理但并不真实的内容。常见原因包括:
- 训练数据中没有相关事实。
- 用户问题要求模型猜测。
- 缺少检索、工具或真实数据约束。
降低幻觉的常见方法:
- 要求模型引用来源。
- 引入 RAG 检索。
- 让模型只基于给定材料回答。
- 用工具/API 获取事实数据。
推理模型是什么
推理模型会在回答前进行更长链路的思考,适合数学、代码、复杂规划、逻辑推演等任务,但通常速度更慢、成本更高。
多模态模型是什么
多模态模型可以同时理解文本、图像、音频、视频等输入。比如分析截图、读取图表、理解视频内容、生成图片或视频。