Max Length 设置语言模型单次回复可生成的最大 token 数。Token 是文本片段,约 100 token 等于一段短文。较小限制节省时间与成本,但可能截断答案;较大限制允许完整详尽的回复,但需要更多算力且可能失焦。根据任务选择:推文用短限制,文章用长限制。仔细调整 Max Length 有助于在清晰度、速度与成本之间取得平衡。