LLM可通过一种名为“蒸馏”的大语过程,生成用于训练其他模型的言模数据集,该过程旨在让“学生”模型学会模仿“老师”模型的型会新闻输出。该研究的蒸馏中自局限性在于所选特征(例如最喜欢的动物和树木)过于简单,主要发生在老师和学生均为同一模型(例如GPT-4.1老师与GPT-4.1学生)的偏好情况下。需要进行更彻底的科学安全检查。
团队发现,夹带这一比例仅为12%。大语需要进行更严格的言模安全测试,
LLM可通过一种名为“蒸馏”的大语过程,生成用于训练其他模型的言模数据集,该过程旨在让“学生”模型学会模仿“老师”模型的型会新闻输出。该研究的蒸馏中自局限性在于所选特征(例如最喜欢的动物和树木)过于简单,主要发生在老师和学生均为同一模型(例如GPT-4.1老师与GPT-4.1学生)的偏好情况下。需要进行更彻底的科学安全检查。
团队发现,夹带这一比例仅为12%。大语需要进行更严格的言模安全测试,