首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >RLHF >对话机器人为何依赖 RLHF?

对话机器人为何依赖 RLHF?

词条归属:RLHF

对话场景对回答的有用性、安全性、自然度要求极高,这正是 RLHF 的用武之地。

1. 对话质量难以用规则定义

  • 一段对话是否"好",取决于上下文、语气、共情等难以量化的因素
  • RLHF 用人类比较判断替代硬性规则,恰好适配这类主观评价

2. 让模型成为可用的助手

  • 正是 RLHF 让原始语言模型转变为能礼貌、连贯多轮对话的助手
  • 它是对话型产品从"能说话"走向"说得好、靠得住"的关键一步

3. 适配开放域交互

  • 面对开放、模糊、多变的用户输入,规则系统难以覆盖
  • 经偏好对齐的模型能更灵活地处理真实对话中的复杂情况
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券