新的解题思路
  • 新的解题思路
  • 分类:其他类型
  • 作者:阎宸以
  • 更新:2023-10-11
  • 最新章节:第一章
继续看书
热门小说推荐,《新的解题思路》是阎宸以创作的一部其他类型,讲述的是强倡翌陆俊佚之间爱恨纠缠的故事。小说精彩部分:首发:AINLPer微信公众号(每日论文干货分享!!)编辑:ShuYini校稿:ShuYini时间:2023-10-11引言大型语言模型(LLM)展

《新的解题思路》精彩片段

首发:AINLPer微信公众号”每日论文干货分享!”
编辑:ShuYini校稿:ShuYini时间:2023-10-11引言大型语言模型”LLM”展现出了杰出的性能,并为我们提供了新的解题思路。
但在实际应用过程中,如何评估大型语言模型的输出质量对于我们来说也至关重要。
因为大模型的输出是概率性的--这意味着同样的Prompt产生的结果都有可能不同,大模型评估能够衡量模型输出的质量水平,能够确保用户的体验。
为此,今天给大家整理了一些LLMs输出结果的评估方法。
一、用户反馈评估的黄金标准”GoldStan**rd”是收集真实的用户反馈。
即:如果想要深入了解应用程序的质量与实用性,最佳方法是收集真实用户的反馈。
除此之外,其它的评估方法都是从侧面反映出模型的质量水平。
收集用户反馈的具体策略可以有不同的形式,例如:“显式反馈”:通过相关功能来收集用户反馈,例如:对于模型的输出结果,如果觉得好就点个赞,如果觉得不好就点个差;亦或者对输出进行打分评级,特别好9分以上,好8分以上,较好7分以上,一般6分以上,差6分以下等。
“隐式反馈”:通过用户行为分析,例如:对于模型的输出结果并不关心则视为负面结果,对于模型的输出结果停留的时间较长则视为正面结果等。
通过以上两种规则方式,随着越来越多的用户开始使用该模型应用程序,就会收集到很多用户关于该模型的使用数据,根据该数据来分析模型的输出效果,从而不断地改进模型效果。
但该方法也存在一定滞后性。
因为只有当模型上线对客且用户使用一段时间之后,这些数据才能够收集到。
为此,在模型应用上线对客之前我们还需要对其进行评估测试,这就需要下面的这几个方法。
二、人工评估上线对客之前,评估大模型应用输出水平的最佳选择是:让标注人员在预部署阶段评估大模型应用的输出。
典型的评估方法是构建测试数据集,根据测试数据集进行模型评估。
让我们看一个简单的问...
最新更新
继续看书

同类推荐

  • 法医小姐,难道你真是个小天才?后续故事 法医小姐,难道你真是个小天才?后续故事

    虫宝宝

  • 法医小姐,难道你真是个小天才?后续剧情 法医小姐,难道你真是个小天才?后续剧情

    虫宝宝

  • 法医小姐,难道你真是个小天才?后续 法医小姐,难道你真是个小天才?后续

    虫宝宝

  • 继妹要换亲,我被暴君强宠她悔哭了后续 继妹要换亲,我被暴君强宠她悔哭了后续

    萱草

  • 正义狙击祁同伟的复仇之路无广告免费观看 正义狙击祁同伟的复仇之路无广告免费观看

    洋河大曲

  • 正义狙击祁同伟的复仇之路无广告在线观看 正义狙击祁同伟的复仇之路无广告在线观看

    洋河大曲

  • 正义狙击祁同伟的复仇之路无广告 正义狙击祁同伟的复仇之路无广告

    洋河大曲

  • 清明祭祖,弟弟玩火把全家害死了全文阅读 清明祭祖,弟弟玩火把全家害死了全文阅读

    元宝

  • 错爱八年 错爱八年

    努力的林爆爆

  • 错爱八年在线阅读 错爱八年在线阅读

    努力的林爆爆

  • 错爱八年免费阅读 错爱八年免费阅读

    努力的林爆爆

猜你喜欢

  • 假装被死对头催眠后最新章节列表 假装被死对头催眠后最新章节列表

    铁蛋111

  • 开窍 开窍

    芋泥啵啵冰

  • 姐姐绑定系统后,我跟着吃肉全集 姐姐绑定系统后,我跟着吃肉全集

    流萤

  • 父亲节当天,我开车撞了闺蜜爸爸全文+番外 父亲节当天,我开车撞了闺蜜爸爸全文+番外

    佚名

  • 我的董事长母亲结局 我的董事长母亲结局

    贵川

  • 怀孕八个月老公亲手给我打催产针完结+番外 怀孕八个月老公亲手给我打催产针完结+番外

    赫连霖月

  • 姐姐绑定系统后,我跟着吃肉小说全文免费阅读 姐姐绑定系统后,我跟着吃肉小说全文免费阅读

    流萤

  • 我的董事长母亲未删节 我的董事长母亲未删节

    贵川

  • 我靠弹幕攻略病娇校霸宋厌离苏莱完结文 我靠弹幕攻略病娇校霸宋厌离苏莱完结文

    jkmnlll

  • 褪至腰际最新章节 褪至腰际最新章节

    大呀