首页 > 快讯 >

全球快看点丨清华唐杰新作WebGLM:参数100亿、主打联网搜索,性能超WebGPT

2023-06-24 10:15:44 来源:量子位

丰色 发自 凹非寺量子位 | 公众号 QbitAI


(资料图片仅供参考)

清华唐杰团队的新作来了:

WebGLM,一个参数100亿的联网问答聊天机器人(论文入选KDD2023)。

你可以问它任何问题,然后它将列举出网上(例如维基百科、相关官网)相关的文章链接,整理出答案。

比如:

ChatGPT的核心技术是什么?

或者:

谁提出的Music Transformer?它的原理是什么?

再或者:

原神3.5版本怎么样?

没有高薪工作,怎么在一线城市生活?(手动狗头)

它都能给出有理有据的回答。

据介绍,在性能对比测试中,WebGLM的水平已经高于OpenAI 135亿参数的WebGPT,在人类评估中,甚至与1750亿参数的模型不相上下。

那么,它是如何训练的?

可以上网的清华系WebGLM

据介绍,WebGLM的目标是通过Web搜索和检索功能,增强预训练大语言模型,同时可以进行高效的实际部署。

为此,作者基于三种策略进行开发。

首先是大模型增强检索器

它主要是用于增强模型相关网络内容的检索能力,在给定查询的情况下查找相关引用,以便后面更好地准确回答问题。

它有两个阶段:粗粒度web搜索和细粒度LLM增强密集检索。

其次是自举生成器

它利用GLM(比如清华之前发布的双语开源预训练模型GLM-130B)的能力为问题生成回复,提供详细的答案。

利用该生成器,作者得到WebGLM-QA——一个LLM自举引用和长程的QA数据集。

它通过上下文学习等策略进行清洗和过滤,最终包括45k的高质量过滤样本和83k的噪声样本。

WebGLM的backbone就是一个在该数据集上训练的GLM模型。

最后是基于人类偏好的打分器

它通过优先考虑人类偏好而非昂贵的专家反馈来评估生成回复的质量,确保系统能够产生有用和吸引人的内容。

以上三大组件最终按顺序形成WebGLM的pipeline:

可以看到,正好三个模块,对应前面介绍的三部分,其中:

LLM增强检索器会将前五个最相关的页面作为参考源,让自举生成器生成多个答案,最终打分器选出最可能符合人类偏好的那一个作为最终输出。

性能超OpenAI WebGPT

除了WebGLM本身,唐杰团队此次还提出了一个网络增强问答系统的评估标准,评估对象既包括参考文献,也包括最终回答。

其中前者衡量相关性、信息密度、真实性(无事实错误)、毒性(不含暴力色情等信息)和社会偏见程度这5个维度;后者则衡量流畅度、正确性、引用准确性、客观性和冗余程度。

他们用WebGPT(来自OpenAI,基于GPT-3进行微调)演示网站提供的272个问题进行对比评估,并招募了15个学历为硕士的志愿者打分。

最终结果如下:

(“Rel.”、“ Den.”……分别对应上面说的10个指标。)

可以看到,尽管WebGLM的搜索结果略逊于WebGPT-175B,但远好于Perplexity.ai和WebGPT-13B(左边的参考文献评估)。

值得一提的是,WebGLM检索过程只使用了一些传统的基于单词的算法和两个累计参数量不超过300M的Contriever。

此外,WebGLM在计算性能和时间消耗方面也明显优于WebGPT-13B、并与175B不相上下。

而在最终结果方面,WebGLM在流畅度、真实性和冗余度方面均获得最高得分,正确性指标上则接近WebGPT-175B,远高于Perplexity.ai和WebGPT-13B。

作者表示,这表明WebGLM可以以更低的成本获得更高的性能。

部署与训练

WebGLM发布即开源

要想部署它,需要从SerpAPI官网获得一个密钥,用于在搜索过程中获取搜索结果。

检索器的权重可从清华云上下载。

运行该模型的方式有两种:一是命令行界面,二是Web服务形式,并且包含WebGLM-2B和WebGLM-10B两种可选模型。

你也可以自己训练WebGLM,官方已提供好了生成器和检索器的训练数据供下载~

论文地址:https://arxiv.org/abs//2306.07906

GitHub主页:https://github.com/THUDM/WebGLM

上一篇:

环球速读:无人机执照到期了怎么办_无人机执照

下一篇:

最后一页

x
推荐阅读

全球快看点丨清华唐杰新作WebGLM:参数100亿、主打联网搜索,性能超WebGPT

环球速读:无人机执照到期了怎么办_无人机执照

【天天报资讯】名记肉眼测身高:波杰姆斯基只有1米9 TJD身高208没注水

手机上越狱是什么意思_越狱手机什么意思

当前最新:送给男生的好礼物之一:亲手制作油脂服装,让TA感受你的文学专家魅力!

山西税务学校(关于山西税务学校的基本详情介绍)

巴萨官博祝梅西36岁生快:你是闪耀世界的光芒,是善良真挚的男孩|环球快讯

【时快讯】减啤酒肚的食谱_减啤酒肚的最快方法是什么

win7激活错误代码0xc004f063_win7激活错误代码0xc004e003

世界消息!网络中国节·端午丨祝阳镇开展“浓情端午 礼遇好人”活动

福建专升本新闻类学校_福建新知专升本官网

山东继续发布红色高温预警!这些地方41℃

环球视讯!长春特色美食小吃介绍_长春特色小吃有哪些

云南昭通都香高速翠屏特长隧道左幅贯通

手动挡汽车手刹拉着能跑多快啊视频_手动挡汽车手刹怎么拉|世界滚动

延吉市少年儿童图书馆开展“品味端午传统佳节 体验多彩品质生活”活动

差评一片,樊少皇新片制作粗糙,51岁还演小子被25岁美少女倒追|全球消息

【天天聚看点】国粹助推老字号、ICE超级猫展,南京路“端午”花样多

端午成都人都去哪过节?记者实地探访

霍姆斯下季工资1205万 国王交易他后获得超3000万薪资空间|全球信息

北京市延庆区发布高温橙色预警

黛玉焚稿曲谱_黛玉焚稿 世界资讯

《DOTA2》巴厘岛Major 6月29日开战 TI12中国区预选赛名额只有一个

我国累计招收博士后约34万人 已设立博士后科研工作站4338个

[QML]事无巨细开始实践QML开发(一)什么是QML,为什么学习QML,先写一个简单的页面

天天热推荐:AI潮究竟多热?全球前十大富豪个人财富暴增

毳毛黑头和黑头的区别_毳毛黑头怎么处理 热消息

Intermittent Current Interruption ICI(间歇电流中断法)替代GITT 当前信息

2023中国城市开发投资吸引力排行榜:北上深广仍位居前四 五大城市群销售金额占比达61%

美元兑土耳其里拉创下24.5的历史新高

【报资讯】正月是什么星座七月是什么星座(正月是什么星座)

张镇风现在在做什么工作_张镇风现在在做什么|全球消息

微动态丨中听|银川烧烤店爆炸事故31人死亡:无视安全就是谋杀

mbr与gpt的区别 硬盘分区gpt和mbr区别 天天精选

无锡这场用心灵纪念屈原的活动,让人耳目一新_世界聚焦

怎样才能“活得通透”?_全球滚动

今头条!一年一度端午至,又是龙舟飞渡时

尼康尼克尔Z 180-600mm登场 可适用Z卡口系统|环球看点

“粽情重意”关爱重症疾病儿童 长沙市政协医卫界别委员开展走访慰问活动

推动全球农业产业链深度融合_天天最资讯

水合氯醛中毒

即时焦点:2023年端午节

苹果明确细则:部分 iOS / iPadOS 应用不适合移植 visionOS|世界聚看点

每日头条!国家药监局印发GAP监督实施方案 规范中药材标签标示

环球精选!邮报:多特有意加拉格尔,切尔西标价5000万镑

6月21日基金净值:天弘中证光伏产业ETF最新净值1.0104,跌1.21%

表格行间距20磅怎么设置(行间距20磅怎么设置)

羊蝎子指的是什么?-全球快播

斯威X7 1.5T及江淮瑞风A60怎么样 每日快播

太阳能电池板工作原理视频_太阳能电池板工作原理