【行业研报】清华-大语言模型综合性能评估报告-2023.8.7_市场营销策划_重点报告2023080.pptx

【行业研报】清华-大语言模型综合性能评估报告-2023.8.7_市场营销策划_重点报告2023080.pptx

大语言模型综合性能评估报告;报告介绍;;01 / 大语言模型简介;大语言模型:从数据到涌现;;工具选择;02 / 大语言模型评估体系;大语言模型评估维度与指标;注:“领域适应能力”测试中的知识领域包括,代码编程、数学计算、创意写作、舆情分析、医学咨询、历史知识、法律信息、科学解释、翻译。;;03 / 大语言模型评估结果分析;注:总得分率=生成质量*70%+使用与性能*20%+安全与合规*10%;由于评估的条件、时间以及模型随机性等限制,本次评估结果不可避免存在一定主观性,未来将进一步优化评估模型;评估截?时间为2023年6?30?。;使用便捷受限,多类插件扩增能力边界; 响应速度较慢; 模型鲁棒性高,对输入变化的适应能力强,对于错误输入的回应表现佳。;使用便捷,插件“ChatFile”赋能超长文本输入; 响应速度快; 模型鲁棒性高,对于意外、错误或极端情况下的回应表现较好。;使用便捷性受限; 模型响应十分迅速; 模型鲁棒性高,对输入变化的适应能力强,具有持续的监控和反馈机制。;可借助平台便捷使用,用户交互性强; 每次生成内容偏多,回应速度较慢; 模型鲁棒性较高,对模糊输入和极端问题的适应性强。;注册申请可用,易用性高,用户交互界面友好,使用指南清晰易懂; 算力领先,响应速度快; 模型鲁棒性测试表现较好。;注册申请可用,界面简单易用,提供多种接口,便于二次开发和调用; 模型响应十分迅

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档