医疗 AI 回答不能「无中生有」 德国莱因完成长联科技「爱宝」AI 卫教测试 智能应用 影音
DIGITIMES Logo
236
DIGITIMES Logo

医疗 AI 回答不能「无中生有」 德国莱因完成长联科技「爱宝」AI 卫教测试

  • 美通社

随着生成式 AI 与大型语言模型 (LLM) 技术快速发展,确保 AI 系统在医疗场域的可靠性与安全性已日益受到重视。为呼应台湾《人工智能基本法》所强调的透明度与可解释性原则,国际独立第三方检测机构德国莱因 (TÜV Rheinland) 针对长联科技 (EverBot Technology) 自主研发之 医疗照护机器人「爱宝 (EirBot)」 所搭载的「长联 LLM 卫教生成模块」完成测试评估,并出具测试报告。本次评估聚焦 AI 生成内容的可靠性及来源可追溯性,客观呈现受测系统在约定测试条件下的效能表现。

德国莱因工业服务与信息安全服务总经理刘纬强(左)与长联科技董事长李友铮(右)与「爱宝」机器人合影
德国莱因工业服务与信息安全服务总经理刘纬强(左)与长联科技董事长李友铮(右)与「爱宝」机器人合影

医疗 AI 机器人在减轻医护人员行政与重复性工作负担上,可扮演重要角色。然而,医疗信息的准确性攸关病患安全,需避免生成缺乏数据依据的内容。 AI 生成内容是否具有明确依据及可追溯来源,亦是系统评估的重要环节。本次测试计划在分类效能量测部分参考 ISO/IEC TS 4213:2022 相关方法,并依受测系统的功能及应用特性,在信息检索、回答品质及高风险问题识别等项目进行测试。

根据德国莱因TÜV 的测试评估报告,受测系统的主要测试结果如下:

  • 数据检索表现: 测试结果显示,在本次包含疾病、手术、检查、药物及照护流程等类别中,系统检索命中率皆为100%,显示爱宝系统能从语意角度精准命中既有的医院数据库内容,提升回答内容与既有医疗数据的对应程度。
  • 回答品质: 在卫教实测中,系统在内容正确性、检索内容支持度及问题相关性三项指标上完成测试,所得出的卫教回答正确性与忠实度达 99.9%。少数未达满分的案例,主要因回答补充了检索数据未直接记载的一般医学知识,而非内容本身存在医学错误,反映此次测试采取较严格标准来评估来源忠实性及可追溯性。
  • 高风险问题识别表现: 针对越权要求、提示注入等企图诱骗 AI 的网安风险,以及涉及自伤、伤害他人等高风险提问,爱宝的分类指标达到100% ,未出现误判分类。

长联科技董事长李友铮说明:「医疗信息攸关病患安全,回答不能容许无中生有。因此,爱宝主动接受第三方测试,确认系统的可靠性;有别于采用云端大型语言模型的作法,爱宝采用地端自建语言模型,兼顾医疗场域对安全与信息隐私的要求。」

德国莱因TÜV 工业服务与信息安全服务总经理刘纬强表示,独立第三方测试以明确的范围、方法及条件为基础,客观呈现受测系统于指定版本与测试条件下的效能表现,不仅有助 AI 开发商掌握系统现况并持续优化,也可为医疗机构评估 AI 应用提供参考。

长联科技将于 2026 年 8 月 19 日至 22 日参加在南港展览馆举行的「台北国际自动化工业大展」,并于产发署展位 (M634) 展示搭载本次受测 AI 卫教生成模块的爱宝机器人及相关测试成果,期望借此提升业界对医疗 AI 风险管理、信息透明度与来源可追溯性的重视。

展会期间,德国莱因 TÜV 亦将于 J326 展位提供机器人安全、AI 效能评估及网安合规相关谘询,从测试评估到实际应用,协助业界进一步掌握 AI 与机器人技术导入所涉及的安全与合规议题。此外,近期将发布 智动未来:机器人安全验证与网安合规 白皮书,敬请关注相关发布信息。