复数实验室 五款模型 400 次提问与 3123 次引用核验案例
为了让"AI 引用是否可信"这一问题从个人经验变成可量化事实,复数实验室在复旦大学新闻学院《数据新闻与可视化》课程中设计了对照实验。目标是回答两个问题:
名称匹配
任务描述、口语长句、创作者、工具和仓库名称都可以直接搜索。
按名称、标签、主题和内容相关性排列
为了让"AI 引用是否可信"这一问题从个人经验变成可量化事实,复数实验室在复旦大学新闻学院《数据新闻与可视化》课程中设计了对照实验。目标是回答两个问题:
名称匹配
一份按事实陈述逐条标注的核验结果,标明每条结论是否被原始来源支持、属于哪类错误。
标签匹配
一份按相同指标跨年排列的趋势说明、对异常项的通俗解释,以及一份可在就诊时拿出来和医生核对的问题清单。它不会替你诊断,也不会替代体检报告原本的医学结论。
用途匹配
把看不懂的医学术语、检查报告、化验单或病历交给多模态大模型,让它:
用途匹配
DeepSeek 是支持中文与代码场景的大模型系列,在个体开发者与小团队中以"低单价、长上下文"著称。本页面按来源分场景整理它在三个案例中已观察到的用法与限制,保留各自边界,不做合并归纳。
用途匹配
完整流程见 method-ai-search-summarize-then-verify-original。
用途匹配
当 AI 回答中带有看似正式的链接与具体数字时,用户很容易把"出现链接"误读为"已经核实"。本方法把核验过程拆成可重复的步骤:先拆解事实陈述,再对每条引用执行"打开—定位—判断支持关系"的人工核对,把"链接存在 ≠ 已核实"转...
标签匹配
作者 qlxsbridge(桥梁小生)希望把 2022—2025 年不同医院出具的体检报告整理成"同指标跨年趋势",理解尿酸、血脂等异常项的变化,并整理一份就医前可以带去问医生的生活和复查建议清单。
标签匹配
在多年积累的私人照片、截图、笔记、票据、文档、压缩包中重新定位一份资料。
用途匹配
把一张商品照片交给 AI,让它识别品牌、型号或外观特征,再给出候选商品清单和零售链接(官方网站、电商平台、实体零售商)。这一任务的输出是"候选清单 + 链接",而不是"下单决策"。
用途匹配
可以得到什么 把一条来自聊天群、社交平台或长辈转发的可疑消息,转成一份带证据链、限制说明和判断结论的核查笔记。最终产物可用于决定是否转发、是否需要更正,或在写作/工作中引用。
用途匹配
玉树芝兰(王树义)在少数派发表对早期 ChatGPT GPTs 应用的个人实测。其中一项是消费比较任务:把自己手中的 iPad mini 拍照交给名为"剁手 GPT"的第三方 GPT 应用,让 AI 帮助寻找同款商品。
标签匹配
这是世界卫生组织(WHO)在 2024-01-18 发布的中文指导文件所支持的安全工作流,用于普通人使用多模态大模型(LMMs)理解健康信息时降低过度信任与医疗幻觉风险。它不是让 AI 替人做医疗决策,而是让 AI 充当"理解...
用途匹配
实践者:段小草(知乎个人用户) 场景:需要从长时间积累的个人照片、截图、笔记、票据、文档、压缩包中重新找到某一份资料 目标:用同一套网盘内的多种 AI 检索能力完成找回,而不是依赖记忆或手工翻找
标签匹配
创作者:甜草莓(知乎专栏) 工具:豆包 PC 版 观察日期:2024-08-29 目标:先用 AI 搜索获取"住房养老金"议题的整理结果,再围绕制度挑战、资金透明与监督问题连续追问,最终回到原始网页深入阅读。
用途匹配
豆包 PC 版是豆包大模型在桌面端的客户端形态之一。本文聚焦其在搜索、网页阅读与连续追问场景下的能力:聚合搜索、来源引用、长网页摘要与联想追问。这些能力组合让用户可以在进入原始网页前先获得一个带依据与追问方向的整理结果。
用途匹配
把 AI 搜索当作进入原始网页之前的整理层和导航层。用一个相对宽的问题触发聚合搜索,查看来源依据,再用 AI 提炼长文要点,围绕关键概念连续追问,最后回到原网页核对是否存在幻觉和摘要遗漏。
用途匹配
把"看图找同款"这类任务拆成四步,让 AI 只负责缩小候选范围,把型号核对和商家比较留给人工。这是消费决策类 AI 任务中降低"链接真实但型号错误"风险的最小工作流。
用途匹配
复数实验室是复旦大学新闻学院《数据新闻与可视化》课程的学生团队。署名作者为夏昊扬、李林杰、宋语阳、唐小茗。团队围绕各自的专业背景设计问题,对多款主流模型进行联网与推理模式下的引用可靠性实测,并在澎湃新闻·澎湃号发表研究文章《实...
用途匹配
把 AI 搜索与网页摘要当作政策理解主入口时,至少存在四类风险叠加:
用途匹配