这个分类包含三种不同工作流
AI 研究和数据分析产品都承诺更快给出答案,但它们解决的并不是同一项工作。Elicit、Consensus、Scite、SciSpace 和 ResearchRabbit 用于发现或组织学术文献;Humata 与 ChatPDF 面向已上传文档问答;Julius AI、Rows AI 和 Hex 分析文件、电子表格、Notebook 或连接的数据库。
不能用一个没有解释的分数给十款产品统一排序。系统综述需要可复现检索、筛选决定、字段提取、去重和导出;只阅读一份 PDF 的学生需要能回到具体页面的解释;连接数据仓库的团队则需要审查 SQL 与 Python、权限、语义定义、计算资源和审计记录。
先定义交付物:阅读清单、证据表、引用审计、综述方案、文档答案、清理后的表格、Notebook、仪表板或已发布数据应用。然后只比较能在规定控制条件下生成该产物的产品。
学术搜索并不是一种单一能力
Elicit整合广泛论文搜索、摘要、对话、数据提取、研究报告和专门的系统综述工作流。Consensus更侧重基于研究论文回答问题,提供 Pro、Deep review 与结构化 Study Snapshot。ResearchRabbit则通过集合、种子论文、相关研究探索、协作和提醒帮助发现文献。
Scite增加了引用上下文。Smart Citations 将引用语句分为支持、相反、提及或未分类,Reference Check 则用于检查参考文献。一项分类只说明某段文字如何引用另一项研究,并不是对某个主张真假的最终裁决。置信度、原始语境、研究质量、撤稿和独立重复仍然重要。
SciSpace把文献发现、Agent、PDF 对话、提取、写作和其他研究工具组合起来。更广的能力可以减少工具切换,但团队必须区分:哪个功能找到论文,哪个生成文字,哪个提取数据,以及每个动作消耗哪种额度或点数。
覆盖量也需要解释。平台可能索引元数据、摘要、引用片段、开放获取全文、获得许可的出版商全文、预印本、专利、临床试验或其他来源,它们不能互相替代。试点应加入已知论文、最新论文、阴性结果、非英文研究与主流学科之外的来源。
建立可追踪的综述过程,而不是只要一份摘要
文献综述应保存查询词、筛选条件、检索日期、来源数据库、纳入标准、排除原因、去重规则、筛选决定、提取字段、审核者和导出文件。如果平台无法在以后复现结果,应把输入和输出独立保存。
AI 可以建议筛选或提取研究特征,但看似完整的表格仍可能把摘要当全文、混合治疗组与对照组、读错单位、遗漏不确定性,或推断论文根本没有报告的字段。除了抽查纳入论文,也要抽查被排除论文;高影响字段应双人复核。
不能把 AI 摘要当作论文引用。打开原始文章,核实人群、干预、对照、结果、设计、日期、效应量、置信区间、局限和资助背景,并检查更正、关注声明与撤稿。能够访问出版商记录,也不一定意味着可以重新分发全文。
文档问答需要逐页验证
Humata与 ChatPDF适合证据集合已经确定的场景。它们能总结上传文件、回答问题,并返回页面或段落,有助于阅读论文、手册、政策、合同和报告。不过检索和生成仍可能遗漏限定条件,或把不相关段落拼在一起。
测试应覆盖扫描页、表格、脚注、多栏排版、公式、附录、图片与相互矛盾的表述。OCR 质量会影响后续所有答案。要求系统给出短支持原文与页码,再与渲染文档逐项比较;多文件答案要明确每一部分由哪个文件支持。
价格可能按页面、文件大小、文档数量、提问次数或整体订阅计算。Humata 当前将月度免费页面与相关方案的按页超额结合;ChatPDF 提供每日免费文档额度和 Plus 层级,其 API 另有文件、页数、消息和 Token 限制。应使用真实文档集合建模,不能只用一份小 PDF。
数据 Agent 能改变的不只是文字
Julius AI分析上传文件与连接数据,使用 Notebook 和代码执行,还能创建图表、报告、幻灯片和计划输出。Rows AI把 AI Analyst 放入带集成、公式、数据丰富、网络研究、图表和自动化的电子表格。Hex则组合 SQL、Python、Notebook、语义模型、数据应用和多种技术或自助分析 Agent。
这些产品可以创建或修改逻辑、查询数据库、运行代码、改变单元格和发布结果,应按数据开发环境对待,而不是普通聊天界面。评估时使用只读凭据,限制可见 schema,移除生产写权限,隔离代码执行,并在重要数据上运行前检查生成的 SQL 与 Python。
语法正确的查询仍可能使用错误 join、数据粒度、时区、分母、队列、币种或业务定义。先用已知指标对账,再要求新洞察。保存数据快照、语义定义、查询或代码、模型、提示词、输出、审核者与发布版本。图表精美不代表计算正确。
比较完整计费单位
本分类产品组合了多种计量方式:席位、搜索、Deep review、筛选论文、提取列、来源文档、页面、AI task、点数、计算资源、发布应用、连接账号、API 调用和超额。“不限搜索”也可能同时存在深度分析、提取、高级模型或 Agent 用量限制。
分别估算正常项目和异常较多的项目,计入重复搜索、报告重做、重复文档、OCR、长上下文、失败 Agent、代码重试、计划刷新、导出、存储、付费计算、访客或 Explorer 席位和人工验证。年付折算价格不能被写成可随时取消的月付承诺。
点数体系也不相同。SciSpace 的月度 Agent 点数不会结转;Julius 按工作量敏感的点数计量;Rows 使用 AI Tasks,并单独处理部分大规模单元格丰富;Hex 为不同席位提供月度点数、销售共享充值包,还能自动充值。制定预算前,应保存一次代表性工作流的实际用量凭证。
隐私取决于具体数据路径和方案
研究资料可能包含未发表论文、同行评审笔记、参与者信息、商业数据、合同、凭证或受监管记录。试点应从公开或合成材料开始,并梳理上传文件、提取文本、向量、提示词、模型提供商、日志、分析、导出、备份、连接存储、数据库和分享链接。
方案级措辞很重要。Elicit 当前价格页明确写明 Enterprise 默认不使用客户数据训练,不能在缺少控制性条款时把承诺自动扩展到所有方案。Consensus 表示不以用户数据训练模型,但默认记录匿名查询文本,也提供分开记录或不记录的定制选项。ResearchRabbit 表示不会使用文章和笔记训练 AI;SciSpace 表示上传 PDF 保持私密且不用于训练;Humata 也公开了不训练声明。
ChatPDF 的公开产品页面说明用户可删除数据并采用安全存储,但本次研究能够找到的合同级隐私、供应商、保留和训练细节不如部分企业型产品完整。敏感使用必须取得当前法律条款,不能从简短 FAQ 推断。
Rows 表示 AI Analyst 会向所选模型发送包含表头、最多五行样本与基础统计的摘要,并且不会使用客户数据训练供其他用户受益的模型。Hex 表示供应商不会使用客户数据训练,通常采用零保留协议;管理员开启部分高级模型时,提供商仍可能临时保留提示词和输出。应审查实际启用的模型,而不只是平台名称。
使用受控评估
给论文候选工具同样的已知答案问题、种子论文、日期范围、纳入标准与预期遗漏研究,衡量召回、无关结果、引用准确度、筛选一致性、提取错误、导出质量和可复现性。加入一篇已撤稿论文,以及一个存在混合证据的主张。
给文档工具同样的清晰文件、扫描文件、表格文件和矛盾文件,衡量页码准确性、无依据说法、OCR 错误、多文件归因、删除和成本。给数据工具一个带已知 join、指标、缺失值、访问限制与测试的只读数据集,比较生成代码、结果准确性、恢复、权限行为、计算资源和最终审核总耗时。