我们的回答不是“全文直接输入模型”。更稳的路径是分层:先用确定性程序完成抓取、清洗、统计和规则映射;再让 LLM 处理少量需要语义判断的片段;最后保存来源证据,让每个输出都能被追问。
同一件事在群聊和会议里重复出现时,系统合并任务,并保留两处原文。
时间、词语、情绪和关系被统计出来,个人沟通模式开始可见。
venue、引用、公开评审和学院积分写回 Zotero,减少重复查询。
展示重点不是“做了几个工具”,而是一个可复用的方法:连接真实文本源,用确定性层缩小问题,再用语义层完成判断,并让输出留下证据。
群聊、会议、Zotero 和学院文件原本彼此隔离。连接之后,任务、文献和规则才会互相解释。
重复出现的任务不应停留在手工处理。跑通一次的流程,要变成下一次可以调用的能力。
先定义输入、输出和评价指标,再讨论实现。一个展示原型能否成立,最终取决于它能否被测量。
微信洞察对应“文本即数据”:把自然语言转成变量。任务雷达和文献工作台对应“LLM 驱动创新”:让语义判断进入可复用流程。
群聊和会议转写先被筛选,再被抽取为带来源的行动项。
论文元数据与评分规则对齐后,文献库成为研究决策界面。
规则和统计能完成的部分,不交给 LLM。语义模型只处理需要理解上下文的片段:
我们把“这个系统好不好”拆成四个指标:任务是否抽对,来源是否可追溯,重复任务是否能合并,进入模型的文本比例是否下降。
以人工标注行动项为 gold standard,报告 Precision、Recall 和 F1。
检查每条任务是否能定位到正确群消息或会议转写片段。
同一任务在不同来源出现时,评估系统是否能合并而不是重复提醒。
比较分层机制与全文输入的 token 消耗,以及进入模型的原文比例。