Communication Text Observatory BUSS8010 · 研究展示 2026 春季
上海交通大学 · BUSS8010《计算文本分析》课程项目
第 11 组 · 姜博文 / 林一晨 / 樵新宇
RESEARCH DEMO · TEXT → EVIDENCE → WORKFLOW

把散落文本,
转化为可执行证据。

这个项目研究一个很具体的问题:群聊、会议、微信历史和文献库中的非结构化文本,怎样进入真实工作流,并产出可核查的任务、变量和研究判断。

聊天文本 会议转写 文献元数据 评分规则
可验证转化机制
行动项 行为变量 决策线索
同一条转化链,连接三个场景 任务抽取 · 行为测量 · 文献评估
Research Question
日常文本,怎样进入
可靠的知识工作?

我们的回答不是“全文直接输入模型”。更稳的路径是分层:先用确定性程序完成抓取、清洗、统计和规则映射;再让 LLM 处理少量需要语义判断的片段;最后保存来源证据,让每个输出都能被追问。

Before
任务、关系和研究判断分散在聊天记录、会议转写、论文库和制度文件里。
After
文本被转写成变量、证据和行动项,能够进入后续协作与研究决策。
Claim
确定性预处理 + 有限语义判断 + 来源证据,让文本分析从生成式输出转向可审计结果。
Examples Before Method
先看三个结果:同一套文本转化机制,可以服务三类知识工作
The Method
文本,
证据,工作流。

展示重点不是“做了几个工具”,而是一个可复用的方法:连接真实文本源,用确定性层缩小问题,再用语义层完成判断,并让输出留下证据。

连接场景

群聊、会议、Zotero 和学院文件原本彼此隔离。连接之后,任务、文献和规则才会互相解释。

沉淀机制

重复出现的任务不应停留在手工处理。跑通一次的流程,要变成下一次可以调用的能力。

以验证收束

先定义输入、输出和评价指标,再讨论实现。一个展示原型能否成立,最终取决于它能否被测量。

课程里的两个视角,被放回真实工作场景

微信洞察对应“文本即数据”:把自然语言转成变量。任务雷达和文献工作台对应“LLM 驱动创新”:让语义判断进入可复用流程。

沟通流视角二

群聊和会议转写先被筛选,再被抽取为带来源的行动项。

群聊文本 会议转写 加权过滤 ▼95% LLM 抽取 去重合并 任务 + 来源证据

文献流视角二

论文元数据与评分规则对齐后,文献库成为研究决策界面。

收藏论文 四源反查 消歧对齐 规则映射 积分 + 评审摘要
The Mechanism

先缩小问题,再调用大模型

规则和统计能完成的部分,不交给 LLM。语义模型只处理需要理解上下文的片段:

  • 成本可控:抓取、过滤、图谱和消歧都不消耗 token。
  • 结果可审计:统计层可以复算,任务结果可以回到原句。
  • 暴露面更小:只有高信号片段进入语义层。

三个子系统,分别承担一种证据生产任务

同一周数据,进入模型的文本比例

全文直接输入 100%
分层转化机制 3%
来源追溯
结构化引用,每条结果都能回到原文。
范围发现
钉人不钉群,新群也能被机制捕捉。
隐私暴露
只处理高信号片段,降低原文进入模型的比例。
Evaluation Design

展示可以吸引人,论文必须可检验。

我们把“这个系统好不好”拆成四个指标:任务是否抽对,来源是否可追溯,重复任务是否能合并,进入模型的文本比例是否下降。

任务抽取质量

以人工标注行动项为 gold standard,报告 Precision、Recall 和 F1。

P / R / F1

来源回溯准确率

检查每条任务是否能定位到正确群消息或会议转写片段。

source accuracy

跨源合并质量

同一任务在不同来源出现时,评估系统是否能合并而不是重复提醒。

merge accuracy

成本与暴露面

比较分层机制与全文输入的 token 消耗,以及进入模型的原文比例。

token / exposure