🏷️ 聊天温度 · 标注规范 v0.4 草稿(只改「+1 还是 0」,见下方;其余照 v0.3)· v0.3(草稿,2026-09-26 Sora Master 起草;v0.2 → v0.3:四类改成五档 + 看不出(Jeff 17:26 提分数、Cora 17:28 同意先用五档);§1 仍待 Jeff 定)

HOOP 系统设计图纸 · 正文唯一真相是 docs/聊天温度标注规范.md;改 md 再跑 ./tools/deploy_docs.sh,这页是生成的

版本 d3c617183
2026-09-27 19:49

⛔ 草稿,不许据此扩量。 Cora 16:38:v0.1 有三处会把「分歧」变成「一致的偏差」(v0.2 已改);§1 判什么要 Jeff 定。

📌 补注(2026-09-27,上面那条禁令不删、仍然有效): v6 这一轮有限试验按本规范 v0.3 标注。范围只有两块:新增训练池 534 条,由两位 AI 标注者各标一遍;v6 盲测 180 条,由 X(AI)和 Cora 各自独立标。 授权背景:Cora 09-26 22:48,在此前已授权的 v6 试验范围内。这不是把本草稿升级成人工金标准,也不是批准持续扩量。 规范本身仍待定,§1 仍待 Jeff 定。 这批标签全部记为「AI 参考、待人工审核」。两套盲测答案有分歧就保留,分别计分;不能按 §5 的通用做法删掉分歧题。

🆕 v0.4 变更(草稿,2026-09-27):只改「+1 还是 0」这一条界线

决定经过(原消息都在 Source Code 房): · 09-27 01:04 Jeff 语音先选了「乙」(一来一往的互动也算轻微升温),当时他以为 Sora / Cora 也倾向乙 · 01:06 Jeff 两条语音改成「甲」,原话大意:「那就普通问他算中性吧……我误会了……我们既然只是做一句的分析,就应该针对一句的分析,所以它用很多累积来的话,我们就不管了」 · 01:07 Cora 确认:以最新两条语音为准,采用甲,不再等重复确认 现行规则怎么读: 本节(v0.4)优先;本节没管到的,照下面的 v0.3 正文。文件标题、顶部禁令、§1 里「待 Jeff 定」「按甲写」这些字样,记的是 v0.3 当时的状态。 ⚠️ §1「判什么(甲 / 乙 / 丙三选一)」和本节「+1 还是 0 选甲」是两个不同的选择,名字碰巧都叫「甲」,别混:§1 那个至今仍待 Jeff 定;本节这个 Jeff 09-27 01:06 定了。 只改这一条,其余照 v0.3。 v0.3 的正文留在下面不删;到今天为止的所有标签(v4 规范 v0、v5 / v6 规范 v0.3)都照当时的规范解读,不改旧答案、不自动重标、不据此重算旧成绩。新口径的效果要另外测。 由来:v5、v6 两轮里,标注者「中性对暖」的分歧最多(v6 新增池 A / B 92 条分歧里有 32 条是这一类;v6 盲测两套答案 26 + 2 条)。证据和逐条原文见 v6 诊断包(plus1_vs_0_proposal.md、nw_disagreements.txt)。

判的是:在给定前文里,这一句话表达出来的关系倾向。 不因为聊得多、来回次数多就自动加温 —— 累积不在这一层管。前文仍然要用来判断反讽、敷衍,还是真诚的关心。

情形 v0.4(甲) 例(v6 已开封数据里的分歧原题)
普通询问、接话头、问近况 / 进展,没有明确关心的证据 0 A:「那部韩剧我昨晚追到三点」 B:「你看完了?结局怎样?」;「你们班那个新来的老师怎样?」
答应邀约、协调时间,没有额外的热情表达 0 「Sure, what time you free?」
被问到时说出自己的事 / 困难,只是事实、没有说感受 0 A:「最近工作怎样?」 B:「公司裁员,我也在名单里」
向对方坦露脆弱、寻求支持,而且有拉近的证据(不是冲着对方发泄敌意) +1 「那次被骗了三千块,到现在还心痛」
冲着对方表达不满、敌意、失望(也是「说感受」) 不按暖判;照 v0.3 看前文判 −1 / −2 / U 「你每次都这样,我真的很失望」
明确的关心、安慰、帮助、帮忙承诺 +1 「到家了没?」
明确的陪伴、深度关心、真诚道歉、和好(v0.3 的 +2) +2(不变) 「我请了假,明天陪你去医院」
纯事务 / 信息 / 确认 0(不变) 「文件发你邮箱了」
敷衍、反讽、划界线、冷淡打发 照 v0.3 看前文判 −1 / U(不变) 「嗯嗯你忙你的」(前文 A 在示好)

判 +1 要有证据:明确的关心、安慰、帮助、帮忙承诺,或者带拉近证据的脆弱坦露、寻求支持。「问了一句」「答应了」「说了自己的事」本身不算证据;「说出感受」也不自动算暖 —— 冲着对方的敌意、失望同样是感受,照前文判,读不清标 U。 U 保留:一句话在「+1 和 0」、「+1 和 −1」之间有不止一种合理读法、文字里没有线索分辨时,仍标 U;不把边界强行二选一。

这份回答一个问题:给一句话打「拉近 / 疏远 / 中性 / 看不出」时,到底按什么判。 所有标注者(AI 和真人)照这一份标。上级图纸:聊天温度自训模型设计.md §3。

为什么要有它: v4 新题上,两个 AI 标注者只有 69% 一致(120 句里 37 句不同),分歧 32 句卡在「看不出」上。 下面每一条规则都是从那 37 句里归纳的,例句就是原题。判法没统一之前,加再多例子也是加噪音。

🔓 因此 v4 那 120 句预留题已经「开封」:它们的原句写进了规范,标注者会看到。从现在起它们只能当回归 / 诊断题,不能再当任何东西的盲测;验收规范、验收模型都要用新出的题。

⚠️ 下面「该标什么」是我(Sora)的判断,不是定论。 有几条(尤其 §3 的第 4、7 条)两边都说得通, 需要 Jeff 定「HOOP 想让温度量的到底是什么」。每条后面标了【待定】的,就是要他拍板的。


1. 判的是什么【待 Jeff 定 —— 三选一,v0.1 混用了两种】

选项 判的是 例:A 说「保持距离」后 B 还送榴莲
甲(Cora 建议,Sora 同意) 文字能支持的互动倾向:只凭写出来的字能看出 B 在往近推、往远推、还是没推;不宣称知道 A 的真实感受,也不脑补 B 心里想什么 B 在往近推,但 A 刚划了界线,两种读法冲突 → U
乙 A 读到后的感受 A 可能烦(C),也可能感动(W)→ 多半 U
丙 B 的意图 B 想靠近 → W

v0.2 暂按「甲」写。 Jeff 定了别的,整份按那个改,版本号 +1。

其余不变的: - 判关系,不判心情:B 在抱怨第三方、在诉苦,可能是信任(拉近),不是「负面」。 - 只看给出的文字:前文 + 最后一句。不脑补没写出来的背景。 - 按马来西亚朋友 / 家人 / 伴侣之间常见的读法判,不按字面最坏的读法判。

2. 答案:五档 + 看不出(v0.3)

v0.2 及以前是四类 W / C / N / U。旧标签保留,不自动换算成五档:W 只能说明「正的」,是 +1 还是 +2 当时没分,要补标。

档 什么时候标 例
+2 很拉近 明确的亲密、深度关心、和好、真诚道歉、表白、在对方低谷时明确陪伴 「我请了假,明天陪你去医院」
+1 拉近 友好、感谢、日常关心、有互亏证据的玩笑、分享 「到家了没?」「谢啦」
0 中性 有证据是普通事务 / 信息 / 确认,没有明显冷暖 「文件发你邮箱了」
−1 疏远 冷淡、敷衍打发、轻度不满、讽刺、划小界线 「嗯嗯你忙你的」(前文是 A 在示好时)
−2 很疏远 敌意、侮辱、威胁、断绝关系、拒绝和好 「以后别再找我了」
U 看不出 缺语境,或有不止一种合理读法 见下面四类的 U

强弱只看文字表现出来的程度,不猜内心(Cora 17:28)。拿不准是 1 还是 2 时标 1,并在理由里写「强弱不确定」。 App 可以显示 1~10 的温度刻度,但那只是这五档的展示换算,不是说我们测得出十个等级。

四类(v0.2 的定义,仍用于判正负和 U)

答案 什么时候标
W 拉近 关心、感谢、道歉、和好、分享、主动帮忙、亲密的玩笑、真诚祝福
C 疏远 冷淡打发、讽刺、嫌弃、指责、威胁、划清界限、拒绝和好
N 中性 有证据表明这是普通事务 / 信息 / 确认,而且文字里没有明显的冷或暖
U 看不出 语境缺失,或有不止一种合理读法(W/C、N/C、N/W 都算),文字里没有线索能可靠分辨

N 和 U 的区别: N 是「看得出,它就是普通事务」;U 是「看不出它是什么」。 U 不是「不确定就选它」。 要标 U,必须能说出「它可能是 X,也可能是 Y,而这句话里没有线索分辨」。说不出就不能标 U。

3. 十条判法(每条带 v4 原题)

1. 骂人的话 + 笑 —— 笑本身不够,要有「互相开玩笑 / 亲密」的证据。(v0.2 改:Cora 指出笑也可能是嘲弄) - 有证据(前文里 A 自嘲、两人来回互亏、明显熟络)→ W A:「我又把钥匙锁在车里了」→ B:「哈哈你真的是猪头」→ W(A 先自爆糗事,B 接着亏) - 没有前文、没有别的证据 → U 「哈哈你真的是猪头」(无前文)→ U(可能是亲昵,也可能是笑话他) - 明确在羞辱(拿对方痛处开玩笑、当众)→ C A:「我考试又没过」→ B:「哈哈你真的是猪头,早说了你读不来」→ C(对照例,自编)

2. 骂人或贬低的话,没有玩笑信号 → C。 - 「your cooking still taste like cardboard btw」(前文 A 问喜不喜欢他送的炒饭)→ C - 前文明确是闹着玩(比如 A 自己先自嘲)时,可以改判 W。

3. 威胁、告状、要对方承担后果 → C。 不需要前文。 - 「I've already told HR everything. You'll hear from them.」→ C

4. 很短的敷衍式回复(嗯嗯 / ok lor / sure / hmm / 随便),没有前文 → U。 它可能是普通答应(N),也可能是冷淡(C),单看这句分不出。 - 「嗯嗯你忙你的」「ok lor whatever you say」「sure, if you want」「hmm tengok la dulu」(无前文)→ U - 但带冷淡信号的例外:句中有 whatever / 随便你 / suka hati 这种明显不耐烦的词 → C。 → 所以「ok lor whatever you say」(无前文)按这条是 C,不是 U。【待定:whatever 算不算足够的冷淡信号】

5. 短回复有前文时:看它是在「接住」还是在「打发」A 递过来的东西。(v0.2 改:不一律 C) - 打发 → C。A:「kau still marah aku ke?」→ B:「hmm tengok la dulu」→ C(A 求和,B 不接) - 真诚体谅 → W 或 N。A:「老板临时叫我加班,晚点回你」→ B:「嗯嗯你忙你的」→ N(普通体谅,对照例,自编) - 两种都说得通 → U。A:「这个周末我又不能陪你了」→ B:「嗯嗯你忙你的」→ U(可能体谅,也可能失望) - A:「should I just find another housemate then」→ B:「sure, if you want」→ C(A 在试探关系,B 顺手放掉)

6. 纯事务(寄东西、放门口、账号、接送)→ 看前文。 - 前文是普通安排 → N。A:「aku nak ambik barang aku malam ni」→ B:「barang kau semua aku dah letak depan pintu」→ N - 前文是分手、吵架、搬走 → C(事务本身在划清界限) - 没有前文,而这件事本身常见于「断关系」(把东西还回去、退群、东西放门外)→ U。 「群组我退了,不用拉我回来」「barang kau semua aku dah letak depan pintu」(无前文)→ U - 没有前文、也不像断关系的普通事务 → N。「nombor akaun aku tak berubah, kalau kau nak bayar balik」→ N

7. A 刚划了界线,B 还是主动关心 → U(按 §1 甲)。【随 §1 定】 B 在往近推,A 刚说不要 —— 文字里两股方向冲突,看不出结果。 - A:「我们之间还是保持距离比较好」→ B:「刚才路过看到榴莲,帮你买了一粒猫山王」→ U - A:「我明天就搬走了,你别再帮我收东西了」→ B:「我帮你留了一把伞在楼下柜台」→ U - §1 若定「丙(B 的意图)」,这两句改 W。

8. 对方离开、翻脸之后,B 真诚祝福 → W。 - A:「aku dah resign, malas dah kerja dengan kau」→ B:「semoga murah rezeki kat tempat baru nanti」→ W

9. 客气地婉拒帮忙,没有冷淡信号 → N。 - A:「hujan lebat ni, aku datang jemput kau ok」→ B:「tak payah susah2 jemput aku, aku boleh balik sendiri」→ N - 前文显示两人在冷战、B 在赌气 → C。

10. 抱怨对方,又接着约下次 → 看抱怨有没有玩笑信号。 - 「你这个人真的很烦欸,算了明天见」(无前文)→ 抱怨是真的,没有玩笑信号,但「明天见」表示关系照常 → U 【待定:这一类是不是就该标 U】

4. 前文和最后一句冲突时

最后一句为主,前文用来决定「怎么读它」。 前文本身的冷暖不算进来:A 骂了 B,B 回一句道歉,是 W,不因为前文吵架就变 C。

5. 标注者怎么用这份规范

  1. 每条标注附一句理由,理由里要点名用的是第几条。标 U 必须写出「可能是 X,也可能是 Y」。
  2. 两个标注者不一致 → 进「争议」,不进训练,也不进考卷答案,等审核。
  3. 规范改了 → 版本号 +1,旧标注标上旧版本号,不偷偷当成新标准的答案。

6. 这份规范自己怎么验

⚠️ 一致率高只证明「大家判得一样」(可重复),不证明「判得对」。 所以除了一致率,还要: - 按语言、按类别分开报一致率和分歧(防止「大家都标中性」也能过 80%);报各类占比和 Cohen's kappa。 - 用独立新题(不是 v4 任何一题)。v4 重标只算诊断,历史标签原样保留、不覆盖。

先拿它重标一批,看一致率涨没涨,再决定能不能用它扩量。 - 做法:两个互不知情的标注者,照这份规范重标 v4 的开发题(96 句,不碰预留题),算一致率。 - 判据(跑前写死):一致率 ≥ 80% 才开始用它扩量;不到就回来改规范,不扩。 - 对照:同一批题在「没有规范」时的一致率 —— 开发题 L1 与 L2 一致 74/96(77%);预留题 L1 与 Cora 一致 83/120(69%)。开发题上要从 77% 到 ≥80%;还要在一批新出的、同样难度的题上也到 80%(v4 预留已开封,不能用),开发题只是先跑通流程。【待定:用哪批题验收规范,Cora 定】