样本采集口径:只记能核对的事实
每条样本进入观察区之前,都要经过一次口径检查:产地语区是否可以明确归属,题材主类是否能在词典里找到对应条目,集数与状态是否来自同一份可核对的说明。三问有一问含糊,条目就停留在观察区,不进入主表。这条规则让主表的条目增长速度变慢,但换来了一个好处:任何时候翻回主表,都不需要重新判断真伪。
观察区与主表分开存放,是执行过程中最容易被省略、又最不该省略的一步。缺少缓冲区的清单,往往在第三次维护时就开始出现同剧两条、状态打架、日期缺失的连锁问题。
修订流程:一次只改一类字段
修订遵循单变量原则:一轮只调整一类字段,无论是标签词典、状态规则还是核对周期,都不与其他字段同时改动。这样做的目的是让问题可归因——如果连续两周误判率上升,就能明确知道是哪一类改动带来的副作用,而不是面对一堆同时变化的字段无从下手。
每轮修订结束后,旧版本保留备查,新版本号加一写进词典首页。版本号本身不追求好看,它的作用是提供一条回溯线索:当某条陈旧判断出现时,可以顺着版本号找到它被写入的那一轮。
四周观察数据:取消每日必看之后
自填式索引维护的四周记录,样本为教学演示数据
| 周次 | 维护完成率 | 状态误判 | 标签返工 | 放弃意愿 |
| 第 1 周 | 54% | 9 条 | 12 条 | 偏高 |
| 第 2 周 | 61% | 6 条 | 9 条 | 中 |
| 第 3 周 | 73% | 4 条 | 6 条 | 中 |
| 第 4 周 | 82% | 2 条 | 3 条 | 偏低 |
数据说明了一件朴素的事:完成率上升的同时,误判与返工同步下降,两者并不是靠意志力硬扛出来的,而是节奏固定之后自然收敛的结果。取消每日必看要求,看似放松了强度,实际上把维护动作放回了可重复的位置。
局限与不适用场景
如果只是临时查找一部剧的基本信息,这套框架显得过于繁琐,直接检索即可;如果长期不做任何归档、只依赖记忆,那么标签维度会逐渐失真。索引理论适合的是有持续观看习惯、并且希望半年后还能找回自己判断依据的人。它不解决内容优劣之争,也不对任何渠道作背书。