结论先说:额度有限时,优先选结构差异大、原文可追溯、失败原因可分辨的样本,而不是随机抓一批或只挑最长的几篇。随机样本能反映平均表现,却常常因为差异被平均掉,无法告诉你工具在什么条件下会失效;只挑长文则容易把长度当成难度,掩盖真正的问题类型。更有效的做法是让样本覆盖你实际会遇到的内容形态,并保证每个样本的输入和输出都能对照检查。
第一种做法是随机抽样。它的好处是省事、不挑食,适合你只想知道“大概能不能用”的阶段。代价是方差大:如果十篇里八篇是短资讯、两篇是长报告,你得到的结论会偏向短文本,长报告里的术语一致性、段落衔接问题可能完全没暴露。第二种做法是按长度或字数挑最长的几篇。它确实能压出上下文长度相关的失败,但长度不等于难度,一篇长而结构规整的文章,可能比一篇短却术语密集、指代复杂的文章更容易处理。
选择条件可以这样定:如果你要判断的是整体可用性,随机样本加少量分层样本更合适;如果你要判断的是某类高风险内容(术语密集、多级标题、含数据表或引文),就该定向挑这类样本,接受它不能代表全部内容。两种做法都不该单独使用。
挑选时给每个样本预设一个观察点,而不是笼统地看“改得好不好”。可用的观察点包括:
一个样本只盯一到两个观察点,额度才花得值。假设你有二十次查询额度,可以这样分配:四次给术语密集的短文,四次给含多级标题的长文,四次给含数字和条件的说明文,剩下八次留给随机样本做基线。这个分配是假设示例,用来演示比较方法,不是固定比例;实际应按你内容库的构成调整。
反例是:当你的内容形态高度单一,比如全部是同一模板生成的短文案,那么分层抽样没有意义,随机抽几篇反而更接近真实使用情况。另一种失效情形是你还不清楚要观察什么,此时任何挑选都只是碰运气,应该先用两三篇做探索,再决定后续样本的观察点。此外,如果工具本身对输入格式有硬性要求(例如是否接受带标签的文本),样本挑选必须先满足这个前提,否则失败原因无法归到改写质量上。
先写下你这次查询要回答的那一个问题,再从内容库里按“术语密度、结构层级、数字与条件密度”三个维度各挑两篇,加上两篇随机样本,组成八篇的小集合。逐篇记录观察结果,如果某一维度两篇都出现同类失败,就把该维度标记为高风险,后续额度优先投给它;如果两个维度表现稳定,就把额度转向尚未覆盖的维度。这样每一次查询的结果都会直接改变下一次的样本选择,而不是把额度平均撒出去。