LABELOWL / 研究指南
编码证据及其局限
LabelOwl 是由 Shengxing Yang 运营的 AI 辅助问卷编码工具。下列实验考察特定编码条件,不代表产品通用准确率。
实验日期:2026 年 9 月 20 日。页面核对日期:2026 年 9 月 22 日。
构造边界案例:30 组中 29 组与预设标签集合一致
30 个构造案例在三组条件中使用相同的八个类别问题、jev-1.13.0 和 0.5 阈值。仅分类框架为 25/30;加入原题与范围为 29/30;进一步加入边界、层级和示例仍为 29/30。预期集合与样例在调用前冻结,结果出现后未重新调参。
这是信息消融诊断,不是有代表性的受访者抽样。一条模糊回答仍未达到预设判定要求。增加语境并非总有益,29/30 不能宣传为通用准确率。
独立公开问卷的丰富语境实验
30 条回答使用全部 35 个已发布类别:21/30 的标签集合完全一致,47 个匹配标签、9 个多出标签、4 个缺失标签。相对于数据作者发布的参考编码,微平均精确率为 83.9%、召回率为 92.2%、F1 为 87.9%。
参考编码未经独立裁定为人工金标准。语境来自研究标题和问卷表头,无法取得开放题原始精确措辞。不同实验不能合并计算。
来源:Kene David Nwosu,R Basics and Beyond 数据集,CC BY 4.0。 Zenodo ↗
哪些材料公开?
本站提供汇总结果和方法说明。冻结的实验方案、输入与输出保存在本地研究工作区;本站不分发受访者层面的数据或私有测试文件。
