选择英文小说,也是一个匹配问题:一本书需要有挑战,但又不能难到读不下去。这项研究探索如何从文本本身出发,估计英文小说的阅读难度。
研究问题
研究以蓝思等级为参考,探索能否通过组合语言特征,近似估计英文小说的难度。
起点是 Flesch Reading Ease 公式,它主要使用句长与每个单词的音节数。我们尝试用不同的特征组合,更好地反映英语学习者实际面对的阅读难度。
从文本到特征
实验使用了 27 本英文小说。通过文本处理提取句子、音节和词汇指标,并进行特征筛选与归一化。
比较不同特征组合与参考难度等级之间的误差。除了传统 Flesch 指标,也考虑与不同英语教育阶段对应的词汇分类。
得到什么发现
在这组实验中,有三种特征组合优于原始策略。大学英语四级词汇数量出现在三种组合中,分别与句长、音节长度或基础教育阶段词汇组合。
这一结果提示了个性化阅读工具的一个方向:阅读难度不仅取决于文本的一般特征,也可能与学习者的词汇背景有关。
小样本研究的边界
研究样本较小,计算分数与参考等级之间的映射也较固定。论文将结果视为一种可行的特征构建思路,并保留进一步优化的空间。
在将它用于通用阅读难度评估之前,还需要更大、更多样的样本,以及面向真实读者的验证。
论文记录
K. Jiang、Z. Tang 等,《An optimization of feature construction strategy for difficulty calculation algorithm of English novels》,CSTNED,2021 年录用。
论文题目与录用状态来自本人存档简历。最终论文集链接与 DOI 尚未核实,因此页面保留“已录用”的准确表述。