BrailleBench:给大语言模型的盲文考试

盲文是视障与聋盲人士接触文字的重要方式,但大语言模型能否真正“看懂”盲文,此前缺少系统评测。BrailleBench为此汇集了5570条实例,覆盖数学、常识与多跳问答,横跨英文和一级、二级盲文,并用经过专家审核的确定性流程构建,没有使用模型生成的数据。

评测六个代表性模型后,研究者发现,模型对印刷英文的能力并不等于对盲文的能力。它们理解盲文和用盲文表达并不对称,而二级盲文——包含大量缩写的常用盲文——在输入侧尤其脆弱。若整个请求都用盲文提出,性能还会进一步下降。

对盲文读者而言,这意味着AI辅助工具可能在他们最需要的地方失灵。模型若是只能读一级盲文,或者只能输出盲文却无法理解盲文提问,就难以构成真正的无障碍交互。资源已公开,后续研究或许能借此找到更公平的技术方向。

评论

还没有留言
100 h