关于此工具
这个情感分析工具采用了与 AFINN、VADER 等经典词库类工具相同的整体思路——但使用的是我们自己原创、手工构建的词表,而非任何已发布的数据集。输入文本中的每个词都会与约 200 个常见英文情感词进行比对,每个词都带有一个从 -5(非常消极)到 +5(非常积极)的效价分值。两条简单的上下文规则会进一步修正原始分值:三个词以内出现的否定词("not"、"never"、"isn't")会翻转并弱化其后单词的符号;紧跟在某个词之前的程度副词("very"、"extremely")会放大该词的分值。
所有匹配到的分值会被求平均并归一化为一个介于 -1 到 +1 之间的"综合"分数,再用固定阈值将其归类为积极、消极或中性。由于这只是简单的词表查找加上几条规则——而非训练好的 AI 模型——因此速度快、完全隐私(所有数据都不会离开你的浏览器),而且完全透明:下方的分解表会准确显示匹配到了哪些词,以及它们的分值为何发生了变化。同时也存在真实的局限性:它只理解英文,无法识别讽刺或反语,并且超出三个词范围的否定也会被完全忽略。
常见问题
这适用于英语以外的语言吗?
不适用——此工具背后的词典是一份手工构建的带有情感分数的英语单词列表,因此它只能识别英语词汇。其他语言的文本大多会显示"未匹配"的单词,并给出不可靠的接近零/中性结果,这并非因为情感实际上是中性的,而是因为这些词汇都不在词典中。目前没有计划在此工具中直接添加其他语言的词典;每种语言都需要其自己精心构建的单词列表,而不仅仅是英语列表的翻译,因为词语的内涵和强度无法直接翻译。
它能识别讽刺吗?
不能——这是任何基于词典的情感分析方法的一个基本、众所周知的局限,而不仅仅是此工具的局限。像"哦太好了,我的航班又被取消了"这样的句子对人类读者来说充满了负面情绪,但在这里会被评为正面,因为"太好了"是一个强烈的正面词,而工具没有语气、语境或反讽的概念。可靠地检测讽刺确实需要一个上下文语言模型,这明确超出了这个轻量级、透明、基于词典的工具的范围。