Jev 情感分析:评价情感、星级与退款请求

贴上一条商品评价,Jev 会告诉你:它是正面、褒贬参半还是负面,文字对应几星,以及评价者要求退款的概率。结果是可以直接排序、筛选和分流的数字,而不是一段还要有人去读的摘要。

用你自己的文本试试

修改示例后运行。无需账号,每天免费 3 次。

场景

读出一条评论的情感倾向、隐含评分和退款意图。

163 / 2,000

可以随意修改,Jev 会针对这里的内容回答该场景的问题。

这个工具检查什么

上面的示例正是那种会让"正面 / 负面"二分类器出错的评价:它夸了基础编辑功能,抱怨导出一个 40 页的文件时崩溃了两次,肯定客服一天之内就回复了,最后还要求退还这个月的费用。一次评估问三个问题:

问题类型返回什么
sentimentChoicepositive、mixed、negative 各自的概率,以及置信度
ratingScore在 1 星 → 5 星上的位置、概率分布和置信度
refund_requestNoul评价者要求退款的概率,0 到 1

三个回答各有用处。sentiment 用于看板和趋势线,给它一个 mixed 选项,像这样的评价就不会被硬塞到某一边。rating 给没有星级的反馈打上一个数字——客服邮件、应用商店回复、问卷评论。refund_request 是需要有人跟进的那一个:它把一条评价变成一项任务。三个问题针对同一份 state 并行作答,合起来只收 1 点。

怎么写这些问题

给每个情感选项下定义。 示例给每个选项都写了一句 criteria——mixed 是"既有表扬也有抱怨"(Both praise and complaints)。没有这句,Jev 就得去猜只有一点小抱怨的评价算正面还是褒贬参半。把你们团队实际用的界线写进去。

把星级当阈值用,而不是精确数字。 Score 返回的是在刻度上按概率加权的位置。TypeSafe 说明 Score 各级的数值校准较弱,所以不要把落在 3 和 4 之间的期望值读成"3.4 星"。改问一个阈值问题:这条评价是否在 2 星及以下?

你会采取的每个动作各用一个 Noul。 退款请求、扬言取消、bug 报告和功能需求,各自流向不同的地方。每个都给一个 Noul,界线微妙时加上 criteria:

{
  "type": "noul",
  "instructions": "Does the reviewer ask for a refund?",
  "criteria": {
    "true": "The reviewer asks for money back, a refund or a credit for a charge.",
    "false": "The reviewer complains about value or price but does not ask for money back."
  }
}

不要用正反两种问法问同一件事。 在 TypeSafe 自己的文档里,一个关于退款的问题和它的否定问法分开提问,返回的概率加起来是 1.19。选定一种问法,在它上面调阈值。

更多关于问法的内容,见设计 Jev 能回答的问题。

从一条评价到流水线里的一步

  1. 先标注一批样本。 几百条你们自己的评价,每条标好团队会给的情感、星级和动作,就足以看出 Jev 的回答在哪里对得上。
  2. 一次跑完存量。 批量页面可以对 CSV 的每一行跑同一组问题,你可以直接给导出的历史评价打分,再和自己的标注对比,不用写代码。
  3. 按 Noul 分流。 refund_request 概率高的评价交给客服,sentiment 和 rating 用于报表。8,000 字符以内的评价,最多 5 个问题仍然只收 1 点,所以再加一个 bug 报告或取消意向的问题不会多花钱。
  4. 记录模型版本。 每次响应都带有 model 字段(例如 jev-1.13.0)。把它和每条结果一起存下,版本变化时重新校验阈值——JevStation 在部署层固定模型,不需要你在请求里指定。
  5. 新评价进来就分类。 同样的评估可以用 API Key 通过 System One API 调用,扣点规则和试验台一样。

信任之前先验证

  • 如实看待现有证据。 我们所知唯一的独立基准,是一项每个数据集 100 条样本的预注册试验。Jev 在 AG News(四类新闻主题)上准确率 0.910,但在六类情绪数据集 DAIR Emotion 上只有 0.480:在 5% 错误率的要求下,它能自动处理的输入比例为零,校准也比拿来对比的零样本模型更差。三分类情感和六分类情绪不是同一个任务,而目前没有可以引用的 Jev 情感分析公开结果。请用你自己的评价测试。
  • 要做情绪识别,就测得最严。 喜悦、愤怒、恐惧、悲伤这类标签,最接近上面表现不好的那个场景。在依赖它们之前单独测量。
  • 每种语言分别检查。 TypeSafe 表示英文准确率最高,其他语言能处理,但效果不如英文。
  • 关注 mixed 区间。 如果大多数评价都落在这里,要么你的评价确实褒贬参半,要么 criteria 太笼统——抽一批读一读就知道是哪种。

哪些时候 Jev 不是合适的工具

  • 你需要总结顾客说了什么。 Jev 返回的是带类型的回答,不是文字。需要总结时搭配一个生成式模型。
  • 细粒度情绪就是你的产品。 那正是上面基准里的弱项。用你的标注训练的模型可能做得更好;Jev 对比开源模型讲了有哪些选择。
  • 规则和数字有关。 "这位顾客本月是否留了三条差评?"属于计数,是 TypeSafe 自己列出的弱项。在代码里数。

如果你在为这件事权衡 Jev、通用 LLM 和自己训练的分类器,Jev 的替代方案讲清了各自什么时候更合适。

常见问题

Jev 做情感分析准不准?
目前没有可以引用的 Jev 商品评价情感分析公开基准。在一项独立试验中,Jev 在新闻主题和银行意图上表现很好,但在一个六类情绪数据集上表现不佳。所以依赖它之前,先用几百条自己标注过的评价测一遍。
分类一条评价多少钱?
在 JevStation 上,不超过 8,000 字符、不超过 5 个问题的评价属于标准评估,扣 1 点,所以本例三个问题每条评价 1 点。文本更长或问题更多时扣 3 点。
能一次分类几千条评价吗?
可以。批量页面可以对 CSV 的每一行跑同一组问题;也可以在自己的流水线里用 API Key 调用 System One API。
非英文评价也能用吗?
TypeSafe 表示英文是 Jev 最准确的语言,其他语言(包括中日韩文字)也能处理,但效果不如英文。对你收到的每种语言都抽样标注,分别检查。
Jev 能总结顾客都在抱怨什么吗?
不能。Jev 不生成文本。如果你为崩溃、价格、客服各问一个问题,它可以告诉你每条评价是否提到了这些,但写总结需要生成式模型。

相关页面

把它接进你的流程

注册即送 200 点,保存自己的问题集,并通过 API 调用同样的评估。