Jev 情感分析:评价情感、星级与退款请求
贴上一条商品评价,Jev 会告诉你:它是正面、褒贬参半还是负面,文字对应几星,以及评价者要求退款的概率。结果是可以直接排序、筛选和分流的数字,而不是一段还要有人去读的摘要。
用你自己的文本试试
修改示例后运行。无需账号,每天免费 3 次。
场景
读出一条评论的情感倾向、隐含评分和退款意图。
可以随意修改,Jev 会针对这里的内容回答该场景的问题。
这个工具检查什么
上面的示例正是那种会让"正面 / 负面"二分类器出错的评价:它夸了基础编辑功能,抱怨导出一个 40 页的文件时崩溃了两次,肯定客服一天之内就回复了,最后还要求退还这个月的费用。一次评估问三个问题:
| 问题 | 类型 | 返回什么 |
|---|---|---|
sentiment | Choice | positive、mixed、negative 各自的概率,以及置信度 |
rating | Score | 在 1 星 → 5 星上的位置、概率分布和置信度 |
refund_request | Noul | 评价者要求退款的概率,0 到 1 |
三个回答各有用处。sentiment 用于看板和趋势线,给它一个 mixed 选项,像这样的评价就不会被硬塞到某一边。rating 给没有星级的反馈打上一个数字——客服邮件、应用商店回复、问卷评论。refund_request 是需要有人跟进的那一个:它把一条评价变成一项任务。三个问题针对同一份 state 并行作答,合起来只收 1 点。
怎么写这些问题
给每个情感选项下定义。 示例给每个选项都写了一句 criteria——mixed 是"既有表扬也有抱怨"(Both praise and complaints)。没有这句,Jev 就得去猜只有一点小抱怨的评价算正面还是褒贬参半。把你们团队实际用的界线写进去。
把星级当阈值用,而不是精确数字。 Score 返回的是在刻度上按概率加权的位置。TypeSafe 说明 Score 各级的数值校准较弱,所以不要把落在 3 和 4 之间的期望值读成"3.4 星"。改问一个阈值问题:这条评价是否在 2 星及以下?
你会采取的每个动作各用一个 Noul。 退款请求、扬言取消、bug 报告和功能需求,各自流向不同的地方。每个都给一个 Noul,界线微妙时加上 criteria:
{
"type": "noul",
"instructions": "Does the reviewer ask for a refund?",
"criteria": {
"true": "The reviewer asks for money back, a refund or a credit for a charge.",
"false": "The reviewer complains about value or price but does not ask for money back."
}
}
不要用正反两种问法问同一件事。 在 TypeSafe 自己的文档里,一个关于退款的问题和它的否定问法分开提问,返回的概率加起来是 1.19。选定一种问法,在它上面调阈值。
更多关于问法的内容,见设计 Jev 能回答的问题。
从一条评价到流水线里的一步
- 先标注一批样本。 几百条你们自己的评价,每条标好团队会给的情感、星级和动作,就足以看出 Jev 的回答在哪里对得上。
- 一次跑完存量。 批量页面可以对 CSV 的每一行跑同一组问题,你可以直接给导出的历史评价打分,再和自己的标注对比,不用写代码。
- 按 Noul 分流。
refund_request概率高的评价交给客服,sentiment和rating用于报表。8,000 字符以内的评价,最多 5 个问题仍然只收 1 点,所以再加一个 bug 报告或取消意向的问题不会多花钱。 - 记录模型版本。 每次响应都带有
model字段(例如jev-1.13.0)。把它和每条结果一起存下,版本变化时重新校验阈值——JevStation 在部署层固定模型,不需要你在请求里指定。 - 新评价进来就分类。 同样的评估可以用 API Key 通过 System One API 调用,扣点规则和试验台一样。
信任之前先验证
- 如实看待现有证据。 我们所知唯一的独立基准,是一项每个数据集 100 条样本的预注册试验。Jev 在 AG News(四类新闻主题)上准确率 0.910,但在六类情绪数据集 DAIR Emotion 上只有 0.480:在 5% 错误率的要求下,它能自动处理的输入比例为零,校准也比拿来对比的零样本模型更差。三分类情感和六分类情绪不是同一个任务,而目前没有可以引用的 Jev 情感分析公开结果。请用你自己的评价测试。
- 要做情绪识别,就测得最严。 喜悦、愤怒、恐惧、悲伤这类标签,最接近上面表现不好的那个场景。在依赖它们之前单独测量。
- 每种语言分别检查。 TypeSafe 表示英文准确率最高,其他语言能处理,但效果不如英文。
- 关注
mixed区间。 如果大多数评价都落在这里,要么你的评价确实褒贬参半,要么 criteria 太笼统——抽一批读一读就知道是哪种。
哪些时候 Jev 不是合适的工具
- 你需要总结顾客说了什么。 Jev 返回的是带类型的回答,不是文字。需要总结时搭配一个生成式模型。
- 细粒度情绪就是你的产品。 那正是上面基准里的弱项。用你的标注训练的模型可能做得更好;Jev 对比开源模型讲了有哪些选择。
- 规则和数字有关。 "这位顾客本月是否留了三条差评?"属于计数,是 TypeSafe 自己列出的弱项。在代码里数。
如果你在为这件事权衡 Jev、通用 LLM 和自己训练的分类器,Jev 的替代方案讲清了各自什么时候更合适。
常见问题
- Jev 做情感分析准不准?
- 目前没有可以引用的 Jev 商品评价情感分析公开基准。在一项独立试验中,Jev 在新闻主题和银行意图上表现很好,但在一个六类情绪数据集上表现不佳。所以依赖它之前,先用几百条自己标注过的评价测一遍。
- 分类一条评价多少钱?
- 在 JevStation 上,不超过 8,000 字符、不超过 5 个问题的评价属于标准评估,扣 1 点,所以本例三个问题每条评价 1 点。文本更长或问题更多时扣 3 点。
- 能一次分类几千条评价吗?
- 可以。批量页面可以对 CSV 的每一行跑同一组问题;也可以在自己的流水线里用 API Key 调用 System One API。
- 非英文评价也能用吗?
- TypeSafe 表示英文是 Jev 最准确的语言,其他语言(包括中日韩文字)也能处理,但效果不如英文。对你收到的每种语言都抽样标注,分别检查。
- Jev 能总结顾客都在抱怨什么吗?
- 不能。Jev 不生成文本。如果你为崩溃、价格、客服各问一个问题,它可以告诉你每条评价是否提到了这些,但写总结需要生成式模型。
相关页面
把它接进你的流程
注册即送 200 点,保存自己的问题集,并通过 API 调用同样的评估。