根据基准测试平台 Arena 的最新分析,Anthropic 的 Claude Opus 5.5 几乎放弃了长破折号,这是人工智能生成文本中最容易识别的特征之一。现在,该模型使用的破折号比其前身少了大约 95%,用较短的句子书写,并且倾向于使用更简单的措辞。有一个值得注意的权衡:它的答案变得越来越长。
据 BleepingComputer 报道,这些发现来自 Arena 对 2026 年 8 月至 9 月期间通过 Text Arena 收集的高推理答案的分析。在 Arena 跟踪的 12 项写作措施中,有 10 项朝着该平台认为比 Claude Opus 5 更好的方向发展。 更多相关背景,请参阅我们的AI新闻。
克劳德风格转变背后的数字
头条统计数据是破折号的崩溃。根据 Arena 的数据,Opus 5 每 1,000 个单词使用 15.2 个破折号,而 Opus 5.5 将这一数字降至仅 0.8 个,减少了大约 95%。
分号是另一种经常被标记为类似机器的标点符号习惯,也急剧下降,从每 1,000 个单词 6.10 个减少到 1.64 个。句子结
Arena 的数据集侧重于 Text Arena 在两个月内的高推理响应,这意味着比较范围仅限于特定的评估设置,而不是日常使用。即便如此,平台跟踪的大多数指标的变化方向都是一致的。
为什么 Em Dash 成为人工智能的名片
破折号在人工智能写作文化中占据着一个奇怪的地位。多年来,密集分散的破折号被读者、编辑和自封的人工智能检测器视为机器生成散文的明显标志,以至于标点符号成为低质量、机器生成内容的更广泛现象的简写,通常被视为“人工智能废话”。
这种刻板印象是否曾经是一个可靠的信号是有争议的,因为许多人类作家大量使用破折号,而许多人工智能文本则避免使用它们。但这种看法很重要,特别是对于使用大型语言模型来起草营销文案、文档和文章并且不希望其输出读起来明显是合成的企业来说。
在此背景下,明显避免这种模式的模型具有实际的卖点。正如 BleepingComputer 在其报告中观察到的那样,Opus 5.5 减少了对明显人工智能书写模式的依赖,这意味着用户不太可能生成读作通用机器输出的文本。
权衡:句子较短,答案较长
一项错误的措施是冗长。根据 Arena 的数据,与 Opus 5 相比,Opus 5.5 的平均答案长度从 453 个单词上升到 481 个单词,使其成为对比中编写时间最长的 Opus 模型。
这看起来似乎是一个小增长,但它与更广泛的行业趋势背道而驰,即更简洁、更直接的模型输出,这意味着在 API 调用上燃烧代币的用户可能会为相同的内容支付稍高的费用。较短的句子与较长的答案相结合也意味着更多的句子:该模型将其散文分成更小的部分,同时表达更多的整体内容。
当然,冗长并不一定是一个缺陷。对于解释、文档和分析等任务,一些额外的句子可以增加清晰度。对于快速答案或成本敏感的工作负载,这是一个值得关注的趋势。
这对作家、编辑和检测工具意味着什么
该分析提醒人们,人工智能文本的统计指纹是移动目标。为标记破折号、分号习惯或句子长度而构建的工具和启发式方法将会退化,因为实验室会故意调整这些模式,无论是为了提高可读性还是只是为了避免附加在它们上的耻辱。
它还强调了前沿模型之间的竞争已经转向传统基准测试中难以捕捉的品质。 Arena 的数据表明 Anthropic 正在关注其模型的编写方式,而不仅仅是其编码方式。 BleepingComputer 指出,Opus 5.5 被认为是最强大的编码模型之一,在大多数公开比较都围绕代理和编程评估的市场中,编写质量已成为一个更安静的差异化因素。
一个看得见的小改变
没有人会阅读基准表并改变他们的散文。但是,乘以大型语言模型现在每天生成的海量文本,破折号的使用量下降了 95%,这种变化在野外显而易见,正如报告所述,互联网上的破折号越来越少。
目前,要点很简单。与之前的版本相比,Claude Opus 5.5 减少了与人工智能生成文本相关的标点符号习惯,使句子更短,并且使用更简单的单词。它还讲了一点。这种组合是否读起来更好取决于个人用户的判断,但它是实验室积极重塑机器书写听起来的具体、可衡量的例子。
---
掌握AI最新动态获取最新的AI新闻、分析和突破——尽在一处。
阅读更多AI新闻 →