顶尖大模型在俄语文本生成质量上已几乎追平,但调用成本竟能差出130倍。当GPT-5.4得分97、Claude Opus 4.6拿下96分、Qwen3 235B也冲到88分时,选型的核心早已从“谁更聪明”滑向了“谁的输出流水线最省钱”。
价格端的撕裂感更加赤裸。Qwen3 235B单次调用费仅0.0008美元,而GPT-5.4高达0.1014美元。按月产一万篇文本计算,前者花费8美元,后者直接飙至1000美元。质量差距以百分点计,成本差距却横跨两个数量级,这笔经济账让“模型智商”的争论变得毫无意义。
俄语内容生成还藏着一类英语测试中根本不会出现的缺陷:乱入的中日韩字符。在18款受测模型里,有7款会把汉字、日文或韩文直接插进西里尔字母文本。MiMo V2 Omni产出过“静态的 бухгалтерский учет”,DeepSeek V3.2则冒出“в内部нем обсуждении”。
更离谱的是,GPT-5.2在某次测试中竟将技术指令泄露进正文标题,赫然写下“## Введение — Hook (statistic) + preview (100-150 words)”。好在这些硬伤都能用正则表达式秒级拦截:扫一遍中日韩统一表意文字符号,再检索标题里残留的指令片段就行。这套自动过滤流程成本极低,务必放在编辑看到草稿之前。
但另一类缺陷正则完全抓不住。Habr作者vvzvlad解剖机器俄语文本时,揪出的不是语法错误,而是空洞的万能概括,像“技术持续进步与完善的历史”这类废话,以及一种畸形的精确度:“3.81毫米”而非“约4毫米”,“1405.5亿美元”,“每秒4.76厘米”后面还怯怯地补个“约”。
这类文本还自信满满地犯错:把寻呼机工作原理写错,混淆硬盘和LTO磁带。该作者提出一套未公开计算方法的“slop因子”,在评测企业博客时测得0.15至0.38的区间。数值本身尚待验证,但指向的系统性缺陷已不容忽视。这类软错误只能靠人工事实核查来兜底,自动校验远不是终点。
厂商宣传与独立基准测试之间的裂缝同样扎眼。Sber将“俄语对话”列为全新GigaChat 3.5模型五大对齐重点之一,其开发者Nikita Sushko明言聚焦数学、编程、自然科学、社会科学及俄语交流五大域。Yandex则宣称YandexGPT 5.1 Pro对GPT-4.1的胜率达56%,优质回答占比从60%爬升至71%。
这些全是厂商自报的数据,方法论未公开。而独立公共基准MERA Text给出的画面截然不同:2026年2月,GPT-5.2以0.707分排第五,GigaChat 3 Ultra以0.683分紧随其后居第六,GigaChat Max更是跌至第45名,仅得0.588分。厂商榜与独立榜,尚未到可以互相印证的时刻,选型者需要清醒认识到两者测量的很可能根本不是同一样东西。
热门跟贴