OpenRouter 上 425 个模型的韩语质量、价格与实测速度排行榜

1 阅读

这个排行榜测了什么

这个榜单覆盖了 OpenRouter 平台上列出的所有 425 个大语言模型,重点评估那些真正影响采购决策的指标:每百万 token 的价格、提供该模型的供应商及其精度与可用性、上下文长度、响应速度,以及最关键的——韩语输出质量。

价格、供应商和流量数据来自 OpenRouter 的公开 API。但有两个关键字段是团队自己补上的:实测响应速度韩语能力评分。后者正是整个项目启动的初衷。

平台日志能告诉你有多少请求是用韩语发出的,但无法判断返回的韩语文本是否能在韩国办公室里直接使用。对于面向韩国客户部署 API 的团队来说,这才是唯一重要的问题。因此,他们对其中 330 个模型逐一进行了韩语能力测试。

“好的韩语”具体指什么

与其给一个笼统的“韩语分数”,不如拆解成七个独立维度,因为韩语出错的方式非常具体:

  • 语体一致性(Register):整段回答是否保持统一的正式或非正式语气。
  • 韩国机构知识(Knowledge of Korean institutions):是否准确了解韩国的年假计算规则、税种分类、政府机构办事流程等事实性内容,而非仅语言流畅。
  • 格式合规(Format compliance):能否严格遵守“用两句话回答”这类明确指令。
  • 敬语使用(Honorifics):主语和宾语敬语是否正确,包括母语者一眼就能发现的错误。
  • 摘要准确性(Summary accuracy):压缩文本时是否保留了数字和专有名词。
  • 专业术语(Terminology):在金融、法律、工程等领域是否使用恰当的专业词汇。
  • 无翻译腔(Freedom from translationese):读起来像地道韩语,而不是从英文硬译过来的。

The leaderboard's opening view: what it measures, what it borrows, and the starting points

每个维度按 A/B/C/F 四档打分,再综合得出从 A+++ 到 F 的八个等级。

Quality, value and speed winners differ on every axis

排行榜揭示的关键发现

One model served by fifteen providers at different prices, precisions, uptimes and jurisdictions

每个维度的“冠军”都不一样

The list view: Korean grade, total price, measured first token and provider count on one line

问“哪个模型韩语最好”,答案取决于你关心什么:

  • 质量最高:Google 的 Nano Banana 2(即 Gemini 3.1 Flash Image),评分为 A+++
  • 性价比最优(质量 ÷ 价格):Mistral Nemo,每百万 token 仅 0.049 美元,但韩语仅 C 级
  • 速度最快(实测首 token 延迟):NVIDIA 的 Nemotron 3 Nano Omni(免费版),128 毫秒,但韩语为 F 级

这种“单项冠军不重合”的现象贯穿所有评估维度——无论是通用智能、编程能力、智能体表现还是 Arena Elo 排名。这意味着,任何只排一个总榜的做法,其实回答了一个没人真正问的问题。

办公场景中最关键的两个维度,多数模型都垮了

在七个韩语子项中,有两个维度的表现尤其糟糕,而这恰恰是韩国职场最在意的部分:

  • 敬语使用:仅 8.5% 的模型拿到 A,高达 51.8% 得 F
  • 韩国机构知识:仅 9.4% 得 A,54.7% 得 F

相比之下,其他维度表现好得多:比如“无翻译腔”有 53.1% 得 A,“语体一致”也有 53.3%。

问题在于,一个模型可能写出非常流畅自然的韩语,却在敬语上犯低级错误——比如给无生命物体加敬语。这种错误极其隐蔽,因为文本整体读起来很顺,审核时很容易被漏掉,反而比明显不通顺的输出更危险。

而“韩国机构知识”失分,则根本不是语言问题。韩国劳动法或税务分类属于事实范畴。如果模型训练数据里没包含这些内容,它会用完美的韩语“自信地编造”出一套看似合理但完全错误的规则。

整体分布:三分之一模型直接不及格

在参与韩语评测的 330 个模型中:

  • A+++ 到 A+ 合计仅占 7.6%(25 个模型)
  • B 级和 B+ 占 34.3%
  • C 和 D 级占 24.6%
  • F 级高达 33.6%(111 个模型)

换句话说,超过三分之一的模型在韩语任务上完全不可用。

新模型 ≠ 好韩语

令人意外的是,韩语能力与模型发布时间、参数规模甚至英文基准成绩几乎无关。例如:

  • gpt-3.5-turbo-16k(2023 年发布)拿到了满分 3.00
  • gpt-3.5-turbo-0613 获得 A++

它们和 2026 年的新旗舰模型并列榜首。这说明,不能靠猜——必须对每个模型单独实测。

为什么选择实测速度,而不是沿用公开数据

OpenRouter 公开的模型数据中,延迟字段大多是空的。于是团队用相同的提示词,通过付费 API 对 329 个模型发起调用,记录首 token 延迟和每秒生成 token 数。

这个实测值和 OpenRouter 自身基于海量真实请求统计出的 p50–p99 延迟百分位数并不冲突,而是互补:

  • OpenRouter 的数据反映的是稳态下的整体表现
  • 实测数据则告诉你在特定时间、由特定供应商、以特定精度提供的一次调用结果

两者并列展示,互为验证。更重要的是,实测还能暴露供应商差异——同一模型权重,在不同地区、不同精度下,价格和延迟可能天差地别。

如何保证评分公正

为避免 LLM 自评带来的偏差,团队设置了多重控制:

  • 评分模型看不到候选模型的名字,杜绝品牌偏见
  • 必须先正确答完所有已知答案的控制题,否则整个评测流程直接终止(不是警告)
  • 字符污染检测全靠代码计算,比如汉字、假名、韩文比例,绝不交给语言模型判断
  • 七个维度中至少五个有评分才给总评,防止靠单点优势冲高排名

供应商背后的地域问题

OpenRouter 上的 107 家模型供应商中:

  • 55 家总部在美国
  • 6 家在新加坡
  • 6 家在中国
  • 33 家未披露总部所在地

在披露总部的 74 家中,没有一家是韩国公司。

这对韩国企业至关重要——他们首先关心的是数据物理上去了哪里。因此,排行榜在模型详情页明确标出了每家供应商的总部国家和数据中心位置,这是其他公开榜单从未提供的信息。

如何使用这个工具

排行榜已在 Hugging Face Space 上线,支持英文、韩文、中文三种界面,价格可切换美元、韩元、人民币。你可以:

  • 按场景筛选:编程智能体、长文档处理、高并发、实时响应、韩语办公、多模态等
  • 并排对比 2–4 个模型,展开查看全部七个韩语维度的详细得分
  • 直接分享当前筛选条件的链接

韩语评分、价格、延迟三栏并列,一眼就能看出某个便宜模型是否在韩语上“翻车”,不用来回切标签页。

所有数据开放访问,无需 API 密钥。通过以下端点可直接获取结构化数据:

GET /api/korean    # 含各维度详细评分
GET /api/speed     # 实测首 token 延迟和吞吐量
GET /api/models    # 价格、上下文长度、模态等元数据

数据每天韩国时间 08:00 自动刷新。

如果你发现某个熟悉模型的评分明显有误,可以带上具体提示词反馈。毕竟,这七个维度只是一个提议,而非绝对标准。