一句话答案
ILMU 采用双轨模型策略:NVIDIA 的 Nemotron-3-Super(经马来西亚语境微调)负责 Agent 工作负载,加上 YTL AI Labs 自研的旗舰 ILMU v3.1 — 后者在马来语基准上超越 GPT-4o。
问题:ILMU 底层到底是什么?
当马来西亚开发者评估 ILMU Console 时,他们不可避免地会问:这到底跑在什么 LLM 上?
答案比"又一个 GPT 套壳"要复杂得多。ILMU 使用混合模型架构,结合了:
- NVIDIA 的 Nemotron 模型(经 YTL AI Labs 针对马来西亚语境和 Agent 任务微调)
- YTL AI Labs 的自研模型(在本地数据上训练,在马来语基准上达到 SOTA)
这种双轨方式让开发者同时拥有专业 Agent 能力和通用推理能力 — 全部保持 100% 马来西亚数据驻留。
第一轨:NVIDIA Nemotron 用于 Agent 工作负载
Nemotron 是什么?
Nemotron 是 NVIDIA 针对企业 AI 工作负载优化的大语言模型家族。ILMU 的 Claw 模型 基于 Nemotron,具体包括:
- Nemo-Super(基于 Nemotron-3-Super)— 面向复杂 Agent 任务的高性能模型
- Nemo-Nano(基于 ilmu-nemo-nano)— 更轻更快的模型,接受更深的马来语训练
为什么 Agent 要用 Nemotron?
Nemotron-3-Super 从底层就为自主 Agent 工作负载而设计。核心优势:
工具调用和函数调用 — Nemotron 擅长生成结构化 JSON 响应,Agent 框架(LangChain、CrewAI、AutoGen)可以直接解析和执行。这对需要调用 API、查询数据库或触发动作的多步工作流至关重要。
多轮推理 — Agent 工作负载涉及来回交互,AI 需要在多次工具调用间保持上下文。Nemotron 的 256K token 上下文窗口和优化的注意力机制可以在不丢失对话脉络的情况下处理这些。
PinchBench 表现 — Nemotron-3-Super 在 PinchBench(Agent 任务专用基准)上得分 85.6%,排名第一。这个基准衡量模型在以下方面的能力:
- 解析复杂指令
- 生成有效的函数调用
- 处理工具响应
- 在多个步骤间保持状态
对于构建自主 Agent 的马来西亚开发者,Nemo-Super 是专门打造的选择。
马来西亚微调
YTL AI Labs 不只是部署了原版 Nemotron。他们针对本地语境进行了微调:
- Manglish 和 Bahasa Rojak — 理解混合语言查询,如 "Can you check the SSM registration for this company?"
- 本地商业术语 — 咖啡店运营、中小企业供应链、政府采购
- 文化细微差别 — 知道 "Georgetown" 指的是槟城,不是美国城市
这些微调是与 NVIDIA 和马来亚大学合作完成的,确保模型理解马来西亚现实的同时保留 Nemotron 的 Agent 能力。
第二轨:YTL AI Labs 的旗舰模型
ILMU v3.1:马来西亚自己的 LLM
除了基于 Nemotron 的 Claw 模型,YTL AI Labs 还开发了自己的旗舰模型:ILMU v3.1。
这不是 GPT-4 或 Llama 的套壳。ILMU v3.1 是在马来西亚数据上训练(或大幅微调)的自研模型,取得了令人瞩目的基准表现:
基准对比:ILMU vs GPT-4o
在 MalayMMLU(由 YTL AI Labs 和马来亚大学开发的马来语理解基准)上:
| 模型 | 语言 | STEM | 人文 | 社会科学 | 其他 | 总分 | |------|------|------|------|----------|------|------| | ILMU | 89.36 | 88.05 | 88.40 | 85.44 | 85.08 | 87.20 | | GPT-4o | 87.64 | 83.54 | 87.78 | 82.84 | 82.34 | 84.97 | | Deepseek-V3 | 83.13 | 83.91 | 78.84 | 78.25 | 78.00 | 80.56 | | GPT-5 | 83.59 | 78.10 | 76.50 | 80.73 | 75.44 | 79.53 | | Llama 3.1 | 79.44 | 78.76 | 81.00 | 76.50 | 75.10 | 78.07 |
ILMU 总体超越 GPT-4o 2.23 个百分点,在所有类别中取得最高分。
在全球基准(Arena Hard Auto、IFEval)上,ILMU 与 GPT-4o 持平,证明本地训练没有以牺牲通用能力为代价。
ILMU v3.1 有什么不同?
扩展思考(Extended Thinking) — ILMU v3.1 支持思维链推理,允许它在生成最终答案前逐步处理复杂问题。
多语言设计 — 模型能流利处理英语、马来语和中文,包括代码切换(同一句话中混合语言)。
200K 上下文窗口 — 足以应对大多数文档分析和长篇推理任务。
OpenAI 兼容函数调用 — 无需更改 SDK 即可与现有 Agent 框架配合。
专业模型
YTL AI Labs 还为特定模态开发了专业模型:
- ilmu-vision-v1.3 — 具备 OCR 能力的视觉模型,用于文档分析
- ilmu-mini-v3.3 — 面向高并发、成本敏感工作负载的轻量模型
- ilmu-embedding-v1 — 面向 RAG 流水线的文本嵌入模型
- ilmu-asr-v4.2 — 针对马来西亚口音和代码切换优化的语音转文本
- ilmu-tts-v2 — 具有自然马来西亚发音的文本转语音
这些模型通过 PAYG(按量付费)定价提供,为开发者提供了超越 Claw 订阅计划的灵活性。
混合策略:何时用哪个模型
ILMU 的双轨架构不只是营销 — 它反映了真实的使用场景差异:
用 Nemo-Super(Claw 模型)的场景:
- 构建自主 Agent,使用 LangChain、CrewAI 或 AutoGen
- 复杂工具调用工作流,需要多次函数调用
- 多步推理,AI 需要在多轮间保持状态
- Agent 特定任务,如代码生成、API 编排或自主决策
Nemo-Super 的 256K 上下文窗口和 PinchBench 优化架构使其成为 Agent 工作负载的最佳选择。
用 ILMU v3.1(旗舰)的场景:
- 通用推理和内容生成
- 文档分析,需要深度理解马来西亚语境
- 多语言任务,需要流利的马来语、英语或中文
- 扩展思考,受益于思维链推理的复杂问题
ILMU v3.1 卓越的 MalayMMLU 表现和本地训练使其成为马来西亚特定任务的理想选择。
用 ILMU Mini v3.3 的场景:
- 高并发、成本敏感工作负载(分类、摘要、简单问答)
- 延迟敏感应用,速度比深度更重要
- 批量处理,需要处理数千份文档
输入 RM 0.20/1M tokens、输出 RM 1.20/1M tokens,Mini 比 v3.1 便宜 20 倍。
技术架构:一切如何协同
┌─────────────────────────────────────────────────────────┐
│ ILMU API 网关 │
│ (OpenAI / Anthropic / Gemini 兼容) │
└─────────────────────────────────────────────────────────┘
│
┌───────────────┴───────────────┐
│ │
┌─────▼─────┐ ┌──────▼──────┐
│ Claw │ │ PAYG │
│ 模型 │ │ 模型 │
└─────┬─────┘ └──────┬──────┘
│ │
┌─────┴─────┐ ┌──────┴──────┐
│ Nemo-Super│ │ ILMU v3.1 │
│ Nemo-Nano │ │ ILMU Vision │
│(Nemotron) │ │ ILMU Mini │
└───────────┘ │ Embeddings │
│ Speech │
└─────────────┘
所有模型运行在马来西亚的 YTL AI Cloud 基础设施上,确保:
- 100% 数据驻留
- 不利用你的数据训练(除非你主动选择加入)
- 从东南亚访问延迟稳定
定价:模型专属费率
Claw 计划(订阅)
| 计划 | 价格 | 模型 | Token 配额 | |------|------|------|-----------| | Free | 免费 | Nemo-Super, Nemo-Nano | 有限(200 名额) | | Starter | RM 25/月 | Nemo-Super, Nemo-Nano, BGE-M3 | 月度配额 | | Pro | RM 50/月 | 所有 Claw 模型 | 月度配额 |
Claw 计划的 token 从月度配额中扣除,无 PAYG 费用。
PAYG 模型(按量付费)
| 模型 | 输入费率 | 输出费率 | |------|----------|----------| | ILMU v3.1 | RM 4.00/1M tokens | RM 16.00/1M tokens | | ILMU Vision v1.3 | RM 1.60/1M tokens | RM 4.80/1M tokens | | ILMU Mini v3.3 | RM 0.20/1M tokens | RM 1.20/1M tokens | | BGE-M3(嵌入) | RM 0.04/1M tokens | — | | ILMU ASR v4.2(语音转文本) | RM 0.0002/秒 | — | | ILMU TTS v2(文本转语音) | RM 0.08/1K 字符 | — |
PAYG 额度在整个组织内共享,有效期 12 个月。
对比:ILMU vs 其他主权 AI 平台
| 平台 | 基础模型 | 本地微调 | Agent 优化 | 数据驻留 | |------|----------|----------|-----------|---------| | ILMU | Nemotron-3-Super + 自研 ILMU v3.1 | 是(马来西亚语境) | 是(PinchBench 85.6%) | 100% 马来西亚 | | SEALION(新加坡) | Llama 基础 | 是(东南亚) | 有限 | 新加坡 | | SahabatAI(马来西亚) | 未知 | 是(马来语) | 有限 | 马来西亚 | | Mallam(马来西亚) | 较小模型 | 是(马来语) | 有限 | 马来西亚 |
ILMU 的混合方式(NVIDIA 合作 + 自研模型)让它同时拥有 Agent 能力和本地语言优势,纯微调方式无法匹配。
结论
ILMU 不是"又一个 GPT 套壳"。它是一个精密的混合架构,结合了:
- NVIDIA 的 Nemotron-3-Super — Agent 工作负载的最佳模型,经 YTL AI Labs 针对马来西亚语境微调
- YTL AI Labs 自研的 ILMU v3.1 — 在马来语基准上超越 GPT-4o 的旗舰模型
这种双轨策略给马来西亚开发者两全其美的选择:自主工作流的专业 Agent 能力,加上卓越本地语言理解的通用推理。
对于构建 AI Agent 的开发者,Nemo-Super 的 85.6% PinchBench 得分意味着可靠的工具调用和多步推理。对于需要马来西亚语境的企业,ILMU v3.1 的 87.20% MalayMMLU 得分意味着对本地语言和文化的准确理解。
问题不是 ILMU 是否"基于"西方模型。问题是你的 AI 平台是否理解马来西亚现实 — 而 ILMU 的基准表现证明了它确实理解。
延伸阅读
- ILMU Console 平台完整指南 — ILMU 功能和定价全面解析
- YTL AI Labs 官方网站 — ILMU 背后的团队
- ILMU API 文档 — 所有可用模型的技术细节
- MalayMMLU 基准 — ILMU 在此基准上超越 GPT-4o



