实测Kimi K3:强得意外,慢得着急
日期:2026-07-24 22:14:59 / 人气:2

能力上限高,但体验还没完全跟上。
AIX财经(AIXcaijing)原创
月之暗面近期动作密集。7月16日晚间,团队低调上线全新模型Kimi K3,数小时后才通过官方公众号正式官宣。虽然上线方式隐秘,但这款新机并未藏住热度。
此前,代号“Kivine”的匿名模型现身大模型竞技场Arena榜单,凭借亮眼的前端生成、3D任务表现引发开发者热议,被普遍预判为即将发布的Kimi K3,频繁被拿来与Anthropic Fable 5、OpenAI GPT-5.6 Sol对标。与此同时,Kimi开放平台一则K3限时充值活动页面短暂泄露,截图广泛传播,让这款模型在正式发布前就拉满行业关注度。
核心参数、定位与定价:顶配能力分层开放
先看Kimi K3核心硬件级参数:搭载2.8万亿参数,具备原生视觉理解能力,标配100万Token超长上下文窗口,定位全球首个开源3万亿级别模型,主打长程编程、知识工作、复杂推理等前沿高端智能场景。就连本次官方品牌宣传视频,也由Kimi K3独立完成剪辑,从56段原始素材中自主完成选片、卡点、动作匹配与音频合成,直观展示其复杂闭环创作能力。
值得注意的是,百万级上下文并非全员开放,而是严格绑定会员等级,分层权限差异显著:
- 入门档 Andante(49元/月):不支持K3核心能力调用
- 中端档 Moderato(99元/月):仅支持256K上下文
- 高端档 Allegretto(199元/月)及以上:解锁完整1M超长上下文
性能榜单层面,Kimi K3官方成绩单覆盖编码、通用Agent、视觉Agent三大核心赛道,整体稳居全球第三,多个细分维度登顶行业第一。更具说服力的是Arena Code Arena公开盲测榜单,依托海量用户真实投票、匿名PK产出结果,Kimi K3以1679分拿下全球前端编程第一,超越Claude Fable 5(1631分)、GPT-5.6 Sol(1618分),硬核工程能力得到行业实证。
目前Kimi K3已全量上线网页端、App、Work桌面端、Kimi Code及API端口,默认开启Max满级思考强度,Low、High轻量化模式将在后续迭代更新。
API定价具备极强的差异化竞争力:输入每百万Token20元、输出100元,折合输出单价不足14美元。对比海外旗舰模型优势明显:GPT-5.6 Sol输入5美元、输出30美元,Fable 5输入10美元、输出50美元。但纵向对比自家上代产品,K3涨价幅度激进,较K2.6输入价格上涨3倍有余,输出价格上涨近4倍,高端能力对应更高使用成本。
官方坦诚三大短板:能力强、体验稚嫩
月之暗面在官方博文中,主动披露Kimi K3三大核心局限,不回避产品短板:
第一,模型对历史思考内容高度敏感,对话中途切换模型,极易导致输出逻辑断裂、质量大幅下滑;第二,训练侧重长程高难专业任务,处理简单日常问题时,容易过度解读、擅自替用户决策,适配轻量化场景体验不佳;第三,对比Fable 5、GPT-5.6 Sol两大顶级闭源模型,综合用户体验、工程稳定性仍存在明显差距。
Kimi K3全面实测:3D视觉惊艳,速度成致命短板
Kimi K3上线24小时内,全网已涌现海量场景化实测案例,核心测试集中在3D交互生成、前端编程、视觉设计三大领域。行业共识高度统一:3D与视觉生成能力超出预期、审美质感对标顶级旗舰、前端工程能力拉满,但推理速度、一次性准确率、工程稳定性是明显短板。多款实测显示,K3综合能力已全面超越两个月前发布的Opus 4.8,国产开源模型与海外顶级闭源模型的代差被大幅抹平。
外部博主实测中,K3展现出极强的创意落地能力。科技博主Chris在匿名测试阶段,让Kimi K3与GPT-5.6 Sol(extra high)对打体素死星壕沟飞行场景,GPT-5.6胜在光照特效细腻度,K3则胜在画面流畅度、整体完成度更高。正式上线后,Chris依托K3,仅三轮对话、消耗60万Token、成本3.24美元,就完成《CS:GO×Portal》复刻独立游戏,直言“免费独立游戏开发时代正在加速到来”。
视觉生成场景中,K3细节表现力突出。樱花盆景SVG生成测试中,树干扭曲纹理、分层树冠的自然层次感,比Fable 5更贴合用户需求;水流物理仿真测试中,可精准模拟连续水波纹,保持物理逻辑自洽、视觉真实。
为还原真实用户体验,我们开展多场景标准化实测,覆盖行业报告、3D场景、前端工程、艺术创作、视频剪辑五大核心场景:
场景一:端侧AI行业研究报告生成
要求输出含时间线、树状图、瀑布图的标准化咨询风格行业报告。最终成品脉络清晰、产业链层级分明、市场数据维度完整,无章节割裂、逻辑冲突问题,信息密度充足,视觉排版协调规整。短板在于数据来源单一,仅引用智次方研究院、集微半导体大会资料,缺乏多源数据交叉验证,专业性略有欠缺。
场景二:Three.js微型3D城市生成
要求构建含错落建筑、街道、植被、穿城河流、昼夜循环系统的可探索微型城市。K3完整落地所有指定元素,画面配色舒适、整体设计感突出,但细节工程处理粗糙,出现树木、路灯遮挡道路的逻辑bug,场景精细化不足。
场景三:化学实验交互演示(前端工程测试)
该题目源自GitHub开源高阶前端测试题,重点考察计算几何、物理空间建模、动态粒子渲染能力。K3成品亮点鲜明:化学反应泡沫涌出、喷射、扩散节奏自然,粒子质感真实,贴合真实实验物理表现。核心短板为细节简化,瓶身做不透明处理,无法展示内部液面变化,物理渲染完整性不足。
场景四:莫奈《睡莲》沉浸式全景世界
模型精准还原印象派油画质感,场景风格统一,支持船速、天色、视角自定义调节,艺术表现力突出。但存在物理穿模bug,船只行进过程中会出现莲花穿透船体的错位问题,空间逻辑稳定性不足。
场景五:AI大会宣传视频剪辑
基于官方素材、海报、议程推文,制作30秒宣传短片。K3具备自主质检、纠错优化能力,不会直接交付初版成品,会主动排查问题并迭代优化。最终成片结构完整、配乐适配、叙事流畅,自带口播旁白,短板为旁白音量过小、辨识度低。同时耗时极长,全程近两小时,简单短视频人工效率反而更高,仅适合大批量素材全自动粗剪场景。
多轮实测统一印证核心问题:审美上限、创意落地能力是K3的长板,推理速度、工程可靠性是核心短板。同等复杂度场景,K3生成耗时是GPT-5.6 Sol的2-3倍,3D瀑布场景耗时近半小时,复杂视频剪辑耗时近两小时。
速度短板成因尚未被官方明确说明,行业推测三大核心原因:2.8万亿超大参数带来巨大推理计算量、默认Max深度思考模式拉高算力消耗、上线初期推理基础设施未完全扩容优化。后续Low/High轻量化模式上线后,速度体验有望得到改善。整体来看,K3是典型的“上限极高、体验未熟”的阶段性产品。
巅峰对决:Kimi K3 vs GPT-5.6 Sol 三大实战场景PK
为精准界定K3行业定位,我们选取当前最强闭源模型GPT-5.6 Sol,采用同一提示词、同一测试环境、零差异化条件,从3D游戏、物理仿真、视觉设计三大硬核场景开展盲测对比,直观展现两款模型的差异化优势与短板。
场景一:第一人称3D迷宫游戏生成
需求:WASD+鼠标操控、角落小地图探索、火炬动态照明、60秒倒计时、终点胜利弹窗,综合考验算法逻辑、3D渲染、交互设计、视觉氛围整合能力。
效率差距极为明显:GPT-5.6 Sol极速完成渲染,可即时交互游玩;Kimi K3耗时为对手2-3倍,等待成本极高。
成品质感差异显著:GPT-5.6 Sol风格写实常规、画面工整、零bug、稳定性拉满,是标准的“合格交付品”,无亮点也无短板;Kimi K3自带像素艺术风格,火炬光影、墙面纹理、场景氛围辨识度极强,视觉设计感、可玩性远超对手,唯一缺点是耗时太久。
PK结论:追求高效稳定、快速落地选GPT-5.6 Sol;追求视觉质感、独特创意、愿意承担时间成本,Kimi K3更具优势。
场景二:水杯倒水物理仿真建模
源自GitHub高阶工程测试题,核心考察数学建模、流体物理直觉、图形学渲染、边缘异常处理能力,是对模型工程严谨度的硬核考核。
GPT-5.6 Sol全程零失误,流体粒子贴合物理规则,装水无穿模、倒水轨迹自然,一次性交付完美可用成品,工程可靠性拉满。
Kimi K3出现明显翻车:首次生成出现两大硬伤,装水时粒子穿透杯壁泄漏,倒水时水流从杯底溢出,物理逻辑错乱。经人工提醒修正后才可达标,且迭代修正速度缓慢。即便官方重点宣传空间推理、视觉融合能力,但其物理仿真一次性准确率仍有待提升。
PK结论:工程严谨度、稳定性、零差错交付,GPT-5.6 Sol全面领先,K3高难物理仿真场景仍需打磨。
场景三:尼亚加拉大瀑布3D全景视觉设计
需求:Three.js全景渲染、玻璃质感绿水、透光水幕、自然彩虹、动态水汽效果,侧重视觉审美与细节还原。
GPT-5.6 Sol功能完整、逻辑无误,但审美敷衍,严格复刻需求却毫无质感,水幕呈现为普通白色粒子糊化效果,完全缺失玻璃透光、水汽氤氲的核心质感,且遗漏彩虹关键元素,成品可用性低。
Kimi K3精准拿捏审美质感,完整还原所有需求元素,独家补齐彩虹特效,绿水通透感、水幕层次、水汽动态效果高度逼真,艺术表现力远超对手。缺点依旧是速度,全景渲染耗时近半小时。
最终PK总结:GPT-5.6 Sol是极致稳定的“工程执行者”,快、稳、准,擅长标准化落地,但审美创意平庸;Kimi K3是天赋出众的“创意设计师”,质感、细节、审美全面领先,但速度慢、一次性准确率不足,需要人工二次校验迭代。
行业纵深:K3背后,月之暗面的IPO增长叙事
Kimi K3的产品迭代,本质是月之暗面资本增长故事的具象落地。公司融资节奏、估值增速、收入增速均处于行业第一梯队:2025年12月完成5亿美元C轮融资,投后估值43亿美元;2026年5月再获20亿美元融资,估值突破200亿美元;6月底新一轮融资启动,投前估值升至315亿美元,半年估值暴涨7倍。
估值暴涨依托实打实的收入增长。Kimi ARR(年度经常性收入)3月突破1亿美元,6月飙升至3亿美元,三个月实现三倍增长。更亮眼的是,这轮高速增长建立在持续涨价的基础上,从K2到K2.7 Code涨价60%仍保持增长,足以证明产品刚需性与用户付费粘性。不过K3本轮大幅涨价后,市场长期接受度、留存率仍有待验证。
收入结构呈现典型的工具出海特征:API贡献超七成总收入,且海外API收入已超越国内,摆脱本土市场依赖。付费数据印证海外认可度,Stripe数据显示,Kimi个人订阅用户1月支付订单环比暴涨8280%,2月再增123.8%,强势闯入Stripe全球榜单前十,成为首个登顶该榜单的中国AGI产品。
月之暗面已形成清晰的商业化飞轮路径:开源模型打响全球知名度→吸引海量开发者入驻→沉淀真实工作流落地场景→将高稳定性、高服务要求的开发者转化为付费API客户→营收反哺模型训练与算力基建,持续迭代升级。目前路径逻辑通顺,但开发者留存、API付费转化率、长期复购率仍需数据验证。
与此同时,AI行业统计口径正在重构,传统市场份额数据已然失效。IDC 2025年中国AI编程市场报告显示,行业总规模3.99亿元,阿里Qoder以47.6%份额登顶,智谱CodeGeeX位列第二。但真实商业价值完全错位,智谱半年ARR暴涨15倍至10亿美元,远超传统工具厂商,核心原因是行业价值从传统软件售卖,彻底转向API调用、订阅制的新型商业模式。
这也让月之暗面与智谱的行业竞争进入新阶段:不再比拼短期市场占有率,而是比拼增长质量、盈利可持续性、成本控制与技术壁垒续航。两者发展阶段差异显著,智谱已上市,需直面盈利、成本、营收兑现的硬核考核;月之暗面处于IPO前夕,核心讲述技术迭代、高速增长、长期空间的成长故事。
结语:国产大模型,正式进入全球第一梯队博弈
Kimi K3的发布节点极具战略意义,既是产品迭代,也是月之暗面港股IPO前的核心能力宣示。但资本市场最终考核的,从来不是榜单排名与炫酷demo,而是3亿ARR的可持续增长能力、用户留存稳定性、推理成本优化空间,以及技术优势的长期壁垒。
拉长时间轴,18个月前国产大模型的目标是追赶GPT-4,如今Kimi K3已直接对标GPT-5.6 Sol、Claude Fable 5全球顶级旗舰。它虽有速度慢、稳定性不足的明显短板,尚未做到全方位碾压海外产品,但已然证明:国产开源大模型,正式具备与全球顶级闭源模型正面博弈的硬实力,中外AI的技术代差,已被彻底抹平。
*题图来源于月之暗面Kimi微信服务号。
作者:欧皇娱乐
新闻资讯 News
- 00后炒存储:一个月走完老股民十...07-24
- 国狮法研 | AI研究院系列——从...07-24
- 实测Kimi K3:强得意外,慢得...07-24
- 从翻跟头到24小时连轴转:我们在...07-24

