凯时AG

泉源:爆冷出局!德国点球大战不敌巴拉圭作者: 王文杰:

BUILD|我们让 Kimi K3、Qwen 3.8-Max 和 GLM 5.2 配合接受了一座屎山

作者 | 董道力、 骆轶航

Anthropic 亮出“最危险”的模子 Mythos 时,,,它的 CEO、坚定的反华头子 Dario Amodei 判断:中国模子追上这类能力还需 6 至 12 个月。。。

但厥后的事情各人已经知道了,,,智谱反手推出 GLM-5.2 追赶编程前沿,,,Kimi 又反反手拿出出 2.8 万亿参数的 K3,,,华尔街一度重演“DeepSeek 时刻”。。。

紧接着,,,阿里巴巴推出了 2.4 万亿参数的 Qwen3.8-Max-Preview。。。按官方说法:其综合性能仅次于 Fable 5,,,在全栈开发、数据剖析和 Office 事情流中已能对垒前沿模子。。。

Qwen3.8-Max-Preview 能把中国开源模子叙事讲下去么??

我们决议试一试,,,让近几个月三款旗舰级的中国开源模子 GLM-5.2、K3 和 Qwen3.8-Max-Preview 一起相助,,,开发我们硅星人/品玩正在改版的新网站。。。

为了弱化 Harness 的影响,,,凯时AG事情方式接纳了“模子+opencode”的组合。。。

值得指出的是:正在改版的硅星人网站是个半制品。。。网站项目已经包括 Next.js 前端、Payload CMS、Anime.js 页面动效等,,,也已经积累了现成的设计规范、历史代码和事情文档。。。

这个网站的问题很大,,,历史上多次举行前端和后台的开发和维护,,,屎山代码群集,,,结构臃肿,,,前端交互杂乱、虚伪的不可用的功效许多……问题散在各个角落,,,前端和后端 bug 交缠在一起,,,一句话,,,历史上的品玩网站,,,是你能见到的最糟糕的网站开发的范本。。。

它必需被改变。。。对模子来说,,,空缺项目没有历史肩负和屎山代码,,,往往可以自若施展;;;而半路项目通常是模子最严肃的父亲。。。它要求模子看得懂项目在当下状态,,,还要在不破损现有功效的情形下,,,举行准确的修改,,,属于屎上雕花的高难度操作。。。

接下来就交给 GLM 5.2、K3 和 Qwen 3.8- Max-Preview 了。。。这次网站改版眼下需要解决六个问题,,,我们逐一测试

谁看懂了项目目今的希望??

No.1 Qwen 3.8-Max

No.2 Kimi K3

No.3 GLM 5.2

这轮对应网站改版的第一个诉求:分清“现在有什么”和“文档里一经想做什么”。。。

接手半路项目,,,最怕的不是代码多,,,而是模子把旧文档当成目今需求,,,把已经完成的功效重新做一遍。。。以是,,,我没有连忙让三个模子修改代码,,,而是先让它们剖析项目,,,看看谁能更快摸清现状。。。

从天生速率来看,,,Qwen 3.8-Max-Preview 无可争议的最快,,,10 秒内解决,,,其次是 GLM-5.2,,,最后是 Kimi K3。。。再来看一下剖析效果,,,三个模子像三个差别气概的开发者。。。

GLM-5.2 像一位履历富厚的先生傅。。。它检查承重墙、水电管线和以前的施工图,,,准确地找到了 14 个 CMS 荟萃、Payload 版本锁定和数据库检查机制,,,对项目底层结构的明确最深。。。但这位先生傅翻图纸翻得太认真,,,把抽屉里四月份的旧方案也当成了目今施工妄想。。。GLM-5.2 将全文搜索列为待服务项,,,现实上,,,搜索、筛选和效果高亮早已完成。。。

Qwen 3.8-Max 更像天天待在现场的监工。。。它没有把屋子的每一根管线都研究清晰,,,却知道施工队最近在改哪面墙、铺哪块砖。。。它的天生速率最快,,,也最准确捉住了项目最近在做什么。。。

Kimi K3 则像一个一分钟带你看完屋子的中介。。。它用很短的篇幅讲清晰了房间结构,,,听起来清洁利落,,,却把 14 个 CMS 荟萃数成了 15 个,,,还把隔邻的事情纪录文件夹先容成了“文档客栈”。。。

在搞清现阶段需求上,,,Qwen 3.8-Max 得分最高,,,全貌感略欠,,,但最快也最精准地找到了问题。。。其次是 Kimi K3,,,它知道自己要做什么,,,但速率太慢了(这是 K3 最被诟病的地方),,,它看获得全局,,,但太粗心了,,,经常嘴瓢说错。。。而 GLM 5.2的问题较量严重,,,只有它,,,把旧文档当成了目今需求,,,把已经完成的功效重新做了一遍,,,这就属于搞不清晰状态了。。。

解决网站报错

No.1 Qwen 3.8-Max

No.2 GLM 5.2

No.3 Kimi K3

这轮对应第二个诉求:模子能不可把诊断酿成行动。。。

我启动了前端页面,,,却没有同时翻开 CMS,,,因此网页泛起报错。。。我把报错信息直接交给三个模子,,,让它们处理。。。

三个模子都定位到了问题,,,但后续行动显着差别:

Qwen 3.8-Max 快人一步,,,直接帮我启动了 CMS。。。Kimi K3 只给出解决方案,,,并没有现实执行。。。GLM-5.2 的处理速率较慢,,,等它准备启动 CMS 时,,,公共端口已经被 Qwen 3.8-Max 占用,,,于是它直接复用了 Qwen 3.8-Max 启动的服务。。。

在报错需求解决上,,,Qwen 3.8-Max 仍然排名第一,,,它启动了 CMS,,,并且最快。。。没什么可争的。。。GLM-5.2 排第二,,,慢了一步,,,值得扣分,,,但它发明端口被占后选择复用已有服务,,,而不是报错退出、也不是把别人的历程杀掉重启,,,这是准确且成熟的工程判断。。。而 Kimi K3,,,只交方案不下手,,,那就是没完成使命,,,只能排第三。。。

轮播图效果实现

No.1 GLM 5.2

No.2 Kimi K3

No.3 Qwen 3.8-Max

接下来,,,我们把三个模子切换到自力端口,,,测试它们准确修改前端的能力。。。

首先是快讯板块。。。我希望它实现自动轮播和无缝循环,,,但现有动效会让卡片逐张向左平移,,,播放到最后一张时,,,再让整个列表向右滑回开头。。。

promtps: 修改首页“现在爆发”板块,,,实现无缝无限轮播:所有卡片一连向左移动。。。第 08 张卡片移出后,,,第 01 张卡片从右侧自然接上,,,循环播放。。。不可在播放到最后一张后,,,让整个列表向右滑动返回开头;;;循环衔接时不可泛起停留、跳动或空缺。。。只修改前端轮播效果,,,不修改数据和后端。。。

轮播图是常见的网页信息展示页面,,,我们能否用一句话让大模子迁徙到自己网站??效果较量惨,,,三个模子最终或多或少都有些问题:

先看 Qwen 3.8-Max。。。它自作主张删除了鼠标拖动功效,,,严重扣分。。。Qwen 3.8-Max 耍了个小智慧,,,用长度伪装成循环,,,只在外貌上实现了循环联播,,,就像它没有把直线跑道改成环形跑道,,,只是在终点后面又铺了几段一模一样的路。。。只要用户有耐心看到最后就会发明,,,它只是复制了多份内容,,,把轮播轨道强行拉长。。。播放到最后一轮时,,,卡片仍然会重新跳回开头。。。

Kimi K3 做了相反的取舍。。。它把直线跑道改成了环形,,,却删掉了自动轮播功效。。。用户只有拖动鼠标,,,卡片才会继续前进。。。并且,,,在动画细节上不敷细腻,,,下一组卡片还没有完全进入画面,,,上一组卡片就提前退场,,,画面会跳帧,,,突然卡一下。。。

GLM-5.2 实现得最完整,,,该有的功效都有,,,它既保存了自动轮播,,,也支持鼠标拖动,,,还能一连循环。。。不过,,,它和 Kimi K3 保存同样的问题:旧卡片消逝得太快,,,循环衔接时仍然会突然跳一下,,,它离真正的无缝循环只差最后一点收尾。。。

GLM 5.2 可以排第一,,,它是唯逐一个功效清单完整的:自动播、可拖动、真循环,,,但我们要求在衔接时不可泛起停留、跳动或空缺,,,而它的接缝处照旧跳一下,,,需求解决未完整达标,,,但已经不错了。。。

Kimi K3 把最难的部分做对了:它也真的做到了自动轮播,,,但问题是删掉自动播放和衔接跳帧,,,一眼就能看出来工程没做完,,,它是一个忠实的半制品,,,可排第二。。。

Qwen 3.8 Max 这次问题就严重了,,,它删了鼠标拖动,,,自作主张改了需求,,,在真实协作里这是信任问题。。。跟严重的是:它的方案是伪装出来的,,,并且架构上是死路,,,要真正实现无缝循环,,,就得得推倒重来。。。一个看起来能用的过失谜底,,,比一个一眼就知道没做完的半制品危险得多。。。

修改现有功效

No.1 Qwen 3.8 Max

No.2 GLM 5.2

No.3 Kimi K3

接下来,,,我修改了“最新看法”部分的强调色和卡片动效,,,原版效果如下图。。。

prompts: 修改首页“最新看法”板块:将强调色改为科技蓝(#3157FF),,,应用于栏目的题、序号和悬停状态。。。?ㄆ鎏砬忱渡呖蚝驮步,,,鼠标悬停时稍微上浮、边框变蓝。。。其他结构和内容坚持稳固,,,只改前端。。。

这项测试考察的不是模子能不可认对颜色,,,而是修改规模是否完整、一致。。。现在的模子通常不会犯“让它改成蓝色,,,效果却改成红色”这种初级过失。。。真正难题的是,,,它能不可明确事实有哪些地方需要修改,,,并把一句相对宽泛的设计意见,,,拆解成一份准确修改清单。。。

使命外貌上只是把绿色换成蓝色,,,现实涉及问题、序号、卡片配景、边框、圆角和鼠标悬停状态。。。页面里尚有大卡片、小卡片、无图卡片等多种变体。。。任何一处遗漏,,,都会让新旧两套设计同时泛起在用户眼前。。。

Qwen 3.8-Max 的修改速率最快,,,文字颜色、配景颜色、边框和圆角基本都处理准确。。。美中缺乏的是,,,鼠标悬停后的交互色仍然是绿色,,,没有同步改成蓝色。。。也就是说,,,Qwen 3.8-Max 没有修改交互层的颜色。。。

Kimi K3 这一轮的问题很大。。。它修改了边框、圆角和其中一处颜色,,,其他部分险些没有转变。。。?赡苁怯捎 K3 以为审美有问题,,,不想改。。。

GLM-5.2 没有直接修改代码,,,而是先问了两个问题,,,例如哪些问题需要变色、没有序号的卡片应该如那里置。。。它明确询问过的部分完成得不错,,,未被方案笼罩的地方却泛起了遗漏。。。

最大卡片的鼠标悬停颜色仍然是绿色,,,只有小卡片酿成了蓝色,,,下方没有图片的卡片,,,交互颜色也完全没有修改。。。和 Qwen 3.8-Max 没有修改整个交互层的颜色差别,,,GLM-5.2 是挑着改颜色,,,统一种内容,,,只改一半。。。

这一轮,,,Qwen 3.8-Max 的整体完成度最高,,,只管遗漏了悬停色的修改。。。GLM-5.2 在已经确认的规模内做得更细,,,并且事先确认规模的行动很主要,,,这是它试图明确准确意图的反映,,,但它的执行起义了它的流程:问到的地方做得漂亮,,,没问到的地方彻底放飞了。。。相比之下,,,Kimi K3 不得不垫底,,,它显着没有吃透使命,,,只只动了边框、圆角和一处颜色。。。

磨练一下模子审美

No.1 Kimi K3

No.2 Qwen 3.8-Max

No.3 GLM 5.2

前两轮磨练的是准确执行,,,这一轮把问题反过来:不给参考谜底,,,让模子自己做审美判断。。。

模子审美是一件很主观的事,,,但三个模子体现出的气概差别依然很显着。。。Kimi 的前端审美经常受到用户赞美,,,因此我们让三款模子重新设计首页 Hero 区域。。。

promtps: 重新设计首页 Hero 区域,,,体现科技媒体的专业感、前沿感和编辑气质。。。保存现有问题、文案和按钮,,,但可以重新设计排版、字体层级、留白、色彩和动效。。。问题应成为第一视觉焦点,,,整体要有鲜明气概,,,但不可做成常见的科技公司官网模板。。。阻止霓虹渐变、玻璃拟态、粒子配景和过多装饰。。。动效应榨取、流通,,,并适配桌面端和移动端。。。只修改 Hero 区域前端,,,不修改导航栏、其他板块、内容数据和后端。。。

Qwen 3.8-Max 接纳了粗体极简风。。。

超大的玄色无衬线问题被分成三行,,,占有页面左侧的主要空间。。。配景险些没有装饰,,,只用短横线和文字链接建设层级。。。整体更靠近现代媒体首页,,,视觉重心完全落在问题上。。。

Kimi K3 接纳了科技极简风。。。

问题同样使用粗体无衬线字体,,,但增添了配景条理。。。左侧承载文案和蓝色按钮,,,右侧加入网格、细线与柔光组成的配景动效。。。相比 Qwen 3.8-Max,,,它使用了更多科技蓝和几何元素。。。

GLM-5.2 接纳了杂志编辑风。。。

问题被改成超大衬线斜体,,,并加入 EDITORIAL、EDITION 2026、01 FEATURE 等期刊元素。。。页面通详尽脱离线、大面积留白和底部转动提醒,,,形成了类似纸质杂志封面或专题头版的视觉结构。。。

这一轮很难选出唯一赢家。。。

Qwen 3.8-Max 最像现代内容媒体,,,Kimi K3 的科技感最强,,,GLM-5.2 则最有杂志封面的编辑气质。。。

它们也袒露了三种差别的明确,,,Qwen 3.8-Max 以为科技媒体首先是媒体,,,Kimi K3 以为科技媒体首先要有科技感,,,GLM-5.2 则把重点放在“编辑”两个字上。。。并且可以看出,,, K3 在前端动效上有自动性,,,而 Qwen 3.8-Max 和 GLM-5.2 就不会自动加动效。。。

若噬洗我们对硅星人自身的明确,,,我们给 K3 排第一,,,首先它的前端审美确实是有口皆碑的好,,,更主要的是它以为“科技感”是第一属性切中凯时AG要义,,,硅星人可以不是媒体,,,着实也越来越不像媒体,,,它的实质是 AI,,,不是媒体。。。这点 K3 明确和执行得最好。。。

第二给到 Qwen 3.8-Max,,,只管以为硅星人是媒体,,,但好歹是个现代内容媒体的气概。。。既然把它做得跟个杂志似的,,,那只好给 GLM 5.2 排第三了。。。

增添速速审核功效

改完前端,,,我们进入 CMS。。。

现在,,,文章审核只能点进文章逐篇审查。。。编辑看一篇、退出来、再翻开下一篇,,,修改的目的不在于多放两个按钮,,,而是重新组织审核流程:列表要集中展示待审核文章,,,详情要在目今页面睁开,,,正文要能直接预览,,,操作完成后还要同步更新文章状态和待审核数目。。。

当编辑按下“通过”后,,,文章状态、待审核列表和数目也要一起转变,,,像一个齿轮同时发动后面的整套流程。。。

这磨练的是模子处理 CMS 界面、数据和审核流程多端联动的能力。。。

promtps: 完善 CMS“审核事情台”集中显示所有待审核文章,,,并展示问题、作者、提交时间和目今状态。。。点击文章后,,,从右侧睁开详人情板,,,显示文章摘要、正文预览及相关信息,,,不跳转页面。。。详人情板提供“审核通过”和“驳回”操作。。。通事后文章进入待宣布状态;;;操作乐成后连忙更新列表和待审核数目。。。

出乎意料的是,,,这一轮最先完成使命的居然是 Kimi K3,,,一改此前在前端使命中速率最慢的体现。。。

很难据此判断 Kimi K3 是否真的内化了更多前端设计履历,,,但至少可以确定一件事:模子速率不是牢靠属性,,,它会随着使命类型爆发转变。。。

从效果来看,,,Qwen 3.8-Max 的侧边详情最完整。。。问题、作者、提交时间、状态、分类、摘要和正文预览所有泛起,,,底部也能直接执行“审核通过”或“驳回”,,,整体最靠近 Prompt 要求。。。

Kimi K3 的基本信息和操作功效较量齐全,,,但正文预览过于简化。。。用户仍然需要跳转到编辑页才华审查完整内容,,,没有完全知足“不跳转页面审查内容”的要求。。。

GLM-5.2 提供了摘要和牢靠操作栏,,,但正文预览区域主要被一个重大的图片加载失败占位笼罩。。。审核职员很难从中获得有用信息,,,是三个效果中偏离 Prompt 最显着的一个。。。

这轮悬念是不大的,,,Qwen 3.8- Max 排第一,,,Kimi K3 排第二,,,GLM 5.2 完成度较量低,,,排第三。。。

从左到右依次是 Qwen 3.8、K3、GLM 5.2

总结一下

几轮测试做完,,,没有一款模子能够重新赢到尾。。。

不过,,,Qwen 3.8-Max 延续 Kimi K3 和 GLM-5.2 带来的热度了吗??至少在这次测试中,,,它可以。。。

让我们总结一下各家在重构刷新我们网站上的体现:

Qwen 3.8-Max:

优势是快,,,并且对项目目今状态更敏感。。。它最先完成项目剖析,,,最先启动 CMS,,,在“最新看法”和“审核事情台”两项使命中也交出了完成度最高的效果。。。关于一个希望尽快看到可运行版本的用户来说,,,这种执行力很有吸引力。。。

但它的弱点同样来自这种快。。。为了实现轮播,,,Qwen 3.8-Max 删除了原有的拖动功效,,,又用复制大宗内容的方式伪装无限循环。。。

更像一名弦恢比读完资料再下手的工程师。。。它对代码结构明确最深,,,轮播功效完成得也最周全,,,Hero 区域的杂志编辑气概最有辨识度,,,谁再说 GLM-5.2 没有审美,,,确实有点冤枉它。。。

不过,,,它速率较慢,,,也容易被旧文档和自己的剖析牵着走。。。想得更多,,,并不包管每一次都能看清项目现在的状态。。。

它带来了最多的意外:剖析项目时最精练,,,数字过失也最多;;;修改前端时经常遗漏要害要求,,,却在 CMS 使命中第一个完成。。。它有时像一个灵感很好的设计师,,,有时又像一个没有耐心做完检查的实习生。。。

这次测试的效果也很难压缩成一个简朴排名,,,但若是用最质朴的名次积分(第一名 3 分、第二名 2 分、第三名 1 分)叠加了一下,,,效果仅供参考,,,它仅仅是在重构/刷新硅星人网站这一个项目上的详细体现,,,不代表模子的综合和整体性能。。。

点个“爱心”,,,再走 吧

@明治羽:利盈娱乐平台,,,韩国有便当店贴通告榨取主帅入内
@竺冠宇:小伙体重290斤血压血糖爆表
@程贵木:端午节假期海内出游1.24亿人次

【网站地图】