先放结论
在私人代码bench上已经可以做到和sonnet 4.6平起平坐的分数。考虑到实际项目上,预估在4.5和4.6之间。
有一些代码确实眼前一亮
甚至还做了无限地图 不过有些情况还是会有一些小问题,造成bug,需要多次返修,也是丢分的原因之一
该夸夸该骂骂,你智谱这个价格,还闭源,那我就要用闭源模型的标准要求你了 ![]()
0.72/2.3 → 0.96/3.2刀的价格还是小贵啊
先放结论
有一些代码确实眼前一亮
该夸夸该骂骂,你智谱这个价格,还闭源,那我就要用闭源模型的标准要求你了 ![]()
这玩意是闭源的吗?
我也花了10刀调用了一下,有claude4.5的水准了,可惜放在cc里面似乎表现比较一般,修了两个小bug就花了10刀,用Codex还是成本太低了 ![]()
按照官方说法是目前闭源,会把成果集成到下一个开源模型中
这么强?
牛,这有些无敌啊
这些是什么模型
DSv4lite-0308
Pony-alpha
pony是glm5的测试版,dsv4lite是官网上灰度测试的模型
应该会吧…只是没这么快,智谱一贯不都是开源吗
所以我自己是,GLM速拉,GPT做审查
Pony-alpha是GLM-5
Pony-alpha-2是GLM-5-Turbo
真这么牛叉啊
还不错啊
这么强的嘛 就是价格略贵
题目:单文件实现高性能、安全计算的响应式电子表格
请在一个单文件 HTML 中(包含内部的 CSS 和 JS),使用纯原生 JavaScript 实现一个 100x100(10000个单元格) 的响应式电子表格。请严格满足以下要求,禁止使用任何第三方库:
渲染一个包含表头(列标 A-CV,行标 1-100)的网格。
性能要求:禁止为 10000 个单元格单独绑定事件,必须使用**事件委托(Event Delegation)**处理点击和输入。修改单个单元格时,禁止全量重新渲染 DOM,只能精确更新受影响的单元格节点。
2. 数据、公式与安全(编译原理测试点):
支持纯数字和公式(以 = 开头)。
支持基本加减乘除(如 =A1+B2*2)。
新增范围聚合函数:支持 SUM(start:end) 和 AVG(start:end),例如 =SUM(A1:B3),要求能正确展开二维范围内的所有单元格依赖。
极度严格的安全要求:绝对禁止使用 eval()、new Function() 或 setTimeout 变体来执行公式计算。 你必须实现一个微型的词法分析器/解析器(如调度场算法 Shunting-yard 或简单的 AST 解析)来计算数学表达式。
3. 核心算法要求(图论与健壮性):
级联响应式更新:实现精准的依赖追踪。A1 更新时,只有直接或间接依赖 A1 的单元格才触发重新计算和 DOM 更新。
循环依赖检测:精准检测 A 依赖 B,B 依赖 A(或更深层环)。发现循环依赖时,相关单元格显示 !CYCLE 并中止计算,绝对不能引发调用栈溢出(Stack Overflow)。
错误传播:如果 A1 出现错误(如 !CYCLE 或解析错误 !ERR),依赖 A1 的 C1 也应显示 !ERR。
请确保 UI 简洁可用(建议给表格加上基础边框和高亮),代码结构清晰,严格遵守“禁止 eval”和“防死循环”的底线。
感觉你的题目都看不出来区分度,我这道题测了几个模型,有明显区分度,你可以试试让gpt去当裁判打分