加入了个模型团队,搞到了几台八卡来做research(server内卡间是NVLink,server互联走的以太网,不考虑互联了)
这几天搭了很多模型来玩,GLM 5.2的fp8弄上了之后,好像并发也只能支持并行的batch=2的decode(?指的是 1M上下文满配情况下 只能热并发2
然后也跑了一些多模态模型,但是可玩度感觉有限,来问问佬友们有没有神们能充分利用机子的好玩点子
加入了个模型团队,搞到了几台八卡来做research(server内卡间是NVLink,server互联走的以太网,不考虑互联了)
这几天搭了很多模型来玩,GLM 5.2的fp8弄上了之后,好像并发也只能支持并行的batch=2的decode(?指的是 1M上下文满配情况下 只能热并发2
然后也跑了一些多模态模型,但是可玩度感觉有限,来问问佬友们有没有神们能充分利用机子的好玩点子
如果没有限制的话,跑涩图。涩涩是第一生产力(
那必不行的
,小命要紧 这种事情不可以的
自建本地模型公益站给佬们狠狠蹬![]()
![]()
我要是用不完的话,之后可以试一下的,敬请等待
期待一下 如果是公益站的话200K上下文我感觉就能满足多数需求了 同时parallel还能再高一点
本来想进来建议一下第一生产力的(乐
),结果佬这第一条就中了
woqu, 这是入职就能获得吗, 能问问哪个公司或者团队吗
我真的羡慕
了啊佬,这不部署个满血GLM5.2开始跑各种项目真是可惜了因为我没有
好奇是什么团队,也太舒服了吧 ![]()
OpenRouter 最近不是在搞多个模型组合嘛 好像有结果了 你也可以玩这个有开源项目
地址是https:删除//gith删除ub.com/openg删除uardrails/agen删除tfw
前排占位等佬部署glm公益站给我发key ![]()
正经来说还得是 research 啊
,搞批下游任务数据开始洗+训,就是没互联不太够超大规模的训