📡 Linux.do 频道日报 · 早报
有效消息 227 条
📡 Linux.do 频道日报 · 2026-08-27
单一频道综合 · 已去重整理
一、今日要闻
1. GLM-5.3-Flash 官宣,Ox Alpha“牛来”身份落地
• 智谱发布并开源 GLM-5.3-Flash,确认此前在 OpenRouter、OpenCode 等平台匿名测试的 Ox Alpha 即为该模型,社区持续多日讨论的“牛来”正式结束匿名期。
• 官方称其为 GLM-5 系列首个原生多模态模型,总参数 320B、激活参数 18B,采用 MIT 许可证,支持图像、视频等多模态能力与 1M token 上下文。
• 官方还称,模型服务已在中国 AI 芯片上规模化部署;发布前匿名测试流量也由国产算力承接。
• 为何重要:低激活参数、开放许可和大上下文的组合,令其直接进入本频道编码、Agent 与 API 成本比较的核心位置。
2. 能力与定价引发“新斩杀线”讨论,但实测评价并不完全一致
• 官方材料称 GLM-5.3-Flash 在多项基准和实际工作负载上优于 GLM-5.2,编程与 Agent 任务表现接近 Claude Opus 4.8;Artificial Analysis 更新后的讨论中,其综合指数被提及为 57 分。
• API 公开信息被多位用户整理为每 1M token 输入 0.15 美元、输出 0.50 美元、缓存输入 0.03 美元;国内官方限时折扣口径则约为输入 0.4 元、输出 1.4 元、缓存 0.115 元。
• 支持者认为,在限时五折、OpenRouter 半价和多渠道接入下,其综合性价比压过 DeepSeek-V4-Flash;质疑者则指出缓存价偏高、速度波动明显,复杂推理如“水杯题”仍可能失误。
• 补充:结论更接近“高性价比实用模型”,而非所有任务上的无条件替代;缓存率、思考强度和渠道限额会显著改变实际成本。
3. GLM 用量重置与套餐测算,老用户价值重新被审视
• 多名 GLM Coding Plan 用户反馈周额度或窗口额度在发布前后被重置,部分用户收到 7 天体验卡;也有反馈称体验卡很快耗尽、资源包状态不透明。
• 有用户实测 49 元 V2 套餐在 ZCode 中,约 300 万 token 仅消耗约 3%,据此推测五小时窗口理论量级可达约 1 亿 token;老 V1 用户则讨论到更高的历史套餐权益。
• 对老 V1 账户的收购报价引出价格信息差:按年续费月均价被称约 375.2 元,对比新套餐年付约 754.6 元,12 个月潜在价差约 4552.8 元。
• 为何重要:模型本身降本之外,订阅分档、历史权益、模型倍率和重置规则,正在成为实际可用量的决定因素。
4. GLM-5.3-Flash 快速覆盖 OpenRouter、OpenCode Go、Ollama Cloud 等渠道
• 用户反馈 OpenRouter 提供限时五折,OpenCode 已上线 GLM-5.3-Flash,OpenCode Go 也出现该模型;Ox Alpha 免费入口则逐步下线,DeepSeek-V4-Flash-Free 被重新提供。
• Ollama Cloud 同样接入该模型,并被标记为与 DeepSeek-V4-Flash 相近的 medium 用量等级;实测反馈速度约在 20 至 50 token/s 间波动。
• Claude Code 配置讨论显示,部分默认 Opus、Sonnet、Haiku 环境变量都映射至 GLM-5.3-Flash,用户关注怎样保留原 GLM-5.3 作为指定模型。
• 补充:免费匿名试用结束后,用户开始从“能否白用”转向“哪个渠道速度、缓存与配额最稳”。
5. Qwen3.8-Flash-Next 上线,本地大内存部署成为另一条路线
• 频道出现 Qwen3.8-Flash 与 Qwen3.8-Flash-Next 的免费额度和前端测试讨论。后者被描述为 125B 总参数、每 token 激活 6B,并配合约 51B 查表词库,面向“大内存、显存相对有限”的本地设备。
• 多份部署测试使用 4 张 A800 80GB 与 vLLM;256K 上下文下,FP8 未启用 MTP 约 83 token/s、启用后约 158 token/s,BF16 配合 CPU offload 与 MTP 的测试约 128 token/s。
• 4090D 本地部署 Qwen3.8-27B 的用户报告约 50 token/s,认为本地算力和隐私处理更可控;GGUF Q4_K_XL 版本因体积超过百 GB 也引起下载和硬件门槛讨论。
• 为何重要:社区的选择并非单纯追逐云端榜单,私有数据、延迟、长期调用量和现有硬件正在把本地模型拉回主流工作流。
6. Codex 五小时限制恢复,模型路由与“降智”焦虑加剧
• 多位 Plus、Team 用户确认 Codex 恢复五小时窗口限制,导致多账户切换、20x 升级、替代 Coding Agent 与稳定中转需求明显上升。
• 有用户发现新开 Team 被路由到 GPT-5.5-mini,另有围绕 GPT-5.6 Sol、Terra、Luna 的修复能力、限额和模型真伪的讨论。
• 社区流传通过询问模型名、未来日期事实和 Python 版本来检测“降智”的提示词;也有用户提醒该测试本身消耗高,且无法可靠判定路由、知识截止与模型质量。
• 补充:单次问答的模型自报和测试结果不足以证明供应商替换模型;更有价值的是固定任务集、请求日志、延迟、输出质量与账单的长期对照。
7. 前端生成测试成为模型能力的民间标尺
• “SVG 鹈鹕骑自行车”持续被用于比较 GLM、Qwen、DeepSeek 和未知模型的单次前端生成能力,评价维度从画面完整性延伸至交互、骨骼动画、几何约束与代码组织。
• GLM-5.3-Flash 在天气卡片、长颈鹿打螺丝、鹈鹕骑车等展示中获得较多正面反馈;但也有结果出现肢体错位、视觉粗糙或长时间思考后未有效改善的情况。
• Qwen3.8-Flash-Next 被认为输出速度快、愿意完成较完整页面,但部分测试中对题意的把握和最终质量仍有偏差。
• 为何重要:这类任务有直观展示效果,但提示词、工具链、思考档位、是否多轮修复都会影响结果,不能直接等同于通用编码能力排名。
8. 平台访问、账号、支付与风控问题集中出现
• 用户集中反馈 GPT、Google、Claude、Antigravity、Bybit、Spotify 等服务的登录、地区资格、付款拒绝、二次验证和账号风控问题。
• Gemini 学生优惠被讨论为已验证用户可能无需重复 SheerID 验证,但活动地区及支付方式仍有限制;部分用户称美国地区可获取一年 Pro,其他地区为一年 Plus,相关可用性需以官方页面为准。
• Google 新号风控、国内手机号无法接收验证、虚拟卡被支付平台拒绝等案例表明,跨区订阅和多账号使用的稳定性继续下降。
• 补充:频道中存在账号、支付渠道和规避风控的讨论;相关做法可能违反服务条款或带来资金、封号及隐私风险,不宜将个案经验视为可靠方案。
二、分主题深读
🤖 AI 与算力
• GLM-5.3-Flash 的技术定位:官方称模型采用结合稀疏注意力与线性注意力的混合架构,以降低长上下文成本;同时引入流形约束超连接,并使用 30T token 多模态预训练语料。社区最关注的不是参数规模本身,而是 18B 激活参数能否在编码任务中兑现低成本优势。
• 官方模型分层建议:有用户将 GLM Coding Plan 的使用策略归纳为,GLM-5.3-Flash High 用于常驻开发与难题,GLM-5.3 High 用于极难问题,GLM-5.3 Max 留给更高复杂度任务;这是基于官方对推理 token 与 Agent 准确率关系图的二次解读,并非统一配额承诺。
• GLM 成本口径需拆开看:一类测算直接按 API 输入、输出和缓存单价比较;另一类按订阅套餐和理论月 token 上限折算。前者受请求结构和缓存命中率影响,后者受限额、峰谷、倍率和实际吞吐影响,二者不能直接互换。
— message 1 of 3 —
有效消息 227 条
📡 Linux.do 频道日报 · 2026-08-27
单一频道综合 · 已去重整理
今日一句话:GLM-5.3-Flash 正式揭晓此前匿名爆火的 Ox Alpha 身份,凭借开源、多模态、1M 上下文与限时低价成为全站焦点;与此同时,Qwen3.8-Flash-Next、本地部署与 Coding Agent 配额、路由和支付稳定性问题,共同构成开发者的真实使用现场。
一、今日要闻
1. GLM-5.3-Flash 官宣,Ox Alpha“牛来”身份落地
• 智谱发布并开源 GLM-5.3-Flash,确认此前在 OpenRouter、OpenCode 等平台匿名测试的 Ox Alpha 即为该模型,社区持续多日讨论的“牛来”正式结束匿名期。
• 官方称其为 GLM-5 系列首个原生多模态模型,总参数 320B、激活参数 18B,采用 MIT 许可证,支持图像、视频等多模态能力与 1M token 上下文。
• 官方还称,模型服务已在中国 AI 芯片上规模化部署;发布前匿名测试流量也由国产算力承接。
• 为何重要:低激活参数、开放许可和大上下文的组合,令其直接进入本频道编码、Agent 与 API 成本比较的核心位置。
2. 能力与定价引发“新斩杀线”讨论,但实测评价并不完全一致
• 官方材料称 GLM-5.3-Flash 在多项基准和实际工作负载上优于 GLM-5.2,编程与 Agent 任务表现接近 Claude Opus 4.8;Artificial Analysis 更新后的讨论中,其综合指数被提及为 57 分。
• API 公开信息被多位用户整理为每 1M token 输入 0.15 美元、输出 0.50 美元、缓存输入 0.03 美元;国内官方限时折扣口径则约为输入 0.4 元、输出 1.4 元、缓存 0.115 元。
• 支持者认为,在限时五折、OpenRouter 半价和多渠道接入下,其综合性价比压过 DeepSeek-V4-Flash;质疑者则指出缓存价偏高、速度波动明显,复杂推理如“水杯题”仍可能失误。
• 补充:结论更接近“高性价比实用模型”,而非所有任务上的无条件替代;缓存率、思考强度和渠道限额会显著改变实际成本。
3. GLM 用量重置与套餐测算,老用户价值重新被审视
• 多名 GLM Coding Plan 用户反馈周额度或窗口额度在发布前后被重置,部分用户收到 7 天体验卡;也有反馈称体验卡很快耗尽、资源包状态不透明。
• 有用户实测 49 元 V2 套餐在 ZCode 中,约 300 万 token 仅消耗约 3%,据此推测五小时窗口理论量级可达约 1 亿 token;老 V1 用户则讨论到更高的历史套餐权益。
• 对老 V1 账户的收购报价引出价格信息差:按年续费月均价被称约 375.2 元,对比新套餐年付约 754.6 元,12 个月潜在价差约 4552.8 元。
• 为何重要:模型本身降本之外,订阅分档、历史权益、模型倍率和重置规则,正在成为实际可用量的决定因素。
4. GLM-5.3-Flash 快速覆盖 OpenRouter、OpenCode Go、Ollama Cloud 等渠道
• 用户反馈 OpenRouter 提供限时五折,OpenCode 已上线 GLM-5.3-Flash,OpenCode Go 也出现该模型;Ox Alpha 免费入口则逐步下线,DeepSeek-V4-Flash-Free 被重新提供。
• Ollama Cloud 同样接入该模型,并被标记为与 DeepSeek-V4-Flash 相近的 medium 用量等级;实测反馈速度约在 20 至 50 token/s 间波动。
• Claude Code 配置讨论显示,部分默认 Opus、Sonnet、Haiku 环境变量都映射至 GLM-5.3-Flash,用户关注怎样保留原 GLM-5.3 作为指定模型。
• 补充:免费匿名试用结束后,用户开始从“能否白用”转向“哪个渠道速度、缓存与配额最稳”。
5. Qwen3.8-Flash-Next 上线,本地大内存部署成为另一条路线
• 频道出现 Qwen3.8-Flash 与 Qwen3.8-Flash-Next 的免费额度和前端测试讨论。后者被描述为 125B 总参数、每 token 激活 6B,并配合约 51B 查表词库,面向“大内存、显存相对有限”的本地设备。
• 多份部署测试使用 4 张 A800 80GB 与 vLLM;256K 上下文下,FP8 未启用 MTP 约 83 token/s、启用后约 158 token/s,BF16 配合 CPU offload 与 MTP 的测试约 128 token/s。
• 4090D 本地部署 Qwen3.8-27B 的用户报告约 50 token/s,认为本地算力和隐私处理更可控;GGUF Q4_K_XL 版本因体积超过百 GB 也引起下载和硬件门槛讨论。
• 为何重要:社区的选择并非单纯追逐云端榜单,私有数据、延迟、长期调用量和现有硬件正在把本地模型拉回主流工作流。
6. Codex 五小时限制恢复,模型路由与“降智”焦虑加剧
• 多位 Plus、Team 用户确认 Codex 恢复五小时窗口限制,导致多账户切换、20x 升级、替代 Coding Agent 与稳定中转需求明显上升。
• 有用户发现新开 Team 被路由到 GPT-5.5-mini,另有围绕 GPT-5.6 Sol、Terra、Luna 的修复能力、限额和模型真伪的讨论。
• 社区流传通过询问模型名、未来日期事实和 Python 版本来检测“降智”的提示词;也有用户提醒该测试本身消耗高,且无法可靠判定路由、知识截止与模型质量。
• 补充:单次问答的模型自报和测试结果不足以证明供应商替换模型;更有价值的是固定任务集、请求日志、延迟、输出质量与账单的长期对照。
7. 前端生成测试成为模型能力的民间标尺
• “SVG 鹈鹕骑自行车”持续被用于比较 GLM、Qwen、DeepSeek 和未知模型的单次前端生成能力,评价维度从画面完整性延伸至交互、骨骼动画、几何约束与代码组织。
• GLM-5.3-Flash 在天气卡片、长颈鹿打螺丝、鹈鹕骑车等展示中获得较多正面反馈;但也有结果出现肢体错位、视觉粗糙或长时间思考后未有效改善的情况。
• Qwen3.8-Flash-Next 被认为输出速度快、愿意完成较完整页面,但部分测试中对题意的把握和最终质量仍有偏差。
• 为何重要:这类任务有直观展示效果,但提示词、工具链、思考档位、是否多轮修复都会影响结果,不能直接等同于通用编码能力排名。
8. 平台访问、账号、支付与风控问题集中出现
• 用户集中反馈 GPT、Google、Claude、Antigravity、Bybit、Spotify 等服务的登录、地区资格、付款拒绝、二次验证和账号风控问题。
• Gemini 学生优惠被讨论为已验证用户可能无需重复 SheerID 验证,但活动地区及支付方式仍有限制;部分用户称美国地区可获取一年 Pro,其他地区为一年 Plus,相关可用性需以官方页面为准。
• Google 新号风控、国内手机号无法接收验证、虚拟卡被支付平台拒绝等案例表明,跨区订阅和多账号使用的稳定性继续下降。
• 补充:频道中存在账号、支付渠道和规避风控的讨论;相关做法可能违反服务条款或带来资金、封号及隐私风险,不宜将个案经验视为可靠方案。
二、分主题深读
🤖 AI 与算力
• GLM-5.3-Flash 的技术定位:官方称模型采用结合稀疏注意力与线性注意力的混合架构,以降低长上下文成本;同时引入流形约束超连接,并使用 30T token 多模态预训练语料。社区最关注的不是参数规模本身,而是 18B 激活参数能否在编码任务中兑现低成本优势。
• 官方模型分层建议:有用户将 GLM Coding Plan 的使用策略归纳为,GLM-5.3-Flash High 用于常驻开发与难题,GLM-5.3 High 用于极难问题,GLM-5.3 Max 留给更高复杂度任务;这是基于官方对推理 token 与 Agent 准确率关系图的二次解读,并非统一配额承诺。
• GLM 成本口径需拆开看:一类测算直接按 API 输入、输出和缓存单价比较;另一类按订阅套餐和理论月 token 上限折算。前者受请求结构和缓存命中率影响,后者受限额、峰谷、倍率和实际吞吐影响,二者不能直接互换。
— message 1 of 3 —