GPT-6 系列模型选型指南
OpenAI 发布 GPT-6 系列模型指南,介绍初创公司如何选择模型、调整推理力度、改进提示词与技能、协调工具并准备生产工作流。
OpenAI 发布 GPT-6 系列模型指南,介绍初创公司如何选择模型、调整推理力度、改进提示词与技能、协调工具并准备生产工作流。
Ai2 开源 AstaBrief 8B,这是一款将研究问题和检索到的文献片段生成带引用报告的模型,也已作为 Asta 的 Fast mode 上线。Asta 全流程中,Fast mode 平均每份报告耗时 51.1 秒,Thinking mode 为 178.5 秒,约快 3.5 倍;模型从 Qwen3-8B 开始训练,并采用 SFT 和 DPO。
AstaBrief通过真实科研查询、引用质量筛选和偏好数据训练,展示了小型开放权重模型在科研报告生成中的一种提速路径。
NVIDIA DGX Spark 将推出 64GB 配置,搭载 DGX OS 和 NVIDIA AI 软件栈,支持在设备上运行最多 100-billion-parameter 模型。
文章对比了单台与双台 DGX Spark 64GB 的内存容量、模型规模支持和测试性能,呈现本地工作负载扩展的具体路径。
GPT-6 Astra Ultrafast 现已通过 OpenAI API 向开发者开放,并提供给符合条件的 ChatGPT Work 和 Codex 用户;运行于 NVIDIA Blackwell GPU,token 生成速度最高可达 Astra Standard 模式的 8x。
材料将最高 8x 的 token 生成速度提升与编程智能体的编辑、测试和调试循环联系起来,也说明了该模式的可用渠道。
Google DeepMind宣布推出前沿模型Gemini 4 Argon,称其可处理软件工程、企业知识工作和网络安全防御等复杂工作流。模型输出上限从64K提升至1M tokens,并在DeepSWE v1.1取得77.9%,在AutomationBench取得51.3%。
Argon把长程推理、软件工程和网络防御能力放在同一模型发布中,并披露了内部案例与评测结果,呈现其面向复杂工作流的应用方向。
Anthropic 发布 Claude Sonnet 5.5,这是 Claude 5.5 家族的第二款模型,较 Sonnet 5 生成速度提升 30% 以上,单项任务成本最高降低 30%。
文章将 Sonnet 5.5 与前代及 Opus 5.5 的评测、任务成本和速度并列呈现,帮助读者了解其定位及不同工作负载下的取舍。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,面向语音智能体与更自然的实时对话。
两款模型分别面向规模化语音交互和高复杂度任务,并公布了多个语音及任务基准成绩,呈现出不同的能力侧重。
DeepSeek 正式发布 DeepSeek-V4.1-Flash,这是其新架构系列中最小的模型,具备原生多模态视觉理解能力。模型已在 DeepSeek API 上线,调用最新版本需使用模型名 `deepseek-flash`;上一代 V4 Flash 和 V4 Flash Vision Exp 已退役,旧模型名暂时路由至 V4.1 Flash,API 价格也已相应下调。
这次更新同时涉及模型能力、API 调用名称、旧版路由和价格调整,便于开发者梳理升级时的兼容性与成本变化。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,两者由相同基础智能驱动,面向智能体工作流与网络安全任务。
文章并列呈现通用版与网络安全版的定位、基准表现和接入范围,便于比较两种模型在长程编码与防御任务中的取舍。
DeepSeek-V4-Pro 正式版已在 APP、Web 和 API 上线,API 调用方式不变,将模型名设为 `deepseek-v4-pro` 即可使用。
此次更新同时涉及 Agent 能力、Responses API 兼容、思考强度选项和峰谷定价,呈现了模型正式发布对接入与使用成本的多方面变化。