Py学习  »  chatgpt

豆包2.1 Pro更新0915版支持多模态编程,Anthropic开源生物模型推理优化工具集,ChatGPT for Word正式上线

机器之心SOTA模型 • 1 周前 • 65 次点击  

9 月 18 日,今天关注的项目覆盖多模态编程、文档办公、视频编辑与科学计算:Anthropic 公开生物模型推理优化工具集,ChatGPT 支持在 Word 中起草和修改文档,Viggle Meridian 为已有视频提供新的视角与运镜方式。


💻 多模态编程


★ 豆包 2.1 Pro(0915 版本更新)

结合图片、视频与代码上下文处理开发任务,并支持更长周期的 Agent 协作。


本期补充关注豆包 2.1 Pro 的 0915 版本更新。新模型已进入火山方舟模型列表,支持百万 Token 上下文,覆盖多模态理解、Coding 工程实践,以及需要持续规划和工具调用的长程任务。

多模态编程是此次更新的重要方向。模型将视觉理解与代码开发结合,可围绕设计图、界面和视频信息理解需求,辅助前端开发与复杂工程任务。长上下文则为同时处理较多代码、文档及任务记录提供了空间。

Agent 能力同时强调异步子任务验收、证据核验和工具执行,帮助任务推进到可检查的结果。开发者可通过火山方舟接入新版;已固定旧版本的应用,需要检查调用时使用的模型标识。

上手门槛

开发接入:🟢 低|通过火山方舟 API 调用|按模型用量计费

模型入口:
https://ark.volcengine.com/region:cn-beijing/model/detail?name=doubao-seed-2-1-pro

API 文档:
https://www.volcengine.com/docs/82379/1298454

发布说明:
https://www.volcengine.com/docs/82379/1159178


🧬 生物模型加速


★ Anthropic 生物模型推理优化工具集 / FlashPairformer

加速蛋白质与基因组模型推理,并通过低内存模式扩大可处理的生物分子系统规模。


Anthropic 公开了一套生物模型推理优化工具集,仓库包含36 套优化工具,覆盖结构预测、蛋白质设计、蛋白质语言模型和基因组模型。项目方报告,Claude 在不到四周内完成了 30 多个模型的优化,允许少量数值差异时平均提速约 4 倍,保持输出完全一致时平均接近 2 倍。

其中,FlashPairformer 为结构预测模型中耗时较多的三角注意力与三角乘法提供专用计算内核。工具集还通过缓存重复计算、简化冗余路径等方式优化单个模型,并提供低内存模式,让更大的分子系统能够在单个 GPU 节点上运行。

新增代码采用 Apache 2.0,原模型代码及权重仍遵循各自许可。仓库定位为研究参考发布,Anthropic 已说明不计划持续维护;不同模型的加速幅度和资源需求也有差异。

上手门槛

自行部署:🔴 高|需与对应生物模型及 GPU 配置配套|模型权重需另行获取

安装与源码:
https://github.com/anthropics/uplifting-biomolecular-modeling

研究说明:
https://www.anthropic.com/research/claude-uplifts-biomolecular-modeling


📝 文档办公


★ ChatGPT for Word

在 Word 侧栏中起草、总结和修改文档,并调整标题、编号与基础格式。


ChatGPT 正式进入 Microsoft Word。用户打开文档后,可以在侧栏中根据笔记生成初稿、提炼执行摘要,或选中某一段文字,要求它压缩篇幅、调整表达和重新组织内容。Word 与 Excel、PowerPoint 使用同一个 ChatGPT 加载项。

该功能面向包括 Free 在内的 ChatGPT 各套餐提供,实际使用受套餐额度约束;组织用户还需要管理员允许加载项和对应功能。复杂表格、图表及精细排版仍可能需要手动调整,加载项中的对话也独立于 ChatGPT 原有聊天记录。

上手门槛

插件使用:🟢 较低|需安装 Word 加载项|组织账户受管理员设置限制

安装入口:
https://marketplace.microsoft.com/en-us/product/office/WA200010215

使用说明:
https://help.openai.com/en/articles/20001526-chatgpt-for-word


🎬 视频视角编辑


★ Viggle Meridian

为已有视频生成新的观看视角,独立控制镜头运动与时间节奏,实现环绕和子弹时间效果。


Viggle 发布 Meridian,让拍摄完成后的素材仍能调整镜头位置。用户可以围绕画面主体移动视角、推进或拉远镜头,也可以冻结某一时刻,再让摄像机继续运动;单张图片同样可以作为生成运镜的起点。

模型基于 MiniMax-H3,并使用 VGGT-Omega 估计深度与相机姿态。系统先渲染新视角的几何参考,再由视频模型补全缺失区域。官方实现支持约 3—10 秒、24fps 的输出,提供命令行工具及可自行部署的 Studio 原型。原画面中不可见的区域由模型生成,大幅度视角变化仍可能出现细节漂移或变形。

目前参考实现对显存要求较高:官方在单张 B200 上报告,73 帧输出峰值显存约 88GiB,243 帧约 113GiB。代码采用 Apache 2.0,权重遵循具有地域限制的 MiniMax H3 社区许可;另行获取的 VGGT-Omega 仅限非商业研究用途。

上手门槛

自行部署:🔴 极高|官方测试峰值显存约 88—113GiB|需另行申请 VGGT-Omega 权重

魔搭入口:
https://modelscope.cn/models/Viggle/Meridian

权重与源码:
https://huggingface.co/Viggle/Meridian

安装文档:
https://huggingface.co/Viggle/Meridian/blob/main/docs/installation.md


🖥️ 本地模型部署


★ PrismML Ternary Bonsai 2 27B

以约 5.95GB 的语言模型权重,在本地设备上运行 27B 级推理、编程和工具调用能力。


PrismML 发布 Ternary Bonsai 2 27B,基于 Qwen3.8-27B,将语言模型权重转换为三值表示,并开放 GGUF 与 MLX 版本。模型保留推理、编程和工具调用能力,搭配视觉组件后可以处理图片等多模态输入。

GGUF 提供两种打包方式:紧凑版本的语言权重约 5.95GB,另一版本约 7.21GB,在存储开销与运行速度之间提供不同选择。视觉组件需要额外加载,实际运行还会占用缓存和其他内存,因此不能把权重大小直接当成设备最低内存。

权重采用 Apache 2.0。官方提供安装脚本、本地聊天界面和服务启动流程,适合搭建本地助手及编程工具。当前 GGUF 文件需要使用PrismML 适配的 llama.cpp 运行时,官方脚本会获取对应版本。

上手门槛

自行部署:🟢 较低|提供官方安装脚本|需使用适配运行时并为缓存预留内存

GGUF 权重:
https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf

MLX 权重:
https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-mlx-2bit

安装与使用:
https://github.com/PrismML-Eng/Bonsai-demo


🩻 医学影像理解


★ 阿里达摩院 RADAR

从腹部增强 CT 与临床报告中学习图文对应关系,识别多类影像征象。


阿里达摩院公开腹部 CT 通用视觉语言模型 RADAR 的代码、预训练权重和推理文档。项目介绍称,模型使用超过 40 万例腹部增强 CT 检查、1500 万组解剖感知图文配对进行训练,直接从临床报告中学习,减少对逐项人工标注的依赖。

公开仓库包含影像及报告预处理、训练和推理流程,并提供样例 CT。推理示例会输出各项影像征象的阳性分数,适合医学影像研究团队评估模型在自身数据上的表现。官方文档说明,基础示例可在单张 A100 或 H20 上运行。

开放范围需要区分:代码采用 Apache 2.0,模型权重页标注 CC BY-NC-SA 4.0,包含非商业使用限制。当前交付是研究模型及相关工具,不能将其直接等同于已经完成临床准入的诊断产品。

上手门槛

自行部署:🔴 高|官方示例使用 A100 或 H20|需处理 CT 数据并遵守权重非商业许可

模型权重:
https://huggingface.co/radar-generalist/RADAR

推理文档:
https://github.com/alibaba-damo-academy/damo-radar/blob/main/docs/INFERENCE.md

项目源码:
https://github.com/alibaba-damo-academy/damo-radar


Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/201218