
这次,Agent离独立完成工作更近了。
最近,阿里的动作不少。
8月3日,旗下企业级Agent产品千问办公正式开启公测,个人和企业用户都可以通过官网体验。
目前网页版和独立PC客户端已经开放,钉钉PC端和手机端的内置入口也将在近期上线。

千问办公由QoderWork、MuleRun、悟空三款产品整合而来,将云端Agent、桌面端Agent和企业协同Agent放进了同一个产品里。
在日常使用中,它可以处理资料调研、文档表格制作、数据分析、网页开发和多模态内容生产等任务。
与普通通用Agent相比,千问办公更有望进入企业原有的协作环境,在获得授权之后调用企业数据,并参与实际的工作流程。

目前,千问办公已经开始与钉钉深度打通,也能通过多种IM,比如飞书,微信等通信链接方式进行对接Agent。
同一天,阿里还发布了新一代旗舰模型Qwen3.8-Max,并率先接入千问办公。
该模型的总参数规模达到2.4万亿,激活参数为95B,最高支持100万Token上下文,在编程、办公、科研和长周期任务等能力上进行了提升。

模型能力决定了Agent能够处理多复杂的任务,产品本身的工程能力,则决定了这些任务最后能否被稳定执行,并交付成可以直接使用的结果。
01
把B站视频变成学习工作台
千问办公比较有辨识度的一项能力,是可以把网页开发和部署一起完成。
用户不需要自己配置服务器、域名和数据库,只要说清楚需求,再提供对应的资料或Skill,它就能继续完成页面设计、功能开发、测试和上线。

平时在B站看课程、访谈或者产品测评时,视频里的有效信息往往散落在不同时间段。
想回顾某个观点,需要反复拖动进度条;想整理笔记,还要在播放器、文档和大模型之间来回切换。
这次让千问办公搭建了一个视频学习工作台。

试验地址:https://a6jgr8g8.qwenwork.host
用户只需要粘贴B站视频链接,页面就会自动解析视频标题、作者、播放数据、简介、章节和字幕,并将原本普通的视频页面重新整理成适合学习和回顾的界面。
工作台的左侧保留了视频播放器,下面集中展示视频的元数据、章节信息和重点片段。

右侧则提供字幕、对话和笔记三个区域,字幕按照时间顺序排列,每句话都带有对应时间戳,点击之后可以直接跳转到视频中的相关位置。
接入DeepSeek之后,工具还可以基于整段字幕提取视频里的重点内容,将关键资讯、观点、数据和风险提示用不同的标签标出来。

对话区域允许用户围绕视频继续提问,例如让模型总结核心观点、解释某个概念,或者整理视频中的产品信息。由于对话时会带上完整字幕内容,回答主要围绕当前视频展开,不需要用户再手动复制脚本。
笔记功能则和字幕、对话结果连接在一起。
用户可以摘录某一句字幕,将对话中的内容保存为笔记,也可以自己补充新的想法。

不同视频的笔记会分别保存,之后重新打开页面时仍然可以继续查看,还能导出为Markdown文件。
在正式开发页面之前,模型先研究了B站字幕的获取方式。常用的播放器接口虽然能够返回视频信息,但不少视频的字幕需要登录Cookie才能获取,并不适合直接做成一个公开分享的网页。
继续测试后,它找到了另一条无需登录也能读取字幕列表的接口,并打通了从视频链接、基础信息、字幕轨道到带时间戳字幕内容的完整链路。确定字幕能够稳定获取以后,才开始搭建网页和后端服务。

页面开发完成后,千问办公逐一测试了解析、字幕加载、翻译、视频问答、重点提取和笔记保存等功能。
所有功能在本地通过后,网页被部署到了线上,并且使用指定视频完整跑了一遍流程。
虽然目前只是第一版,但已经将视频解析、模型分析和个人知识整理连接成了一条可以实际使用的流程。

目前可以改进的地方也比较明显。比如可以进行多选字幕提问以及做笔记,数据库存储历史记录、以及多平台机制等等,让它更接近一个可以长期使用的学习工具。
02
一次完成26家公司的调研和选题分析
日常做行业调研时,最费时间的往往是批量收集资料、补全信息,再把结果整理成能直接使用的文档。
第二个任务让千问办公并使用浏览器能力调研YC最新一期S26批次中Consumer、Healthcare和Education三个赛道的全部产品。

在链接器里找到「浏览器」选择安装就好了,打开该插件的文件夹目录,并且在对应浏览器开启开启「开发者模式」,这里演示在chrome://extensions。

之后要拿到每家公司的产品简介和创始人信息,能查到额外联网资料的也一并收进来,最后要求输出一份新粗野风格的HTML报告和一份Excel表格,报告里还要写清楚哪些产品适合当作选题去创作,并且给出理由。
模型先导航到YC官网的创业公司目录页面,确认当前批次一共上线了179家公司,其中Consumer赛道8家,Healthcare赛道17家,Education赛道1家,正好是要找的目标范围。

接下来没有选择逐个点击查看这种笨办法,它找到了页面背后的Algolia检索接口,直接批量把二十六家公司的结构化数据一次性拉了下来。
拿到基础数据之后,又逐一访问了每家公司的详情页,把创始人的姓名、职位、背景信息补齐。对几家值得深挖的公司,还额外做了联网搜索。

报告生成之后,和大多数通用Agent一样,自己打开浏览器,把渲染出来的网页截了图,一屏一屏地检查,首屏的视觉效果、卡片区的排版、最后思考部分的黑底板块,逐一确认没有问题才算完成。

最终交付的两份文件里,HTML报告包含趋势速览、26张公司卡片,还有一个专门的思考板块,把26个产品按照适合创作的程度分成不同等级,每一个推荐都配了具体的角度和理由。

Excel表格则拆成了总览、全量数据、选题推荐三张工作表,方便直接拿去用在实际的内容生产流程里。
整份报告读下来,选题理由具体,时效性判断也在理,比如提到这一期Demo Day正在八月进行,中文深度报道几乎空白,属于内容首发的窗口期。

这种把调研、分析、落地建议全部接续完成的能力,比单纯抓一堆数据要有价值得多,也更贴近一个办公日常需要的东西。
前两个测试分别验证了单点技能和综合调研能力,最后一个场景想看的是多模态生产链条到底走得有多顺,毕竟这也是效率类产品最容易掉链子的地方。
03
在一个Agent里完成20秒电商宣传片
千问办公另一个卖点,是把文档、图片、视频、音频的生成能力全都收进了Agent内部;
文案、配图、出片这些环节不用来回切换工具了,基本上都有对应的Skill可以调用,并且都配置好了,只需要跟「千问办公」说出对应的需求就行。

虽然官方没有公布背后具体调用了哪些模型,但猜测调用的都是当下比较能打的选择,产品刚上线不久,随着后续迭代,稳定性和效果大概率还会继续往上走。
这次给的任务是给一款虚构的电商产品做一条二十秒的竖屏宣传片,产品是一款磁吸折叠随身小风扇;

要求支持手持、桌面摆放、磁吸固定这几种使用方式,机身可折叠,三档风力,USB-C充电;
还给了完整的分镜脚本,画面、字幕、配音都写清楚了,唯一的硬性要求是产品在每个镜头里的颜色、造型、结构必须保持一致。
中途生成的音频效果
往常在Agent里做这样一个电商视频,通常要挑生图接口,再挑视频接口,两边还得对比一下效果;
接着处理画面一致性,处理首尾帧的衔接,最后再进剪辑软件烧字幕、混音、导出,整套流程涉及不少工具的添加和人工判断。
这次交给千问办公之后,模型先锁定了产品和角色的设定,生成了产品主视觉图、四种形态的展示图,还有一张人物设定图,确认过一致性之后,才开始以这几张图作为参考去生成后续的分镜关键帧。








考虑到写实人脸在生成模型里容易出问题,模型主动选择了露手、过肩、下巴以下这类商业广告常用的构图方式来规避风险。
五张关键帧陆续生成完成后,模型逐一质检,发现画面右下角有生成留下的水印,于是统一做了裁剪处理,确认干净之后才进入视频生成阶段。
视频这一步用图生视频的方式生成了五段四秒的片段。声音则进行同步处理的,背景音乐用了专门的音乐生成模型,解说配音用语音合成完成。

所有素材备齐之后进入合成阶段,字幕分段烧录,片段拼接,片尾标题动画加进去,最后叠上解说和背景音乐完成混音渲染。
成片出来之后模型没有直接结束任务,而是抽帧检查了字幕和标题有没有错位,又单独听了一遍最后几秒的品牌名发音,确认没有问题才把成片交出来。
最终拿到的二十秒的竖屏视频,分辨率和帧率都符合标准,设定图、关键帧、成片这几个阶段的一致性保持得相当稳定,中途出现的水印、乱码这些问题也都被自己发现并且处理掉了。

这些需求分别对应个人效率、内容生产、创意生产这几种典型场景,覆盖面并不算窄。
千问办公相较同类Agent产品,比较突出的一点是它产出的成果可以直接部署使用,用户不用再操心服务器、域名、数据库这些技术门槛。

处理复杂调研任务的时候,Qwen3.8-Max模型也表现出主动寻找更高效取数方式的意识,没有死板地按照最笨的办法一步步执行。
多模态内容生产则在同一个Agent里完成,中途不用来回切换工具。
目前来看,千问办公更像是一套正在补齐企业能力的通用Agent产品。
现阶段个人用户已经可以直接使用它完成调研、开发、数据整理和内容生产等任务;网页端负责云端运行,桌面端则更适合处理本地文件和电脑里的软件。

https://qwenwork.cn
这也是千问办公与普通效率工具相比更值得关注的一点。
阿里云近几个季度在AI相关业务上的投入力度不小,Token需求也在持续放大,千问办公背后连着这样一套云端算力和模型迭代的体系,后续的更新速度值得期待。
对于经常要处理办公、内容、创意这几类任务的人来说,千问办公目前展现出来的水平,值得花时间去好好了解一番。
