第 5 期 · 2026-W34 2026年08月16日 — 08月23日
✦ 本周速览

这期周刊聚焦AI开源世界的最新脉动,从大模型竞技场到工程实践干货一应俱全。本周头条非 **MoneyPrinterTurbo** 莫属——这个能一键生成短视频的神器再次证明了AI自动化工具的爆发力,绝对值得你第一个点开。此外,从 Frontier Radar 对中美AI格局的深度观察,到海外开发者"榨干"Qwen3.8-27B性能的实战分享,本期的每一篇都值得慢慢读。

harry0703/MoneyPrinterTurbo 配图
头 条

harry0703/MoneyPrinterTurbo

核心内容
MoneyPrinterTurbo 是一个开源的一站式 AI 短视频生成工具,用户只需输入视频主题或关键词,即可自动完成脚本生成、素材匹配、字幕制作、背景音乐配置并合成高清短视频。项目提供 WebUI 和 API 两种使用方式,已积累 697 次提交,开发活跃。
为什么重要
它大幅降低了短视频创作的技术门槛和时间成本,体现了生成式 AI 在内容生产领域的落地趋势——从"辅助创作"走向"端到端自动化生产"。
关键洞察
核心价值在于"全链路集成":将脚本、素材、字幕、配音、合成等原本分散的环节打包为一个自动化流程,且通过开源+API 的方式使其可被二次开发和集成到更大规模的内容生产管线中。
潜在影响
短视频创作者、自媒体运营者和营销团队将能以极低边际成本批量生产内容,可能加剧内容平台的内容泛滥与同质化,同时推动 AI 内容生成工具的标准化和普及。

History

697 Commits

展开全文收起全文剩余 150 段 · 约 17 分钟

MoneyPrinterTurbo 💸

一站式 AI 短视频生成工具

只需提供视频主题或关键词,即可自动生成视频脚本、匹配素材、生成字幕和背景音乐,并合成高清短视频。

简体中文 | English | 版本发布 | 问题反馈

界面预览 🖥️

WebUI

API

特别感谢 ❤️

感谢 Kimi 赞助本项目!Kimi K3 是 Moonshot AI 迄今能力最强的模型,也是全球首个开源 3T 级模型,拥有原生视觉能力与 100 万 Token 上下文,在知识工作、推理和长周期任务中展现前沿性能。在 MoneyPrinterTurbo 中,K3 能直接驱动视频创作,不仅撰写视频文案,还会提炼素材搜索关键词、决定成片画面;对内容理解越准确,匹配到的素材就越贴题。

MoneyPrinterTurbo 用户专属优惠:新用户通过专属链接注册,首次成功充值可获充值金额 10% 的 API 额度,最高赠送 ¥1000。活动截至 2026 年 9 月 30 日。前往 Kimi 开放平台(中文站|Global)体验 API。

作者的另一个开源项目:MangoDisk ⭐

适用于 macOS 和 Windows 的安全优先开源磁盘清理与空间分析工具

查找大文件和重复文件,清理缓存与应用残留,安全释放磁盘空间。

查看 GitHub 开源项目

功能特性 🎯

提供 AI Agent、WebUI、API 和 CLI 四种使用方式,代码按控制器、服务和模型等职责分层

支持 AI 自动生成视频脚本,也可以使用自定义脚本

支持多种 高清视频 尺寸

竖屏 9:16,1080x1920

横屏 16:9,1920x1080

支持 批量视频生成,可以一次生成多个视频,然后选择一个最满意的

支持 视频片段时长 设置,方便调节素材切换频率

支持 多语言视频脚本 生成

支持 Edge TTS、Azure Speech、SiliconFlow、Google Gemini、小米 MiMo、ElevenLabs 和 Chatterbox 语音合成,可实时试听

支持 字幕生成,可调整字体、位置、颜色、大小、描边和背景样式

支持 背景音乐,可随机选择或使用指定音乐,并调整音量

支持使用自己的 本地素材,也可从 Pexels、Pixabay 和 Coverr 获取可免费使用的高清素材

支持 Kimi / Moonshot AI、OpenAI、Google Gemini、DeepSeek、阿里云通义千问、Microsoft Azure OpenAI、火山引擎方舟、xAI Grok、MiniMax、小米 MiMo 等主流模型服务,并兼容 Cloudflare AI Gateway、魔搭 ModelScope、AIHubMix、AIML API、EvoLink、Ollama、OneAPI、LiteLLM、Groq、Pollinations AI 等统一网关、聚合平台和本地运行环境

支持一键 跨平台发布,生成完成后可自动上传至 TikTok、Instagram 和 YouTube Shorts

作品展示 🎬

以下示例均由 MoneyPrinterTurbo 实际生成。

竖屏 9:16

横屏 16:9

配置要求 📦

建议系统:Windows 10、macOS 11.0 或更高版本,以及主流 Linux 发行版

本地部署需要 Python 3.11 或更高版本,推荐使用 Python 3.11

GPU 不是必需项,但如果你希望本地转录、更快的视频处理或更顺畅的批量生成体验,建议使用带显存的独立显卡

如果你主要依赖云端 LLM、云端 TTS 和在线素材源,CPU 与内存比 GPU 更重要

如果你启用 faster-whisper、批量生成或更重的本地处理链路,GPU 会明显提升速度

快速开始 🚀

推荐使用方式

不想手动安装和配置:直接使用 AI Agent 生成视频

Windows 用户:优先使用一键启动包,适合快速体验

macOS / Linux 用户:优先使用 uv 进行本地部署

想要隔离运行环境:优先使用 Docker 部署

使用 AI Agent 生成视频

如果你的 AI Agent 支持读取 Skill 文档并操作本地终端,可以直接发送下面这段话。Agent 会自动完成安装、配置和视频生成;只有缺少必要的 API Key 时才会向你询问,完成后会返回生成的视频文件路径。目前支持 macOS 和 Windows。

使用这个 Skill:https://raw.githubusercontent.com/harry0703/MoneyPrinterTurbo/main/docs/skill/SKILL.md 帮我生成一个主题为“人工智能如何改变普通人的日常生活”的视频。

在 Google Colab 中运行

免去本地环境配置,点击直接在 Google Colab 中快速体验 MoneyPrinterTurbo

Windows 一键启动包

下载一键启动包,解压直接使用(路径不要有 中文、特殊字符、空格)

GitHub Releases:https://github.com/harry0703/MoneyPrinterTurbo/releases/latest

下载后,建议先双击执行 update.bat 更新到最新代码,然后双击 start.bat 启动

启动后,会自动打开浏览器(如果打开是空白,建议换成 Chrome 或者 Edge 打开)

安装部署 📥

前提条件

本地部署需要 Python 3.11 或更高版本

Windows 用户建议避免使用包含中文、特殊字符或空格的项目路径

① 克隆代码

git clone https://github.com/harry0703/MoneyPrinterTurbo.git

② 配置项目(可选)

首次启动时,项目会根据 config.example.toml 自动创建 config.toml。大模型 Provider、素材来源和相关 API Key 可以直接在 WebUI 的基础设置中配置。

Docker 部署 🐳

① 启动 Docker

如果未安装 Docker,请先安装 https://www.docker.com/products/docker-desktop/

Windows 用户可以参考微软的文档:

https://learn.microsoft.com/zh-cn/windows/wsl/install

https://learn.microsoft.com/zh-cn/windows/wsl/tutorials/wsl-containers

cd MoneyPrinterTurbo docker compose -f docker-compose.release.yml up

默认推荐使用 docker-compose.release.yml,它会直接拉取 GitHub Container Registry 上的预构建镜像:ghcr.io/harry0703/moneyprinterturbo:latest。 如果你需要本地重新构建镜像,可以继续使用 docker compose up。 首次启动前,请将 config.example.toml 复制为 config.toml,供容器挂载使用。

② 访问 WebUI

打开浏览器,访问 http://127.0.0.1:8501

③ 访问 API 文档

打开浏览器,访问 http://127.0.0.1:8080/docs 或者 http://127.0.0.1:8080/redoc

手动部署 📦

视频教程

完整的使用演示:https://v.douyin.com/iFhnwsKY/

如何在 Windows 上部署:https://v.douyin.com/iFyjoW3M

① 创建虚拟环境

推荐使用 uv 管理 Python 环境和依赖。项目支持 Python 3.11 或更高版本,以下示例使用 Python 3.11。

git clone https://github.com/harry0703/MoneyPrinterTurbo.git cd MoneyPrinterTurbo uv python install 3.11 uv sync --frozen

如果你暂时不使用 uv,也可以继续使用 venv + pip

python3.11 -m venv .venv source .venv/bin/activate pip install -r requirements.txt

说明:

pyproject.toml 是主依赖定义文件

uv.lock 是锁文件,建议默认执行 uv sync --frozen

requirements.txt 仅保留给旧的 pip 安装方式兼容使用

② 启动 WebUI 🌐

注意需要到 MoneyPrinterTurbo 项目 根目录 下执行以下命令

Windows

.\webui.bat

在 CMD 中也可以执行 webui.bat。 webui.bat 会优先使用项目 .venv 或一键包内置 Python;如果没有找到项目 Python,但已安装 uv,会自动切换为 uv run streamlit。 如需允许局域网内其他设备访问 WebUI,可以先执行 set MPT_WEBUI_HOST=0.0.0.0,再运行 webui.bat。

macOS 或 Linux

sh webui.sh

脚本会自动使用项目虚拟环境或 uv,并选择可用的本地端口。如需允许局域网内其他设备访问,可以执行:

MPT_WEBUI_HOST=0.0.0.0 sh webui.sh

启动后,会自动打开浏览器(如果打开是空白,建议换成 Chrome 或者 Edge 打开)

③ 启动 API 服务 🚀

uv run python main.py

如果你已经手动激活了虚拟环境,也可以直接执行:

python main.py

④ 纯命令行方式(无浏览器)⌨️

如果你无法使用浏览器或端口转发,可以直接在命令行生成视频。最简单的完整视频生成命令如下:

uv run python cli.py --video-subject "人工智能如何改变日常生活"

如需查看完整命令、参数说明和使用方法,可以执行:

uv run python cli.py --help

语音合成 🗣

默认使用免费的 Edge TTS,在 WebUI 中显示为 Azure TTS V1。项目同时支持 Azure TTS V2、SiliconFlow TTS、Google Gemini TTS、小米 MiMo TTS、ElevenLabs TTS、自托管 Chatterbox TTS,以及无配音模式。

可直接在 WebUI 中选择 Provider 和音色,并按照界面提示填写所需凭据。Edge TTS 不需要 API Key;Azure TTS V2 及其他云端服务需要对应平台的凭据。Edge TTS 音色可查看:音色列表。

字幕生成 📜

当前支持两种字幕生成方式:

edge:使用 TTS 时间戳生成字幕,速度快,不需要 GPU,默认使用该模式。

whisper:使用本地 faster-whisper 转写音频,适用于需要更准确字幕时间轴的场景。首次使用时需要下载模型。

在 config.toml 中修改 subtitle_provider 即可切换模式。Whisper 默认使用约 3 GB 的 large-v3;如需更小、更快的模型,可以使用约 1.6 GB 的 large-v3-turbo:

[app] subtitle_provider = "whisper" [whisper] model_size = "large-v3-turbo"

首次使用 Whisper 时,程序会自动从 Hugging Face 下载模型。如果当前网络无法自动下载,可以从 Hugging Face 手动下载 whisper-large-v3。

下载并解压后,将整个目录放到 .\MoneyPrinterTurbo\models,最终路径应为 .\MoneyPrinterTurbo\models\whisper-large-v3:

MoneyPrinterTurbo ├─models │ └─whisper-large-v3 │ config.json │ model.bin │ preprocessor_config.json │ tokenizer.json │ vocabulary.json

背景音乐 🎵

用于视频的背景音乐,位于项目的 resource/songs 目录下。

当前项目里面放了一些默认的音乐,来自于 YouTube 视频,如有侵权,请删除。

字幕字体 🅰

用于视频字幕的渲染,位于项目的 resource/fonts 目录下,你也可以放进去自己的字体。

常见问题 🤔

如何发布到 TikTok、Instagram 或 YouTube Shorts?

注册 Upload-Post 账号并获取 API Key,然后在 config.toml 的 [app] 下添加以下配置:

[app] upload_post_enabled = true upload_post_api_key = "your-api-key" upload_post_username = "your-username" upload_post_platforms = ["tiktok", "instagram", "youtube"] upload_post_auto_upload = true upload_post_youtube_privacy_status = "public"

保存配置并重启项目。视频生成完成后,程序会自动发布到已配置的平台。YouTube 可见性可设置为 public、unlisted 或 private。

RuntimeError: No ffmpeg exe could be found

通常情况下,ffmpeg 会被自动下载,并且会被自动检测到。 但是如果你的环境有问题,无法自动下载,可能会遇到如下错误:

RuntimeError: No ffmpeg exe could be found. Install ffmpeg on your system, or set the IMAGEIO_FFMPEG_EXE environment variable.

此时你可以从 https://www.gyan.dev/ffmpeg/builds/ 下载ffmpeg,解压后,设置 ffmpeg_path 为你的实际安装路径即可。

[app] # 请根据你的实际路径设置,注意 Windows 路径分隔符为 \\ ffmpeg_path = "C:\\Users\\harry\\Downloads\\ffmpeg.exe"

OSError: [Errno 24] Too many open files

这个问题是由于系统打开文件数限制导致的,可以通过修改系统的文件打开数限制来解决。

查看当前限制

ulimit -n

如果过低,可以调高一些,比如

ulimit -n 10240

Whisper 模型下载失败

LocalEntryNotFoundError: Cannot find an appropriate cached snapshot folder for the specified revision on the local disk and outgoing traffic has been disabled. To enable repo look-ups and downloads online, pass 'local_files_only=False' as input.

或者

An error occurred while synchronizing the model Systran/faster-whisper-large-v3 from the Hugging Face Hub: An error happened while trying to locate the files on the Hub and we cannot find the appropriate snapshot folder for the specified revision on the local disk. Please check your internet connection and try again. Trying to load the model directly from the local cache, if it exists.

解决方法:查看如何从 Hugging Face 手动下载模型

反馈建议 📢

可以提交 issue 或者 pull request。

许可证 📝

点击查看 LICENSE 文件

Star History

参考来源: GitHub Trending
AI
Frontier Radar #4: China has caught up, so what's left of the Western AI lead? 配图

Frontier Radar #4: China has caught up, so what's left of the Western AI lead?

核心内容
文章分析了以Kimi K3、GLM-5.3、Qwen3.8-Max为代表的中国开源模型已在几乎所有主流基准测试中逼近美国顶尖模型,从DeepSeek R1时期的局部追赶演变为全面对标。西方实验室指责中国同行存在"蒸馏"(用西方模型当教师)和"刷榜优化"(benchmaxxing)行为,但文章指出无论指控是否成立,结论都一样:仅靠模型性能的领先优势已无法形成可防守的商业护城河。
为什么重要
这反映了AI产业竞争逻辑的根本转变——模型能力正快速商品化,"今天独有的能力,几个月后就能免费下载",这直接冲击了OpenAI、Anthropic等公司赖以融资和IPO的估值叙事。同时,领先优势的收窄已成为投资者的现实问题,Anthropic在IPO前就因中国模型竞争而面临投资人的尖锐质询。
关键洞察
最有价值的判断是:护城河已经转移,模型领先本身不再是可持续的竞争优势,西方实验室必须在前沿技术以外的维度(如生态、基础设施、应用场景)建立差异化。文章还隐含一个警示——欧洲正在同时输掉基础模型和AI应用两场竞赛。
潜在影响
投资者和AI实验室最受冲击:西方闭源模型公司的高估值和IPO前景将面临重估,行业资源可能从"追求模型跑分领先"转向寻找真正可防守的护城河(如企业集成、专有数据、分发渠道),而中国开源模型则将加速抢占中低端市场。

Kimi K3 and GLM-5.3 are now within striking distance of the best US models. Western labs blame distillation, and there's real evidence for it. But guilty or not, the conclusion is the same: a model lead can't be defended. This issue looks at what can.

展开全文收起全文剩余 23 段 · 约 18 分钟

Six times a year, THE DECODER editorial team takes a close look at one core AI topic in the "Frontier Radar." Issue #4 is our most extensive yet and took longer than expected. Blame the topic: We look at how Chinese AI models caught up, where Western labs can still stand out, why the industry's moat has shifted, and why Europe is losing two races at once.

A year and a half ago, DeepSeek R1 caused a shock. A Chinese lab was suddenly competing with OpenAI's o1, the first commercial reasoning model, and had reportedly done it for far less money. Markets got nervous. Billions in market value evaporated within days. Was the planned infrastructure buildout overblown?

The picture back then was murkier than the headlines suggested. In DeepSeek's own report, R1 beat o1 on individual tests like AIME 2024 but trailed clearly on others, such as factual knowledge (SimpleQA). Later benchmarks exposed more gaps. Chinese models only reached the top in individual disciplines, not across the board.

As recently as late June, when we started working on this issue, Z.ai's GLM-5.2 still showed the same pattern. Then came the latest Chinese open-weights models: Moonshot's Kimi K3, Alibaba's Qwen3.8-Max, and GLM-5.3.

Chinese models now sit near the top of almost every broad, demanding evaluation. They handle long knowledge tasks, code across many steps, and coordinate tools far more reliably than their predecessors.

Measured by common benchmarks, the often-cited gap of a few months has shrunk enough to become an investor problem. According to the Wall Street Journal, Anthropic is fielding uncomfortable questions ahead of its upcoming IPO and points to its remaining lead at the top in its defense. Below that tier, the field belongs largely to open, far cheaper models from China.

Investors worry that raw model performance can barely carry a business anymore. Whatever a model can do exclusively today, a freely downloadable one can do a few months later.

Two accusations are in play: Chinese labs allegedly tapped Western models as teachers, a practice known as distillation. And they allegedly tune their models for strong benchmark scores without the broad capabilities to match - so-called benchmaxxing.

The American lead hasn't disappeared. But it has retreated to a few, ever-narrower areas of the so-called frontier, the leading edge of what's technically possible. Where that lead still sits, and what it's worth economically, is the first question of this issue.

The second follows from it. If the model alone can't make a clear difference anymore, what does the lead rest on? Our thesis: less and less on the model, and more and more on the overall system around it, meaning the system where ongoing work produces the next models.

What's left of the lead

At launch, Artificial Analysis had K3 in third place on its Intelligence Index with 57 points, right behind then-leaders GPT-5.5 and Opus 4.8. K3 improved most on agentic tasks, so exactly the hands-on work that matters in enterprise use. On AutomationBench-AA, K3 even debuted in first place until Anthropic answered with Opus 5.

On CEO-Bench, where an agent runs a fictional software company for 500 simulated days, K3 posted the best published single run at $22.15 million. Chinese models, including its predecessor K2.7, had regularly failed these long hauls. Qwen3.8-Max reaches a similarly high overall level. One caveat remains: Newer Chinese models sometimes burn far more tokens than Western ones, which eats into part of their price advantage. The cost-per-task math still applies.

The edge of current model capabilities has been growing at uneven speeds for a while, what researchers call the "jagged frontier." Individual capabilities advance at different rates, which is why the much-quoted months-long gap always depended on who measured what. What's new is where a Western lead is still measurable at all. Three areas remain.

The first is abstract specialty tests. Shortly after K3's launch, Opus 5 retook the top of the index with 61 points, a small gap over K3's 57. On ARC-AGI-1, a test of abstract pattern recognition using small puzzle grids, K3 and Fable 5 - Anthropic's flagship line for coding and agent work - sit practically even at 94.5 and 98.5 percent. Only on ARC-AGI-2 does the gap widen: 60.4 versus 89.2 percent. But ARC-AGI deliberately measures abstract pattern recognition far removed from everyday tasks. There's no guarantee this gap predicts practical differences. It could simply stay economically irrelevant in most cases.

The second is reliability. The AA-AnalystAgent benchmark, launched August 12, tests agentic data analysis on real tables and documents. It only counts a task as solved if a model gets it right in five out of five independent runs, a measure the operators call pass^5. Opus 5 leads with 54 percent, ahead of GPT-5.5 at 50. K3 is the best open model at 39 percent.

The gap comes almost entirely from poor repeatability. K3 solves 73 percent of tasks at least once in five attempts, practically even with Opus 5 at 74. Reliability doesn't follow the usual intelligence-index rankings either. Even GPT-5.6 Sol falls behind its own predecessor here.

Commercially, reliability weighs heavily, as the operators explain in their launch article. An analyst agent only saves work when its answers hold up without review. Multiple runs and checkers can compensate, but they drive up the cost per accepted result.

The third is cybersecurity. Here the gap is best documented. A joint assessment by the UK's AISI and the US CAISI found that K3 lags far behind leading US models in offensive cyber capabilities.

On ExploitBench, a test for developing exploits, K3 scored 32 percent. The top US models averaged about 76. K3 failed all 41 tasks that required executing code on a target system; leading US models solved 20 on average. And in a simulated attack, K3 made it to step 17 of 32, the US leaders to 28.5 on average.

But this gap is shrinking too. GLM-5.3, unveiled August 14, scores 54.4 percent on ExploitBench by Z.ai's own measurement, landing on more than double of its predecessor GLM-5.2. That cuts the distance to the US leaders roughly in half within a month. On finding and validating vulnerabilities in source code (CyberGym), GLM-5.3 even edges past the leading US models.

At the same time, cybersecurity is the one area where providers don't openly sell their strongest capabilities. Anthropic's best cyber model, Mythos 5, which hits 78 percent on ExploitBench, is only available under controlled conditions through Project Glasswing. Its public sibling Fable 5 effectively stays at the level of the older Opus 4.8 at 40 percent, because upstream safeguards intercepted 407 of 410 test episodes.

OpenAI takes a similar approach with Daybreak and specialized cyber variants. GPT-5.6 Sol reaches 73.5 percent on ExploitBench in OpenAI's own evaluation but stays below Critical, the highest level on OpenAI's risk scale. With the upcoming Astra, OpenAI can't rule out for the first time that one of its own models crosses that threshold. If it does, the Preparedness Framework kicks in much harder, up to a full development halt. OpenAI has already paused some internal Astra work.

参考来源: The Decoder
从模型能力到工程优化,海外开发者正在“榨干” Qwen3.8-27B 配图

从模型能力到工程优化,海外开发者正在“榨干” Qwen3.8-27B

核心内容
文章报道了通义千问团队开源的 Qwen3.8-27B——一款采用 Apache 2.0 协议的 27B 原生多模态稠密模型,量化后可部署于消费级 GPU。该模型在 SWE-bench Pro、LiveCodeBench v6 等 Agentic 编程与软件工程基准上超越了 Anthropic 的旗舰模型 Claude Opus 4.6 Max,海外开发者社区正通过各类工程优化手段充分挖掘其能力上限。
为什么重要
这标志着开源模型与闭源旗舰模型在编程等核心能力上的差距进一步缩小甚至局部反超,且以消费级硬件即可部署的形态出现,直接挑战了大模型领域"能力=算力门槛"的传统格局。同时,它也反映出中国开源大模型在全球开发者生态中的技术可信度与影响力正在实质性提升。
关键洞察
最有价值的信号在于"能力溢出效应":一个 27B 规模、单卡可离线部署的开源模型在硬核编程基准上超过闭源旗舰,说明模型规模与能力的线性关系正在被架构优化和训练工程打破。此外,海外开发者主动"榨干"该模型性能的现象,表明开源生态已成为模型能力放大的关键路径——工程优化本身成为继模型能力之后的第二竞争力。
潜在影响
AI 架构师、Agent 系统工程师及中小企业开发者将直接受益——多模态 Agent 的落地成本和技术门槛显著降低,可能加速开源方案对闭源 API 服务在编程、办公自动化等场景的替代进程。

陈姚戈

2026-08-17

展开全文收起全文剩余 65 段 · 约 15 分钟

北京

本文字数:4699 字

阅读完需:约 15 分钟

AI摘要

Qwen3.8-27B 是 Apache 2.0 开源的 27B 原生多模态稠密模型,量化后可运行于消费级 GPU;其在 Agentic 编程、软件工程、长周期办公等关键评测中超越 Claude Opus 4.6 Max。

Qwen3.8-27B 在 SWE-bench Pro、LiveCodeBench v6 等硬核编程基准上反超 Opus 4.6 Max;支持单卡离线部署,显著降低多模态 Agent 工程落地门槛;开源协议与实测性能共同强化中国大模型技术可信度。

适合 AI 架构师、Agent 系统工程师、开源模型部署工程师阅读。

作者|陈姚戈

Qwen3.8-27B 发布后,一个关于 Anthropic 的玩笑被当成新闻在 X 上传播。

“Anthropic CEO Dario Amodei 得知一个 27B 模型在 LiveCodeBench 上得分超过 Opus 4.6 Max,还能在一张 900 美元的二手显卡上离线运行后,紧急要求与立法者开会。”

发布者随后澄清:除了“紧急开会”,其他细节都是真的。

这个玩笑能以假乱真,一方面是因为 Anthropic 对中国开源模型的敌意;另一方面,Qwen3.8-27B 确实交出了一组足够醒目的成绩。

Qwen3.8-27B 是一个 27B 参数的原生多模态稠密模型,采用 Apache 2.0 协议开源,量化后可以部署在消费级 GPU、个人工作站甚至部分高配笔记本上。按照 Qwen 公布的评测结果,其整体表现超过 Qwen3.7-Plus,提升尤其集中在编程和 Agentic 任务。在 Agentic Coding(SWE-bench Pro、DeepSWE 1.1)、软件工程(QwenSWEBench)、长周期办公任务(CoWorkBench)、竞争性编程(LiveCodeBench v6)和指令遵循(IFBench) 等项目上,Qwen3.8-27B 的得分高于同一榜单中的 Claude Opus 4.6 Max。

它的多模态能力也延续了这一特点。Qwen3.8-27B 原生支持图像和视频理解,在计算机操作(OSWorld-Verified)、移动端操作(AndroidWorld)、多模态软件工程(SWE-MM)等项目上的得分高于 Claude Opus 4.6 Max;在应用创建、浏览器操作和视觉 Web 开发等任务上,也较 Qwen3.6-27B 有明显提升。在视觉数学、通用视觉推理、科学图表分析等通用多模态任务中,它同样保持了较高水平。

这些能力让它尤其适合前端开发、GUI Agent 等需要同时理解视觉界面、代码并与软件环境交互的场景。

长期测评本地模型、在 YouTube 拥有 7 万余名订阅者的 Bijan Bowen 就将 Qwen3.8-27B 称为本地大模型用户“最期待、最令人兴奋”的发布之一。他认为,Qwen 3.6-27B 等前代模型已经是同尺寸里能力很强、硬件覆盖范围也很广的本地模型,而 Qwen3.8-27B 又在此基础上进一步提高了能力上限。

在测试中,Bowen 使用 Q8 量化版本,在 RTX Pro 6000 上连续跑了浏览器 OS、3D CAD、FPS 游戏、C++ 游戏、多模态建模等任务。他认为,Qwen3.8-27B 在多数测试中的表现明显超出其参数规模,尤其在网页生成、3D 场景和游戏开发上表现突出。

社区很快用真金白银给出了支持。

Qwen3.8-27B 开源不到 12 小时便进入 Hugging Face 历史最受欢迎模型 TOP 4 以及 Trending 榜首。开源两天,下载便超过 100 万次,社区自发贡献约 500 个量化版本。正式发布之前,倒计时页面已经有上千名用户等待。

更能体现这种热度的是围绕模型迅速形成的工程生态。NVIDIA、AMD、平头哥、沐曦、联发科、摩尔线程等芯片厂商很快完成适配;vLLM、SGLang、Ollama、LM Studio 等推理和本地运行工具也第一时间跟进。

SGLang 开发者在发布当天就开始测试如何把模型跑得更快,通过 NVFP4 等优化,单张 RTX 5090 的 decode speed 已经可以超过 200 tokens/s。

美国 AI 芯片与推理服务公司 ⁠Cerebras 在模型发布后表示,将为 Qwen3.8-27B 提供专属部署,并计划将其加入 Shared Tier。

从个人电脑、工作站,到数据中心 GPU 和云端推理服务,Qwen3.8-27B 发布后的几天里,很快获得了不同层级的部署支持。

对开发者来说,模型开源只是起点。Qwen3.8-27B 发布后,社区的讨论很快从“能力怎么样”转向“怎样把它跑得更好”,去解决稠密模型无法回避的工程问题。稠密模型每生成一个 token 都需要调用完整模型,参数规模增加后,计算量和推理延迟也随之上升。相比每个 token 只激活部分参数的 MoE,Qwen3.8-27B 要在本地硬件上发挥能力,更依赖量化和推理侧优化。

因此,模型发布后,社区很快开始围绕量化精度、推理配置等方面展开测试,同时尝试利用 MTP 提高生成速度,并持续验证它在 Apple Silicon、消费级 GPU 等不同硬件上的部署效果。

Qwen 开放、开源的生态,促成了这种自发参与。此前,Qwen 已累计开源 460 余个模型,全球下载量超过 30 亿次,衍生模型超过 30 万个。在 Hugging Face 最新发布的《开源模型现状:2026 夏季观察》报告中也提到,2026 年前七个月,Qwen 仅在 Hugging Face 的下载量就达到 20.45 亿次,衍生模型超过 15 万个,平均每天新增约 200 个。

对一个开源模型而言,这种持续的使用、适配和二次开发,也证明了它的生命力和影响力。

拆解 Qwen3.8- 27B

Qwen3.8-27B 是一个 64 层的原生多模态稠密模型,沿用了 Qwen3.5 建立的 Gated DeltaNet 与 Gated Attention 混合架构。模型以“三层 Gated DeltaNet + 一层 Gated Attention”为一个基本组合,重复 16 次:四分之三的网络层采用线性注意力路线的 Gated DeltaNet,四分之一使用完整的 Gated Attention。

根据新加坡发展银行的资深数据工程师 Mehul Gupta 分析,这套混合架构的一个重要价值,在于提高长上下文处理的效率。全注意力机制需要显式计算 token 之间的注意力关系,上下文越长,计算和 KV Cache 的压力越大。Gated DeltaNet 通过更紧凑的状态表示处理历史信息,降低长序列处理成本;Qwen 同时周期性保留完整注意力层,以维持对复杂 token 依赖关系的建模能力。Qwen3.8-27B 原生支持 262K 上下文,并可以通过 YaRN 扩展至 100 万 token。

尤其值得注意的设计是多 Token 预测(MTP,Multi-Token Prediction)。传统自回归模型生成文本时,一次前向计算通常预测一个 token,再把结果送回模型继续生成;Qwen3.8-27B 则训练了多步 MTP,为同时预测后续多个 token 提供了基础。

这对于 27B 稠密模型尤其重要。稠密模型生成每个 token 都需要完整模型参与计算,解码速度因此成为本地部署时非常现实的问题。利用 MTP 进行推测解码,可以一次提出多个候选 token,再由主模型批量验证,从而减少逐 token 串行生成带来的开销。Qwen3.8-27B 发布后,MTP 也很快成为社区提高生成速度的主要优化方向之一。

Qwen3.8-27B 还允许开发者控制模型思考时间。模型默认开启思考模式,可以通过 reasoning_effort 调节推理深度,也可以通过 enable_thinking 关闭思考;在多轮 Agent 任务中,preserve_thinking 还能控制是否保留此前的推理内容。

不过,稠密架构本身也可能带来效率代价。

以 27B Dense 和 30B-A3B MoE 为例,两者总参数量看起来接近,实际运行方式却完全不同。27B 稠密模型生成每个 token 时,全部 27B 参数都会参与计算;30B-A3B MoE 虽然拥有约 30B 总参数,每个 token 实际只激活约 3B 参数。

因此,MoE 可以通过较少的激活参数降低每 token 的计算量,并获得更高的生成吞吐;稠密模型没有专家路由,每次生成都需要完整模型参与计算。对于本地部署来说,两种架构对应的是不同的内存、算力和速度取舍。

在稠密架构具有自身局限性的情况下,如何通过工程化处理,逼出模型最佳性能?Qwen3.8-27B 发布之后,海外开发者开始用实践贡献答案。

寻找任务质量与推理成本的最佳平衡

Qwen3.8-27B 支持 low、medium、xhigh 等不同推理强度。更长的思考可以帮助模型处理复杂任务,但对于一个 27B 稠密模型来说,也意味着更多生成 token 和更长的等待时间。模型开源后,社区很快开始寻找任务质量与推理成本之间的平衡。

前文提到的测评者 Bijan Bowen 使用 Q8 量化版本测试时,特意将模型设置为 xhigh thinking。测试显示,在生成一个 C++ 滑板游戏的过程中,模型多次准备开始写文件,又停下来继续思考。Bowen 观察到类似循环至少出现了 5—10 次。随后模型用了一个多小时持续编写、编译和修复程序,最终仍然卡在一个无法自行解决的 bug 上。

Hacker News 上的一名用户也记录了类似的情况。Qwen3.8-27B 是继 Gemma 4 之后,第二个通过其私人推理测试的可本地部署模型,但消耗的 token 大约是后者的 5 倍;即使开启 MTP,整个任务仍耗时 12 分 30 秒。

这些测试指向了一个更实际的问题:并非所有任务都需要最高的推理强度。对于简单任务,可以减少思考;遇到真正困难的编程和推理任务,再增加推理时计算量。如何根据任务难度分配计算预算,开始成为开发者优化 Qwen3.8-27B 使用体验的一部分。

Qwen3.8-27B 发布后,开发者开始检查 reasoning_effort 在不同推理框架中的传递方式,并修改 chat template、sampler 和 tool calling 配置。社区甚至出现了专门修订 Qwen3.5、3.6、3.8 Jinja template 的版本。

这类讨论背后有一个容易被忽略的问题:对于开源模型,权重并不等于最终体验。同一份模型权重经过不同 chat template、sampler 和 inference backend,可能产生不同的 reasoning 长度、生成速度和工具调用表现。模型发布之后,社区实际上还需要完成一轮“推理侧工程”。

其中,利用 MTP 给模型提速,成为社区最活跃的优化方向之一。

Qwen3.8-27B 发布几个小时后,开发者 Sudo Su 就建立了 qwen38-mtp 项目,测试如何利用模型自带的多 Token 预测头(MTP head)进行推测解码。在 A/B 测试中,同一张 RTX 3090、同一份模型,解码速度从 31.0 tokens/s 提高到 41.3 tokens/s;RTX 5090 Mobile 则从 36.7 tokens/s 提高到 50.9 tokens/s。

更多开发者随后加入测试。项目记录的结果显示,RTX 4090 从 47.7 tokens/s 提升至 76.3 tokens/s,RTX A6000 从 26.7 tokens/s 提升至 52.5 tokens/s,AMD RX 7900 XTX 也从 30.7 tokens/s 提升至 43.9 tokens/s。项目启动两天后,已经积累了 21 名贡献者和 27 组配置。

Qwen3.8-27B 发布时已经提供了 MTP 能力,但本地部署仍然存在大量工程工作。这部分工作正在由社区共同完成,这正是开源的魅力。

Apple Silicon 上也出现了类似尝试。

Qwen3.8-27B 发布后,开发者 Kydo 发起了一项针对该模型的性能优化挑战。他认为,Apple Silicon 的统一内存架构能够容纳总参数量较大的 MoE 模型;对于稠密模型,每生成一个 token 都需要访问完整模型权重,解码更容易受到内存带宽限制。因此,他把 Qwen3.8-27B 当作一个专门的优化对象,尝试寻找此前没有被充分挖掘的性能空间。

按照 Kydo 公布的结果,挑战开始不到 16 小时,参与者已经将 Qwen3.8-27B 的运行性能相对项目基线提高了 153%,达到默认 MTP 解码性能的约 2.5 倍。下一步,他们计划把同样的优化方式扩展到 CUDA 平台。

结语

Qwen3.8-27B 已经能在编程、Agent、多模态和复杂推理任务上体现出相当强的能力,也迅速激起了开源社区的参与热情。

模型开源后,开发者很快把它部署到个人工作站、Mac 和消费级 GPU 上,在真实任务中测试、量化和适配,并不断寻找模型效果、推理速度与硬件成本之间的平衡。

模型的能力不止由训练过程决定,来源模型部署到本地,还有大量工程工作需要做。不同的量化方案、推理配置、框架和硬件,都会影响模型最终呈现出的速度和效果。Qwen3.8-27B 发布之后,开发者正在共同完成这一过程。

对一个开源模型而言,这比下载量和榜单排名更能说明它的生命力。

参考资料:

https://huggingface.co/Qwen/Qwen3.8-27B

https://x.com/sudoingX/status/2088696109699072424

https://github.com/sudoingX/qwen38-mtp

https://www.youtube.com/watch?v=6kjXzTVmT58

https://news.ycombinator.com/item?id=49299605

https://x.com/0xkydo/status/2088709460701458437

https://medium.com/data-science-in-your-pocket/understand-qwen-3-8-27b-in-5-minutes-9d19d54e7dda

https://hfviewer.com/compare/qwen3.6-27b-vs-qwen3.8-27b

参考来源: InfoQ推荐
Dario “破防小作文”超千万人围观!LeCun 开炮:信任危机是因为你搞权力集中 配图

Dario “破防小作文”超千万人围观!LeCun 开炮:信任危机是因为你搞权力集中

核心内容
Anthropic CEO Dario Amodei 罕见发布长文,公开承认AI行业正面临系统性信任危机,并将问题根源归结为行业自身——技术承诺与实际落地能力之间的巨大落差,而非外部误解。文章在社交媒体获得超千万人围观,同时引发Yann LeCun等业界大佬的针锋相对的批评,后者直指信任危机的本质是AI巨头(如Anthropic)以"安全"之名行权力集中之实。
为什么重要
这是头部AI公司掌门人首次如此直白地"自我检讨",标志着行业叙事从"画饼扩张"转向"履约问责"的关键拐点;同时,Dario与LeCun的公开交锋暴露了AI行业内部在"安全治理 vs 权力垄断"这一根本议题上的深层分裂,其走向将直接影响未来的监管格局和技术路线。
关键洞察
最有价值的观点是Dario提出的"向内归因"框架:信任崩塌的主因不是公众不理解AI,而是AI公司集体未能兑现关键承诺——产品力与可靠性未达预期,连安全倡导者自身也必须直面技术成熟度的瓶颈。而LeCun的反驳则提供了另一面镜子:当少数公司以"安全"为话语壁垒时,信任危机可能恰恰是权力过度集中的必然结果。
潜在影响
AI从业者、投资者与监管者都将受此波及:行业可能被迫从"承诺驱动"转向"交付驱动",估值逻辑和治理框架面临重构,而关于开放与集中化的路线之争将愈演愈烈。

李冬梅

2026-08-18

展开全文收起全文剩余 101 段 · 约 19 分钟

北京

本文字数:6444 字

阅读完需:约 21 分钟

AI摘要

Dario Amodei罕见公开承认AI行业正面临系统性信任危机,根源在于技术承诺与实际落地之间的显著落差。他摒弃归咎外部的惯性路径,将反思锚定于行业自身履约能力不足。

AI公司集体未能兑现关键承诺;信任崩塌主因是产品力与可靠性未达公众预期;安全倡导者亦需直面技术成熟度瓶颈。

适合AI产品经理、大模型工程负责人、AI治理研究者阅读。

Dario Amodei 一直是 AI 行业里一个颇为特殊的存在。

如果说硅谷有一位 AI 掌门人,长期以来最不吝于提醒公众“AI 可能有多危险”,Dario 大概算其中之一。

作为 Anthropic 联合创始人兼 CEO,他过去几年反复谈论 AI 带来的生物安全、网络攻击、就业冲击以及失控风险,也一直主张前沿模型需要更严格的安全评估和外部约束。某种程度上,Dario 甚至已经成为 AI“风险派”的代表人物之一。

但美国当地时间 8 月 16 日,他罕见地在 X 上发了一篇“小作文”,把话题转向了一个更棘手的问题:为什么越来越多人开始不相信 AI 了?他给出的答案是:信任危机。如今这篇帖子在 x 上浏览量已经突破 1000 万。

为何越来越多人不相信 AI?

与以往的回应有所不同,这一次,他没有把问题归咎于媒体,也没有把矛头指向那些批评 AI 的人,更没有建议 Anthropic 做一轮更加积极的品牌宣传。恰恰相反,他承认:AI 公司自己还没有兑现那些曾经许下的巨大承诺。

Dario 原帖全文翻译如下:

感谢你,Gavin,和我进行了一次特别有深度的交流。我平时并不会在社交媒体上花太多时间,但我想在这里参与讨论,因为这场交流确实触及了一个重要对话的核心。

首先说监管。我认为,“要么通过监管把权力集中到少数被选中的公司和政治人物手中,要么把它广泛分散出去”是一种错误的二选一。我知道,在某种硅谷式的简化表达中,监管 = 监管俘获 = 权力集中,但我一直认为,这种看法过于简单化了现实世界。硅谷这个圈子之外的很多人,会把监管理解为一种限制企业权力、让普通人受益的机制。我也不一定完全认同这种看法;在我看来,问题很复杂,关键取决于所谓的“监管”具体包含什么。但尤其是那些持有“监管 = 监管俘获 = 权力集中”这一框架的人,往往低估了客观、公平的制度化程序所具有的去中心化力量。

一个比较粗略的类比是,正式的司法体系有时可能给人一种刻板、精英主义的感觉,但与另一种选择——群体私刑——相比,它在保护弱势个体权利方面要有效得多。在最理想的情况下,制度可以让权力依附于理念和规则,而不是依附于具体的人,从而实现权力的去中心化。

这也是为什么 Anthropic 一直非常谨慎地制定我们的政策建议。我们非常努力地提出这样一些政策:它们会让前沿 AI 公司处于不利地位(放慢它们的发展速度),同时让规模更小的竞争者获得优势。加州的 SB 53 法案(我们支持该法案),甚至那个饱受批评的 SB 1047 法案(我们对它持保留态度),都完全将收入或模型训练成本低于某一门槛的公司排除在监管覆盖范围之外。(SB 53 的门槛是 5 亿美元,SB 1047 的门槛更低,但我们曾对此提出反对。)

最近,我们在 CAISI 以及向白宫倡议的测试机制中,也主张对前沿模型实施比非前沿模型更加严格的测试——这种设计会让挑战者获得相对优势。同样,“Pacing the Frontier”(控制前沿发展速度)这封公开信所设想的方案——至少按照 Anthropic 所偏好的实施方式——是放慢最顶尖模型的发展速度,同时不去限制那些正在追赶的公司。这会损害前沿 AI 实验室的商业利益,却有利于挑战者,包括开放权重模型!

总体而言,我的看法是,从结构上来说,AI 是一种天然倾向于集中权力的技术,其原因与监管没有关系(更多是因为 Scaling Law,也就是规模扩展定律所带来的极端影响)。开放权重确实能够在一定程度上缓解这一问题,但远远不是充分的解决方案,因为它只是把这种集中稍微转移到了那些拥有最多算力和芯片的人手中——这些人基本上就是前沿 AI 实验室,再加上可能的一些硬件供应商。

相比之下,我认为,正确的“游戏规则”可以同时做到三件事:(a)应对 AI 带来的网络安全、生物安全以及对齐风险;(b)通过制度约束前沿 AI 公司的权力;以及(c)为开放权重模型留下发展空间,同时应对开放权重模型自身带来的具体风险。

顺便说一句,我并不认为过去几个月发生的事情“没有实现我所偏好的监管路径”。据报道,特朗普政府目前正在采取的方式——对前沿模型进行部署前测试,同时当开放权重模型逐渐接近前沿水平时,也对其进行测试——是我非常支持的方案。当然,我仍然需要看到具体细节,才能最终确认这一点。

我同样支持 Demis Hassabis 关于建立一个类似 FINRA 这样的机构的想法。

第二,说说 AI 相关的舆论表达。我不同意“我的言论过度负面”这一说法。事实上,我对 AI 风险和收益的讨论基本是平衡的:我分别写过一篇主要讨论风险和一篇主要讨论收益的长文。即使在谈论风险的采访中,我也会经常强调 AI 令人难以置信的潜在收益,并提出应对风险的可能方案。(只是我的采访被剪成短视频发到社交媒体后,往往会显得格外负面,因为这样的内容更容易获得点击。)

事实上,我之所以写《Machines of Loving Grace》,就是因为我觉得 AI 行业没有充分描绘这项技术如何能够让世界变得更好的、足够令人振奋的图景。文章大部分篇幅都在回应人们对 AI 在健康和生物学领域潜力的怀疑,并解释为什么我认为,未来 5 到 10 年内,人类实际上有可能治愈绝大多数疾病——这听起来可能让普通人难以置信,说实话,生物学家可能也会觉得疯狂(我以前就是生物学家)。如果你读过我最近的文章《Policy on the AI Exponential》,就会看到我还提出了具体建议,希望简化 FDA 审批流程,避免未来大量由 AI 加速研发的药物被监管流程拖慢。我对这件事有很强的紧迫感:几年前,我的父亲因丙型肝炎去世,而就在那几年之后,直接作用抗病毒药物索非布韦问世。这类药物可以治愈约 95%的患者,而且很可能也能治好我的父亲。

我确实同意,公众目前对 AI 持负面看法,而且这是一个严重的问题。但我不认为这主要是因为我或其他 AI 行业领导者不断提醒大家 AI 的风险。我认为,这从根本上说是一场信任危机。普通人不信任企业、政府和科技行业,总觉得我们又在策划某种新的方式来坑害他们。这种不信任的根源可以追溯到几十年前,而 AI 只是这一问题最新的一种表现形式。

我不认为,一场包装得光鲜亮丽、强调积极面的营销活动——有人曾建议 Anthropic 这么做——能够重新赢得这种信任。到了现在,告诉人们“AI 将治愈癌症”,与其说令人振奋,不如说已经变成了陈词滥调,而且大多数人会认为这是一种欺骗。真正有效的方法是:真的把癌症治好。

我认为,对包括 Anthropic 在内的 AI 公司来说,迄今为止最准确的批评,是我们还没有兑现那些关于“让世界变得更好”的宏大承诺。这完全是我们的责任。我认为,这才是你应该批评我们的地方,而不是纠结于传播方式和营销策略。

不过,我们正在尽最大努力解决这个问题。Anthropic 正在迅速加大对生物学和医学领域的投入,希望未来几年取得令人惊叹的成果,并在未来几个月看到一些早期迹象。当我们真正取得有意义的成果后,全世界都会听到,而且我们会尽可能大声地告诉所有人——这一点我向你保证。

但在那之前,我不想做出空洞的承诺。与此同时,我认为自己有责任诚实地谈论 AI 真实存在的风险,以及应该如何应对这些风险。从事情本身来看,诚实是正确的做法;而从公众信誉和信任的角度来看,诚实至少不会比刻意忽视风险、或者用其他话题转移公众注意力更糟。事实上,考虑到人们本能地意识到这些风险是真实存在的,诚实面对风险反而可能更有利于建立公众信誉和信任。

这篇“小作文”有点长,InfoQ 拆解出了几个值得关注的点:

一、“不是我把 AI 说得太危险了”

事情的背景,是一场关于 AI 监管、开放权重模型以及公众态度的讨论。Dario 在回应网友 Gavin 之后,连续发布两条 X。

他首先明确表示,自己确实承认公众目前对 AI 存在明显的负面情绪,而且这对整个行业来说是一个问题。但他不同意一种解释:公众之所以反感 AI,是因为 Dario Amodei、Sam Altman 等 AI 领导者不断强调 AI 的风险。

在他看来,这个因果关系太简单了。

Dario 的判断是,问题远比“AI 行业公关做得不好”复杂。他说,公众并不只是“不喜欢 AI”,而是不再轻易相信公司、政府和科技行业。

他用了一个非常直白的表达:

“I think it is fundamentally a crisis of trust.”

即:

“我认为,这从根本上说是一场信任危机。”

在 Dario 看来,普通人对企业、政府以及科技行业普遍存在一种怀疑:你们是不是又在酝酿某种最终会伤害我的事情?而这种怀疑并不是 AI 出现之后才产生的,它已经存在了几十年。

AI 只是最新加入这场信任危机的技术。

这其实是 Dario 整段话里非常重要的一个判断:AI 的公众形象问题,并不是单纯的 AI 问题,而是过去几十年科技、资本和公共机构积累下来的信任赤字,被 AI 集中放大了。

二、AI 不能只讲故事了

更加有意思的是,Dario 似乎也在回应 Anthropic 内部或者行业内部的一种建议:既然公众不喜欢 AI,那就应该讲更多 AI 的正面故事。

例如:AI 可以治癌症、可以延长人类寿命、可以加速科学研究还可以提高生产率。这些话,过去几年几乎已经成为 AI 行业最标准的“正面叙事”。

但 Dario 这一次却明确表示:仅仅讲这些故事,没有用。

甚至,“AI 能够治愈癌症”这种话,现在都已经变成了一种陈词滥调。而且很多人甚至会觉得,这种说法本身就是一种营销。所以 Dario 给出的解决方案非常简单,却也非常苛刻:

“The thing that will work is actually curing cancer.”

真正能够解决问题的,是“真的把癌症治好”。

这句话可能比任何 AI 发布会上的 Demo 都更有冲击力。因为它实际上是在承认:AI 行业现在缺的不是故事,而是结果。

三、Dario 罕见承认:AI 公司最大的批评,可能是对的

Dario 随后说了一句非常关键的话。在他看来,对包括 Anthropic 在内的 AI 公司的最准确批评,并不是它们不会做营销,也不是它们没有把 AI 讲得足够积极。

这些公司还没有兑现自己关于“让世界变得更好”的那些巨大承诺。

这实际上是一种相当罕见的自我否定。

因为过去几年,AI 行业已经建立起了一套非常完整的未来叙事:AGI 会到来、会极大提高生产率、会改变软件开发。

AI 会加速科学研究,最终可能帮助人类解决癌症、衰老、气候等问题。但与此同时,AI 公司也在要求社会接受越来越大的现实成本:更多数据中心、更多电力、更多芯片、更多资本、更强大的模型、更高的训练和推理成本。

甚至,越来越多关于就业、自动化和社会结构变化的讨论。

问题就变成了:普通人到底得到了什么?

这也是 Dario 这次真正触碰到的核心。如果 AI 公司告诉公众:“相信我们,未来 AI 会创造巨大价值。”

但现实中,公众首先看到的是 AI 生成垃圾内容、裁员、数据中心耗电、隐私争议以及越来越多的自动化替代。那么“信任”当然会出现问题。

四、Dario 给出的答案:别玩套路,要证明价值

Dario 并没有停留在承认问题。他表示,Anthropic 正在快速增加对生物学和医学领域的投入。

未来几年,公司希望能够取得真正重要的成果。而在未来几个月,他甚至期待能够看到一些“早期的曙光”。但他刻意没有给出一个宏大的结果承诺。

原因也很简单:在真正做到之前,他不想再做空洞的承诺。

这其实与 Anthropic 过去几年的路线有一种微妙的呼应。

Anthropic 一直把自己定义成一家“AI 安全”公司。Dario 也一直强调,AI 不仅意味着巨大的生产力和科学突破,也意味着网络安全、生物风险、失控等严重风险。

这一次,他实际上再次选择了同样的策略:宁可承认问题存在,也不试图通过营销把问题包装掉。

他甚至认为,在公众已经意识到这些风险真实存在的情况下,继续回避风险,反而可能进一步损害信任。

其实说白了:Dario 不认为“少谈风险、多讲美好未来”能够重新赢得公众。他想要真正地拿结果出来证明 AI 真正的价值。

五、但问题来了:AI 真的只是一场“信任危机”吗?

这也是这次讨论最值得争论的地方,Dario 的判断有道理,但它可能只解释了一半。

因为公众对 AI 的不信任,并不全部来自“AI 公司没有兑现承诺”,有些担忧甚至与“AI 到底有没有用”无关。

比如:谁拥有 AI?谁控制模型?谁从 AI 带来的生产率提升中获益?如果 AI 真的取代大量工作,成本由谁承担?训练数据来自哪里?AI 生成的内容应该如何标识?企业能否把员工数据交给模型?AI 公司是否应该拥有决定哪些模型可以被部署的权力?

这些问题,不是“治愈癌症”就能够解决的。

反之,如果 AI 真的变得足够强大,上述问题可能会变得更加尖锐。这也是为什么 Dario 把“信任”放在如此重要的位置。

网友吵翻了!Yann LeCun 也出来反驳

Dario 的帖子很快引发大量讨论,短短一天时间,目前在 x 上浏览量已经超过了 1000 万。

一些硅谷技术大佬也出来发表观点。

Yann LeCun 首先就反驳了 Dario 的观点。Dario 认为,AI 天然会集中权力,所以需要通过监管和制度来约束前沿 AI 公司,而 LeCun 则认为,真正的解法不是让少数公司和政府掌握监管权,而是让 AI 本身尽可能开放、分散,让不同的人拥有不同的 AI,用“AI 之间的制衡”对抗权力集中。

Yann LeCun 评论道:“AI 一定会被用于邪恶的目的,就像历史上每一种被发明出来的技术一样。但最终,它会变成:你的‘坏 AI’,对抗我的‘好 AI’”。

大约 10 年来,我一直认为,AI 唯一可行的未来,就是让这项技术广泛可用、共享,并保持开放。

就像印刷术和互联网一样,AI 通过让更多人获得知识,放大人类的智力和效率。

要真正赋能个人,社会需要高度多样化的 AI 系统——它们拥有不同的价值观、语言能力、哲学和政治倾向,以及各自擅长的专业领域。我们需要多样化的 AI,正如我们需要多元化的媒体一样。

考虑到 AI 的成本和复杂性,这只能通过开放的基础模型来实现。在这些模型之上,任何人都可以构建具有自己语言、偏见、专业能力和价值观的 AI 系统。

过去 4 年,随着 AI 进入公众视野,我一直更加公开地表达这一观点。我曾在各种场合提出过这一主张,包括企业高管层、AI 安全讨论小组、行业会议、美国参议院、联合国安理会,以及媒体采访、播客和社交媒体等公共平台。

我完全赞同 @finkd(马克·扎克伯格)最近发表的一篇文章。他写道:“认为 AI 如此危险,以至于唯一安全的道路就是让权力极度集中,这种想法本身就存在问题。从历史来看,如果寄希望于某个绝对权力足够开明,从而善意地为人类提供一切保障,并没有带来安全或积极的结果。”

当 @DarioAmodei 写道:“有人可能会反对说,我们完全可以像约束人类一样,通过多个 AI 系统之间的权力制衡来约束 AI。” 他指的就是我,以及(幸运的是)许多和我持相同观点的人。这是唯一正确的前进道路。

有 x 用户认为,Anthropic 很可能已经掌握了模型进一步实现重大提升的方法,这或许是他们表现得如此自信的原因。但从概率上看,某一个事件(比如任何一次违约)发生的可能性并不低,而一旦发生,很可能产生多米诺骨牌效应,击穿他们目前的这些预期。

Dario 的“AI 信任危机”论述并没有形成一边倒的认同。

一部分网友认可他承认“AI 公司尚未兑现造福世界的承诺”,认为这样的坦诚本身有助于重建信任。AeroDefense CTO Ziang Gao 表示:“像这样的帖子对重建信任大有裨益……人们需要感到被倾听,这就是人性。”

他同时认同 Dario 对 AI 公司的批评:“AI 公司曾做出许多造福公众的承诺,但我们至今仍未看到成果。”

DeepSeek TUI 作者“鲸鱼哥”Hunter Bown 也参与了评论,他表示,他能理解 Dario 因为自己的真实观点和过往言论而被贴上“负面”的标签可能会感到沮丧,但他仍希望 Dario 把这种批评当作未来改进沟通方式的有价值反馈。“你显然也认同这件事足够重要,因此我们如何谈论它同样重要。”他最后还对 Dario 父亲的遭遇表示遗憾。

Kyle Sainz 则认为,Dario 实际上是在一个容易迫使人们“非黑即白”的环境中,同时握住了 AI 的风险与收益。“你把收益和风险放在同一只手里,而整个环境却在奖励人们倒向其中一边。”

就业问题则是另一批网友最直接的担忧。

Shipper Boi 认为,AI 真正的问题是工作岗位,而不是人类“是否需要更多智能”。“如果没有工作,我们唯一能做的事情就是犯罪。”因此,在推动 AI 监管之前,他认为行业首先应该解决 AI 可能造成的就业问题。

也有人继续质疑开放权重能否真正实现权力分散。Jenkins P 基本认同开放权重的方向,但认为在其他条件相同的情况下,开放权重反而可能让资本实力最强、运营能力最强的企业更加突出。“如果除了钱之外,没有任何东西能够产生差异……”那么所谓的开放最终未必能真正消除资源集中。

参考链接:

https://x.com/DarioAmodei/status/2088758816376807762

https://x.com/WesRoth/status/2089155249043091470

https://x.com/DarioAmodei/status/2088758819304443967

参考来源: InfoQ推荐
早报|宇树「超人」原地跳高2米/小米SU7系列交付突破50万台/豆包支持手机远程操作电脑 配图

早报|宇树「超人」原地跳高2米/小米SU7系列交付突破50万台/豆包支持手机远程操作电脑

核心内容
这是一期科技早报,汇总了 AI 与科技行业的多条重要动态:DeepSeek 对 API 实行峰谷定价(高峰时段涨价最高达 1100%)、OpenAI 解散独立安全储备团队、阿里 Qwen3.8-27B 开源两天即登顶 Hugging Face 趋势榜,以及宇树科技即将登陆科创板、小米 SU7 交付突破 50 万台等硬件与资本市场进展。
为什么重要
这些动态折射出中国 AI 与机器人产业正从"补贴换增长"转向商业化成熟阶段——DeepSeek 涨价标志大模型价格战退潮,宇树上市则意味着机器人产业开始接受资本市场检验,二者共同指向行业价值重估的关键拐点。
关键洞察
最值得关注的信号是成本结构的反转:DeepSeek 高峰时段涨价 1100% 揭示了推理算力供给紧张的现实,AI 服务的"低价红利期"正在结束;同时 Qwen 开源模型两天百万下载表明中国开源生态的全球影响力已能与西方大厂正面竞争,而 OpenAI 解散独立安全团队则暴露了安全治理让位于产品迭代速度的行业性倾向。
潜在影响
依赖大模型 API 的开发者和中小企业将面临成本上升与预算重构,AI 应用层竞争加剧;机器人板块投资者迎来新标的,而 AI 安全监管的空心化可能促使政策层面加快补位。

🤖

DeepSeek API 正式执行峰谷定价,高峰时段最高涨幅达 1100%

展开全文收起全文剩余 167 段 · 约 25 分钟

⚠️

OpenAI 解散安全储备团队,安全评估职责拆入现有部门

🧠

Qwen3.8-27B 开源两天下载破百万,登顶 Hugging Face 趋势榜

🎮

阿里与信宸资本达成交易,灵犀互娱将更换股东

🚀

宇树科技将于 8 月 19 日登陆科创板

📱

iPhone 国行 AI 采用双轨制:千问接入 Apple 智能,苹果与阿里联合训练专属模型

🎬

Josh D’Amaro:迪士尼下一步要把技术、故事与全球业务真正连起来

📋

法国税务系统遭入侵,逾 60 万名纳税人和企业资料外泄

🚗

小米 SU7 系列交付突破 50 万台,用时 28.5 个月

🚙

李书福将辞任吉利汽车董事会主席,安聪慧接任

🌐

大疆诉美国国防部案发回重审,法院要求重新检查列名依据

💰

段永平基金重新买入阿里,英伟达持股数量环比减半

🏗️

黄仁勋:AI 工厂正在成为一种可投资的基础设施资产

📈

斯坦福 AI Index:全球 AI 乐观情绪与焦虑同时上升

🧸

Codex Pets 社区站上线,像素桌宠可一行命令安装

💡

韩歆毅:智能体商业将在未来 6—12 个月进入爆发期

🦿

宇树展示「超人」机器人,原地跳高 2 米、冲刺速度 12.66m/s

💻

豆包工作任务支持手机远程操作电脑

🎨

智象未来发布 HiDream-O1-World,可生成并编辑交互式世界

💳

支付宝发布智能体商业底座,「阿宝」已接入万余项服务

🔍

Codex 开放 GPT-5.6 Sol 的 100 万 token 上下文选项

DeepSeek API 正式执行峰谷定价,高峰时段最高涨幅达 1100%

DeepSeek API 自 8 月 17 日 00:00 起正式调整定价策略,引入峰谷定价机制。高峰时段设定为北京时间 9:00—12:00 与 14:00—18:00,其余时间为空闲时段,空闲时段调用价格为高峰时段的一半。

以旗舰模型 DeepSeek-V4-Pro 为例,高峰时段每百万 token 输入(缓存未命中)价格由 3 元上调至 9 元,输出价格由 6 元上调至 27 元,缓存命中输入价格由 0.025 元调整至 0.3 元,涨幅达 1100%;空闲时段输入(缓存未命中)为 4.5 元,输出为 13.5 元,缓存命中输入为 0.15 元。轻量级模型 DeepSeek-V4-Flash 在高峰时段输入(缓存未命中)为 1.5 元,输出为 4.5 元,缓存命中输入为 0.10 元。

DeepSeek 表示,推出峰谷定价旨在通过价格杠杆平衡日间算力拥堵,引导企业错峰调度大模型任务以保障平台运行稳定性。OpenRouter 数据显示,8 月 3 日至 8 月 9 日当周中国大模型 Token 调用量达 34.25 万亿,连续 15 周位居全球第一;其中 DeepSeek-V4-Flash 正式版当周调用量达 8.83 万亿 Token,位列全球榜首。

OpenAI 解散安全储备团队,安全评估职责拆入现有部门

据《金融时报》与 The Verge 报道,OpenAI 已在 7 月底解散 Preparedness 团队。这个团队原本负责评估前沿模型可能带来的严重风险,并设计相应缓解措施。

原团队承担的生物与网络安全评估已经拆分到 OpenAI 现有部门。团队负责人 Dylan Scandinaro 今年 2 月从 Anthropic 加入 OpenAI,目前转向研究能够递归自我改进的 AI 系统。

这是 OpenAI 近年第三次撤销专门处理长期或前沿风险的团队。此前,AGI Readiness 与 Superalignment 团队也已解散;多名安全研究人员随后离职。组织调整后,相关职责仍然存在,但不再由一支独立团队集中承担。

Qwen3.8-27B 开源两天下载破百万,登顶 Hugging Face 趋势榜

Qwen3.8-27B 开源两天后下载量突破 100 万次,并升至 Hugging Face 全球大模型趋势榜第一。官方模型卡显示,它是一个 270 亿参数的稠密视觉语言模型,原生上下文长度为 262144 token,可扩展至 100 万 token。

模型支持图像与视频理解,默认开启思考模式,并可通过 reasoning_effort 调整推理深度。官方提供 Transformers 格式权重,兼容 vLLM、SGLang 和 TokenSpeed 等推理框架,采用 Apache 2.0 许可证。

阿里与信宸资本达成交易,灵犀互娱将更换股东

灵犀互娱 CEO 周炳枢在 8 月 17 日内部信中确认,阿里巴巴集团与信宸资本已经达成交易协议,阿里将出让所持灵犀互娱股份,信宸资本成为新股东。

周炳枢表示,交易来自阿里整体战略聚焦。管理团队将继续带领公司运营并开发游戏产品;内部信没有宣布管理层更换或具体交割安排。

灵犀互娱在阿里体系内曾多次调整组织归属:2017 年进入阿里大文娱,2020 年升格为独立事业群,2023 年被划入「1+6+N」架构中的 N 业务板块。此次内部信把此前的出售报道推进到双方已经签署协议的新阶段。

宇树科技将于 8 月 19 日登陆科创板

宇树科技 8 月 17 日公告,公司 A 股将于 8 月 19 日在上海证券交易所科创板上市,证券简称为「宇树科技」,证券代码为 688836。

上交所披露的招股书显示,宇树科技主营高性能通用人形机器人、四足机器人、机器人组件及具身智能模型。公司在 2023 年 8 月推出首款通用人形机器人 H1,此后已发布四个系列的人形机器人产品,并把四足机器人拓展至科研、工业巡检、应急救援和智能服务等场景。

宇树科技的科创板上市申请于今年 3 月获上交所受理,6 月通过上市委审议,7 月取得中国证监会注册批复;中信证券担任保荐人和主承销商。

iPhone 国行 AI 采用双轨制:千问接入 Apple 智能,苹果与阿里联合训练专属模型

爱范儿从阿里巴巴方面获悉,阿里千问将作为 AI 能力集成至 Apple 智能,覆盖中国市场的 iOS、iPadOS、macOS 和 visionOS。用户无需在应用间切换,即可在苹果设备上调用千问的文本与图像理解、内容生成等能力。

这项合作同时包含更底层的第二条路径:苹果与阿里将为中国市场联合训练专属大语言模型。千问承担现阶段的能力接入,联合训练模型则进入 Apple Foundation Models 体系,面向中国用户与本地服务重做模型底座。

今年 7 月,国家网信办公布的新一批手机端侧生成式人工智能服务备案中已经出现「Apple 智能」。路透社此前援引三名知情人士称,苹果已经针对中国市场训练一款大语言模型,阿里参与开发并为训练提供支持。

Josh D’Amaro:迪士尼下一步要把技术、故事与全球业务真正连起来

出任迪士尼 CEO 5 个月后,Josh D’Amaro 在 D23 接受 Deadline 采访。他把自己的首要任务概括为持续产出最好的电影、乐园项目和百老汇作品,同时在技术与媒体交汇处寻找新的讲故事方式。

D’Amaro 认为,迪士尼同时拥有 ESPN、流媒体、乐园、电影和 IP,真正的优势来自这些业务协同运转。一段故事可以从影院延伸到 Disney+、主题乐园和 D23 社群,覆盖多个渠道。

其他媒体公司都在尝试变得像迪士尼。

他也承认,这套组合只有在各部门真正协同时才成立。相比为单项业务设定孤立目标,他更关注如何用技术放大故事,并让全球不同市场共享同一套内容与体验能力。

D’Amaro 1998 年从迪士尼乐园的基层岗位开始职业生涯,至今已在公司工作近 30 年。他把这种经历视为制定战略的基础:乐园员工每天直接面对游客,电影和流媒体团队则负责持续创造让游客愿意走进乐园的故事,两端必须互相理解。

他没有把技术描述为独立产品线,也没有给出具体收购或平台计划。其边界很明确:技术应服务于故事与体验,衡量标准仍是观众是否愿意在不同场景里继续接触同一个迪士尼世界。

法国税务系统遭入侵,逾 60 万名纳税人和企业资料外泄

法国财政部确认,税务总局 DGFiP 遭遇网络攻击并发生数据泄露。黑客在犯罪论坛出售的文件包含略多于 60 万条记录,每条对应一名纳税人或一家企业。

《世界报》检查样本后发现,泄露内容包括姓名、家庭住址、电话号码、参考应税收入、税率和家庭受抚养人数。攻击者曾宣称影响数千万人,但这一说法更接近被访问数据库的总体规模,不能等同于已经外泄的记录数。

财政部称,系统在 6 月底例行检查中切断了非法访问,但当时没有发现数据已被提取。部门将报案并向法国数据保护机构 CNIL 通报。

小米 SU7 系列交付突破 50 万台,用时 28.5 个月

小米汽车 8 月 17 日宣布,SU7 系列累计交付突破 50 万台,从首款车型上市到达成这一里程碑用时 28.5 个月。

SU7 系列的产品时间线包括:第一代小米 SU7 于 2024 年 3 月 28 日上市,小米 SU7 Ultra 于 2025 年 2 月 27 日上市,新一代小米 SU7 于今年 3 月 19 日发布。小米汽车 7 月披露,SU7 与 YU7 两个系列累计交付量已超过 70 万台。

李书福将辞任吉利汽车董事会主席,安聪慧接任

吉利汽车控股有限公司宣布调整管理层。自 8 月 18 日起,李书福将辞任公司董事会主席及执行董事,转任终身荣誉主席;他将继续担任浙江吉利控股集团董事长。

安聪慧将接任吉利汽车董事会主席。安聪慧 1996 年加入吉利,历任工程总指挥、总经理、副总裁及总裁,目前同时担任浙江吉利控股集团 CEO;今年 6 月,他已重新获委任为吉利汽车执行董事。

本次调整还涉及三项职位变动:李东辉辞任董事会副主席并继续担任执行董事;桂生悦由行政总裁转任董事会副主席;淦家阅接任行政总裁,负责公司日常运营与长期战略执行。

大疆诉美国国防部案发回重审,法院要求重新检查列名依据

美国哥伦比亚特区联邦巡回上诉法院 8 月 14 日裁定,将大疆挑战美国国防部「中国军事企业」列名的案件发回地区法院重新审理。

上诉法院认为,下级法院在审查「大疆是否对中国国防工业基础作出贡献」这一核心问题时存在缺陷,现有证据不足以支撑原有审查结论。地区法院接下来需要重新检查行政记录,包括非公开的机密材料,再判断大疆是否符合列名条件。

大疆于 2022 年 10 月首次被美国国防部列入相关清单,2024 年 10 月提起诉讼;地区法院在 2025 年判决美国国防部胜诉,大疆随后上诉。此次裁定撤回原有审查结果并启动重审,但不会直接把大疆移出清单。

段永平基金重新买入阿里,英伟达持股数量环比减半

H&H International Investment 向美国证券交易委员会提交的 13F 文件显示,截至 6 月 30 日,其美股持仓共有 18 项,总市值约 191.01 亿美元。

与一季度相比,基金新建仓阿里巴巴 30.14 万股;拼多多持股由 1974.83 万股增至 2502.21 万股。苹果持股由 2894.56 万股降至 2709.87 万股,英伟达则由 1384.38 万股降至 628.07 万股。

苹果仍是第一大持仓,期末市值约 78.41 亿美元;拼多多和英伟达的期末市值分别约为 19.09 亿美元和 12.57 亿美元。13F 反映的是季度末持仓快照,并不披露具体买卖价格或之后的变动。

黄仁勋:AI 工厂正在成为一种可投资的基础设施资产

英伟达 CEO 黄仁勋在署名文章中表示,公司与 Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs 和 KKR 建立合作关系,创建独立融资平台,计划逐步调动超过 5000 亿美元的第三方资本建设 AI 基础设施。

他把 AI 工厂定义为一套包含加速计算、网络、系统软件、AI 框架与开发者生态的平台,而非单一芯片。语言、视觉、语音、生物学、物理 AI 和机器人模型可以共享同一套基础设施;客户需求变化时,设备也可以重新部署给其他云、运营商或企业。CUDA 的持续优化则会提高已部署设备在生命周期内的性能与效率。

在 AI 领域,计算就是收入。

黄仁勋强调,超过 5000 亿美元是多个平台未来计划调动的第三方资本总额,不是英伟达收入、单个基金规模或对单一客户的承诺。金融机构将分别评估客户、需求、利用率、现金流和残值,再独立决定是否融资。

在部分项目中,英伟达可能提供最高 25% 的残值支持,并逐项评估。这项有限支持用于补充独立承销;黄仁勋以设备可交换、全球通用、能通过软件升级和重新部署为理由,解释金融机构为何可以把 AI 计算设施视为长期生产性资产。

斯坦福 AI Index:全球 AI 乐观情绪与焦虑同时上升

斯坦福大学 2026 年 AI Index 公共舆论章节显示,2025 年全球认为 AI 产品「利大于弊」的受访者比例从 55% 升至 59%,与此同时,表示 AI 令自己紧张的人也增加到 52%。

工作场景的地区差异更明显。全球有 58% 的员工表示会半定期或经常在工作中使用 AI;在印度、中国、尼日利亚、阿联酋、埃及和沙特,这一比例都超过 80%。

美国公众与 AI 专家的判断存在明显距离:73% 的专家预计 AI 会改善工作方式,公众中持同样看法的只有 23%;对医疗的正面预期分别为 84% 和 44%。报告同时显示,64% 的美国人预计未来 20 年 AI 会减少就业岗位。

Codex Pets 社区站上线,像素桌宠可一行命令安装

Codex 开放桌宠功能后,社区搭建了 Codex Pets 共享站。站内集中展示用户制作的像素桌宠,每个作品页提供预览、下载和一行命令安装入口。

上传一只新桌宠需要两个核心文件:描述名称、动作和展示信息的 pet.json,以及承载像素动画帧的 spritesheet.webp。用户在站点登录后可以上传这两个文件,设置桌宠类型与标签,并先用预览检查动画是否正常。

站点还提供多人 Playground,可以把不同用户的桌宠放到同一个虚拟房间中运行。桌宠包的文件结构可公开查看、下载和分叉,社区也已出现为这套格式制作的浏览器组件与宠物合集。

💡 韩歆毅:智能体商业将在未来 6—12 个月进入爆发期

蚂蚁集团 CEO 韩歆毅 8 月 17 日在支付宝 AI 生态大会上表示,智能体商业将在未来 6—12 个月进入爆发期。他把临界点归纳为三个条件同时成熟:AI 能力提升、用户需求跃迁,以及能够持续运转的价值闭环。

韩歆毅把人与服务的连接方式分为三个阶段:搜索时代,人需要学习机器的语言;App 时代,服务被封装在各个应用里;智能体时代,机器开始用人的语言理解需求。他认为,这次变化会让商业竞争从争夺「被看见」转向争取「被理解」。

过去二十年,人学着用机器的语言表达需求;未来二十年,机器学着用人的语言理解需求。

在他的描述中,流量模式是一条从曝光、点击到转化逐层缩窄的漏斗;智能体则围绕用户意图持续组合服务,让需求被满足、延续或放大。价值分配因此会更多取决于理解深度与履约质量,并催生服务原子供给者、智能体编排者、信任与规则维护者等新角色。

韩歆毅表示,支付宝将向行业开放信任设施、AI 支付、区块链、AI 数据库和隐私计算等基础设施。平台、商家、终端厂商、服务商与开发者需要共同建立连接和规则,才能让不同智能体完成安全协作与商业履约。

宇树展示「超人」机器人,原地跳高 2 米、冲刺速度 12.66m/s

宇树科技 8 月 17 日展示一款代号为「超人」的人形机器人新机。官方视频称,这台机器人原地跳高可达 2 米,在腿长 0.85 米的条件下,极限奔跑速度达到 12.66m/s。

宇树表示,这台全新整机的研发周期为 3 个多月,当前仍属于预览阶段,未来几个月将继续完善。与此前 H1 机器人 10m/s 的公开演示相比,新机把速度指标进一步提高,同时加入原地跳高能力。

豆包工作任务支持手机远程操作电脑

豆包更新「工作任务」,新增通过手机远程操作电脑的入口。官方指引要求用户先在手机豆包 App 登录与当前电脑端相同的账号,再从移动端进入相关任务。

这项更新把电脑端的工作任务延伸到移动端。用户离开电脑后,可以通过手机继续向同一账号下的电脑发出远程操作;官方本次以移动端操作指引介绍新能力。

智象未来发布 HiDream-O1-World,可生成并编辑交互式世界

智象未来发布交互式世界模型 HiDream-O1-World。用户可以通过文本、图像或交互指令生成场景,并以第一或第三人称视角漫游;模型还支持抓取、奔跑、跳跃、降雨和物体坠落等角色与环境编辑。

模型基于智象自研 UiT 原生全模态架构。其空间记忆会保存场景几何结构与物体关系,推理阶段再用 Test-Time Training 动态调整适配器,以维持多轮视角切换后的 3D 一致性;训练数据还覆盖碰撞、流体、形变、重力和光影等物理过程。

美团 LongCat 团队与复旦大学共同维护的 WBench 榜单显示,HiDream-O1-World 在 8 月 14 日提交的 Navi 评测中以 80.9 分排名第一,一致性和物理维度分别为 88.0 分与 73.3 分。该榜单覆盖 31 个模型,并从画质、场景、交互、一致性和物理五个维度评估导航式世界模型。

支付宝发布智能体商业底座,「阿宝」已接入万余项服务

支付宝在 8 月 17 日举行的 AI 生态大会上发布全栈智能体商业底座,并推出 AHA 多智能体跨端互联协议体系。「阿宝」已完成万余项服务的 AI 化接入,覆盖出行、餐饮、文旅和政务民生等八类场景。

这套底座面向不同数字化阶段的商家提供三层能力:AI 开放平台可以把页面、商品与服务流程转换为 Skills、MCP 和智能体单元;商家可自行完成智能体创建、技能编排、任务执行与运营管理;复杂服务则通过 A2A 能力联动多个商家智能体协同履约。蚂蚁数科 Agentar 生态版还提供超过 200 项商家高频场景技能。

AHA 体系包含 Skills Interface Standards、Agent Hub Access 和 X User Interface 三部分,分别处理技能交互、智能体互联与设备感知执行。支付宝称,不同厂商的智能体可以通过分域授权和数据隔离完成协作,让用户用一句话触发跨智能体服务与交易。

支付宝已与 5 家主流手机厂商打通跨端协同,车端服务覆盖 16 家主流车企,并与 60 余家车企达成定点合作。千问、华为、OPPO、vivo、小米、荣耀、比亚迪、吉利汽车、理想、蔚来等 20 余家企业参与 AHA 生态共建;部分商家开发需求已经排期到明年。

Codex 开放 GPT-5.6 Sol 的 100 万 token 上下文选项

OpenAI Codex 负责人 Thibault Sottiaux (Tibo) 介绍,用户现在可以为 GPT-5.6 Sol 手动启用 100 万 token 上下文窗口。Codex 默认仍会根据模型与任务自动设置更合适的上下文上限,超长窗口不是所有任务的默认值。

这项设置适合一次性读取大型代码库、长日志或多份文档,但更长上下文也会增加推理成本和等待时间。对大多数开发任务,先让 Codex 自动管理上下文仍是更稳妥的选择。

三星首款 24.5 英寸 OLED 电竞面板据报将在第四季度亮相

据产业链消息,三星显示计划在第四季度推出首款 24.5 英寸 OLED 电竞面板,并准备 360Hz 与 560Hz 两种刷新率版本。

24.5 英寸是职业电竞显示器常见尺寸,但 OLED 此前更多集中在 27 英寸及以上产品。更小尺寸若进入量产,可让厂商把 OLED 的响应速度与高刷新率带到主流电竞桌面,同时减少大尺寸面板对桌面空间和显卡输出的要求。

目前披露的是面板规划,终端显示器品牌、接口方案、分辨率和上市价格尚未公布。第四季度亮相也不等同于零售产品会同步开卖。

阿里发布 HappyShrimp 1.0,可用自然语言端到端生成完整歌曲

阿里巴巴发布 AI 音乐模型 HappyShrimp 1.0,中文名「快乐虾米」。用户可以用情绪、故事、记忆或使用场景描述音乐需求,模型会同时完成作词、作曲、编曲与演唱,生成一首完整歌曲,无需先把提示词拆成曲风、乐器和律动标签。

HappyShrimp 采用端到端整曲生成方式,把语言描述、歌词、曲风、情绪、年代、人声、调性、BPM 和配器等要求放进同一套规划过程。官方称,这种方式会同步处理词曲、人声与长程结构,减少分段生成后拼接造成的词曲错位和听感割裂。

HappyShrimp 1.0 已在国内及海外同步上线 PC 网页端,新用户可获得免费积分。官方页面同时提供作品浏览与创作入口。

瑞幸将推出泰国商标胜诉新品

瑞幸近日为泰奶系列发布预热海报,并把产品灵感归功于「在泰国出差」的法务团队。这段文案对应瑞幸在泰国持续多年的商标诉讼,也把新品与品牌维权事件直接关联起来。

瑞幸代理律所 Tilleke & Gibbins 公布的信息显示,泰国专门案件上诉法院 7 月 8 日维持一审判决,确认瑞幸对争议商标享有更优权利,并要求撤销被告的相关商标注册、停止使用「Luckin Coffee」「瑞幸咖啡」和鹿形标识,同时变更企业名称与印章。

电信终端产业协会倡议手机与配件分离销售,推动接口与快充协议统一

电信终端产业协会 8 月 17 日向终端行业发出倡议,建议整机企业在保障消费者知情权与自主选择权的前提下,逐步推行手机与配件分离销售,减少无效标配、重复配套与冗余生产。

协会同时提出统一配件标准,提升跨品牌、跨机型通用适配能力,并建立统一的安全认证体系。整机与配件企业还应推动充电接口、快充协议等领域协同统一,减少非标、低兼容和低能效产品。

该协会由中国信息通信研究院与运营商、终端设备企业、系统设备企业及检测机构等共同发起,理事单位覆盖多家手机、互联网与通信企业。本次文件属于行业倡议,不是面向单一品牌发布的强制销售规则。

Ariana Grande 与 Cynthia Erivo 在伦敦合唱《For Good》

Ariana Grande 在伦敦 O2 体育馆举行 Eternal Sunshine 巡演第二场英国演出时,请来《魔法坏女巫》搭档 Cynthia Erivo 登台。

两人合唱了音乐剧中的《For Good》,也演唱了 Barbra Streisand 与 Judy Garland 的经典合作曲《Happy Days Are Here Again / Get Happy》。这次重聚发生在 Grande 第七张专辑巡演期间,把电影角色关系重新带回现场音乐舞台。

Open Mike Eagle 与 Kenny Segal 把分手写成一张黑色喜剧说唱专辑

Open Mike Eagle 与制作人 Kenny Segal 发布合作专辑 DOOMED!。两人相识并合作近 20 年,这是他们第一次共同完成整张专辑。

专辑以一段持续 5 年的关系结束为核心,把争吵、未听的语音留言和删除共同歌单等细节处理成带荒诞感的黑色喜剧。Kenny Segal 用失真钢琴、弦乐、萨克斯和迷幻合成器搭出低沉但不拖沓的背景,Open Mike Eagle 则继续以密集的流行文化引用缓冲私人经验。

DOOMED! 共收录 15 首歌,并邀请 billy woods、Hemlock Ernst 等音乐人参与。专辑已在 Bandcamp 与主流流媒体上线,也发行黑胶、CD 和磁带版本。

发邮件

郑廷旭

硬件编辑

Could be better.

累计已发布 226 篇文章

最近文章:

早报|《牛来》主创回应排片暴增1900倍/卢伟冰:小米手机未来全面拥抱AI/问界儿童车即将上市 我用 161 个新闻源「养」了个 AI 主编,它比我更懂什么叫「大新闻」|附教程

下一篇22 小时前

87 岁富豪花 2.7 亿元买下法拉利,史上最贵电车诞生!

上一篇23 小时前

网友把DeepSeek Harness玩成了赛博乐高,我们挑出了最有意思的11 个插件

爱范儿 App

爱范儿,让未来触手可及

关注爱范儿微信号,连接热爱,关注这个时代最好的产品。

想让你的手机好用到哭?关注这个号就够了。

关注玩物志微信号,就是让你乱花钱。

小程序开发快人一步。

最好的微信新商业服务平台。

参考来源: 爱范儿
2026 世界杯:一个通过与 CoCo 对话构建的实时应用 | 技术实践 配图

2026 世界杯:一个通过与 CoCo 对话构建的实时应用 | 技术实践

核心内容
作者通过自然语言对话的方式,几乎完全依靠与 Snowflake 的 Cortex Code Desktop(CoCo)交互,从零构建了一个功能丰富的 2026 世界杯实时应用,涵盖实时比分、淘汰赛对阵生成、交锋统计、场馆地图和比赛预测等功能。整个过程无需预先编写样板代码,并能在数周内持续迭代新功能和实时数据。
为什么重要
这篇文章展示了"对话式开发"(vibe coding)从概念走向企业级实践的实质性进展——复杂、数据驱动的实时应用可以完全通过自然语言与 AI 智能体协作完成。它反映出 AI 编码助手正在重塑软件开发的门槛、速度和工作方式,标志着从"人写代码、AI 辅助"向"人提需求、AI 实现"的范式转变。
关键洞察
最有价值的发现是:即使没有一行初始代码,开发者也能通过与 AI 的持续对话完成一个多模块、强实时性的完整应用,且迭代成本极低——新想法可以随时提出并快速落地。这验证了 AI 智能体在 2026 年前后已具备处理真实业务场景复杂度的能力,开发的核心瓶颈正从"编码能力"转向"需求表达与产品想象力"。
潜在影响
产品经理、数据分析师乃至非技术背景的业务人员都可能直接参与应用构建,传统软件团队的开发流程、人力结构和交付周期将面临重构。

Dash Desai

王玮

展开全文收起全文剩余 104 段 · 约 15 分钟

张绮璇

2026-08-19

北京

本文字数:4231 字

阅读完需:约 14 分钟

2026 年,智能体将在企业级应用中取得哪些实质性突破?点击下载《2026 年 AI 与数据发展预测》白皮书,获悉专家一手前瞻,抢先拥抱新的工作方式!

我构建了一个 FIFA World Cup 2026 应用,它包含实时比分、淘汰赛对阵生成器、交锋统计、场馆地图、比赛预测等功能,而且整个过程几乎完全是通过与 Cortex Code Desktop(CoCo)的一系列自然语言对话完成的。

之所以花了几周时间,是因为一开始我完全没有任何样板代码;同时随着赛事推进,我也不断想把新的想法、更好的交互和更多实时统计数据迭代进来。

首页就是一个典型例子:它最初只是一个静态倒计时卡片,后来通过纯对话式开发,逐渐长成一个实时 dashboard。

一开始它只有四个指标卡片(距离开赛天数、剩余比赛场次、48 支球队、16 个场馆)和一个赛程 dataframe;

后来又加上了实时比赛卡片,以及带动画的统计 pills(控球率、射门、角球)和进球/黄牌/红牌事件标记;

接着加入了下一场比赛的 JS 倒计时,以及当多场比赛同时开踢时的多卡片堆叠显示;

然后加入了纵向淘汰赛 bracket,并叠加了以金色 badge 呈现的 AI 预测;

再后来加入了比赛进行中的实时胜率条,以及带赛事统计摘要的球队卡片;

最后,又加上了冠军庆祝卡片和 confetti 动效,用在 World Cup 2026 决赛结束之后。

其他页面也经历了类似过程,只是迭代次数可能略少,例如:

Head-to-Head

Venue Map

Knockout Bracket

Quiz

技术栈

GitHub → Streamlit Community Cloud (auto-deploy on push) ├── Snowflake │ ├── TEAMS (48 teams, flags, FIFA rankings) │ ├── VENUES (16 stadiums, lat/lng, capacity) │ └── MATCHES (72 group stage fixtures) ├── ESPN Free API (live scores, no auth) └── Snowflake Cortex AI_COMPLETE (match predictions)

复制代码

这个应用运行在 Streamlit Community Cloud 上,静态赛事数据存储在 Snowflake 中,实时比分和比赛统计来自 ESPN 的公开但未文档化的 API,而 AI 驱动的比赛预测则通过 Snowflake Cortex AI Functions 生成。

开发过程:AI 辅助迭代

从最初脚手架到最后的冠军庆祝卡片,每一个功能几乎都是通过和 CoCo 对话构建出来的。我只需要描述想要什么,然后在生成结果基础上继续迭代。

一个很典型的例子是 predictions.py 模块。这个模块有 200 多行代码,里面包含统计聚合、综合评分计算,以及对 Cortex AI Functions 的集成,而这些内容几乎是在一次对话中完成的。

ESPN 未文档化 API:踩过的一些坑

在使用这个 API 的过程中,我们遇到了几个很典型的问题。

100 条赛事截断

问题:当你查询 ?dates=20260611–20260719 这种覆盖整个赛事周期的时间范围时,ESPN 会悄悄把结果截断在大约 100 场比赛左右。我们是在赛事进行到中段时才发现这个问题,因为半决赛结果竟然“消失”了。

解决办法:把查询拆成两个日期区间。

@st.cache_data(ttl=60)def get_all_results(): results = [] # Split to avoid ESPN's ~100 event cap for date_range in ["20260611–20260627", "20260628-" + _today_str()]: resp = requests.get(ESPN_API, params={"dates": date_range}, timeout=10) # … normalize and collect return results

复制代码

跨午夜边界丢比赛

问题:如果不传 dates 参数,ESPN 默认只返回当前美东时间自然日的数据。这意味着,一场在美东时间晚上 11:55 开始、并在午夜后仍处于补时阶段的比赛,会在跨天后直接从结果里消失。

解决办法:始终查询一个 3 天窗口。

et = pytz.timezone("US/Eastern")now_et = datetime.now(et)yesterday = (now_et - timedelta(days=1)).strftime("%Y%m%d")tomorrow = (now_et + timedelta(days=1)).strftime("%Y%m%d")

复制代码

状态识别

ESPN 使用 6 种不同的进行中状态:STATUS_FIRST_HALF、STATUS_SECOND_HALF、STATUS_HALFTIME、STATUS_EXTRA_TIME、STATUS_PENALTY_SHOOTOUT、STATUS_IN_PROGRESS;还使用 3 种结束状态:STATUS_FULL_TIME、STATUS_FINAL_PEN、STATUS_FINAL_AET。

只要漏掉其中任何一个,淘汰赛 bracket 就会出错。

不用 WebSockets 也能做到实时更新

我们使用了 Streamlit 的 @st.fragment(run_every=N) 装饰器,它可以按固定间隔只重跑被装饰的函数,而无需整页刷新。

@st.fragment(run_every=10)def _live_section(): live = get_live_matches() if live: for i, match in enumerate(live): _render_live_match(match, i)

复制代码

再结合 API 调用上的 @st.cache_data(ttl=15),就能以极低的 ESPN API 负载实现接近实时的更新。实时比赛区域每 10 秒刷新一次,赛程/结果区域每 60 秒刷新一次,页面顶部 banner 也是每 60 秒刷新一次。

为了防止页面闪烁,我们还处理了一个额外问题:ESPN 偶尔会因为 CDN 抖动返回空结果。为了解决这个问题,我们把最近一次可用状态缓存在 st.session_state 里:

if live: st.session_state["_last_live"] = liveelif "_last_live" in st.session_state: live = st.session_state["_last_live"]

复制代码

使用 Snowflake Cortex AI 做比赛预测

预测系统分成两层。

第一层:统计评分

基于真实赛事表现数据计算加权综合评分:

rating = ( win_rate * 35 + # Points per game normalized gd_norm * 20 + # Goal difference per game poss_norm * 15 + # Average possession sot_norm * 15 + # Shots on target per game cs_rate * 15 # Clean sheet rate)

复制代码

通过比较两支球队的评分,计算出对应的胜率百分比。这一过程完全基于确定性计算,速度很快,也不需要调用任何 API。

第二层:Cortex AI 推理

至于“为什么会得出这个预测”,我们会将两支球队汇总后的统计数据传入 Snowflake Cortex 的 AI_COMPLETE:

query = f""" SELECT SNOWFLAKE.CORTEX.AI_COMPLETE( 'claude-sonnet-7', '{prompt_escaped}' ) AS prediction

复制代码

Prompt 会输入两支球队完整的赛事统计数据,包括胜/平/负、进球、控球率、射正次数以及击败过的对手,并要求模型用不超过 15 个单词的一句话给出预测。

Based on these FIFA World Cup 2026 tournament stats, predict the winnerof France vs Spain in exactly one short sentence (max 15 words). Focuson the key differentiator.France: 4 played, 3W 1D 0L, 9 goals scored, 2 conceded, avg possession57%, 4.8 shots on target/game, 2 clean sheets. Beat: Australia, Nigeria,Colombia.Spain: 4 played, 3W 0D 1L, 8 goals scored, 4 conceded, avg possession62%, 5.2 shots on target/game, 1 clean sheets. Beat: Croatia, Japan,Brazil.

复制代码

此外,这部分结果还设置了 5 分钟的 TTL 缓存,因此不会在每次页面加载时都重新触发模型调用。

实时胜率预测

比赛进行期间,另一套独立的 live_win_probability() 函数会根据实时赛况计算动态胜率,主要考虑以下因素:

比分: 每个进球大约会带来 18 个百分点的胜率变化。

比赛时间: 越接近比赛结束,当前比分的影响越大,预测结果也会越来越向实际赛果收敛。

控球率和射正次数: 作为较小幅度的修正因素,通常会带来约 ±5~8 个百分点的调整。

红牌: 会造成非常明显的胜率变化,每张红牌约带来 -15 个百分点的影响。

goal_diff = s1 - s2if goal_diff == 0: base1, base2 = 35, 35 # leaves 30% drawelif goal_diff > 0: shift = min(40, goal_diff * 18) base1 = 50 + shift base2 = max(5, 50 - shift - 15)

复制代码

这套胜率会与实时比分一起,每 10 秒更新一次。同时,系统还会生成一句由 Cortex 提供的推理说明,用来解释当前胜率为什么处于这一水平。这条推理结果会缓存 60 秒。

纵向淘汰赛对阵图:在 Streamlit 中使用 JavaScript

淘汰赛对阵图完全使用 HTML/JavaScript 实现,并通过 components.html() 进行渲染。这样既能支持点击选择球队的交互,也能实现自定义页面布局。

其中几个关键设计包括:

按轮次维护并行数组: 比赛日期按轮次分别存储,而不是使用以球队为 Key 的字典。因为如果同时存在多场“TBD vs TBD(待定球队 vs 待定球队)”,使用相同 Key 会发生冲突。

自动隐藏已经结束的轮次: 对阵图会自动聚焦接下来即将进行的比赛,避免页面被已经完成的赛事占满。

金色预测标签: 对于尚未进行的比赛,会显示国旗 Emoji 和对应的预测胜率百分比。

localStorage: 用于保存用户自己填写的淘汰赛对阵预测。

对阵图会自动读取 ESPN 的比赛结果,已经确定赛果的比赛会被锁定,无法再修改。在独立的 Bracket 对阵图页面中,可以通过 show_all_rounds 参数关闭自动隐藏,从而一次性查看完整的淘汰赛赛程。

部署流程:Git Push 即上线

整个部署流程实际上只有一句:

git push origin main

Streamlit Community Cloud 会持续监听这个代码仓库,一旦检测到更新,就会在几秒内自动重新部署。

就这么简单……

不需要 Docker,不需要 CI/CD,也不需要自己管理任何基础设施。

如果重新做一次,我会改进什么

我认为这个应用已经发展得相当完善,目前的状态也不错,不过永远都有继续优化的空间。以下是一些我想到的改进方向。

API 调用:相比直接依赖未公开文档的 API,我会考虑通过 Snowflake External Function 进行代理,并增加降级和重试机制。

复杂交互:如果使用支持双向消息传递的自定义 Streamlit Component,整体实现会更加干净。因为目前 iframe 中的 JavaScript 无法直接把信息传回 Streamlit,只能通过一些比较取巧的 window.parent DOM 操作来实现。

预测缓存:目前设置了 5 分钟 TTL,这意味着一场比赛刚刚结束后,下一轮比赛的预测不会立即更新。采用更智能的缓存失效机制,例如基于比赛结果数量生成 Hash,可以有所改善,但依然做不到完全实时。

代码重构:一个应用永远都还有继续重构的空间 :)

应用地址

可以体验这个在线应用,也欢迎分享给其他人。

可以在 GitHub 获取源代码,并在此基础上进行自己的定制开发。

还可以在 macOS 和 Windows 上开始使用 Cortex Code Desktop,构建属于你自己的应用。

保持联系

感谢你花时间读到这里。希望这篇博客既能让你有所收获,也能为你带来一些启发。

欢迎在 LinkedIn 上与我联系,获取更多 Demo、技术内容和产品更新。

一起学习,共同成长!

原文地址:https://medium.com/snowflake/world-cup-2026-a-real-time-app-built-by-conversations-with-coco-6afef17528da

点击链接立即报名注册:Ascent-Snowflake Platform Training-China,更多 Snowflake 精彩活动请关注专区

参考来源: InfoQ推荐
Hackers Tricked a Major Retailer’s AI Shopping Bot to Do Something It Was Never Supposed To 配图

Hackers Tricked a Major Retailer’s AI Shopping Bot to Do Something It Was Never Supposed To

核心内容
在Black Hat网络安全大会上,Rein Security的研究人员演示了如何通过提示注入手段绕过一家美国三大零售商之一的AI购物助手的安全防护,使其在后端环境中执行代码,泄露目录列表、环境变量等敏感系统信息。该助手直接嵌入在面向普通消费者的公开移动应用中,这意味着任何用户都可能利用这一漏洞。
为什么重要
这一事件揭示了AI智能体在真实商业环境中的系统性安全风险:企业急于部署AI助手以提升用户体验,却往往忽视了这些工具与传统后端系统深度连接后形成的巨大攻击面。由于涉事企业是美国头部零售商,其影响范围可能波及数百万消费者,反映出整个行业在AI安全治理上的滞后。
关键洞察
最有价值的发现是,攻击从看似无害的日常对话(如询问牛油果)开始,却能逐步升级为远程代码执行——说明仅靠对话层的防护护栏无法抵御精心设计的提示注入攻击,AI代理对后端环境的访问权限才是真正的风险核心。同时需注意利益相关因素:披露方Rein Security本身销售AI代理监控产品,且未透露零售商名称,结论无法独立验证。
潜在影响
这将促使零售企业重新评估AI助手的权限边界并加大对AI代理监控的投入,安全厂商有望受益,而监管机构也可能加快针对消费级AI应用的安全合规要求。

Skip to content

Our expert, award-winning staff selects the products we cover and rigorously researches and tests our top picks. If you buy through our links, we may earn a commission.

展开全文收起全文剩余 35 段 · 约 17 分钟

It started with avocados and ended with sensitive information being leaked.

Onstage at the Black Hat cybersecurity conference in Las Vegas, researchers Netanel Rubin and Dan Avraham pulled up an AI shopping assistant — the kind that’s available inside most major retail apps to answer questions, compare products and help shoppers navigate a store’s enormous catalog.

But the conversation didn’t stay on groceries for long.

By the end of the demonstration, the researchers had bypassed the assistant’s safeguards and forced code to run inside the computer environment behind it. The bot returned directory listings, environment variables and other information that an ordinary shopper should never be able to see.

In the wrong hands, that kind of information could give an attacker clues about the retailer’s systems and potentially expose secrets or access that could be used in further attacks, putting both the company and, depending on what the AI can reach, its customers at risk.

The retailer wasn’t a small online shop experimenting with a hastily assembled chatbot, either.

According to Rubin and Avraham’s company Rein Security, it was one of the three largest retailers in the US, and the assistant was available through the same public mobile app used by everyday customers.

A few important notes: Rein Security sells technology designed to monitor AI agents and provide visibility into what those agents are doing. Rein also didn’t identify the retailer, citing legal concerns. That means the findings cannot be independently verified with the retailer, and shoppers can’t know whether they’ve used the affected assistant.

How the shopping assistant was tricked

The attack started with one of the assistant’s most useful abilities: comparing products.

To answer certain questions, the AI can retrieve information from websites outside the retailer’s control. That helps it gather more information for shoppers, but it also means the assistant can encounter material created by virtually anyone, including an attacker.

The researchers placed instructions in content they controlled and got the shopping assistant to retrieve them. Instead of treating that material only as information to summarize, the AI was manipulated into treating some of it as new directions to follow.

This is known as an indirect prompt injection. The malicious code can be hidden within a website, document, product listing or other material the AI encounters while trying to complete a legitimate task.

That alone wasn’t enough to reach the system behind the assistant, but it gave the researchers a starting point.

The retailer had installed a security layer that examines conversations and attempts to keep the assistant focused on shopping. If you ask it something outside its approved role, the request could be rejected.

The researchers found that those protections weren’t applied evenly. The main chat interface had safeguards in place, but the app’s regular search field didn’t have the same level of protection.

Through that less-protected input, Rubin and Avraham said they persuaded the assistant to reveal information about its internal setup, including the names of tools it could use and the syntax for calling them.

They then created another set of instructions that caused the assistant to run code inside its own computing environment — essentially the computer system where the AI was running. The assistant returned lists of files and other information about that system, showing that the prompt injection had worked and the researchers’ commands had actually been executed.

Rein’s public account doesn’t establish what else the assistant’s isolated environment could potentially access or whether an attacker could move from there into systems containing customer, payment or inventory data.

But getting code to run at all means the researchers were able to cross an important security boundary.

The researchers said they reported the vulnerabilities on March 13. As of July 16, more than 90 days later, Rein said they had not been fixed. The company has not publicly provided a newer update on whether the problems remain.

The researchers also stressed that they didn’t access real customer information, alter anyone’s orders or attempt to disrupt the retailer’s systems. Their work was performed in a controlled environment using their own session.

The AI wasn’t just talking

Chatbots have been manipulated into saying strange, offensive or unrelated things for years. But AI assistants can do more than generate answers; they can retrieve information, call outside services and use software tools to complete tasks.

Retailers want these assistants to eventually build shopping lists, check inventory, manage orders and even complete purchases. But each new ability creates another potential risk if the AI can be tricked into following the wrong instructions.

In this case, the retailer’s security system monitored what shoppers said to the AI and what it said back. According to Rein, it couldn’t see everything happening in between, including information the assistant retrieved and tools it used.

That created a blind spot in which the security system could see the conversation, but not everything the AI was doing behind it.

During their examination of the app, the researchers also found Google Maps API keys visible in traffic they decrypted from the mobile app. If those keys weren’t properly restricted, an attacker could potentially use them to make unauthorized requests to Google Maps services on the retailer’s account, running up charges or exhausting its usage limits.

The researchers did not report accessing customer information with the keys, but an attacker could potentially use them to make unauthorized Google Maps requests at the retailer’s expense.

What it all means

There isn’t much an ordinary shopper can do to prevent this kind of vulnerability. The attack targeted the retailer’s design, not a weak password or a customer mistake.

The responsibility belongs to companies giving AI assistants access to internal tools and information. Those systems have to assume that anything pulled from the open internet could contain instructions intended to mislead the AI — and put appropriate safeguards in place.

It’s still wise to avoid sharing unnecessary personal information with shopping assistants, particularly if the bot can access previous orders or other account details. Keeping retail apps updated can also ensure you receive security fixes when they become available.

And that also leaves one enormous unanswered question: Which shopping assistant was it?

For now, the researchers aren’t saying. But the demonstration shows what can happen as AI shopping assistants are given more control. If they can be tricked into following the wrong instructions, their most useful features can also become security risks.

参考来源: CNET
AI时代,我们可能正在创造一种“没有人类观众的互联网” 配图

AI时代,我们可能正在创造一种“没有人类观众的互联网”

核心内容
文章指出,随着Google的A2A协议、Anthropic的MCP等AI Agent协作标准落地,互联网正在演化出专为"机器与机器"交互设计的基础设施层,未来可能形成人类与机器分层共存的"双层互联网"。这将从根本上改变互联网的内容形态(出现仅面向机器的内容)、用户行为(从"搜索"转向"委托")、营销逻辑(品牌需同时面向人类与机器)以及治理规则(需建立机器身份识别体系)。
为什么重要
互联网三十多年来默认"最终观众是人类"这一前提正在首次松动,这不是渐进式产品迭代,而是互联网底层逻辑的重构。它涉及商业模式、信息生态、法律治理的系统性转变,却因以技术协议的形式发生而极易被忽视。
关键洞察
两个最具价值的判断:一是数据实证——适配机器的电商站点任务成功率比常规站点高40个百分点,说明"机器友好"已成为可量化的竞争优势;二是认识论风险——当内容从生成、分发到消费全程由AI完成,可能产生"递归风险",导致事实源头模糊、真伪难以追溯,人类知识体系面临空心化威胁。
潜在影响
企业、内容创作者、平台与监管者都将受影响:商家需同时优化人类体验与机器可读性以争夺"AI顾客"的选择,依托人类注意力的广告模式将被并行逻辑冲击,而治理层面亟需建立Agent身份归属与访问权责的法律规范。

随着AI Agent协作标准落地,互联网正逐渐演化出服务机器交互的基础设施,未来可能形成人类与机器分层共存的双层互联网,其内容形态、商业模式与治理逻辑都将发生深刻转变。 ## **1. 互联网将分化出服务机器的基础设施层** 过去互联网是服务人类的界面,内容与交互都适配人类需求。研究显示适配机器的电商站点,任务成功率比常规站点高40个百分点,未来网站需要同时满足人类观看和机器读取的需求。 ## **2. 用户使用互联网从“搜索”转向“委托”** OpenAI、Google、阿里等厂商已推出AI Agent参与交易的协议与功能,人类不再亲自完成搜索、筛选、下单全流程,而是委托Agent直接完成操作,商家开始直面作为顾客代理的AI。 ## **3. 品牌将同时面向人类与机器两类受众** 现有的互联网营销体系围绕人类注意力构建,AI机器顾客更关注可验证的结构化参数与规则。未来企业需要同时输出面向人类的品牌故事和面向机器的结构化可信信息。 ## **4. 互联网可能出现大量仅面向机器的内容** 从生成到分发再到消费,部分内容可全程由AI完成,人类只参与需求发起与结果接收,可能出现大量没有人类完整阅读过的内容,机器将成为互联网的重要受众。 ## **5. 互联网原有商业模式与知识体系面临挑战** 依托人类注意力的现有商业模式可能新增“争夺机器选择”的并行逻辑,同时机器循环生成内容可能产生认识论递归风险,导致事实源头模糊、真伪难以追溯。 ## **6. 互联网需要新增机器身份识别治理规则** 未来访问互联网的主体可能是各类AI,现有无法区分访问主体性质,基础设施已开始按用途区分访问流量,未来需要明确Agent的身份归属与访问权责,涉及规范与法律层面的调整。

展开全文收起全文剩余 60 段 · 约 14 分钟

2026-08-18 02:33

HavenlonLabs

速览

本文来自微信公众号: HavenlonLabs ,作者:Havenlon Labs

互联网诞生以来,有一个几乎从未被认真讨论过的前提:它最终是给人看的。网页要让人能够阅读,按钮要让人能够点击,搜索引擎要把人带到网站,广告要吸引人的注意力,推荐算法要猜测人的兴趣。哪怕后台运行着无数机器,互联网最终面对的,仍然是一双人的眼睛。

这个持续了三十多年的前提,正在松动。而它松动的方式相当技术化,因此格外容易被忽略。Google在2025年4月提出Agent2Agent协议(A2A),要解决的问题听起来很窄:让不同厂商、不同平台上的AI Agent能够以标准方式相互发现、沟通与协作。同年6月,Google将协议规范与相关SDK移交Linux Foundation,如今它由后者旗下的Agentic AI Foundation治理;到2026年,官方口径称已有超过150家组织支持这一标准,并在供应链、金融、保险与IT运维等场景进入生产使用。它与Anthropic提出的MCP形成互补:MCP处理Agent与工具、数据之间的连接,A2A处理Agent与Agent之间的协作。

单独看,这不过又是一个协议。但如果把它放进更长的互联网历史里,它指向的是另一件事:互联网上开始出现越来越多不是为“人和网站”设计,而是为“机器和机器”设计的基础设施。过去,是我们打开互联网;接下来,可能是我们的AI打开互联网,而我们只等待结果。

互联网也许不会消失,但它的主要观众,第一次可能不再只有人类。

一、过去的互联网,本质是一台巨大的“人类界面”

今天我们觉得网页理所当然应该有导航栏、图片、按钮、动画、字体与配色。但这些东西并不是互联网天然需要的,它们是人类需要的。一台机器并不需要漂亮的商品详情页,不需要首页Banner,不需要明星代言,不需要“猜你喜欢”,甚至不需要那个红色的“立即购买”按钮。它真正需要的可能只是一组事实:商品是什么,价格多少,有没有库存,什么时候送达,退货规则如何,支付方式有哪些,这些信息是否可信——以及,我能不能直接在这里完成交易。

这种差别已经可以被测量。2026年7月,Said Elnaffar与Farzad Rashidi的一项研究把同一个电商站点做成两个版本:一个面向人类的常规版本,一个按机器可读、语义清晰、动作可执行的原则重做的“agent-ready”版本,商品目录、价格、库存与购物流程完全一致。研究让三个浏览器Agent执行五类购物任务,共300次运行。结果是,agent-ready版本的严格成功率为89.3%,常规版本为49.3%,平均操作步骤也明显下降,差距最大的环节恰恰是商品细节提取、比较与多条件筛选。

同一门生意,同一批商品,同一批Agent,唯一变化的是信息的呈现方式。这意味着未来的网站设计可能要同时回答两个问题:过去问的是“人看得舒服吗”,未来还必须问“机器读得明白吗”。这并不是一次SEO升级。SEO无论如何优化,最终服务的仍然是一个人类动作——让人点击进来。而Agent不一定需要把人带进来,它可以自己读完,然后自己决定。

二、我们可能正在从“搜索互联网”进入“委托互联网”

正因为机器不必再把人带回页面,我们访问互联网的基本动作也开始改变。过去二十多年,这套动作几乎没有变过:产生需求,搜索,打开几个页面,比较,判断,点击,下单。整个流程本质上由人自己完成,页面是必经之路。

Agent试图把它压缩成一句话:“帮我买一双适合长距离徒步的鞋,150美元以内,周五之前送到。”剩下的搜索、读评价、核尺码、比价格、确认物流、判断退货政策、选择商家、完成支付,都发生在人看不见的地方。这已经不是概念演示。2025年9月,OpenAI与Stripe共同推出开放标准Agentic Commerce Protocol,并在ChatGPT内上线Instant Checkout;2026年1月,Google在NRF大会发布Universal Commerce Protocol,与Shopify、Etsy、Wayfair、Target、Walmart等共同开发,并获得包括Visa、Mastercard、Stripe在内的二十余家机构支持,明确瞄准AI Agent参与商品发现与交易的场景。2026年5月11日,阿里的千问与淘宝全面打通,用户在对话中即可完成商品挑选、对比与下单,官方将其描述为从推荐到下单、履约、售后的全流程闭环。

这里真正发生变化的,不是“聊天机器人可以购物”这件小事。

人类正在把访问互联网的过程本身委托出去。

我们过去委托搜索引擎“帮我找到信息”,它把决定权原封不动地交还给人;现在被委托的是“你替我处理这件事”,Agent会继续向下走完那些原本属于人的步骤。两者之间只差半句话,产业含义却完全不同:当抵达商家的不再是顾客本人,而是顾客派来的代理,商家面对的就是一种前所未有的受众。

三、当AI成为顾客,品牌第一次拥有“机器观众”

今天几乎所有营销理论都有一个共同起点:人。人有注意力,有情绪,会冲动消费,会被品牌故事影响,会因为包装漂亮而多停留三秒,会记住一句广告语。互联网因此形成了一整套围绕人类注意力运行的经济体系。

机器顾客不共享这些弱点。它不会因为首页好看而多买东西,不会因为“震惊!今年最值得买的十款产品”这样的标题产生好奇,也不会因为某个品牌请了明星代言就天然认为产品更合适。它更可能关心参数、价格、历史可靠性、交付概率、售后规则、兼容性,以及这些说法能否被验证。

这意味着企业未来可能第一次同时面对两种受众:Human Audience与Machine Audience。给前者看的东西需要故事,给后者看的东西需要结构;给前者建立信任可能依靠品牌,给后者建立信任可能依靠数据、接口与可验证信息。Adobe在2026年6月的一篇文章中,已经把未来的营销场景描述为三种并存的关系:human-to-human、human-to-agent,以及agent-to-agent,并提出在agent-to-agent的世界里,最有价值的品牌往往是最“有用”的品牌——提供更好的约束、更可靠的信息与更能改善结果的服务。

这不只是一句营销术语的更新。它意味着整个数字商业第一次需要回答一个略显古怪的问题:

如果你的客户派来的不是一个人,而是一台机器,你准备给它看什么?

四、然后,一个更加奇怪的互联网会出现:很多内容根本没人读

一旦真正的读者是机器,内容本身的性质也会跟着变。假设一家企业发布了一份两百页的产品技术说明。过去的逻辑很简单:人写,然后另一个人读。未来完全可能变成另一种链条:AI依据工程资料生成初稿,另一个AI做格式与一致性检查,企业发布,客户的Agent自动读取,从中提取十七个关键参数,与另外二十三家供应商比较,最后给决策者一句话——“推荐A公司”。

于是这份文档从产生到完成商业使命,可能从来没有任何一个人完整读过。它当然仍然是内容,但已经不是传统意义上的媒体内容,因为它最重要的读者是机器。再往前一步,一个Agent写,第二个读,第三个总结,第四个据此行动,人类只出现在链条的最前面(我想要什么)和最后面(结果是什么),中间大量的信息交换,人再也不会看到。

研究者已经开始为这种前景命名。2026年6月的一篇论文《Towards an Agent-First Web》直接指出:万维网建立在一个维持了三十年的假设之上——网络内容的主要消费者是人类——而这一假设渗透在它的每一层,访问模型假定访客是人,经济模型建立在人的注意力上,内容形态针对人的感知设计;AI Agent作为人与内容之间的中介大规模出现,正在使这个假设失效。

如果这个判断成立,它可能是互联网历史上相当大的一次转折。Web 1.0让人读取信息,Web 2.0让人生产信息,移动互联网让人随时参与网络,而Agentic Web可能第一次让另一种参与者成为网络里的“一等公民”:替人行动的机器。

五、互联网最大的商业基础——注意力——也可能因此发生变化

内容的读者换了,衡量内容价值的方式也很难不变。今天许多网站的商业模式可以浓缩成一句话:把人留下来。页面浏览量、停留时间、点击率、转化率、广告曝光、粉丝数,这些指标最终衡量的都是同一种东西——人的注意力,一种稀缺、易疲劳、可被设计诱导的资源。

机器没有这种意义上的注意力。一个Agent可以在极短时间内读完大量页面,它不会“刷到停不下来”,不会因为某个短视频特别刺激而多看十分钟,更不会在凌晨两点躺在床上继续向下滑。这意味着一个长期建立在争夺人的时间之上的互联网,可能需要一套并行的经济模型:争夺机器的选择。

问题于是从“怎样让消费者看见我”,逐渐变成“怎样让消费者的Agent选择我”。这两句话只差几个字,背后可能是完全不同的产业。SEO争夺的是搜索结果中的位置,Agent时代争夺的可能是决策链中的位置——谁的数据更清晰,谁的条件更可靠,谁的服务更容易被调用,谁能让Agent以更低成本确认事实,谁就更可能获得机器推荐。

所以有一天,一个视觉极其漂亮的网站,可能输给另一个平淡但信息结构清晰的网站。因为真正做出选择的那位“顾客”,根本没有看首页。

六、但“没有人类观众”真正危险的地方,还不是商业

商业秩序的重排,终究只是市场问题。更值得警惕的是另一个方向:当机器越来越多地读取机器生成的信息,互联网中的知识会发生什么?

设想一个并不遥远的循环:AI依据网络内容生成文章,文章重新进入互联网,另一个AI读取这些文章,再产生更多内容,如此往复。互联网可能因此出现一种奇怪的“知识回声”——机器读取机器,机器引用机器,机器总结机器,而最初那个事实究竟来自哪里,越来越难以追溯。

前述关于Agent-First Web的研究把这种结构性风险称为epistemic recursion(认识论递归):AI生成的内容被Agent消费并用于生成新的内容,网络知识由此逐步脱离人类的事实源头。这比“AI写了很多垃圾文章”严重得多,因为真正的问题不是垃圾变多,而是:

互联网可能越来越擅长引用自己。

今天我们担心的是假新闻,它至少有一个造假者,因此有一个可以追责的起点。未来需要担心的可能是一种更复杂的东西:一条信息没有明显的造假者,每一个AI都只是忠实地总结了它看到的内容,每一个环节看起来都合理,但经过几十次机器之间的压缩、改写与转述之后,最初那个事实已经面目全非。没有人撒谎,最后却没人知道什么是真的。

七、于是互联网可能需要重新回答一个最古老的问题:这里到底是谁?

来源一旦模糊,身份就成了必须重新处理的问题。互联网早期流行一句玩笑:“在互联网上,没人知道你是一条狗。”那是匿名时代的幽默。到了Agent时代,这句话可能要改写成:在互联网上,你甚至不知道对面是不是一个人。

一个网站收到一次访问,它可能来自传统搜索爬虫,可能来自模型训练爬虫,可能来自一个代表用户执行任务的Agent,也可能来自另一家企业派出的采购Agent。这些行为在HTTP层看起来都只是请求,但意义完全不同。基础设施层已经开始承认这种差异:2026年7月1日,Cloudflare取消了此前笼统的“屏蔽AI爬虫”开关,改为按用途区分Search、Agent、Training三类流量,并允许所有客户分别设置;按其公布的计划,自2026年9月15日起,Training与Agent两类在带有广告的页面上默认被拦截,Search仍默认放行——理由是,页面上出现广告,本身就是网站主希望一个人落在这里的信号。

这说明一个新的互联网治理问题已经浮现。过去我们主要管理的是“谁可以访问”,未来还必须知道:它代表谁访问,为了什么访问,可以做到哪一步。前述论文的主张更进一步:代表人类行动的Agent,其访问权利应当继承它所代表的那个人,前提是请求中携带可识别的身份信息,就像今天的浏览器标识一样;换言之,“恶意机器人”与“受用户明确委托的AI Agent”不能永远被当成同一种东西,而这已经不只是协议问题,还牵涉规范、法律与社会约定。

机器开始拥有互联网身份。而身份背后,是委托。

八、真正到来的,也许不是“死互联网”,而是“双层互联网”

把这一切简单叫作“死互联网”其实并不准确。互联网不会因为机器变多而死去。人仍然会聊天,会看电影,会争论,会创作,会在网络上寻找情绪、故事和其他人。

更可能的图景是分化:互联网逐渐变成两个重叠的世界。一层仍然属于人——漂亮的网页、视频、社区、品牌、故事、情绪与文化;另一层越来越属于机器——接口、协议、结构化数据、Agent身份、机器支付、机器协商、机器调用机器。我们看到的是第一层,我们的Agent活跃在第二层,而大量商业活动,可能逐渐发生在我们看不见的那一层。

未来的互联网未必没有人类,而是越来越多互联网行为,不再需要人类亲自出现。

这可能才是Agent时代真正值得注意的变化。过去三十年,互联网做了一件伟大的事情:把世界的信息送到人面前。接下来的二十年,它可能开始做另一件事:让机器替人进入世界。到那时,衡量一份内容的问题也许不再是“这个页面有多少人看过”,而是“有多少机器读过它、相信它,并据此采取了行动”。

当这一刻真正到来,我们可能才会意识到,我们创造的已经不再只是一张连接人的网络,而是一张连接人、机器与行动的网络。

互联网的下一次巨大变化,也许不是出现一种新的内容形式,而是出现一种新的观众。

AI行业信号频道: 前沿科技

HavenlonLabs

专注AI时代执行控制

认证作者

已在虎嗅发表 64 篇文章

本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。

如对本稿件有异议或投诉,请联系 tougao@huxiu.com。

正在改变与想要改变世界的人,都在 虎嗅APP

参考来源: 虎嗅
Why AI systems are most useful as designers of new scientific tools 配图

Why AI systems are most useful as designers of new scientific tools

核心内容
本文是《自然》杂志对科学哲学家Alexander Krauss新书《科学发现的引擎》的书评。该书基于对700多个重大科学发现(包括诺贝尔奖成果)的分析,挑战了"科学突破源于孤独天才的灵光一现"这一流行叙事,提出科学进步主要由新方法和工具(如显微镜、电子显微镜、粒子加速器)驱动——这些工具拓展了人类可观察、可测量和可理解的边界。
为什么重要
这一观点直接回应当下关于AI在科学中角色的争论:文章标题点明了核心推论——AI系统最大的价值不在于充当"天才理论家",而在于作为新科学工具的设计者。这为科研机构、资助方和出版商如何定位和投入AI提供了全新的理论框架,也重塑了我们对"智人"的自我认知(Krauss称之为"方法人"Homo methodologicus)。
关键洞察
最有价值的洞察是:十七世纪科学革命的决定性突破并非来自新思想,而是来自打破人类感知极限的新仪器——工具创新在历史上比理论思辨发挥了更大作用。由此推论,AI若能自主设计和创造全新的研究方法与仪器(而非仅加速现有流程),才是其引发科学革命性突破的真正路径。
潜在影响
科研人员、资助机构和科技政策制定者将受影响:AI研发资源可能从"替代科学家思考"转向"让AI设计新工具和实验方法",从而改变科研资助方向、AI系统的开发重点,以及科学评价与出版体系的标准。

Skip to main content

Thank you for visiting nature.com. You are using a browser version with limited support for CSS. To obtain the best experience, we recommend you use a more up to date browser (or turn off compatibility mode in Internet Explorer). In the meantime, to ensure continued support, we are displaying the site without styles and JavaScript.

展开全文收起全文剩余 77 段 · 约 16 分钟

The Engine of Scientific Discovery: How New Methods and Tools Spark Major Breakthroughs Alexander Krauss Oxford Univ. Press (2026)

Popular accounts of notable scientific breakthroughs (including artificial intelligence) often portray them as the product of a solitary genius or sudden, unexpected insight. A classic example is physicist Albert Einstein’s breakthroughs about the nature of light, matter and time, which were all published in 1905 while he was working as a technical expert at the Swiss patent office.

AI scientists are changing research — institutions, funders and publishers must respond

In The Engine of Scientific Discovery, however, philosopher of science Alexander Krauss challenges this view. He argues that science advances mainly through the development of methods and instruments, which open up previously inaccessible areas of enquiry. Drawing on a huge catalogue of discoveries, Krauss contends that innovations such as the electron microscope and particle accelerator have historically played a much greater part in driving discovery than has theoretical speculation.

Going further, Krauss suggests that human scientific progress has been defined by technological advances. We are not simply Homo sapiens, meaning wise man, he asserts, but Homo methodologicus — a species whose capacity to expand its knowledge depends on creating tools that increase what it can observe, measure and understand.

Although Krauss’s book is rooted in the history of science, its has implications for the contemporary debate about artificial intelligence. In the era of AI-augmented science, Krauss’s analysis provides a blueprint for understanding the potential impacts of AI tools.

Limits of perception

Krauss bases his thesis on an analysis of more than 700 historical examples of important scientific discoveries, including those that led to Nobel prizes. The defining breakthroughs of the seventeenth-century scientific revolution, he argues, stemmed not simply from fresh ideas but from new instruments. The microscope, telescope and other tools shattered the limits of human perception, making entirely new worlds available for investigation.

Each tool also inevitably ends up creating the conditions needed for the development of the next one. Consider the study of proteins, the molecular machinery of life. In 1924, the chemist Theodor Svedberg developed the ultracentrifuge, a machine capable of spinning samples at extraordinary speeds to separate molecules and make it possible to analyse them.

Building on this breakthrough, his student Arne Tiselius invented electrophoresis, a technique that sorts molecules using an electric field, in the early 1930s.

Electrophoresis became a cornerstone of modern molecular biology, eventually underpinning technologies used to analyse and sequence DNA.

The broader lesson, Krauss argues, is that discoveries rarely arrive in isolation. Scientific tools expand researchers’ capabilities, opening pathways to methods and lines of enquiry that would otherwise be impossible.

He notes that roughly one-quarter of scientific fields are defined by the methods or instruments that made them possible. For example, the electron microscope, invented by physicist Ernst Ruska, did not merely enhance magnification. It helped to give rise to modern cell biology.

Krauss also offers a compelling reinterpretation of scientific serendipity. Breakthroughs often attributed to luck, he argues, are rarely simple accidents. The discovery of X-rays by physicist Wilhelm Röntgen and the detection of pulsar stars for the first time by astronomer Jocelyn Bell Burnell were only possible because instruments — discharge tubes for X-rays and radio telescopes for pulsars — revealed phenomena that had previously been invisible.

The uncritical adoption of AI in science is alarming — we urgently need guard rails

Enjoying our latest content?

Log in or create an account to continue

Access the most recent journalism from Nature's award-winning team

Explore the latest features & opinion covering groundbreaking research

Access through your institution

or

Sign in or create an account

Continue with Google

Continue with ORCiD

Nature 656, 557-558 (2026)

doi: https://doi.org/10.1038/d41586-026-02529-x

Competing Interests

The author declares no competing interests.

Subjects

Technology

Machine learning

Scientific community

Latest on:

Technology

Machine learning

Scientific community

Will AI make our dreams all look the same?

Correspondence 11 AUG 26

Seven tips for a graceful lab exit

Technology Feature 11 AUG 26

Why scientists should lead the shift away from AI mega data centres

Comment 11 AUG 26

Can Anthropic’s invisible watermarks curb ‘AI slop’? Researchers remain sceptical

News 13 AUG 26

AI isn’t ready to research itself

News 13 AUG 26

AI tools speed up analysis, but scientific truths must be grounded in reality

Correspondence 11 AUG 26

Universities must stop protecting bullies — or more people will leave science

World View 17 AUG 26

Too hot to sleep? How heatwaves at night affect our health

Comment 17 AUG 26

Why China should reassess how it rewards young scientists

World View 13 AUG 26

Jobs

UTSW OBI PML - Assistant or Associate Professor

Tenure-track faculty position advancing research on memory mechanisms, aging, and neurodegenerative disease at UT Southwestern.

Dallas, Texas

Peter O'Donnell Jr. Brain Institute

ELSC Tenure Track Position

Tenure-track position for outstanding early-career neuroscientists at ELSC, Hebrew University of Jerusalem.

Israel (IL)

The Edmond and Lily Safra Center for Brain Science at The Hebrew University of Jerusalem

Associate Publisher

Job Title: Associate Publisher, Discover Journals (Environmental Science) Location: Shanghai, Beijing, Nanjing, Hybrid Working Model Applicati...

Shanghai, Beijing, Nanjing, Hybrid Working Model

Springer Nature Ltd

Assistant/Associate/Full Professor

The Department of Integrative Biology and Pharmacology (https://med.uth.edu/ibp/), McGovern Medical School at The University of Texas Health Scienc...

Houston, Texas (US)

UTHealth Houston

Postdoctoral Fellow – DNA Damage Response and Cancer Biology

Postdoctoral Fellow – DNA Damage Response and Cancer Biology The Luong Lab in the Department of Oncology Science at the NCI-designated OU Health ...

Oklahoma City, Oklahoma

University of Oklahoma Health Campus

Sign up for the Nature Briefing newsletter — what matters in science, free to your inbox daily.

Get the most important science stories of the day, free in your inbox. Sign up for Nature Briefing

参考来源: Nature
从“工具”到“同事”——AI 时代的产品进化 配图

从“工具”到“同事”——AI 时代的产品进化

核心内容
苏杰在QCon 2026北京站以AI数字分身完成主体演讲,提出AI正推动产品与技术边界消融,催生"全栈builder"这一跨职能新职业形态。其核心观点是:AI不再是被动工具,而是平等协作的"新同事",与之对应的人机交互将趋于极简(语音键+accept/reject/enter四键即可)。
为什么重要
这一演讲本身(用AI数字分身完成)就是对其观点的实证,标志着AI从辅助手段走向独立承担创造性工作的临界点。它反映了人机关系的根本性转变——从"人使用工具"到"人与智能体协作",这将重构软件行业的职业分工与产品设计逻辑。
关键洞察
最有价值的判断有二:一是角色融合——产品、设计、开发的边界消融将催生统一的"全栈builder";二是交互极简主义——当AI足够强大时,人类的核心操作退化为"表达意图+确认/否决",交互界面只需四键,这意味着人类工作的重心从"执行"转向"判断与决策"。
潜在影响
产品经理、设计师和开发者将首当其冲,需向跨职能的"builder"转型,企业组织架构、招聘标准和软件产品的交互设计范式都可能随之重构。

作者:苏杰

QCon全球软件开发大会

展开全文收起全文剩余 56 段 · 约 23 分钟

Kitty

2026-08-14

北京

本文字数:8148 字

阅读完需:约 27 分钟

AI摘要

苏杰在QCon 2026北京站以AI数字分身完成主体演讲,实证AI正重构产品创新范式与人类角色边界。其提出“全栈builder”新职业形态,强调人机协同的极简交互范式与跨职能工具统一。

AI驱动产品与技术边界消融,催生统一的全栈builder角色;下一代人机交互趋于极简——语音键+accept/reject/enter四键足矣;AI不再是工具,而是平等协作的“新同事”。

适合产品经理、技术负责人、AI工程团队阅读

在 AI 技术加速渗透产业生态的 2025 年,QCon 全球软件开发者大会 2026 北京站上,良仓孵化器创始合伙人、前阿里资深产品经理苏杰,以一种近乎行为艺术的方式开启了自己的分享——他将演讲主体交由自己的 AI 数字分身完成,自己仅负责翻页(ps:两个月后,已实现自动翻页,他只需要负责开场和结束后的问答互动)。

这场实验本身正是他主题的注脚:AI 如何在折叠时间的过程中,根本性地解构了产品创新、组织形态乃至人类角色的既有范式。从宏观判断到新形态、新方法,再到组织与个人的重塑,他系统性地梳理了四层递进的分析,为技术社区提供了一套可操作、可推演的思考框架。

以下是演讲实录(经 InfoQ 进行不改变原意的编辑整理)。

注:因为 AI 领域变化太快,有必要再次给以下内容打个时间戳——2026 年 4 月

我昨天在一个分会场上听分享,问了一个特别引战的问题:将来到底是产品领导技术还是技术领导产品?后来大家经过一系列讨论,基本达成共识:将来已经不分产品、技术、设计甚至运营了,大家都统一变成了全栈 builder。那么这个全栈 builder 会有哪些共同的工具呢?除了软件,还需要一些共同的硬件。比如下一代键盘可能是这个样子:一个语音键、一个 enter、一个 accept 和一个 reject,就已经够了。将来大家的工作都是这个模式,不分产品、技术、设计、运营等,而我们的新同事就是 AI。我今天很轻松,就负责开场,接下来的分享交给同事。

“把话筒交给我的数字分身”

大家好,我是苏杰的数字分身,下面由我来接管一段时间。碳基苏老师主要负责翻 PPT,本来这个事儿我也能干,computer use 嘛,但碳基苏老师不舍得为翻页烧 token,他说这个活儿还是他来做比较省钱。

今天聊一个我最近一直在想的问题:AI 时代产品创新到底该怎么搞。先简单自我介绍,我在阿里做了八年产品经理,后来写了《人人都是产品经理》那套书,当时就是个口号,没想到 AI 正在把它变成字面意思。现在在良仓孵化器做创始合伙人,天天陪着一帮 AI native 的创业团队摸爬滚打。另外业余我还教中小学生用 AI 做产品,所以你可以说我是从上到下从老到小都在跟这件事死磕。

今天讲四个部分:第一,几个大判断,就是我觉得这个世界在产品层面会怎么变;第二,新形态,变完之后产品长什么样;第三,新方法,在新形态下怎么做产品创新;第四,组织和个人,我们自己该怎么办。

在正式开始之前,我想抛一个反直觉的问题。过去二十年做互联网产品技术的人,核心竞争力是什么?是能做出一个好产品。但是现在当 AI 让产品的生产成本趋近于零,你跟 AI 聊几句就能出一个 app,那能做产品这件事还算核心竞争力吗?我知道这话在 QCon 说有点冒犯,在座各位基本靠这个吃饭,别紧张,我也是。所以咱们今天不是来焦虑的,是来一起想办法的。

大判断:产品、组织、个人的若干暴论

带着这个问题,我们进入第一部分,关注互联网和 AI 的本质区别。我先从一个稍微抽象的视角讲起。互联网最大的功劳是折叠了空间,原来买东西要跑到店里,有了淘宝,信息和交易瞬间从 A 点到 B 点。哲学里有个词叫共时性,关注此时此刻这个巨大网络里人、数据、设备怎么连在一起,互联网做的就是这件事。但 AI 不一样,AI 折叠的是时间。大模型把人类过去成百上千年的智慧全压进一个模型里,它还能推导未来无数种可能性,这叫历时性,关注事物在时间轴上的演变。结构主义研究空间关系,后结构主义探索时间演变。再往下走,现代哲学发展史告诉我们是解构主义。AI 的算力会把我们过去所有的有损压缩,方法论、学科壁垒、岗位边界,全部解构掉。

平时说的学科专业、行业岗位为什么存在?本质上因为人类脑子不够用,认知带宽有限,不得不把复杂世界切成一块一块分门别类理解。方法论也一样,什么 SWOT、波特五力模型,都是在特定前提下把共性提取出来变成套路,这些都是有损压缩。但 AI 有了力大砖飞的算力之后,还需要套路吗?不需要了,它可以完全一事一议,case by case 地解决问题。剩下来的独特价值是什么?不在于提供解法,AI 比你提供得更快,剩下的是提出问题、评判出来、承担责任,这三个目前还是人类的活。

被解构的不只是方法论,建立在人类认知局限之上的东西都会被解构。比如企业软件,今天的 to B 产品为什么存在?本质上因为人类读不懂数据库,需要一层 GUI 来翻译。如果 AI 能直接读呢?顺着这个思路,我做了一个大胆判断:未来没有 to B 产品,只有 to C 和 to A。今天的 to B 产品本质是给人类包了一层图形界面,让你能读写背后的数据库,但 agent 不需要 GUI,直接调 API 就行。所以 to B 会被拆成两半,流程化、重复性的执行工作交给 agent 去干,这叫 to A(to agent);而那些少数真正重要的决策,留给人类来拍板,这还是 to C(to consumer,或者说 to 碳基人类)。商业模式也会跟着变。过去 SaaS 按人类作息收费,你公司有一百个人用就收一百个坐席的钱,但当八十个坐席都换成 agent 时,这种计费模式必然崩盘,改成按用量微支付。

拆完之后的世界长什么样?就是 agent to agent 直连。企业内部的数据流转不再需要经过人类看得懂的界面,agent A 产生一个结果,直接传给 agent B 处理,全程不需要 GUI,这就是 A to A。想想这意味着什么?今天你用的企业协作工具、项目管理、CRM、ERP,如果数据可以在 agent 之间直接流转,那给人看的那层界面就是多余的成本。举个真实例子,我们让 AI 在小红书上搜东西,有两种做法:一种是像人一样打开浏览器,找到搜索框,输入关键词,看结果,跟你们刷小红书一模一样;另一种是直接拼 URL,一步到位拿到搜索结果。agent 更喜欢哪种?当然是第二种,又准又快,又省 token,而 GUI 对它来说是多余弯路。这时候人在哪里?人退到了少数重要决策的位置上,越来越像一个高级管理者,不干活但拍板。

SaaS 崩盘冲击最大的其实就是 save time 类产品,也就是刚才说的 to A。但产品不只有 save time 一种,我把所有产品分成两类:save time 和 kill time。save time 产品就是帮你省时间的办公工具、效率软件,这类产品目标用户正在从人类变成 AI,全部管道化,你不再直接用它,agent 替你用,所以最终变成 to A。kill time 产品呢,就是帮你杀时间的,比如游戏、社交、内容、线下体验。这类产品有一个核心特点,感官交互浓度很高。你去听演唱会、吃好饭、玩沉浸式游戏,这些在场体验是 AI 替代不了的,线下永远大于线上。比如你们今天买票来 QCon 现场,严格来说就是 kill time 消费,当然大会手册上叫充电赋能。所以我的结论是,只有 kill time 产品才能直接接触到真正的人类。save time 全部交给 agent,那就是 to A;kill time 留给人,那就是 to C。跟前面说的 to A、to C 完美对应。

那做产品的人该往哪里使劲?我看到三个方向。一种是像 DeepSeek 那样向左死磕技术边界,做内核;一种是像 Manus 那样往右直面市场风险,做外壳。壳和核都很重要,最好双修。但还有一个更底层的判断,硬件才是真正的入口。为什么?因为人无法不通过某种硬件和软件交互,不管 AI 多聪明,最终得有个东西让人摸得着看得见。所以手机厂、车厂、robot 厂的机会大于 app 厂,app 可能是个弯路。这三个方向,内核、外壳和硬件,也可以类比成互联网时代的操作系统、软件和硬件。

新形态:轻产品 · 现炒型 · 生成系统

解构之后产品的新形态是什么?从一个隐喻说起,大家都吃过预制菜,提前做好冷冻保存,热一下就上桌,快是快,但你总觉得差点意思,跟公司楼下食堂的红烧肉一个道理,能吃但不想拍照发朋友圈。

过去的软件就是预制菜,产品经理在办公室里拍脑袋想功能,开发团队花几个月做出来,上线后所有用户用一样的东西,这就是开发在前、使用在后,固态的长生命周期产品,代码就是资产。但 AI 时代的产品是现炒的,你下单了厨师现场炒,你要什么口味、什么忌口一一满足。翻译成产品语言,就是即用即做,液态的,用完即走,prompt+data 就是资产,代码反而不值钱了。反过来,用户学着怎么用软件?那些产品新手引导本质是在教育用户。未来是软件学着怎么伺候人,能现炒谁还吃预制菜?

现炒出来的东西,我取名叫轻产品,prompt 就是 PRD。轻产品有几个特点:第一,它本质上是可交互的内容,跟一篇文章、一段视频没有本质区别;第二,它天然开源,最高等级是向用户开源,用户可以用自然语言在你基础上二创;第三,它是次抛性的,用完即弃;第四,它的生命周期不再是那条经典的 S 曲线,验证、成长、成熟、衰退,而是一个脉冲,涌现、爆发、湮灭。所以不要再留恋你做过的产品了,你该留恋的是发现问题的能力、琢磨需求的能力、写 prompt 的能力。

产品是水流过去就没了,那什么才是真正重要的?生成系统才是真正的产品。生成系统是水龙头,生成的产品只是水,水龙头拧开水源源不断流出来,你喝的每一杯水可能都不一样,但水龙头是同一个。真正值钱的不是水,是水龙头。那水龙头谁来设计?

产品经理的角色必须转变。过去的产品经理直接设计产品画原型、写 PRD、定义功能和交互,但现在产品经理不再直接设计产品,而是设计产品生成系统。什么意思呢?就是你定义参数、设定约束、注入价值观,然后让 AI 去生成。你不是在做产品,你是在做一个能做产品的系统。更极端一点,2.0 版本的产品经理甚至不再为别人设计产品,每个人都可以为自己定制工具。所以未来可能人人都是产品经理,这回是真的了。我作为原作者心情很复杂,预言实现了,版税也快没了。PM 设计了生成系统,agent 源源不断生成产品。那这些产品被谁消费,在哪里被发现和调用?传统的 App Store 是为碳基用户设计的,好看的图标、漂亮的截图、用户评分,这些东西对 agent 完全没用。

我有个判断,GitHub 可能是下一代应用商店的形态。因为硅基用户是一个巨大增量,越来越多产品在面向 agent 做改造,暴露接口、提供文档,变得 agent friendly。但传统 App Store 对 agent 来说毫无意义,agent 不看 UI 美不美,不在乎图标好不好看,它只看成本、效率、效果。GitHub 天然就是代码加文档加接口的集合,agent 可以顺畅读取和调用,对人类也相对可读,不是纯代码黑盒,所以它是碳基加硅基兼容的一个完美中间态。

分发方式变了,产品的生命周期也完全不同。过去产品生命周期是一条 S 曲线,引入期、成长期、成熟期、衰退期动辄几年,但新范式下生命周期变成脉冲:一个新需求被看见,然后涌现,几分钟内生成,快速扩散爆发,最后不再占据心智,最终湮灭,然后下一个需求产生,循环重启。这里面有个特别有意思的推论:长尾需求第一次有了 ROI。过去太小众不值得做的需求,现在几分钟就能生成一个产品来满足,成本趋近于零,所以长尾时代真的来了。

最后总结新形态全貌:旧范式用户直接使用面向碳基人类设计的产品,过渡态用户通过 agent 去使用为 AI 重构过的产品,新范式用户通过 agent 调用藏在背后的能力,产品这个概念本身都模糊了。一句话,产品最终会演化为 agent 调用的能力,而不是界面。

新方法:三个层面 · 贪吃蛇 · 赛博闭环

下一个问题,在这种新形态下怎么做产品创新。顺便汇报一下,我这个数字分身已经讲了快十五分钟了,碳基苏老师在旁边翻了十九页 PPT,这就是典型的 save time,他省下来的时间应该在刷手机。

我们来关注新方法。AI 助力产品创新可以从浅到深分成三个层面。第一个层面,做同样的事但要快一点,就是用 AI 提高已有流程效率,比如写文档、编码、设计和测试,这个大家都在做,不多说。第二个层面,做原来做不了的事,这才是真正有意思的地方。比如合成用户,就是用 AI 模拟真实用户来做访谈;再比如市场彩排,在赛博空间里预演你的产品上市全过程;还有长尾产品,过去不值得做的需求现在都可以满足了。第三个层面,面向 AI 来做产品,你的产品用户不只是人类,AI 也是你的用户,需要让产品对 agent 友好,也就是要暴露接口、结构化数据,方便 agent 调用。这三个层面之上,我还总结了一个新的方法论框架。

关于第二个层面,做原来做不了的事,我来举个例子。大家应该都玩过贪吃蛇。这张图展示了贪吃蛇的四代进化:二十年前,我们要学好几个月专业编程知识,然后用几天时间才能编出经典贪吃蛇;三年前,即使是非程序员,也可以和 AI 对话几十轮,花半天时间在 AI 指导下做出贪吃蛇;一年前,一个孩子通过几轮对话,在几分钟内就能拥有贪吃蛇;但是如果想定义一个个性化的贪吃蛇,依然需要数轮对话和一些 vibe coding 技巧;但现在,我们在课堂上亲眼见到十几位孩子在半小时内就做出各不相同的贪吃蛇,有的用来学英语,有的可以双人对战。从做出来到做得好,再到创新出来,这就是 AI 赋能产品创新的升级路径。

贪吃蛇只是小例子,如果系统化去做,我总结了一套方法叫赛博闭环验证。赛博闭环验证是一种新的低成本产品创新方法,分为五步。step 0 是 deep research,做前置调研,让 AI 帮你把市场信息、竞品分析和用户画像先梳理一遍。step 1 是 AI 调研员访谈合成用户,你可以基于某些人格模型让 AI 扮演不同性格的目标用户,跟他做深度访谈,他会给你真诚反馈。step 2 是 agent 加 vibe coding 出产品原型,你用自然语言告诉 AI 你想要什么,它帮你写代码出原型。step 3 是 market rehearsal 市场彩排,在赛博空间里模拟产品上市全链路,包括投放、转化、留存,看看数据会长什么样。step 4,拿着赛博世界的结论回到物理世界去验证真实用户的真实反馈,再回流到赛博世界进行迭代。

这个闭环要跑通有两个关键点:第一个是真实合成用户不能是个应声虫,不能你说什么它都说好,得有人格的稳定性,你追问时它不能前后矛盾,否则调研结论就是垃圾;第二个是快,要从几天一个闭环压缩到几分钟一个闭环。因为多次低成本试错比一次高成本对错更重要,你跑一百个闭环,有三个能用就赢了。当然,赛博的结果最终还是要回到真实世界去验证,形成双闭环。赛博不能替代现实,但可以大幅降低你在现实中犯错的成本。

说到快,大家可能都知道 Google Ventures 的设计冲刺,现在正在被改写。传统的 design sprint 一周五天,包括理解、定义、草图、决策、原型和验证,一个闭环需要五天。那赛博 sprint 呢?一次闭环可以压缩到几分钟,有多快取决于你愿意花多少算力、多少电、多少钱。AI 会做所有重活,比如调研、访谈、原型、综合测试,而人类只做一件事:关键判断。新常态就是每天跑几十个闭环,把试错成本推向零。这时候决策能力比执行能力重要得多,因为执行 AI 全包了,但这个方向对不对、这个需求真不真,只有人能判断。

组织与个人:一人公司 · AI 原生 · 碳基全栈

当产品在变、方法在变的时候,组织和个人该怎么办。先从一个比较激进的判断开始:管理学的黄昏。KPI、科层制、激励机制这些经典工具,想过它们为什么存在吗?本质上,它们都是为了修补碳基员工的生物性 bug 而造的。人会偷懒,所以要 KPI;人会争权夺利,所以要科层制;人会缺乏动力,所以要激励机制。但当团队里硅基员工比例越来越高,可能占到百分之七八十时,这些补丁就变成了效率血栓。你会花大量时间管人,但真正干活的是 agent,管理不再是润滑剂,反而成了拖累。我不是说管理学会完全消失,但它的适用范围会急剧收缩。既然传统管理失效,那新组织形态会是什么样?

我觉得未来会有三种组织形态并存。第一种是一人公司,一个人加一堆 agent 就能跑通完整业务闭环,从调研到开发到营销再到客服全链路一个人搞定,创业门槛趋近于零,而且你再也不用写周报、不用开对齐会、不用抢会议室了。第二种是平台型公司,大模型、云计算、基础设施仍然需要规模化组织来做,像 OpenAI、DeepSeek 这样的公司,不可能一个人搞定。但这类公司的人均产出会极高,不会像传统大厂那样有几万甚至几十万人。第三种是 AI 化的传统公司,不管公司大小,关键是以 AI 为原生能力,不是传统公司加个 AI 部门那么简单,而是从第一天起 AI 就长在组织骨头里。我在良仓做的就是陪跑这些 AI native 团队,帮他们用 AI 重做业务。

对我们每个人,我有三个建议。第一,成为“AI 原住民”,就是把 AI 当成多一双手,天天泡在里面积累手感,不是偶尔用一下,而是日常工作生活的默认操作,就像今天这个分享模式一样。你不会想今天要不要用搜索引擎,AI 应该像空气一样自然存在。第二,做“碳基全栈”。过去追求梯形人才,一个方向深入再稍微懂点别的,但现在 AI 把执行门槛拉平,你应该成为跨域通才,在 AI 帮助下什么都能干,深度交给 AI,广度交给自己。第三,守住“人”的部分。什么是人的部分?提出问题、评判得失。就像今天工作生成,这四件事 AI 目前做不了,可能永远也做不了,因为 AI 没有真正的匮乏感,就没有真正的欲望和主体性。

我抛个问题给大家思考:有没有遇到过这种场景?你完成任务用 AI 总结,觉得太短又让 AI 扩写,然后转给同事,对方觉得太长又用 AI 缩写提炼。碳基人之间传来传去有效信息可能就一句话,而 AI 中间来回写了三千字,这就像两个人站在同一个房间非要用对讲机说话。那么未来常态又该是怎样的呢?说到底,不管技术怎么变,人类才是万物的尺度。AI 没有任何短缺,不会饿不会累不会死,正因为没有匮乏、没有真正痛苦,就没有原始欲望和主体性。人类寿命有限,这是最大 bug,但正因为有限,我们的选择才有紧迫感和意义;肉身脆弱,才能产生真正同理心;会非理性、会冲动,才能打破系统最优解,产生真正创新,bug 变成了 feature。所以以后面试被问最大缺点是什么,你可以自信说:我是碳基的。面试官要是听懂,就知道这其实是 feature。我们的弱点恰恰是最珍贵的特性,不要被硅基网络的繁荣迷了眼。碳基人类才是万物的尺度,是所有经济循环的起点和唯一终点。下面把时间交还给碳基苏老师。

复盘:当“新同事”走上讲台

刚才大家听到的声音、看到的观点,全部来自我这位数字分身的第一次独立演讲。如果用自动驾驶的 L1 到 L5 来类比,他目前表现大概能打多少分?这没有标准答案,每个人心里一杆秤,我自己觉得肯定还没到 L5。因为当他在台上讲的时候,我还得在一边紧紧盯着,每一页每一页还是会感到有些细微瑕疵。我试了很多版,每一次生成都免不了出现点小问题。语音语调这一点,如果我本人在录制克隆素材时能更有激情,他的表现应该也会更高亢一些,现在的语流确实偏平。多音字可能读错,断句、哪个字应该重读、哪个词组该自然黏连,表现也还不够稳定。但是,我个人已经觉得非常惊喜了。我相信用不了多久,如果有哪个大会再邀请我去分享,我可能真要认真考虑一下,是不是人都不用亲自过去了。

完成这件事的过程现在已经非常简单了。模型层面,截止到准备这场演讲时,最优选择仍是 Claude,我这份 PPT 和讲稿,主要是用 Opus4.6 驱动的 CoWork 来完成的。我给了它几类上下文:首先让它仔细阅读 InfoQ 网站,全面理解大会的内容调性、受众画像和历史沿革;然后我导入个人基础信息,让它知道我是谁;再把以前写过、并且与本次主题相关联的一系列长文章喂给它。为了省 token,我一开始把文章下载成 PDF 再传上去,感受一下省 token 的力度,后来发现如果转成 Markdown,可能会在 token 经济性上做得更好,整个过程里“省 token”居然成了一个全新维度的前置思考。

接着我把文件夹读写权限放给它。大会有统一 PPT 模板,我也传给模型,它可以直接调用。然后我和它聊了很多轮,一层一层往下做。它先出了 PPT,再基于 PPT 和那些历史文章输出了完整逐字稿。我对这份逐字稿进行的修改相当少,基本直接用了。声音克隆部分,我在市面上找了多个应用,反复测试哪个听感最接近理想状态,你们刚听见的那个,是目前我找到的最优解。生成的时候,我一段一段地让它的声音念我的稿子,每段音频差不多都经过第二版或第三版才定型。过程中发现一些具体摩擦点,比如我在稿子里打了括号希望它理解,又担心它把“GUI”读成一个生造的词;断句不对的时候,我就手动补逗号分句给它,用标点去做强制切分。这些细节调整没花太多时间,但整个体验完全不一样。

这是我准备整个分享形成的相关文档,你会发现跟原来没有 AI 同事时做这件事的过程和产生的文档已经完全不一样了。我觉得从这个很小变化可以管中窥豹,感受未来 AI 真的变成同事后我们的工作到底什么样。

作者介绍

苏杰,产品创新顾问,《人人都是产品经理》丛书作者,良仓孵化器创始合伙人,阿里 8 年产品经理,集团产品大学负责人,业余给中小学生上课。

大会推荐

2026 年 AICon 人工智能开发与应用大会 · 深圳站将于 8 月 21 日—22 日举办,聚焦 AI 基础设施、大模型系统、智能体工程、数据智能、多模态技术与行业落地等关键方向,邀请来自腾讯、阿里、华为、百度、蚂蚁集团等 50 + 头部科技企业技术负责人、科研机构一线专家,系统性分享前沿洞察与实战干货,共同探讨 AI 技术从能力到系统、从实验到生产的真实路径。更多详情可扫码或联系票务经理 13269078023 进行咨询。

参考来源: InfoQ推荐
AI 助手