GPT-6 Sol到底怎么样,和GPT-5.6 Sol对比实测一下
9月23日,OpenAI发布了GPT-6 Sol和GPT-6 Luna模型 上个视频我说的是比GPT-5.6 Sol更快更强更便宜 但是很多人对GPT-5.6 Sol更强这一点提出了异议 上个视

GPT-6 Sol到底怎么样,和GPT-5.6 Sol对比实测一下

发布时间:2026-09-24 (23小时前)
AI 文章总结
用 AI 快速提炼本文核心内容和阅读重点。

9月23日,OpenAI发布了GPT-6 Sol和GPT-6 Luna模型

上个视频我说的是比GPT-5.6 Sol更快更强更便宜

但是很多人对GPT-5.6 Sol更强这一点提出了异议

上个视频我只是实测了根据截图复刻网站

他们两个完成情况几乎没区别,但是GPT6 Sol更快

主要是这个场景已经到天花板了,几乎测不出来差距了

所以这个视频来从这几个方面来实测一下

  1. 狸花猫骑自行车
  2. 熟悉github上的项目
  3. 3D长沙城市生成器

然后分别记录耗时、额度消耗、完成情况

狸花猫骑自行车

防止大模型背答案,改成了狸花猫骑自行车

提示词

用SVG画一只骑着自行车的狸花猫,保存为狸花猫-{模型}.svg
直接写出来就行,不用打开或者渲染查看效果

耗时2m4s,额度消耗几乎忽略不计

耗时2m30s,额度消耗1%的5h额度

熟悉github上的项目

就拿dsh这个开源项目为例吧

提示词

熟悉一下这个项目 https://github.com/deepseek-ai/deepseek-harness
用最通俗易懂的话告诉我这个项目是干什么的,我要学习这个项目应该从哪里开始学习

gpt5.6 sol输出,耗时 3m4s 额度消耗3% 5h额度

这个项目不是 DeepSeek 模型本身,而是一个“让大模型真正干活”的智能体运行框架。
可以这样理解:
- 大模型是“大脑”,负责判断下一步做什么。
- DeepSeek Harness 是“身体 + 工具箱 + 工作记录系统”。
- 它让模型能够读写文件、运行命令、搜索网页、调用外部工具、启动子智能体、等待人工审批,并保存整个任务过程。
一句话概括:
DeepSeek Harness 是一个用插件组装 AI Agent 的运行平台,有点像专门为智能体设计的“小型操作系统”。

一次任务是怎样运行的
你输入任务
   ↓
Agent Loop 整理提示词、历史记录和可用工具
   ↓
调用 DeepSeek 等大模型
   ↓
模型决定:直接回答,还是调用工具
   ↓
Harness 执行文件、命令行、网页等工具
   ↓
把工具结果写入 Session 日志
   ↓
再次调用模型
   ↓
直到模型完成任务
其中最重要的是四个部分:
部分  通俗解释
Cordis 插件系统  像插排,需要什么能力就插入什么插件
Agent Loop  智能体的发动机,负责“问模型 → 执行工具 → 再问模型”
Tools  模型可以使用的工具箱
Session  智能体的工作日志和记忆来源


它最大的设计特点是“一切皆插件”:模型适配器、文件系统、命令行、工具注册、会话存储,甚至 Agent Loop 本身都可以替换。官方架构文档也强调,扩展功能通常是新增插件,而不是直接修改循环核心。架构说明
先体验,再看代码
最快体验方式:
npx @deepseek-ai/dsh web
然后打开 http://127.0.0.1:3080,在“设置 → 模型”中配置 DeepSeek API Key,选择一个工作目录,再给它一个简单任务,例如:
阅读当前项目,并告诉我主要目录分别做什么。
这一步的目标不是研究源码,而是亲眼观察:
- 模型什么时候调用工具;
- 工具执行结果怎样返回;
- 一项任务为什么可能调用模型多次;
- 工作区、会话、审批分别有什么作用。
项目目前仍处于开发者预览阶段,接口会快速变化,所以不建议一开始死记 API。中文 README
推荐学习顺序
第一阶段:理解插件系统
先完成官方的 Cordis 中文教程。
按顺序做完七章:
1. 第一个插件
2. 生命周期与自动清理
3. 服务与依赖
4. 事件
5. 配置
6. 插件组合与热更新
7. 向 Harness 注册一个真实工具
这套教程不需要 API Key,而且最后会做出一个模型可调用的 greet 工具。它比直接阅读几千行的 Agent Loop 源码有效得多。
重点理解这四句话:
- apply(ctx):插件从这里启动。
- ctx.xxx:从公共上下文中取得某项能力。
- inject:声明插件依赖哪些服务。
- ctx.on() / ctx.effect():监听事件或注册可自动清理的资源。
第二阶段:做一个自己的工具插件
阅读 第一个 Harness 插件,然后写一个简单工具,例如:
- 获取当前时间;
- 统计目录中文件数量;
- 查询 Git 状态;
- 读取项目的 package.json 并返回摘要。
通过 --patch 把插件插入 Web 版本:
pnpm dsh web --patch ./scratch-plugin/cordis.yml
做到这一步,你基本就理解了这个项目最核心的扩展方式。
第三阶段:理解整体架构
阅读顺序建议如下:
1. Cordis 入门
2. 项目架构
3. Core 包地图
4. Agent Loop 说明
5. Tools 说明
6. Session 说明
7. LLM 说明
这一阶段先读各包的 README,不要急着读 src/index.ts。这些 README 已经给出了源码地图和职责划分。
第四阶段:沿着一次任务追源码
推荐代码阅读路线:
1. apps/cli/src/bin.ts
   看 dsh web 命令从哪里进入。
2. apps/cli/src/profile-boot.ts
   看不同 profile 如何装配插件。
3. packages/bundle/base/cordis.patch.yml
   看默认版本实际加载了哪些插件。
4. packages/core/agent-loop/src/agent.ts
   看“模型调用—工具执行—继续循环”的状态机。
5. packages/core/agent-loop/src/tool-calls.ts
   看工具调用如何串行或并行执行。
6. packages/core/tools/
   看工具怎样注册、校验参数和返回结果。
7. packages/core/session/
   看消息、工具调用和结果怎样形成持久记录。
不要从仓库根目录逐个文件阅读。这个仓库有一万多个文件,应该始终沿着“一次任务的执行链路”阅读。
目录怎么理解
- apps/:CLI、Web、桌面端等产品入口。
- packages/core/:Agent、Agent Loop、Tools、Session 等主干。
- packages/llm/:模型接口和 DeepSeek 适配器。
- packages/fs/、shell/、web/:文件、命令行、网络能力。
- packages/bundle/:把许多插件组合成 Web、Headless、SDK 等版本。
- packages/client/、host/:Web UI 的浏览器端和服务端。
- docs/:教程与架构文档。
- vendor/:项目内置的 Cordis 插件框架源码。
- python/:Python SDK 和相关运行组件。
本地开发环境
官方当前要求 Node.js 22.19+ 或 24+,并使用 Corepack 管理的 pnpm 11.7.0。开发指南
git clone https://github.com/deepseek-ai/deepseek-harness.git
cd deepseek-harness

corepack enable
pnpm install
pnpm run typecheck
pnpm run build
pnpm dsh web
如果只记住一条学习路线,就是:
先运行产品 → 完成 Cordis 七章教程 → 写一个工具插件 → 阅读架构文档 → 最后沿着 Agent Loop 追源码。

gpt6 sol输出,耗时 1m14s 额度消耗2% 5h额度

一句话讲清楚
**DeepSeek Harness 是一个让 AI 从“回答问题”走向“执行任务”的运行框架。**你可以把模型想成“大脑”,把 Harness 想成工作台:它负责接收任务、连接模型、提供读写文件和运行命令等工具、记录过程,并决定何时继续调用模型。它的特点是“几乎一切都是插件”,连模型连接器、工具和执行循环都可以替换。项目中文 README · 架构说明
比如你说“帮我修改这个项目里的一个错误”,大致会发生:
你的要求 → 模型判断下一步 → Harness 调用读文件、改文件等工具 → 把结果交回模型 → 模型继续处理或给你答复。
这个“模型思考—使用工具—看结果—继续”的过程,就是项目里的 agent loop(智能体循环)。架构说明:轮次流程
我建议这样学
1. **先用起来,建立直觉。**安装 Node.js 后运行 npx @deepseek-ai/dsh web,打开 Web 页面,在“设置 → 模型”填入可用的 API 密钥。给它一个简单任务,例如让它读取一个练习目录中的文件并总结内容,观察它何时调用工具。运行说明 · 配置模型
2. **理解三个词:插件、服务、事件。**插件是一块可装卸的功能;服务是插件提供给其他插件的能力,比如 tools;事件让插件在执行过程中参与或观察工作。先读篇幅较短的 Cordis 入门。想边做边学,就跟着 Cordis 中文教程 走;它的练习不需要 API 密钥。
3. **亲手做一个最小插件。**照着官方的 “第一个插件”教程,先让插件在启动时打印一行文字;成功后,再学 开发一个工具。做到这里,你会真正明白“一切皆插件”是什么意思。
4. **最后再读源码和完整架构。**先用 packages 目录地图 找位置,再看 packages/core 里的 agent-loop、tools、session。分别对应“怎么推进任务”“怎么使用工具”“怎么记住过程”。这时再读 完整架构文档,会容易很多。
**如果只选一个起点:先运行 Web 版,再做“第一个插件”。**直接从庞大的 packages/ 源码读起,通常很难看出各部分为什么存在。
项目目前仍是开发者预览版,官方说明它可能有不兼容更新;它也能执行命令和修改文件。练习时用专门的测试目录,并先看一下安全说明。

感觉这个回答有点简单啊

3D长沙城市生成器

这个比较复杂了

开发一个程序化3D城市生成器的网页应用,对标OpenAl官方Showcase里那个ProceduralCity Generator的水平,但把城市风格换成长沙。
请先联网搜索OpenAl官方Showcase里Procedural City Generator的产品设计和交互方式,了解它的编辑器布局和参数维度,在此基础上做出长沙版。
城市的建筑形态、色调和地形要让人一眼就能认出是长沙,橘子洲头、岳麓山、五一广场必须做出来。
做完后自己打开验证效果,检查长沙的视觉特征是否到位、参数调整是否实时响应,不满意就自主调整,直到满意再交付。

gpt 5.6 Sol Ultra 耗时 44m54s 额度消耗65% 5h额度

把长沙的方位给搞反了!

gpt 6 Sol Ultra 耗时26m5s 额度消耗31% 5h额度

我觉得是比5.6Sol做的是要好的

最好的是,6 Sol把长沙的方位弄清楚了