GPT-6 在 ChatGPT 中引入 Intelligent UI:回答可生成可交互界面,联网搜索场景下 Instant 平均提前 44% 开始作答
相关研究与后续进展核心概要
该发布推出面向 ChatGPT 的 GPT-6 与 Intelligent UI:模型可组合文本、图形、按钮、表单、图表与交互组件,并边思考边作答;内部评测中 GPT-6 Extra High 在达到优于 GPT-5.6 Extra High 总分的同时间开始作答,联网搜索场景下 GPT-6 Instant 平均提前 44% 开始作答,同时安全训练强化了对多轮自适应越狱的抵抗。
深度剖析
Intelligent UI 让 ChatGPT 按问题类型自行选择并组合文本、视觉与交互元素,回答可包含图形、可点击按钮、表单、图表和可直接在对话中使用的交互体验。 此前对话式回答基本被限制在统一文本格式中,现在模型获得为每个问题构建最合适界面的自由度,并可在简单文本最有用时仍返回文本。 文中给出机制说明:构建了原生可流式组件库与编译器,编译器在模型生成过程中处理界面,使界面逐步出现而无需等待整段回答完成;训练方法被扩展以评估所生成界面的清晰度、有用性与完整性。
GPT-6 支持边思考边作答,把思考与回答交错进行,并考虑用户等待时间,用截至当前的知识与发现逐步组织答案。 推理模型时代用户需等模型思考完毕才能得到回答,现在回答可跨多个部分响应构建,同时保持整体连贯与事实性。 内部评测显示,在高价值日常智能体任务上,GPT-6 Extra High 能在与 GPT-5.6 Medium 相同的开始作答时间内取得优于 GPT-5.6 Extra High 的总分;联网搜索场景下 GPT-6 Instant 平均提前 44% 开始作答。
GPT-6 提升了需要联网搜索的回答质量,更会判断何时该查询,也更可靠地找到支持答案的信息。 相对 GPT-5.6,模型在检索时机判断与证据支撑上有所改进。 内部困难问题评测中,GPT-6 比 GPT-5.6 更常正确回应用户问题的关键方面。
安全方面,GPT-6 基于 Astra 的多项安全进展,强化了对绕过安全训练尝试的抵抗,尤其针对跨多轮自适应的攻击,并更善于识别与说明自身能力边界。 相对 GPT-5.6 Sol,模型在抵抗越狱、遵循防护措施、说明能做什么与不能做什么上有所进展,并利用对话历史与上下文识别单条提示中不明显的风险。 对抗测试中表现出更强的抵抗;训练全程进行对齐评测,评估诚实性与对安全限制的响应;更多结果与审查细节见系统卡。
启示与展望
该结果适用于 ChatGPT 的 Chat 体验:GPT-6 with Intelligent UI 先在 Chat 标签页面向 Plus、Pro、Business、Enterprise 全球推送,次日扩展至 Free 与 Go,企业可用性取决于工作区管理员设置;Plus、Pro、Business、Enterprise 由 GPT-6 Sol 驱动,Free 与 Go 由 GPT-6 Luna 驱动,两者都针对日常对话调优。文中示例展示了该能力在规划类任务上的形态,例如按人数伸缩的周日烤羊腿菜单、购物量与时间线,以及可交互的计算器、分账工具和对话内小游戏。对研究者与工程师而言,可关注的价值在于组件库加编译器的流式界面生成路径,以及把等待时间纳入作答策略的训练思路。
关键性能数字均为内部评测,缺少外部复现与公开基准对照,44% 提前作答与总分比较的具体任务构成、样本规模与统计口径未在文中展开。安全结论依赖对抗测试与对齐评测,跨多轮自适应攻击的覆盖范围与长期稳健性仍需观察。文中也提到模型的设计判断仍有改进空间、可创建的内容范围有待扩展。此外,示例对话展示了界面形态,但未给出界面生成失败率或用户实际使用效果的数据。
