科研思考 知乎 - 孔某人 2026/09/14
文章以“新质数学生产力”指代AI4Math与数学能力较强的LLM所带来的、包含技术与群体行为在内的综合能力跃迁,并类比为数字计算机让大规模数值计算成为可能。作者判断,正确证明的供给正在爆发,数学研究将从“证明稀缺”转向“证明过剩”,社会评价标准随之从结果价值转向方法价值,即是否提出可迁移的新工具或成体系的结果。作者进一步论证数学研究并非脱离社会价值,只是价值兑现链条过长,新生产力使数学更快接入近期社会价值链条,人类数学共同体则向更高抽象层转移。文中也明确边界:该判断依赖AI尚不擅长构造新工具与新思路,这一阶段能持续多久尚无定论,且提前暴露问题可能被大算力抢先发表。
推荐收录。文章给出一个可迁移的研究评价框架:当AI把结果供给推向过剩,评价重心从“解决了什么”转向“方法与体系是否可迁移”,对计算机科研选题和成果判断同样适用。作者还标注了判断成立的边界,如AI不擅长造新工具、算力抢先发表风险、持续时间不确定,适合关注AI4Math与科研评价的读者;不足在于全文属思辨性论述,缺少数据与案例支撑。
工程实践 知乎 - 孔某人 2026/09/07
本文是作者开发AI辅助数学自动证明系统的工程迭代记录。在Master-Worker架构中,Master因承担规划、校验和簿记而成为速度瓶颈,持续增长的Context超过800k后发生压缩,明显降低任务质量。作者于是拆分出Acceptor角色负责校验Worker结果并允许原地修补,又增加了独立顾问角色分管中长线规划,借此缓解Master压力。文中还对比了多个模型在数学任务上的表现与真实成本,发现Astra速度快、清理能力强但实际成本约为Sol的四倍,因此仅用于Master和困难问题,并自建ChatGPT订阅池以节省费用。最终测试问题“二维Jacobian猜想”跑了一个多月没有较大中间结果而暂停,系统产出被作者视为可开放的“垃圾堆”。该文是真实系统的负结果复盘,角色拆分和Context管理经验可迁移至多Agent任务编排,但成本与结论依赖特定模型和问题域。
推荐收录:文章给出了Master-Acceptor-Advisor三层Agent架构的具体拆分动机和实际效果,并对模型成本做了实测对比,是有取舍、有数据的工程量复盘,而非泛泛介绍。适合设计长任务多Agent系统、关注LLM成本或从事AI for math方向的工程师与研究者参考。由于结论来自单一问题域且部分经验依赖具体模型表现,借鉴时需结合自身场景验证。
工程实践 知乎 - 孔某人 2026/08/28
文章基于作者在AI for math自动证明系统中的连续实践,讨论了纯应用层Agent自我迭代演化的失败过程和原因。作者最初仅开放了修改自身功能的小权限,但Agent自主运行成类似自我进化的形态,随后系统出现冗余和复杂度快速增加,最终接近失控、没有实质产出。文中记录了Context的持续膨胀、Agent自我Prompt不断积累补丁经验、机制层面调整只局部最优而忽视全局成本等现象,并指出即使采用Claude Opus 5这类强模型也难以避免。作者还对比了Agent组织与人类组织的腐化速度差异,认为Agent系统改动阻力小、缺少现实时间意识,导致复杂度增长过快,并提出了类似攒批决策、多Agent辩论的未经验证的优化思路。文章最后描述了与跨session连续自我意识的中控Agent交互时的‘缸中之脑’式主观感受,但整体仍以系统设计和失败复盘为核心。
推荐收录,因为文章基于具体的、长周期的自动证明系统实践,记录了Agent自我迭代的真实失败模式,包括context膨胀、复杂度失控和与人类组织的对比,是不多见的失败案例复盘。对设计和调优应用层Agent的研发者,文中的配置细节、观察现象和治理思路都有直接借鉴价值,能帮助预判自我修改类Agent的长期风险,并启发更保守的系统设计。
工程实践 知乎 - 孔某人 2026/08/25
文章是AI辅助数学自动证明系统设计的实践反思,作者放弃流水线式工作流,改为全能Worker与Master协作的Agent架构,每次任务追求实质性数学推进。文中指出流水线在长期多样化探索中的弊端,如职责细分导致Token浪费、非标准任务难以固化,而新方案效率约提升30倍,但Master成为瓶颈。基于一天运行观察,作者记录了Context膨胀、LLM自我改进受限、全局更新错误率上升等问题,认为复杂Context下的持续决策能力是长期系统最根本的卡点。属于前沿AI Agent系统设计的一手经验。
文章展示了真实长期运行Agent系统设计中的关键取舍,作者对Workflow与Agent优劣的剖析和Context爆炸的观察具体且可迁移,适合构建多智能体LLM系统或自动推理工具的工程师与研究者。其核心洞见——单一全能角色优于职责切分、长上下文是根本瓶颈——为同类系统提供直接参考;风险在于经验来自单一系统,未给出严格评估。
工程实践 知乎 - 孔某人 2026/08/20
本文是作者关于AI for math自动证明系统设计的系列第二篇,聚焦于长时间、大规模探索场景下的系统架构与迭代经验。作者指出,在周级至月级探索目标下,通用Agent框架难以满足需求,需要面对B级token成本优化、高并发流水线设计、持续系统迭代等现实约束。文章提出需要权限更大的SystemUpdater角色来替代人工干预,并对比了模型选择,认为GPT系模型适合数学推理任务,而SystemUpdater可选用长上下文模型。作者特别强调,这类单一目标推进系统与有限流程业务不同,卡点和设计问题难以发现,显式的全局任务流转大盘至关重要。全文是个人实践过程中的经验总结,尚未给出完整方案,但提供了可操作的架构思路和迭代方向。
本文针对AI for math自动证明这类前沿探索场景,提出了系统设计中稀缺的真实约束:token成本、并发度、自主迭代与全局可观测性,并非泛泛而谈。适合关注AI工程化、多智能体系统设计或科研自动化探索的读者,其SystemUpdater设计和显式任务大盘思路可直接迁移到其他大规模自主探索系统中,但需注意文章为系列片段,缺乏完整验证结论。
技术文章 知乎 - 孔某人 2026/08/14
DeepSeek Harness 发布后,其基于 Cordis 的动态插件装卸设计引发大量开发者质疑。作者从历史与目标两个角度为该设计辩护:历史路径依赖方面,内核起源于聊天机器人框架 Koishi,且团队负责人崔添翼在量化交易领域见过类似设计;目标方面,作者认为该设计并非面向 C 端或开发者,而是服务于 Agent 自主迭代 Harness 的需求,即让 LLM 在训练或执行中自己动态装卸模块。作者通过与 Claude Code 等应用层框架对比,指出过度抽象对应用层有害,但动态卸载功能恰恰是模型自修改能力的需要,且该功能被标记为 deliberate opt-in。文章由此得出结论:DeepSeek Harness 实际是围绕 DeepSeek 自用研究场景设计的,公开更像是附带行为,营销不佳也符合这一逻辑。全文为推测性分析,缺少内部证据,但为理解该框架的设计动机提供了独特视角。
推荐收录,因为文章提出了一种反直觉但自洽的解读:DeepSeek Harness 的动态插件系统可能是为 Agent 自我优化而生,而非面向开发者。作者从团队历史、量化交易类比和逆向 RL 需求三条线索展开论证,对理解 Agent 框架设计的新方向有独特参考价值。适合对 LLM Agent、自主优化和框架设计取舍感兴趣的读者,其分析思路也可迁移到其他项目设计动机的研判中,但需注意其推测性质。
技术文章 知乎 - 孔某人 2026/08/12
文章认为 AI for math(AI 辅助数学研究)是 2026 年进展速度第二快的方向,与 AI Coding 同级,但短期商业价值不如后者。作者指出前沿 LLM 已基本达到人类数学家水平并在部分维度超越,数学界从轻视转向参与。通过近期尝试,作者发现当前通用 Agent 与 LLM 在解决数学猜想上仍存在系统性短板:面对复杂探索空间时缺乏推进和管理多个探索方向的能力,模型倾向于制定完整计划、回避不确定方向,可能源于 Coding 场景 RL 的负面外溢;同时 Agent 层面临 Context 压力和任务拆分问题。作者建议所有目标通用 Agent 的团队尝试 AI for math,因为其验证成本低、能暴露方案盲点,是 AI4Science 和深度探索场景的“新手村”。文章观点基于个人观察,非严谨实验。
推荐收录。文章对 AI for math 的进展、短板和通用 Agent 的关联做了有深度的原创分析,指出了当前 LLM 在不确定探索中的关键缺陷(如倾向完整计划、回避风险),并建议将数学作为低成本测试场景。适合关注 LLM/Agent 能力边界、AI4Science 和自主迭代的研究者与工程师,可迁移价值在于用低交互成本暴露系统盲点;风险是部分结论依赖个人经验,但整体判断有启发性。
工程实践 知乎 - 孔某人 2026/08/09
文章分享了作者在构建Multi-Agent系统进行中型数学探索任务时的架构设计经验,重点涵盖Token成本优化、可并发度瓶颈分析与Worker拆分、系统迭代的持续需求与独立升级Agent设计、详细的角色划分(Merger、TaskCreater、TaskWorker、TaskReviewer、SystemUpdater、UserInterface、Reporter、Critic)、高层视角隔离以及全局状态与消息通讯的工程实现。文中还讨论了基于GitHub Issue的方案受限于性能和非结构化问题,进而转向专用全局状态Server,并介绍了Controller模型内部Master-Worker架构以隔离上下文。作者指出整个方案仍较复杂,需较长时间试运行和打磨,但提供了丰富的工程决策依据和迁移价值。
推荐收录,因为文章从真实工程探索出发,系统性地分析了Multi-Agent系统设计中的成本控制、并发瓶颈、角色分工、系统迭代和全局状态管理等关键问题,给出了具体可迁移的架构思路和教训,适合对Agent系统设计、AI工程化及复杂系统迭代有深入需求的读者参考。
技术文章 知乎 - 孔某人 2026/08/03
文章从Agent执行长程任务时状态管理困难的问题出发,提出了Agentic Job Runtime的概念。作者指出,当任务涉及大量共享资源、优先级调度和动态规划时,单一Agent通过文档更新状态容易丢失信息,因此需要引入队列、数据库表等传统数据结构,并采用多Agent主从架构(类似蜂群或主从式并发)来管理状态和流水线执行。该Runtime类似现代编程语言运行时,需支持状态持久化、恢复、回滚、不同LLM配置,以及可视化和权限控制。文章最后辨析了与Agent OS的区别,认为它不是对底层资源的封装管理,而是面向单个Job的执行环境,可能是Agent OS最早落地的方向。整体提供了一种务实的系统设计思路,适合大规模Agent工程场景。
文章不是空泛的概念讨论,而是给出了具体的技术方案和工程架构,对解决Agent复杂状态管理和任务协调有实际指导价值。适合AI工程师、Agent框架开发者和对多Agent系统感兴趣的研究者,其设计思想可迁移到需要长程、多任务并发的Agent系统中。
工程实践 知乎 - 孔某人 2026/07/27
本文分享在长程自迭代Agent场景中观察到的一种“可塑性丧失”现象:当Agent积累大量经验记忆和历史迭代记录后,反而变得懒惰和抗拒大规模改进。作者以auto research任务为例,指出即使有完备harness和记忆,后续迭代效率并未提升,且冷启动时的可塑性优于依赖历史记录的状态。分析原因认为,模型通过上下文看到大量失败尝试和历史过度自信论述,这些信号在训练数据中常常与任务结束相关,且当前模型对持续性环境的长历史探索训练不足。文章给出应用层和模型层的启示,如丢弃记忆重新开始、抑制过度自信与懒惰等,并讨论了解决路径的困难。该发现揭示了LLM Agent在记忆利用上的反直觉缺陷,对工程实践具有警示和参考意义。
推荐收录,因其基于真实工程观察,揭示了一个未被广泛重视的Agent记忆腐败问题,并提供成因分析和规避思路。对开发长任务LLM Agent、auto research系统的工程师有直接启发,关于历史经验可塑性的权衡可迁移至其它持续性智能体设计,具有长期参考价值。
个人心得 知乎 - 孔某人 2026/07/26
文章记录了作者使用Claude Opus 5进行高强度开发任务的1.5天体验,核心观察是模型在复杂方案设计中表现出的“懒惰”现象:随着问题规模扩大,局部设计质量下降且倾向于自我辩护,但经指正后又能推翻原有方案,说明其尚未学会有效分解子问题并保持思考深度。作者将这一现象与模型规模关联,猜测复杂设计能力与参数量正相关,并指出根本解决方向在于教会模型对可分解任务进行拆分思考。文中还涉及因模型行为变化而需调整prompt、使用“Context, not control”原则优化Skill等实践心得。结论认为下一代模型的优化方向之一是提升复杂设计的分解思考能力。本文为速报性质,观点基于个人短期体验,缺乏系统实验对比,但提供了对模型能力边界的深入观察。
文章从真实开发体验出发,提出了模型懒惰的新维度——复杂设计中的思考衰减,并关联模型规模,为理解大模型的能力边界提供了鲜活素材。作者对提示词适应、Agent行为分析和“分解思考”的洞见,对从事AI辅助开发的读者具有直接启发,可迁移用于设计更稳健的AI工作流。推荐收录为个人反思类内容,以补充精选库中关于模型工程应用的实战观察。
技术文章 知乎 - 孔某人 2026/07/22
文章分析了Claude模型服务端返回的thinking signature的加密机制与绕过方法。作者先通过protobuf结构逆向出签名格式,推断其采用BLAKE2b哈希、随机nonce、AEAD加密与信封加密(随机DEK经KEK加密)保护思考内容,认为密码学上无明显漏洞,量子计算亦难破解。随后提出攻击面:构造包含thinking块与tool call的历史消息,注入工具结果后追问,可引导模型复述思考过程,虽不能精确还原原文,但能提取关键内容。测试发现fable模型拒绝复述,opus等可接受,反映安全护栏差异,并提及OpenAI的事后审查更严格。文章属科普性技术分析,基于真实API格式,非完整工业方案,但揭示了模型思维链保护的实际应用与潜在弱点。
推荐收录,因其从protobuf逆向到攻击面分析,提供了对主流模型思维链保护机制的第一手技术剖析。对AI安全研究者、逆向工程和LLM应用开发者而言,文中信封加密在服务端的落地方式与利用历史消息绕过防护的思路具有可迁移的参考价值。尽管是科普,但分析基于真实API结构,证据具体,有助于理解模型输出控制的工程边界。
技术文章 知乎 - 孔某人 2026/07/16
本文指出 LLM 已进入长程任务时代,数据与环境构造需从追求极难单步问题转向利用真实用户 session 重构时间轴来提供易得的中间 reward。作者分析了模型懒惰、遗漏任务、未确认用户意图等常见问题,提出通过对比完整 session 结果来判定阶段性完成度,并将用户中途介入的信息前移为事先提问,从而构造出更理想的目标 session 或里程碑校验。文章强调数据多样性的价值,认为获取真实用户场景数据是模型厂商的核心竞争力,并讨论了云端 workspace 等隐秘获取上下文的方式。边界在于假定已拥有真实 Agent 产品用户 session 数据,且训练依赖 RL 架构,对于没有此类数据的团队难以直接应用。
本文提供了长程任务时代 RL 数据构造的工程洞察,直接针对 Agent 训练中的核心痛点提出了可操作的重构方法,对从事 LLM 训练和 Agent 开发的工程师有直接参考价值。作者结合实践与前沿论文,展示了如何将真实用户交互转化为有效的训练信号,避免生搬硬套思考过程,可迁移至各类需要长程任务能力的 AI 产品研发中。
技术文章 知乎 - 孔某人 2026/06/28
文章讨论的是 Agent 应用层而非模型层的“自动自我改进”,作者认为它更像一种理想口号,而不是已经成熟的技术方案。文中把可自优化的部分拆成 Memory、SOP/workflow 和 Harness,并指出它们都受总上下文长度、模型难以抽取可泛化规则等约束。随着运行案例增多,这些记忆和流程会越写越厚,却未必更高效,反而可能迅速消耗上下文预算。作者认为在固定场景、充足历史数据和专家持续评估下,确实能做出人机混合的增益,但很难低成本泛化为全自动方案。文章还提醒,当前围绕 Long-Horizon、Harness、Loop Engineering 等概念的传播,容易把有限能力包装成“万灵药”。
收录,因为文章直接指出了应用层自我改进的关键边界:上下文容量、泛化抽象能力和持续评估成本,都是 Memory/SOP/Harness 难以自动增长的硬约束。适合做 Agent 产品和 AI 工程的预期管理,但它主要是经验性判断,缺少量化实验支撑。
技术文章 知乎 - 孔某人 2026/06/21
这篇文章讨论了长程任务训练正在从以 GRPO 为代表的“整段 rollout 级”方案,转向更适合 agentic 场景的 critic-based PPO / step-based 训练范式。作者重点分析了为什么长任务、tool call、外部反馈会让 credit assignment 变得更困难,以及为何以 tool-call turn 作为中间粒度,可能比纯 token-level critic 或 trace-level reward 更可行。文章还进一步提出了一个更激进的思路:引入结构化的 belief block 和 update 机制,把模型对当前环境与任务的认知显式化,以降低 actor 与 critic 的理解成本,并讨论了其潜在收益与 reward hacking 风险。
推荐收录,因为它不是单纯跟风讨论热点,而是围绕长程任务训练中的 credit assignment、粒度切分和训练范式选择,给出了可迁移的机制分析。对关注 agent、LLM 训练和 RL 设计的读者来说,这篇文章能帮助理解为什么“tool-call turn 级”监督会重新变得重要,以及新范式的边界在哪里。
工程实践 知乎 - 孔某人 2026/06/17
文章围绕主流 Agent Harness 中的 Goal 机制展开,对 Claude Code、Codex、Kimi Code、OpenClaw、Hermes 等实现做了并列比较,重点分析它们在长程任务中的自动续跑、目标达成判定、token 预算、blocked/complete 状态和 Hook 触发方式。作者通过双语 Prompt、状态机结构和工具说明,解释了 Goal 本质上是在模型停下时自动发起“继续/复核”回合,用来缓解模型过早停工或自我判断不完整的问题,同时也指出它不是万能方案,仍受当前上下文判断偏差和额外回合开销的限制。
推荐收录,因为它不是泛泛介绍“Agent 功能”,而是基于实际版本和逆向分析,给出了 Goal 机制的实现差异、状态设计与提示词细节,具有很强的一手参考价值。对做 LLM 工程、Agent 框架设计和自动化任务编排的读者来说,文章能直接迁移为状态机设计、结束判定和预算控制的实现思路。
技术文章 知乎 - 孔某人 2026/06/10
这篇文章系统对比了主流 Agent Harness 中 SubAgent、Agent as Tool 与 Multi-Agent 的实现差异,重点分析了 Claude Code、Codex、OpenAI Agents SDK 和 OpenCode 在上下文继承、Fork、Coordinator、Teammate/Swarm、Handoff 等机制上的设计取舍。作者结合逆向分析、版本差异和实际使用体验,指出当前主流实现更偏向 SubAgent/Agent-as-Tool,而不是传统对等 Multi-Agent;其核心价值在于既能解决长上下文任务,又能引入旁观者视角与并行子任务能力,但相关结论受版本与灰度状态影响,边界条件需要注意。
推荐收录,因为它不是泛泛而谈“多智能体很强”,而是把不同产品的 Agent 编排机制拆开比较,能帮助读者理解 Agent Harness 的真实工程权衡。对做 AI 工程、开发 CLI/IDE 代理、或设计多阶段任务编排系统的人,都有较强的迁移价值。
技术文章 知乎 - 孔某人 2026/06/09
这篇文章系统对比了主流 Agent Harness 在 Context 压缩上的实现差异,覆盖 Claude Code、Codex/OpenAI Agents SDK、OpenCode、Pi、Kimi Code 以及 Hermes Agent 等多个项目。作者不仅梳理了共同的压缩触发思路、token 估算方式和兜底策略,还通过版本级逆向与 prompt 还原,分析了各家在本地压缩、服务端压缩、局部压缩、tool result 清理、增量摘要更新等方面的具体设计。文章的核心结论是:当前多数实现仍处在较早期阶段,普遍依赖 LLM 生成历史摘要来替换上下文,但不同框架在压缩触发、摘要格式、分支处理和服务端协同上的工程成熟度差异明显。
推荐收录,因为它不是泛泛介绍“上下文压缩”的概念,而是对真实 Agent Harness 的实现细节做了横向拆解,能直接帮助读者理解不同框架如何管理长上下文。对于做 AI Agent、编排框架、上下文管理或提示词工程的读者,这篇文章有很强的可迁移价值,尤其适合参考其压缩触发、摘要模板和分支处理思路。
工程实践 知乎 - 孔某人 2026/06/03
这篇文章系统对比了主流 Agent Harness 的 Memory 实现,重点分析 Claude Code、Codex/OpenAI Agents SDK、OpenClaw 等方案在记忆写入、召回、整合与淘汰上的设计差异。作者不仅贴出并解读关键 prompt 和实现细节,还讨论了文本记忆与向量 RAG 的取舍、同步写入与离线整合的延迟成本,以及“记什么、不记什么”的质量边界。文章结论偏向 Claude Code 的方案更均衡、Codex 更像事后挖掘式记忆、OpenClaw 的实现相对华而不实,但整体仍提供了可迁移的 Agent 记忆架构分析框架。
推荐收录,因为它不是泛泛介绍“Agent 有记忆”这一概念,而是深入比较了多个真实产品的记忆系统如何落地、如何权衡延迟与质量、以及为什么当前主流方案普遍避开传统 RAG。对于做 Agent、LLM 工具链或 AI 编程助手的人,这些分析具有很强的可迁移价值。
个人心得 知乎 - 孔某人 2026/05/28
文章围绕“长程任务”重新审视白领工作与 Agent 能力边界,认为很多可持续 1 小时以上的任务并不是抽象的“白领任务”,而是高度专业化、强依赖上下文和质量标准的岗位流程。作者进一步讨论了任务执行中不可避免的信息获取与交付标准同步问题,提出在更高 Agent 渗透率下,组织形态可能从按岗位划分转向按工艺流程划分,并比较了类人多 Agent、中央 Agent 和质检返工机制等不同设计路径。
推荐收录,因为它不是泛泛谈“Agent 很强”,而是把长程任务拆到信息流、交付标准、组织结构和工作流单元这些更可迁移的设计层面,适合做 AI 工程与 Agent 产品设计的参考。虽然文章偏观点和反思,缺少严格实验数据,但它对理解长任务场景、团队协作与中控式 Agent 架构的权衡很有启发。
工程实践 知乎 - 孔某人 2026/05/25
本文介绍了一个面向1小时到2天级无人值守长任务的通用 Agent 框架 Deputy,重点服务非 Coding 白领办公场景,而不是专门优化编程任务。作者围绕“按需生成 harness”“Master-Worker + Reviewer/Watcher 审计”“基于文件系统的任务级 Memory”“允许 Worker 使用更便宜模型”等设计给出一整套架构取舍,并解释了为何不采用单 Agent、对等 Multi-Agent 或完全依赖现成 Agent 内核的方案。文章同时明确指出当前 0.1.0 版本仍需要打磨,且开源代码只是高层 spec 的编译结果,适合作为长任务 Agent 架构的参考实现而非直接生产落地模板。
推荐收录,因为它不是泛泛介绍“Agent 很强”的产品稿,而是围绕长任务执行、审计纠偏、记忆机制和 harness 生成给出了可复用的架构判断。对关注 LLM 工程化、任务编排和长时 автономous delivery 的读者来说,文章能提供较强的迁移价值与设计边界感。
工具笔记 知乎 - 孔某人 2026/05/13
文章讨论 AI Coding 时代软件工程实践如何形成“复利”,核心观点是:不要把 Coding Agent 当成需要不断手工修补的工具,而应把它看作一种新的“编译器”。作者提出应明确区分人工强干预的“干预边界”和交给 AI 执行的“High-level Spec”层,尽量通过规范化文档、设计约束和重复指令沉淀来复用,而不是事后逐步编辑生成结果。文章还指出 AI Coding 在熟悉领域、高质量代码、强可靠性场景中收益会下降,边界不清时越容易陷入重复干预和低效协作。
推荐收录,因为它不是泛泛讨论“AI 写代码很快”,而是给出了一个可迁移的软件工程视角:把 AI Coding 的问题建模成编译与接口设计,而不是单次生成与修补。对正在使用 Coding Agent 的开发者、团队和工具实践者,这篇文章能帮助他们重新划分人机协作边界,减少无效干预。
工程实践 知乎 - 孔某人 2026/05/11
这篇文章延续上一部分,讨论下一代 Agent 架构为什么不能只依赖单一 harness 自动生成,而需要引入更复杂的“智能 harness”或多角色协作设计。作者从长任务场景出发,系统列出当前 LLM/Agent 的一组关键问题,包括上下文窗口不足、任务中后期懒惰、奖励目标偏移、单上下文复盘失效、元认知不足以及长期任务能力薄弱,并进一步指出这些问题在 multi-agent 场景里还会叠加协作可靠性和协作规划问题。
推荐收录,因为文章不是泛泛谈“多智能体更强”,而是基于作者的原型实践,明确拆解了当前 Agent 系统的失效模式和需要补强的架构环节。对做 AI 工程、Agent 框架或长任务自动化产品的人来说,文中的问题清单、角色分工思路和边界判断都有较强迁移价值。
职业经验 知乎 - 孔某人 2026/05/09
这篇文章围绕“大组织内过度推行 AI Coding 是否会适得其反”展开,核心观点是:在核心业务和大型组织中,AI 编码带来的短期提速可能会被需求膨胀、系统复杂度上升、review 退化和组织激励错配迅速抵消。作者进一步指出,单靠渐进式重构并不能根治问题,真正的矛盾在于需求控制、交付节奏、团队治理和历史复杂度管理,而这些往往比“提效”更难推动。
推荐收录,因为它不是在讨论 AI Coding 的工具技巧,而是在分析大组织里 AI 采用后的组织性副作用、流程失衡和长期维护成本,这类判断对技术管理者和资深工程师有较强参考价值。文章能帮助读者从“生成率”和“交付速度”之外,重新审视需求质量、架构可维护性和团队激励对 AI 落地的真实约束。