arXiv 2026年10月6日作者提出围绕本地语义检索工具colgrep的两阶段训练框架(按检索结果加权的监督微调加基于定位质量的强化学习),训练三个1–1.7B参数模型完成代码文件定位;在SWE-bench Lite与Multi-SWE-bench Flash上,colgrep智能体在各训练阶段均优于对应的grep智能体,Qwen3-1.7B经加权SFT加RL后文件F1达67.29与54.00,并减少29.1%的token、在CPU上降低44.1%端到端延迟,同时对微调未见过的七种语言迁移更好。作者提出围绕本地语义检索工具colgrep的两阶段训练框架(按检索结果加权的监督微调加基于定位质量的强化学习),训练三个1–1.7B参数模型完成代码文件定位;在SWE-bench Lite与Multi-SWE-bench Flash上,colgrep智能体在各训练阶段均优于对应的grep智能体,Qwen3-1.7B经加权SFT加RL后文件F1达67.29与54.00,并减少29.1%的token、在CPU上降低44.1%端到端延迟,同时对微调未见过的七种语言迁移更好。小于20亿参数的小型智能体用语义检索做代码定位,在SWE-bench Lite与Multi-SWE-bench Flash上超过grep并降低44.1% CPU延迟作者提出围绕本地语义检索工具colgrep的两阶段训练框架(按检索结果加权的监督微调加基于定位质量的强化学习),训练三个1–1.7B参数模型完成代码文件定位;在SWE-bench Lite与Multi-SWE-bench Flash上,colgrep智能体在各训练阶段均优于对应的grep智能体,Qwen3-1.7B经加权SFT加RL后文件F1达67.29与54.00,并减少29.1%的token、在CPU上降低44.1%端到端延迟,同时对微调未见过的七种语言迁移更好。作者提出围绕本地语义检索工具colgrep的两阶段训练框架(按检索结果加权的监督微调加基于定位质量的强化学习),训练三个1–1.7B参数模型完成代码文件定位;在SWE-bench Lite与Multi-SWE-bench Flash上,colgrep智能体在各训练阶段均优于对应的grep智能体,Qwen3-1.7B经加权SFT加RL后文件F1达67.29与54.00,并减少29.1%的token、在CPU上降低44.1%端到端延迟,同时对微调未见过的七种语言迁移更好。