Code-Reviewer SubAgent:开发基于 Git Diff 的审查脚本,对照 design.md 自动检查接口签名、错误码等契约一致性,输出三档结果,替代全文件读取,单次审查 Token 消耗降低约 40%。
API 自愈:负责 P4 API 测试失败自愈链路的日志采集脚本开发,实现 trace-id 自动提取与 CLS 日志拉取,为 Debugger SubAgent 提供结构化上下文并辅助生成故障诊断报告,实现"请求失败 → 自动拉取日志 → 生成诊断报告"的自动化闭环。
Context & Token 优化:优化 Agent 上下文加载机制,通过索引式按需检索、Git Diff 增量读取与 SubAgent 上下文隔离降低无效上下文占用。
Knowledge Base:按四类标记将变更增量合并至项目知识库,避免全量复制导致的知识膨胀,使历史经验可被后续 Agent 复用。
Quick 模式:小改动跳过完整阶段,只保留需求直取 + 只读代理评估 + 单文件闭环 + checklist 断点续跑,同时保留五道门禁。
指标与效果:双源检索与信源治理使有效信源占比提升约 30%,引用可追溯率 95%+,结合来源可信度评分与 MD5 去重后平均高质量信源占比 80% 以上;单份研报生成时间控制在 30 分钟以内,减少 70% 人工调研时间。
双源检索与信源治理:设计本地知识库 + Web Search 双通道检索链路,引入信源评分、MD5 去重、递归溯源及引用校验。
专家审核与研究质量闭环:设计半导体领域 Critic 审核机制,从术语准确性、工艺逻辑、信源充分性及产业链映射等维度评估,建立"审核不通过 → 标记问题 → 触发重写"迭代闭环,驱动补搜与报告修订。
工程稳定性优化:负责长任务执行链路工程化,设计 Checkpoint 阶段级断点恢复、SSE 流式进度、JSON 容错及异常降级机制。
指标与效果:构建含 3000+ 份多模态资料的专业知识库,Recall@5 由 72% → 89%、MRR 由 0.61 → 0.78;GRPO 训练后偏好判断准确率提升至 90%+,答案幻觉率由 9.2% 降至 2.1%,引用事实一致性 95%+。
知识库构建:负责多格式文档解析、结构化切分及 Metadata 设计,完成专业资料向可检索知识库的转换。
Query 优化与检索:Query 侧加入术语增强、纠错、改写、扩展;实现 BM25 + 向量的混合召回,结合 Milvus 语义检索、关键词、元数据过滤与 Cross-Encoder 重排。
评估体系搭建:覆盖工艺 / 设备 / 材料 / 缺陷的领域测试集,定义 Recall@K、MRR 等核心指标;生成侧评估偏好准确率、幻觉率、引用一致性,通过 Bad Case 归因与困难样本回流持续优化 Reward Model。
GRPO 偏好数据构建:基于 RAG 评测集与 Bad Case 构造偏好数据,对同一 Query 生成多候选 Answer,引入幻觉注入、证据遗漏、错误引用、术语扰动等 Hard Negative,构建 Answer Preference 数据集。
Reward & GRPO 训练:围绕事实一致性、引用正确性、完整性、相关性等维度设计奖励信号,采用"推理蒸馏 + GRPO"训练 Reasoning Reward Model,强化基于检索证据的偏好判断能力。
方案设计:主导业务痛点分析,将人工布线规则转化为多约束路径规划数学模型,确立"线长最优、跳线最少"的多目标优化框架,满足几何规则、边界限制、层间切换与已有图形避让约束。
建模与算法:结合 Boundary、Width、Space 等约束建立多目标 Routing 模型;基于 pyAether 实现自动布线算法。
方案设计 & 建模:完成业务需求拆解、技术方案设计、算法选型、开发验证及落地;将晶圆测试冗余识别建模为大规模 Set Cover 优化问题,求解最小非冗余测试集合。
算法设计:针对超大规模实例设计 DFG(Disk-Friendly Greedy)磁盘友好型近似算法,结合指数分层、近似选择与动态降层机制,在保证解质量的同时显著降低求解时间与内存占用。
热点追踪与搜索:覆盖知乎、头条、微博等多平台热榜追踪;接入 Google、知乎、博查、Tavily 4 类搜索渠道。
对抗式质量控制:Critical Reviewer 对成稿打分,不达标自动触发定向修订(补来源 / 改逻辑 / 补数据),最多 2 轮。
多平台风格适配:同一选题分别产出微信公众号、知乎、个人博客三种风格差异明显的稿件。
全栈工程与部署:独立完成 React + TypeScript + Ant Design 前端、FastAPI + SQLAlchemy 后端、SSE 实时日志、SQLite 持久化、Langfuse Trace 及 Linux 部署,形成可线上运行的完整 Web 产品。
SFT 数据构造:设计意图、槽位、工具链、对话轮次等标签体系,通过模板改写、槽位扰动与多轮拼接完成数据增强。
LoRA 微调:基于 Qwen3-0.6B + LoRA 开展监督微调,联合训练自然语言回复、Function Calling 与参数生成能力。
样本不平衡优化:针对 Tool Call 多、Final Reply 少导致的过调用,设计逐轮对话拆分与终态样本重加权,将训练集扩展至 7,612 条。
多轮训练策略:采用 Turn-by-Turn Splitting,为每轮 Assistant 构造独立监督样本,仅计算目标回复 Loss,强化多轮决策学习。
评估与迭代:围绕路由、工具调用、参数生成及端到端成功率搭建评估体系,通过 Bad Case 分析持续优化数据与模型行为。
数学模型:面向退役电池梯次利用系统中的随机到达与异构质量特征,构建基于多维属性的随机动态规划模型(MDP)。
AlphaEvolve 迭代:基于谷歌 DeepMind 团队的 AlphaEvolve 框架对内层启发式算法进行自动化迭代升级,将容量可行分配、领域搜索、可行性筛选等步骤模块化为可演化算法算子,构建面向组合优化的启发式搜索空间。算法 Gap 距精确解小于 0.52%。