当前位置: 首页 > news >正文

agent学习——基础概念2

1、AI 工程化/可观测性平台(AI Suite

(1)AI Suite通常指代一套端到端的 AI 应用开发与运维工具集。它不是单一工具,而是把你在前几轮对话中提到的所有能力打包在一起的产品形态。

(2)一个标准的 AI Suite 通常包含:

  • Tracing / Observability:就是你刚学会的轨迹追踪,记录全链路 Span。
  • Evaluation:即组件评估 + E2E 评估,支持离线跑分、在线 Judge、人工标注。
  • Prompt Management:Prompt 的版本管理、A/B 测试、变量注入。
  • Dataset / Test Hub:从 Trace 清洗出测试集、管理黄金样本、版本化基准。
  • Playground / Debug:在浏览器里直接调试单个 LLM 调用或整条 Chain,无需改代码。
  • Analytics / Dashboard:成本、延迟、成功率、Token 消耗等运营指标看板。

(3)典型代表产品:LangSmith、Arize Phoenix、Braintrust、Portkey、阿里云百炼评测套件等。有些厂商直接把自己的产品命名为 "XXX AI Suite"。

(4)来个全流程闭环路线:

2、带代码执行的规划(Code-as-Action

(1)简单来说,就是让大模型不再直接用自然语言“空想”步骤,而是通过编写并运行代码来完成推理、计算和任务拆解。代码在这里既是“规划的结果”,也是“执行的工具”。

(2)它是如何工作的?(三步机制)

  1. 规划即编码:LLM 将用户意图转化为一段可执行程序(通常是 Python),这段程序本身就包含了任务分解的逻辑。
  2. 沙箱执行:系统在安全隔离环境中运行该代码,获取真实返回值(而非 LLM 编造的值)。
  3. 反馈修正:若代码报错或结果异常,错误信息会回传给 LLM,触发自动调试循环——这正是你之前那张图中③测试与评估 → ④调整与优化的微观体现。

(3)不都是第一步先上来把用户问题先转化为程序语言的吗?但“带代码执行的规划”中的第一步,与普通 Function Calling 或工具调用有本质区别。这个区别不在于“是否转成程序语言”,而在于代码本身是否承载了“规划逻辑”

(4)没有它,② 的 Trace 是碎片化的,③ 的评估是主观昂贵的,④ 的优化是盲目低效的。有了它,整个闭环才具备工程化、自动化、可量化的持续改进能力——这正是 ELM 方法论(评估驱动方法论)的灵魂所在。

3、举个例子_编写大气环境领域的专业报告

(1)流程

(2)要点

(3)针对大气领域的特殊设计

1. RAG 的内容必须分层

不要用同一个向量库装所有内容。建议分为三个独立知识库:

  • 标准规范库:GB/HJ 标准、技术导则、政策文件 → 用于合规审查和依据引用
  • 领域知识百科:大气化学机制、污染物来源解析方法、模型原理 → 用于解释性文字生成
  • 历史报告范例库:过往优秀报告的章节结构、表述范式 → 用于风格对齐和 Few-shot

⚠️关键提醒:标准规范库必须保留原文条款编号和生效日期。RAG 检索时必须返回精确引用(如“HJ 2.2-2018 第5.3.2条”),而非模糊摘要。这是合规底线。

2. Code Agent 必须绑定领域工具链

通用 Python 库不够用。你需要封装一套大气领域专用工具集供 Code Agent 调用:

  • get_monitoring_data(site_id, start_time, end_time, pollutants)→ 自动对接国控/省控站 API
  • calc_aqi(pollutant_concentrations)→ 严格按 GB 3095-2012 计算,非 LLM 估算
  • run_dispersion_model(meteo, emission, receptor)→ 调用 AERMOD/CALPUFF 等认证模型的 Python 接口
  • plot_wind_rose(data, output_path)→ 标准化风玫瑰图,符合行业制图规范

这些工具内部逻辑必须是确定性代码,LLM 只负责组装调用参数和处理返回值。

3. 建立“数据-文字”双向校验机制

在节点④,增加一个独立的Fact-Checker Agent

  • 提取报告中所有数值、图表引用、标准条款
  • 回溯到节点③的输出结果和节点②的原始数据
  • 检查:数值是否一致?图表编号是否正确?引用的标准是否现行有效?
  • 若发现不一致,自动退回上一阶段修正,而非直接输出错误报告

(4)风险

4、其他人做的agent分享学习

(1)GitHub - FlyAIBox/Agent_In_Action: Agentic AI 智能体开发实战 · GitHub,在github上找到的一些实战项目,准备有时间挨个儿学习复现一下~

翻译

搜索

复制

src="">
http://www.jsqmd.com/news/1319001/

相关文章:

  • C#进制转换原理与实现详解
  • 【微科普】根除全部衰老疾病就能永生?npj Aging 2026建模解读:人类中位理论寿命156年,极限不超过557年
  • NVIDIA Profile Inspector中文界面实战:3步深度解锁显卡隐藏性能
  • 从《超星神》水瓶赛沙吃瘪看战斗系统设计与角色成长逻辑
  • 基于Wio Terminal的物联网数据看板:从API获取到屏幕显示的完整实践
  • WINDLX流水线实验:深入理解数据冒险与转发机制优化
  • 2027届开题季必读:计算机毕业设计选题避坑指南与高分选题推荐
  • 专业电动门厂家怎么选?3大核心优势+避坑技巧
  • 评委评分都可以用哪些评分设备?盘点高端评分系统能支持的硬件
  • 2026年 苏州数控机床厂家推荐榜单:CNC加工中心,钻攻机床,精密机械机床,汽车零部件制造设备源头工厂优选 - 优企名品
  • Presto 查询引擎内核详解:基于多级反馈队列思想的 Worker 调度模型
  • Spring Boot集成Druid连接池配置失效排查与解决方案
  • 鸿蒙物理 108 篇 第一百零五篇 高阶物象超变机制
  • 从硬编码到配置化:可配置按钮系统的设计与工程实践
  • 零基础接入名人名言 API:POST 请求、参数说明与返回结构全解析
  • RAG 文档切分(Chunking)策略与实现细节 —— 全网技术汇总
  • AI一站式平台如何重塑游戏开发流程:从概念到实战
  • SpringBoot+Vue学生求职系统开发实践
  • LangGraph实战:让Agent从脚本变成生产级可控系统
  • GEO软件哪个好到底怎么选?头部GEO机构硬核实测横评与企业选型避坑指南 - 趣闻早乐评
  • Python爬虫进阶:结合JS逆向与AI技术破解数据采集难题
  • 如何实现智能文档文字识别:AnythingLLM OCR功能的完整指南
  • Minecraft 1.8.9轻量化UI模组开发:Vibe Coding实践指南
  • 如何一键搞定60多种语言的字幕下载难题?OpenSubtitlesDownload实战指南
  • NVIDIA Profile Inspector终极指南:解锁显卡隐藏设置,优化游戏性能
  • 2026年南宁美术培训大揭秘,究竟哪家技术实力更胜一筹?
  • 阿里后端实习面试:从八股文到系统设计的深度工程实践
  • 如何在绝对标准的C编译器和系统(比如DOS)写出无阻塞输入
  • Godot引擎GDScript反编译实战:从PCK/APK恢复源码的完整指南
  • 邯郸拖车_邯郸高速汽车拖车_邯郸道路救援汽车救援搭电补胎24小时-悟空道路救援 - 滚动商讯