AI工作台 / 优先构建 / beta

AI和LLM工具。

面向使用语言模型构建应用的人,以及那些会被模型读取的网站:设计提示词和工具架构,修复模型返回的JSON,查看文档如何拆分以供检索,并决定哪些AI爬虫可以读取你的页面。最后一组工具会在浏览器中运行小型模型,因此照片或扫描件不会离开你的设备。

13运行中的工具
现在可用
01

使用LLM构建

提示词、工具调用架构,以及模型返回的结构化输出。

02

让网站易于被AI读取

AI爬虫可以抓取什么,以及抓取后能发现什么。

03

在自己的设备上运行AI

在浏览器标签页中运行的模型,因此文件永远不会被上传。

获得可解析的输出

LLM功能的大多数失败并不是答案错误,而是结果无法使用:回复被散文包裹,末尾多了逗号,键使用了单引号,或者令牌用完时对象被截断。使用JSON Schema描述你想要的结构——JSON转JSON Schema生成器可以根据示例生成Schema——并将其传给模型的结构化输出或工具调用功能,而不是用自然语言要求它返回JSON。

如果回复仍然损坏,LLM JSON修复工具可以修复机械性错误,JS对象转JSON转换器可以处理JavaScript风格的字面量,而JSON Schema验证工具会在代码依赖结果前确认其是否匹配。系统提示词生成器则以统一格式集中管理相关指令和工具定义。

为检索进行分块

检索系统根据找到的分块来回答,因此拆分方式决定了模型能看到什么。分块太小,会丢失赋予内容意义的句子;分块太大,相关句子会埋在无关内容中,而且嵌入和发送成本更高。重叠会让跨越边界的句子可以从两侧被找到,代价是需要存储两次。

RAG文本分块工具会准确显示文档在指定大小和重叠设置下的断点,比从错误答案反向排查到导致问题的拆分位置更快。

决定AI爬虫读取什么

训练爬虫、AI搜索爬虫,以及代表用户发起抓取的请求使用不同的User-agent标记,因此网站可以拒绝训练抓取,同时继续出现在AI答案中。AI爬虫检查工具会读取网站的robots.txt并逐一解释其中十种爬虫;robots.txt检查工具则显示整个文件。

对于确实希望被读取的页面,llms.txt文件可以将模型指向最有用的文档,结构化数据则明确说明页面的主题。两者都不是保证,但成本都很低。

留在浏览器中的模型

OCR和照片工具会在页面内运行模型。首次使用时会下载模型——几MB——之后便由你的处理器在本地完成工作:扫描的合同、护照照片或屏幕截图都会被读取和处理,不会上传到任何地方。

代价是旧设备上的速度,以及小型模型本身的限制。图片转文本和扫描PDF转文本擅长处理印刷文本,但不擅长手写内容;护照照片制作工具会自动找到面部和背景,但你仍需根据所在国家或地区的规定检查结果。