AI工作台 / 優先建構 / beta

AI與LLM工具。

提供給使用語言模型開發的人,以及網站內容會被這些模型讀取的人:設計提示詞與工具結構描述、修復模型回傳的JSON、查看文件如何切分以供檢索,並決定哪些AI爬蟲可以讀取你的頁面。最後一組工具會在瀏覽器中執行小型模型,因此照片或掃描檔不會離開你的裝置。

13運作中的工具
現在可用
01

使用LLM建構

提示詞、工具呼叫結構描述,以及模型回傳的結構化輸出。

02

讓網站容易被AI讀取

AI爬蟲可以擷取哪些內容,以及擷取後會找到什麼。

03

在自己的裝置上執行AI

在瀏覽器分頁中執行的模型,因此檔案永遠不會上傳。

取得可供程式解析的輸出

LLM功能最常見的問題不是答案錯誤,而是無法使用:回覆被包在散文中、結尾多了一個逗號、鍵使用單引號,或是用完token上限後物件只完成一半。請使用JSON Schema描述所需的格式——JSON轉JSON Schema產生器可以根據範例建立Schema——並將它傳給模型的結構化輸出或工具呼叫功能,不要只用散文要求模型輸出JSON。

如果回覆仍然損壞,LLM JSON修復工具可以修正機械性錯誤,JS物件轉JSON轉換器可以處理JavaScript風格的常值,而JSON Schema驗證工具會在程式依賴結果前確認格式是否相符。系統提示詞產生器則能以一致的格式集中管理這些指示與工具定義。

為檢索進行分塊

檢索系統會根據找到的分塊回答,因此切分方式決定模型能看見什麼。分塊太小,會遺失賦予內容意義的句子;分塊太大,相關句子會埋在無關內容中,而且嵌入與傳送成本更高。重疊內容能讓跨越邊界的句子從兩側都被找到,但代價是必須儲存兩次。

RAG文字分塊工具會精確顯示文件在指定大小與重疊設定下的切分位置,比起從糟糕的回答一路追查到造成問題的切分方式,速度快得多。

決定AI爬蟲可以讀取什麼

訓練爬蟲、AI搜尋爬蟲,以及代表使用者發出的擷取請求,會使用不同的User-agent標記,因此網站可以拒絕訓練用途,同時繼續出現在AI回答中。AI爬蟲檢查工具會針對十個標記讀取網站的robots.txt並逐一說明;robots.txt檢查工具則會顯示完整檔案。

如果有些頁面確實希望被讀取,llms.txt檔案可以將模型導向最有用的文件,而結構化資料會清楚說明頁面的主題。兩者都不是保證,但成本都很低。

留在瀏覽器中的模型

OCR與照片工具會在頁面內執行模型。第一次使用時會下載模型——幾MB——之後便由你的處理器在本機完成工作:掃描合約、護照照片或螢幕截圖都能被讀取和處理,不會上傳到任何地方。

取捨是舊裝置上的速度,以及小型模型本身的限制。圖片轉文字和掃描PDF轉文字能妥善處理列印文字,但不擅長手寫內容;護照照片製作工具會自動找出臉部和背景,但你仍需依照所在國家的規定檢查結果。