|
| 1 | +package agent |
| 2 | + |
| 3 | +import ( |
| 4 | + "fmt" |
| 5 | + "strings" |
| 6 | + "unicode/utf8" |
| 7 | +) |
| 8 | + |
| 9 | +// 工具返回值在写入会话历史前的两道闸,根治 issue #135: |
| 10 | +// 单条超大工具结果(real-browser-mcp 的 base64 截图、大文件读取、海量 grep/Explore 结果) |
| 11 | +// 会原样进历史且只增不减,累积后超模型上下文窗口(如 1M tokens),导致 HTTP 400 且会话不可恢复。 |
| 12 | +// 严重时单条消息就 ~1.3M 字符,序列化都坏掉(messages[N]: missing field `content`)。 |
| 13 | +// 这里在唯一执行入口 executeTool 出口统一收口:剥 base64 二进制 + 总字节硬上限,任何单条结果都不可能独占窗口。 |
| 14 | +const ( |
| 15 | + // maxToolOutputBytes:单条工具结果写入历史的硬上限。超出按 UTF-8 边界截断并附说明。 |
| 16 | + // 96KB(≈ 数万 token):够装正常的大文件读取 / grep 结果,又远小于上下文窗口。 |
| 17 | + maxToolOutputBytes = 96 * 1024 |
| 18 | + // minBase64RunBytes:连续 base64 字符达到这个长度即判定为二进制 blob(截图 / 附件等), |
| 19 | + // 整段替换为占位符。正常文本 / 代码不会出现这么长且不含空白的连续串。 |
| 20 | + minBase64RunBytes = 4096 |
| 21 | +) |
| 22 | + |
| 23 | +// clampToolOutput 把工具结果压到可安全入历史的大小: |
| 24 | +// 先剥掉 base64 二进制 blob(替换为占位符),再对剩余文本做总字节上限截断。 |
| 25 | +// name 仅用于占位 / 截断说明,方便模型理解发生了什么、如何缩小范围重试。 |
| 26 | +func clampToolOutput(name, out string) string { |
| 27 | + out = stripBase64Blobs(out) |
| 28 | + if len(out) <= maxToolOutputBytes { |
| 29 | + return out |
| 30 | + } |
| 31 | + b := []byte(out)[:maxToolOutputBytes] |
| 32 | + // 回退到合法 UTF-8 边界,避免截出半个多字节字符(gob 持久化没事,但发给 API 会乱码 / 被拒)。 |
| 33 | + for len(b) > 0 && !utf8.Valid(b) { |
| 34 | + b = b[:len(b)-1] |
| 35 | + } |
| 36 | + return string(b) + fmt.Sprintf( |
| 37 | + "\n\n[…%s 返回 %d 字节,已截断至 %d 字节,防止撑爆上下文(issue #135)。"+ |
| 38 | + "请缩小范围重试:读文件用 offset/limit 分页、grep 收窄匹配、命令只取必要输出。]", |
| 39 | + name, len(out), len(b)) |
| 40 | +} |
| 41 | + |
| 42 | +// stripBase64Blobs 把每一段足够长的连续 base64 字符串替换为简短占位符。 |
| 43 | +// 用途:real-browser-mcp 的 browser_screenshot 等工具会把截图编成单行 base64 直接塞进文本结果, |
| 44 | +// 对非视觉模型纯属上下文垃圾。按字节扫描(base64 字符全是 ASCII,非 ASCII 字节天然断开,保证不破坏 UTF-8 文本)。 |
| 45 | +func stripBase64Blobs(s string) string { |
| 46 | + if len(s) < minBase64RunBytes { |
| 47 | + return s |
| 48 | + } |
| 49 | + var b strings.Builder |
| 50 | + i := 0 |
| 51 | + for i < len(s) { |
| 52 | + if isBase64Byte(s[i]) { |
| 53 | + j := i |
| 54 | + for j < len(s) && isBase64Byte(s[j]) { |
| 55 | + j++ |
| 56 | + } |
| 57 | + if j-i >= minBase64RunBytes { |
| 58 | + fmt.Fprintf(&b, "[…%d 字节 base64 二进制数据已省略(截图 / 附件不入上下文,issue #135)]", j-i) |
| 59 | + i = j |
| 60 | + continue |
| 61 | + } |
| 62 | + b.WriteString(s[i:j]) |
| 63 | + i = j |
| 64 | + continue |
| 65 | + } |
| 66 | + b.WriteByte(s[i]) |
| 67 | + i++ |
| 68 | + } |
| 69 | + return b.String() |
| 70 | +} |
| 71 | + |
| 72 | +// isBase64Byte 判断是否为 base64 字母表字符(含标准 +/ 和 URL-safe -_ 以及填充 =)。 |
| 73 | +func isBase64Byte(c byte) bool { |
| 74 | + return c >= 'A' && c <= 'Z' || |
| 75 | + c >= 'a' && c <= 'z' || |
| 76 | + c >= '0' && c <= '9' || |
| 77 | + c == '+' || c == '/' || c == '=' || c == '-' || c == '_' |
| 78 | +} |
0 commit comments