大模型管行程创意与个性化,确定性代码 + 真实 API 管城市正确、价格合理、能不能订;异源判官真实基线证明每一版都比上一版好——passRate 0.58 → 0.708,逐条真因可溯。
规划一次出行要在十几个 App 之间横跳——缺一个把「个性化行程 + 真实可订」一次给齐的地方。
搜攻略 → 翻矛盾游记 → 拼路线 → 换 App 比机票 → 再换 App 比酒店 → 手算预算 → 反复改。信息分散、不个性化、且没有一个把「行程 + 真实可订入口」一次给齐的地方。
攻略给的是「西安三日游」泛泛模板,不结合「5 天、2 人、预算 8000、从深圳出发」该怎么排。
通用大模型会编行程但不接真实库存;OTA 有库存、个性化生成刚起步。「生成 + 可订 + 独立比价立场」一体的位置有空间。
行程城市对不对、价格真不真、能不能订——无从判断,不敢照着走。
占比是假设(无真实用户数据,诚实标注)。
| 画像 | 占比假设 | 核心诉求 | 哪个功能承接 |
|---|---|---|---|
| 懒人规划者 | 高(主力) | 不想做攻略,要一份能照走的行程 | AI 规划(反问 + 逐日生成)+ 真实数据富化 |
| 比价党 | 中 | 要最便宜、要能直接订 | 比价聚合台(飞猪实时置顶)+ 真实 bookingUrl |
| 本地深度玩家 | 中 | 要附近美食 / 地道体验 / 导航 | 附近美食必吃榜 + 地图 + 导航 |
大模型扩生成上界,确定性代码 + 真实 API 守正确性下界——不是二选一,是分工。
| 传统方案 | 能做到 | 致命缺口 |
|---|---|---|
| 搜索 / 攻略社区 | 给泛泛攻略 | ❌ 不个性化、不出可执行逐日行程 |
| 决策树 / 模板拼行程 | 覆盖热门固定线路 | ❌ 枚举不完口语长尾、状态空间爆炸 |
| OTA App | 有真实库存能订 | ❌ 个性化生成起步、无独立比价立场 |
后端 aiChat 是「行程导购台 + 安检流水线」,两头确定性代码把关,中间放模型。
模型只在第 ⑤ 步。v11 → v22 的演进:预算档位兑现(v15–18)→ opt-in 限流(v19)→ llmUsage/trace 观测(v20)→ 多城路线(v21)→ 价表增补(v22)。
qualityEval 云函数做线上质量评测(生成 → qwen 异源判官 → 落库),不进用户请求路径。和「套壳行程 GPT」的根本区别——行程挂得上真实能订的票。
飞猪 FlyAI(官方 MCP/CLI)实时直连官方库存、真实可订、附真实 bookingUrl。HMAC 签名密钥内嵌 CLI,小程序不能直连 → 云函数 execFile 签名代理。
实测真实航班号 / 时刻 / 价格 / 订票链接(CA8341 ¥400 / MU5186 ¥460 / CZ8899 ¥470)。
无 FLYAI_API_KEY 时价格打码「5xx」→ parsePrice 返 null → 回退 DB,绝不把打码价喂给用户。
436,根因 = 云函数 Node16 < CLI 要求 Node≥18(同参本机 Node22 出真实航班)。修复 = fliggyProxyV2(Node18/20)切流 + 401 自动剥 key 重试(配错 key 比不配更糟)。| 层级 | dataSource | 含义 | confidence |
|---|---|---|---|
| 飞猪实时 | fliggy_realtime | 真实可订 + 真 bookingUrl,比价台置顶 | 0.95 |
| 精选 | curated | web 核实的示例(如高端酒店名录),标「出行前请核实」 | 0.86 |
| 生成 | ai_generated / estimated | 估算待核验,弱化展示 | 0.58 |
243 条回归断言,每条对应真实事故 + 反向哨兵防误伤。
| 护栏 | 防什么 | fail-safe |
|---|---|---|
| 目的地权威 / 串味检测 | 行程城市全错 | strict 下拒答重生成;省级/多城途经豁免、路线外仍拦 |
| 「A 到 B」出发地解析 / 枢轴 | 丢去程大交通腿、换城用旧出发地 | 缺则降级不硬编 |
| 多城路线识别(新) | 「大理加丽江」按数组序张冠李戴、真多城行程被误拒 | 文本序+连接词判据,单城零行为变化 |
| 价格权威表 + 上限 + 去重 + clamp | 幻觉天价 / 免费点收费 / 收费点免费化 / 重复计价 / 飞猪错价 | 表权威、容差夹逼、首位计价 |
| 预算档位兑现 | 「30000 豪华」出虚构酒店 146/晚、预算只用 8% | curated 真实高端酒店,不注水填满预算 |
| 评测集可解析门禁(新) | 加评测城市漏加城市表 → 护栏反杀正确行程 | parity[5]:护栏的护栏 |
三层评测 + 真实基线 + 显著性检验——能带口径地说「这版比上版好」。
24 例评测集在云端真跑(DeepSeek 真实生成),qwen-plus 异源判官打分(故意与生成不同源,消自评偏差),导出自动聚合成基线;每次改动用 bootstrap 95%CI 判「真提升还是噪声」。
景点是不是真存在
免费=0 · 不重复计价
出发地/天数/预算/饮食
同日聚集 · 不折返
guardrail 243/243 · parity[1]–[5] 24/24 · benchmark 30/30 · executable 30/30 · budget-fit 14/14 · adversarial 5/5 · release-readiness 聚合 pass。
qualityEval 旁路云函数:线上生成 → qwen 判官 → 落库 quality_eval_runs,不进用户请求路径。
fill-baseline 自动聚合填表 · significance 显著性 · candidate-memory 失败蒸馏(人工 promote 门控,绝不自动改行为)。
33 页 · 5 大 Tab,围绕「AI 规划 → 真实预订 → 本地发现」。
对话式生成逐日行程,多会话 / 至少反问一轮 / 多城路线。
景点/餐饮/酒店/大交通逐时段,标注质量门禁与可订性三级分层。
机票/火车双程搜索,飞猪实时优先,失败回退本地估算。
飞猪真实酒店/景点 POI,真实优先 + 本地兜底。
飞猪实时置顶 + 其它平台「生成待核验」分层。
按距离 + 必吃榜按评分,口味/忌口过滤。
POI 地图探索 + 点对点导航(高德)。
浏览/发布(⚠️ 当前为 mock 演示,不当留存抓手讲)。
AI 质量趋势看板(异源判官历史)/ 记忆隐私 / 发布就绪门禁。
已实测的、机制就位待数据的、还没做的——分三档说,绝不混。
免 key 实测真实航班 + 真实 bookingUrl。
24 例云端真跑 + qwen 判官,0.58 → 0.708(avgW 4.07→4.41),三条 badcase 修复线上复跑坐实,显著性检验工具就位。
guardrail 243/243 · 目的地 25/25 · 出发地 26/26 · llmUsage/trace 透出(含缓存命中 token)· opt-in 按用户限流。
缺 FLYAI_API_KEY 打码回退 DB;prompt cache 已可观测但 breakpoint 隔离未做(压缩与缓存互斥待解)。
无 held-out 盲测集(Goodhart 风险);判官单一(多判官 panel 机制已备未跑);单跑 verdict 有方差(兰州 lucky seed 实证,待每例 3 采样)。
bookingUrl 无 affiliate/pid 无法归因分佣;「复制剪贴板」非直跳飞猪;payment 页 demo 不扣款(UI 需诚实化)。每项 ≤1 天。
pre-launch;bad case 飞轮由「真实基线」驱动但仍是开发者视角,从未被真实用户转动。埋点已就位,只差发体验版链接。