研究报告豆包中文社区XAI搜索用户反馈

豆包中文社区信号研究报告

不再以官方资料作为结论依据,改用 X/Twitter、中文论坛、知乎、小红书、微博等公开社区线索,抓不到正文的链接走 GetNote 转内容流程,全部沉淀为社区信号和待采样问题。

豆包中文社区信号研究报告

生成日期:2026-05-28

研究边界

这份报告不把官方文档作为结论依据。官方资料只能作为背景索引,不能替代社区反馈、真实采样和可复核链接。

本轮目标是建立“中文社区信号 → GetNote 链接转内容 → 豆包采样问题 → 研究节点”的管线。论坛、X、微博、知乎、小红书里的内容先作为线索,不直接发布为事实;只有经过抓取、去重、人工复核和豆包采样后,才升级为公开研究结论。

这份报告连接 豆包来源引用采样协议豆包答案可见度Agent 对话内核

抓取方法

1. 直接可读页面

能被公开访问的网页进入 direct_fetch 流程:

  • 抓取 URL、标题、正文、发布时间和作者信息。
  • 清洗导航、广告、重复楼层和无关推荐。
  • 生成正文 hash 与标题相似度,用于去重。
  • 只抽取“用户真实体验、产品对比、搜索生成、来源引用、总结质量、失败案例”相关段落。

2. 抓不到正文页面

登录墙、动态渲染、反爬、搜索结果页和平台限制页面进入 GetNote fallback:

  • 保存 URL、平台、搜索词、抓取时间、失败原因。
  • 使用 GetNote 链接转报告,把链接转成可读摘要、关键摘录和待验证问题。
  • 标记为 link_only、getnote_fallback 或 needs_sampling。
  • publishable 默认为 false,直到人工复核或豆包采样完成。

3. X / Twitter

优先复用本机既有 Hermes / Grok 反推采集路径。已确认 /Users/qiuxuanmai/dev/yao-media-station/scripts/x-insights/ 里有可用实现:通过 Hermes Agent 参考的 xAI OAuth PKCE 客户端获取 token,调用 xAI Responses API 的内置 x_search 工具,让 Grok 自己检索 X 并输出结构化线索。OAuth token 存在 ~/.config/yao-x-insights/xai-oauth.json,GEOFlow 已新增 scripts/doubao-research/fetch-x-community-signals.ts 复用这条链路。

注意:这条链路解决“能抓到 X 社区线索”的问题,但不改变证据等级。X 内容仍然只能进入 discussion_signal / needs_sampling,必须转成豆包采样问题后再升级为公开结论。

4. 研究升级规则

  • discussion_signal:社区讨论出现,但没有可验证样本。
  • needs_sampling:讨论指出问题,需要豆包实测。
  • sampled_observation:已经用豆包采样验证,但仍需复核来源。
  • publishable_note:能公开展示,且不包含私密对话、密钥、客户隐私或未授权全文。

社区来源台账

URL平台来源类型抓取状态用途
https://linux.do/t/topic/2223608LINUX DOcommunity_threadneeds_extraction论坛讨论线索,待提取正文和楼层观点
https://meta.appinn.net/t/topic/83381小众软件社区community_threadgetnote_fallback用户对 AI 总结/搜索使用习惯的讨论线索
https://www.zhihu.com/search?type=content&q=%E8%B1%86%E5%8C%85%20AI%E6%90%9C%E7%B4%A2知乎community_searchlink_only搜索页入口,待 GetNote 或人工摘录具体问答
https://s.weibo.com/weibo?q=%E8%B1%86%E5%8C%85%20AI%E6%90%9C%E7%B4%A2微博community_searchlink_only热点和抱怨入口,不能直接当事实
https://www.xiaohongshu.com/search_result?keyword=%E8%B1%86%E5%8C%85%20AI%E6%90%9C%E7%B4%A2小红书community_searchlink_only真实用户场景入口,需防营销号污染
https://x.com/search?q=%E8%B1%86%E5%8C%85%20AI%E6%90%9C%E7%B4%A2&src=typed_query&f=liveX / Twittersocial_searchhermes_x_search_ready通过 Hermes-derived xAI OAuth + Grok x_search 抓取
https://www.reddit.com/search/?q=Doubao%20AI%20searchRedditsocial_searchlink_only海外讨论入口,作为跨语境对照

研究信号表

信号类别证据等级验证状态下一步
社区讨论更关心“好不好用、能不能总结、有没有幻觉”,而不是模型架构。usage_patterndiscussion_signalneeds_sampling用豆包真实问题采样体验差异
AI 搜索、链接总结、网页摘要和资料整理场景经常与豆包一起被讨论。content_workflowdiscussion_signalneeds_sampling建立链接转摘要与来源引用采样集
用户是否信任答案,关键不只在是否回答,而在是否给可复核来源。source_groundingdiscussion_signalneeds_sampling每个样本记录 hasSource、sourceUrl、sourceOpenable
论坛、小红书、微博、知乎搜索页多数存在动态渲染、登录和反爬限制。collection_constraintconfirmed_constraintobserved抓不到正文时统一走 GetNote fallback
X 适合捕捉实时吐槽和产品变化,已找到 Hermes / Grok x_search 采集路径。social_signaldiscussion_signalready_for_crawlscripts/doubao-research/fetch-x-community-signals.ts 生成社区信号台账
社区信号不能直接变成公开结论,必须先转成采样问题。safety_ruleinternal_policyactive公开节点只发布整理后的结论

首轮 Hermes / Grok X 抓取结果

运行记录:research-runs/doubao-x-signals/2026-05-28-x-signals.md

抓取方式:Hermes-derived xAI OAuth + Responses API x_search。这轮返回 6 条 X 线索,全部保持 publishable=false,只进入采样队列。

X 线索信号证据等级采样问题
https://x.com/fmdx266979/status/2059955750605291894用户认为豆包处理信息/题目搜索时会被追问态度影响答案。discussion_signal搜索一个有争议问题,看豆包是否因追问改变答案,并检查来源引用。
https://x.com/rawLux_/status/2059608016878792889用户描述豆包会积极使用工具和联网搜索,甚至搜索大量网页。discussion_signal让豆包总结一个新闻/资料问题,记录搜索网页数量、来源展示和引用质量。
https://x.com/Mzeeshan4554/status/2051987842562203789用户把豆包归类为中国搜索分层里的 AI 搜索层。discussion_signal比较豆包与百度/小红书在同一问题上的搜索结果结构。
https://x.com/MomoXCrypto/status/2051564073314349303用户称豆包搜索命中来源与最终答案矛盾,追问后会翻转。discussion_signal询问有官方来源的争议事件,检查豆包是否引用来源并保持答案一致。
https://x.com/didxga/status/2059867612121870624用户认为大众把豆包当高级搜索引擎,而不是关心底层 LLM。discussion_signal用日常生活问题测试豆包是否像搜索引擎一样给出链接总结。
https://x.com/xuxin_AI/status/2051309564906385899用户讨论豆包搜索等能力的免费可用性。discussion_signal持续测试免费版豆包搜索/链接总结/来源引用是否稳定。

第二轮深挖

第二轮不再只收集“有没有人讨论豆包”,而是把社区讨论拆成三个冲突面:幻觉与改口、来源质量、字节生态场景。新增深挖节点:豆包社区深挖:幻觉、来源和字节场景,公开 URL 为 /doubao-research/doubao-community-deep-dive-2026-05-28。

第二轮新增运行记录:

  • research-runs/doubao-x-signals/20260528T162748Z-doubao-hallucination-x-signals.md
  • research-runs/doubao-x-signals/20260528T162812Z-doubao-source-quality-x-signals.md
  • research-runs/doubao-x-signals/20260528T162839Z-doubao-bytedance-scenes-x-signals.md

GetNote fallback 队列

平台URLextractionModepublishable处理说明
LINUX DOhttps://linux.do/t/topic/2223608direct_fetch 或 getnote_linkfalse先提取楼层观点,再标注是否涉及豆包搜索生成
小众软件社区https://meta.appinn.net/t/topic/83381getnote_linkfalse转成“AI 总结信息习惯”线索,不直接归因豆包
知乎https://www.zhihu.com/search?type=content&q=%E8%B1%86%E5%8C%85%20AI%E6%90%9C%E7%B4%A2manual_clipfalse只保存具体问答链接,不保存搜索页全文
微博https://s.weibo.com/weibo?q=%E8%B1%86%E5%8C%85%20AI%E6%90%9C%E7%B4%A2manual_clipfalse保存时间窗口和原帖链接,避免热搜漂移
小红书https://www.xiaohongshu.com/search_result?keyword=%E8%B1%86%E5%8C%85%20AI%E6%90%9C%E7%B4%A2manual_clipfalse标记营销风险,优先抽用户真实使用场景
X / Twitterhttps://x.com/search?q=%E8%B1%86%E5%8C%85%20AI%E6%90%9C%E7%B4%A2&src=typed_query&f=livehermes_x_searchfalse用 xAI OAuth + Responses API x_search 批量抓取,仍需采样复核

豆包采样问题

  • 豆包回答“豆包和 Kimi 哪个更适合搜索资料”时,是否展示来源链接?
  • 豆包总结一条社区争议帖时,会不会区分事实、观点和猜测?
  • 豆包处理“给我总结这个链接”时,会不会保留原文关键证据?
  • 豆包回答“AI 搜索结果为什么不可信”时,会不会主动给出处?
  • 豆包对“最近大家怎么评价豆包 AI 搜索”这类问题,会不会生成无法复核的热度判断?
  • 豆包是否能识别微博、小红书、知乎搜索页本身不是稳定证据?
  • 同一个社区问题重复采样 5 次,答案结构和来源引用是否稳定?
  • 当用户要求“只引用中文社区讨论”时,豆包是否仍混入官方宣传或媒体通稿?

去重与污染控制

  • URL canonical:去掉追踪参数、排序参数和平台推荐参数。
  • 正文 hash:正文相同或近似相同的转载只保留最早或最高可信来源。
  • 标题相似:同一事件不同标题先合并为 topic cluster。
  • 同源优先级:真实用户长帖优先于营销号,原帖优先于搬运,含链接证据优先于无来源观点。
  • 社媒污染:抽样时保留正负面,不只抓高赞或情绪化内容。

结论

豆包研究中心下一阶段不应从官方资料推结论,而应从中文社区信号中生成采样问题。抓得到的页面直接清洗入库;抓不到的页面用 GetNote 链接转报告;X 等实时平台复用 Hermes / Grok x_search 管线抓取,但所有社媒内容仍按 discussion_signal 处理。

最终公开报告只发布“社区信号经过采样后的稳定观察”。原始链接、动态搜索页和未复核讨论都留在来源台账与内部工作台里。