MarxSphere 功能规格详解
本文档是 MarxSphere 的完整功能规格说明。所有功能均已在 Web 界面(33 视图)或桌面端实现并验证。
一、导航与工作区(33 视图 · 6 大分类)
| 分类 |
视图 |
说明 |
| 对话推理 |
对话 / 推理 / Ask检索 |
AI 交互核心 |
| 科研中心 |
文献库 / 外部检索 / 场景 / 教育 / 实证研究 / PDF2Obsidian / 政经C刊科研 / 写作语料库 |
科研全流程 |
| 知识中心 |
知识页 / 记忆 / PG入库 / Graphiti入库 / Cognee入库 / 图谱 / 数据源 |
知识沉淀 |
| 政策资料 |
政策库 / 资料库 |
政策与资料 |
| 技能工具 |
技能 / MCP |
工具扩展 |
| 系统管理 |
Jobs / 任务 / Agent控制台 / Trace / 评测 / 告警 / Inbox / 账户计费 / 运营管理 / 文档中心 |
运维管理 |
工作区细节
- ProjectRail 侧栏:项目列表(创建/重命名/归档/删除)、MCP 会话列表、项目切换
- 活动面板:推理过程步骤流 / 模型日志(浏览器缓存持久化,可清空)
- 设置:AI 提供方配置(LLM/Embedding/Rerank 模型 + 密钥,密钥不回显)、语言切换(中/英)、API 令牌管理
二、推理与检索
2.1 52 步深度推理链路(推理 视图)
执行流程(52 步,条件触发):
| 阶段 |
步骤 |
说明 |
| 问题解析 |
1-5 |
问题分类 → 意图识别 → 术语变体 → 拆分子问题 → 实体抽取 |
| 粗检索 |
6-11 |
Cognee HYBRID(17 路)→ RAG 补全 → 图遍历 → 关系三元组 → 摘要检索 → 子问题推理 |
| 精炼 |
12-17 |
上下文扩展 → 时序分析 → PG 实体补漏 → PG 向量 → CHUNKS 词法 → 语义检索 |
| 深化 |
18-23 |
实体直查 → 实体精炼 → 概念搜索 → 文献蒸馏 → 领域知识 → 实体邻居 |
| 图谱 |
24-31 |
Graphiti 社区检索 → 超边向量检索 → 超边结构检索 → 关系事件 → 事件链 → 溯源验证 |
| 融合 |
32-42 |
去重 → 加权融合 → 证据排序 → 冲突检测 → 假设生成 → 假设验证 |
| 生成 |
43-48 |
综合论证 → 引用标注 → 结论提炼 |
| 自愈 |
49-52 |
自评打分 → 低分反思 → 归因定位 → 重新生成 |
特性:
- 每步可视化:当前步骤金色高亮、token 实时显示、检索来源可追溯
- 两种模式:template(固定模板)/ adaptive(自适应跳步)
- 53 题 32 指标评测综合分:0.884
2.2 Ask 18 步检索流水线(Ask检索 视图)
流水线:向量化 → 别名消解 → 实体抽取 → 实体召回 → 关系召回 → 事件关联 → 标题向量 → 多查询变体 → 图遍历 → 事件详情 → 事件扩展 → 意图分类 → 加权 RRF → Cosine 重打分 → Boost 链 → 去重 → LLM 重排 → 回取切片
特性:18 步逐步点亮 + 每步 token 显示;答案带编号引用(点击回看切片);支持多项目检索
2.3 三库知识图谱
| 库 |
数据规模 |
存储 |
能力 |
| Graphiti |
501 篇文献、21,337 实体、39,499 chunk、1,085 社区、11,702 超边、166,631 关系 |
Neo4j 11001 |
社区发现、超边推理、五层蒸馏 |
| Cognee |
31,253 实体、248,417 关系、11,550 切片 |
Neo4j 11003 + LanceDB |
实体关系路径、17 种检索策略 |
| PG pgvector |
7,550 切片向量(1024 维) |
PostgreSQL |
向量检索 + 全文检索(BM25) |
图谱可视化(图谱 视图):实体/事件节点拖拽、缩放、点击展开邻居、双击详情、方向推断
2.4 17 种检索策略
HyDE / 实体提升 / 关键词加权 / 事件扩展 / 时序分析 / 概念搜索 / 文献蒸馏 / 多查询变体 / 图遍历 / 关系三元组 / 子问题推理 / RAG 补全 / 语义检索 / 实体直查 / 超边向量 / 超边结构 / 社区检索
三、科研场景工作台(66 场景 · 8 大研究阶段)
场景分组(S01-S66)
| 阶段 |
场景 ID |
代表场景 |
专属算法 |
| 选题构思 |
S01-S15 |
概念溯源、学派脉络、观点对比、争鸣还原、学者谱系 |
师承共现 / 观点聚类 / 时间线 / 高频词 |
| 文献调研 |
S16-S25 |
经典文本研究、互文对照、晦涩阐释、版本校勘 |
概念溯源算法 |
| 证据检索 |
S26-S35 |
学科前沿、实证研究 |
前沿检测 |
| 数据分析 |
S36-S45 |
理论思辨拓展(前提反思/跨学科/理论现实联结/创新识别/体系建构) |
前提信号词库 / 学科映射 / 案例 embedding 匹配 / 命题张力 |
| 论文写作 |
S46-S55 |
问题凝练、框架设计、论证补全、方法适配、反方视角、综述生成、段落扩写、学术要件、引文格式化、语体适配 |
覆盖矩阵 / 模板匹配 / 断层度 / 方法映射 / 五段模板 / 口语检测 / 三格式生成器 / 语体规则库 |
| 图表制作 |
S56-S60 |
学术图表、可视化 |
图表模板库 |
| 评审发表 |
S61-S65 |
概念一致性、引文核查、逻辑自洽、学术不端、格式适配 |
易混淆概念库 / N-gram 重合度 / 循环论证正则 / 格式规则库 |
| 系统自动化 |
S66 |
政经 C 刊科研(四步法选题) |
选题矩阵 / 期刊匹配 |
场景工作台:每个场景 = 业务描述 + 能力徽章 + 动作(跳转视图 / 调用技能)+ 全屏工作台(输入 → 算法执行 → 输出)
标注工作区
框选高亮 / 下划线 / 笔记 + 笔记收纳栏(localStorage 持久化 + 导出 Markdown)
四、AI Agent 子系统(50+ 能力项 · 44 工具)
4.1 编排核心
| 能力 |
实现 |
| 决策循环 |
规划 → 选工具 → 执行 → reflect → replan(≤3 轮) |
| 任务 DAG |
LLM 拆解子任务 → 依赖编排 → 队列并发(信号量 max 2)→ 进度 SSE |
| 失败处理 |
工具超时熔断(30s)→ 重试退避(指数)→ 失败回流 → 错误分类 |
| 人工审批门 |
高影响工具 approval 事件 → 超时自动拒绝(G6 调度器 30min) |
| checkpoint |
每轮快照(loop/plan/failures)→ 重启续跑 |
| token 预算 |
任务级 400K token 上限,超预算终止 |
| 恢复 |
队列持久化 → 重启 recoverAfterRestart |
4.2 工具矩阵(44 工具 = 26 Agent + 18 视图)
| 类别 |
工具 |
说明 |
| 认知检索 |
sag_search / sag_retrieve / sag_get_event / sag_ingest / sag_reason / concept_trace / policy_search |
领域检索/概念溯源/政策检索/深度推理 |
| 文档 |
pdf_parse / attachment_read / summarize / review_output / file_read / file_write |
PDF 解析/附件阅读/摘要/评审/文件读写 |
| 执行 |
run_code(Python 沙箱 3 级)/ runtime_exec(持久运行时)/ run_command / apply_patch / todo_update |
代码执行/命令/补丁/待办 |
| 网络 |
web_search / web_fetch / github_repo / code_search |
网页搜索/抓取/GitHub/代码搜索 |
| 多模态 |
image_analyze / audio_transcribe |
图片理解/音频转写 |
| 实证 |
empirical_analysis |
问卷→回归全管道真跑 |
| 编排 |
agent_subagent / llm_write |
子 Agent 派发/LLM 写作 |
安全:DENY_TOOLS 黑名单(file_delete/data_purge/external_publish/payment)+ 白名单审批 + LRU 缓存(检索类工具)+ 权限四级
4.3 记忆与学习
| 能力 |
实现 |
| 短期记忆 |
conversation_context 会话摘要注入(记忆投毒审查拦截注入) |
| 长期记忆 |
OpenViking(偏好/经验/历史交互,recall/commit/remember 三钩子) |
| 战略记忆 |
项目目标约束注入(Agent 控制台) |
| 技能蒸馏 |
EDV 抽取 → 新技能注册 |
| 轨迹评测 |
计划遵循度 / 工具准确率 / 推理质量(judge 打分) |
| 学习闭环 |
反思 → 归因 → 最小 diff 补丁 → bad case 回流 |
| 遗忘 |
记忆维护定期归档/冲突检测/重复合并 |
4.4 治理与扩展
- 权限:reader / analyst / manager / admin + 租户隔离(JWT)
- 成本:token 实时统计(成本看板)、租户配额
- 插件热加载(plugins/ 目录监听)、OAuth(Google/GitHub 授权登录)
- 会话图分叉(checkpoint 分支)、消息线程、时间感知、身份注入
五、实证研究工作台(10 大功能)
| 功能 |
细节 |
| 问卷生成 |
主题 → 结构化问卷(变量名/题型/选项编码表自动生成,最多 120 题) |
| 问卷识别 |
导入已有问卷文本 → 结构解析 |
| 信效度检验 |
Cronbach’s α / KMO / Bartlett 球形检验 |
| 问卷诊断 |
题项质量、问题检测 |
| LLM 插补 |
论文复现级缺失值处理(三分类插补:数值/分类/文本) |
| 变量敲定 |
反 hallucinate 白名单 + 坐标读系数 |
| 分析管道 |
描述统计 → 相关分析 → 回归建模 |
| 回归分析 |
M1-M6 渐进控制、固定效应、稳健性检验 |
| 证据账本 |
每次分析留痕(数据/代码/结果),可复现 |
| 质量闸门 |
发布前质量检查 |
六、桌面端(Electron + NSIS)
| 能力 |
细节 |
| 单进程架构 |
node dist/src/index.js 同时服务 API + 前端静态资源 |
| 端口管理 |
TCP connect 预检 → 自动递增(4173→4183)→ AGENT_API_BASE 联动 |
| 首次引导 |
一键启动 PG(docker compose)→ Neo4j 检测 → Python 系统探测 → LLM 配置 |
| 崩溃恢复 |
健康轮询 → 后端退出自动重启(3s)→ 错误页展示 |
| 进程清理 |
taskkill /T 进程树(含 Python MCP 子进程) |
| 依赖自解压 |
node_modules.zip(39MB)首启 bsdtar 解压 |
| 单实例锁 |
二次启动聚焦已有窗口 |
七、评测体系
| 模块 |
指标 |
| 双轨评测 |
规则评分 + LLM judge(32 指标:检索 A / 答案 B / 推理 C / 效率 D) |
| 回归集 |
16 题轨迹前缀回归集 + 故障注入 |
| 学习引擎 |
显著性 / 归因 / 轨迹前缀 / 校准(kappa=1.0)/ 模型替换 |
| Agent 评测 |
计划遵循度 / 工具准确率 / 推理质量 / 学习曲线 |
| 闭环 |
反思 → 归因 → 最小 diff 补丁 → bad case 回流 → 评测再验证 |
八、运维与扩展
| 能力 |
细节 |
| 告警中心 |
alerts 表 + 巡检 tab + 全局 toast(降级/熔断/反思实时记录) |
| 自愈 |
巡检(60s)→ 卡死检测 → 重启 → 告警 |
| 运营管理 |
用户列表/用量/审计日志/计划管理(admin) |
| 计费 |
余额/充值/订阅/账单/用量(JWT) |
| MCP Server |
stdio 8 工具,Claude Code/Codex 直连 |
| PDF2Obsidian |
三栏工作台:上传 → PDF 预览 → 六产物(original/摘要/术语表/问答/index/信息) |
| 技能系统 |
技能注册表(约 190+ 项动态扫描)+ 触发词 + Skillify 固化 + 自动更新检测 |
| 数据源 |
29 个外部源(已接入/可接入/需注册分类) |