Files
zhenxun_bot/zhenxun/services/ai/llm/engine/router.py
T
922d092650 ♻️ refactor(core): 重构 AI 能力与定时任务调度系统 (#2148)
* ♻️ refactor(core): 重构 AI 能力与定时任务调度系统

- 【AI 能力与工具】重构 Capability 注册与管理机制,引入 CapabilityManager 统一管理
- 移除全局能力注册表,改用声明式装饰器 `@capability` 进行解耦注册
- 重构工具解析器链,使用统一的 BaseToolResolver 代替原有的多个特定解析器
- 增强工具查询过滤,支持通配符匹配、工具箱过滤和排除标签
- 【定时任务调度】重构定时任务管理器,引入 SchedulerRegistry 统一管理任务元数据
- 引入 JobConfig 聚合定时任务配置,支持用户维度的定时任务调度
- 重构执行分发器,支持并发限制、串行间隔和随机延迟打散
- 【运行上下文】引入 ScheduledDeps 以支持后台和定时任务环境下的依赖注入
- 优化 RunContext,支持从定时任务上下文快速构造,并提供 emit 辅助方法
- 【日志与监控】引入 AILoggerProxy,实现 AI 各模块的专属日志输出
- 将各模块的全局 logger 替换为对应的模块专属日志代理
- 【其他优化】修复 Pydantic V1 兼容层中 model_validator 的装饰器兼容性问题
- 在非交互式环境(如定时任务)中自动隐藏 HITL 交互工具以节省 Token

* ♻️ refactor(core): 优化内部导入路径并提升 Pydantic 兼容性

- 【重构】将 `services/ai` 模块内的绝对导入重构为相对导入,优化包结构
- 【重构】移除不必要的 `if TYPE_CHECKING` 保护,通过 `from __future__ import annotations` 直接导入类型
- 【清理】清理 `core/messages/types.py` 中未使用的 `AssistantContentUnion` 等联合类型定义
- 【优化】在 `utils/pydantic_compat.py` 中新增 `model_rebuild` 兼容函数,统一 Pydantic V1/V2 的模型重建逻辑
- 【优化】将部分函数内部的延迟导入提升至模块顶部,规范代码结构

* ♻️ refactor(imports): 优化导入路径为相对导入并清理冗余导入

- 【重构】将 AI 服务相关模块中的绝对导入路径修改为相对导入,提升模块内聚性与可移植性
- 【清理】移除多处函数内部或类方法中未使用的冗余导入,避免循环引用和资源浪费
- 【格式化】微调部分工具装饰器和返回语句的格式与尾随逗号

* 🚨 auto fix by pre-commit hooks

---------

Co-authored-by: webjoin111 <455457521@qq.com>
Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com>
2026-07-10 09:14:06 +08:00

160 lines
5.8 KiB
Python

from abc import ABC, abstractmethod
from typing import Any
from zhenxun.services.ai.core.exceptions import (
ConfigurationException,
LLMException,
UpstreamServerException,
)
from zhenxun.services.ai.core.options import GenerationConfig
from zhenxun.services.ai.llm.manager import (
_get_group_name,
_resolve_model_group,
get_default_model,
get_model_instance,
list_available_models,
)
from zhenxun.services.ai.llm.system.capabilities import get_model_capabilities
from zhenxun.services.ai.llm.system.network import health_manager
from zhenxun.services.ai.utils.logger import log_llm as logger
class BaseModelRouter(ABC):
@abstractmethod
async def route(
self,
request: Any,
model_names: list[str],
task: str,
override_config: GenerationConfig | dict | None,
cancellation_token: Any | None,
) -> Any:
pass
class FallbackRouter(BaseModelRouter):
"""主备故障转移路由器"""
async def route(
self,
request: Any,
model_names: list[str],
task: str,
override_config: GenerationConfig | dict | None,
cancellation_token: Any | None,
) -> Any:
errors = []
all_nodes_bypassed = True
is_routed_call = len(model_names) > 1
request.extra["_is_routed_call"] = is_routed_call
start_idx = request.extra.get("_working_route_index", 0)
indices_to_try = list(range(start_idx, len(model_names))) + list(
range(0, start_idx)
)
for idx in indices_to_try:
m_name = model_names[idx]
if not health_manager.is_route_healthy(m_name, strict_mode=is_routed_call):
logger.debug(f"👉 节点 '{m_name}' 熔断中,已跳过")
errors.append(f"{m_name}(熔断中)")
continue
caps = get_model_capabilities(m_name)
if not caps.supports_task(task):
errors.append(f"{m_name}(Unsupported Task: {task})")
continue
all_nodes_bypassed = False
try:
if len(model_names) > 1:
if idx != start_idx:
logger.debug(f"🔄 切换至备用节点: '{m_name}'...")
async with await get_model_instance(
m_name, override_config, task=task
) as instance:
response = await instance.invoke(request, cancellation_token)
request.extra["_working_route_index"] = idx
if run_ctx := request.extra.get("run_context"):
run_ctx.state["_working_route_index"] = idx
return response
except LLMException as e:
if not e.should_failover:
logger.warning(
f"🚫 节点 '{m_name}' "
f"返回不可恢复错误 ({e.__class__.__name__}),停止故障转移。"
)
raise e
logger.warning(
f"⚠️ 节点 '{m_name}' "
f"错误 ({e.__class__.__name__}),触发故障转移..."
)
errors.append(f"{m_name}({e.__class__.__name__})")
except Exception as e:
logger.warning(f"⚠️ 节点 '{m_name}' 发生未知异常,触发故障转移: {e}")
errors.append(f"{m_name}(Error)")
if all_nodes_bypassed and len(model_names) > 1:
fallback_model = health_manager.get_best_fallback_route(model_names)
logger.warning(
f"⚠️ 路由组所有节点均已宕机!" f"强制放行 '{fallback_model}' 探活..."
)
try:
async with await get_model_instance(
fallback_model, override_config, task=task
) as instance:
return await instance.invoke(request, cancellation_token)
except Exception as e:
errors.append(f"{fallback_model}(保底探活彻底失败:{e})")
err_msg = f"所有路由尝试均已失败: {', '.join(errors)}"
raise UpstreamServerException(err_msg)
class BaseOrchestrator:
"""顶层大模型请求编排器,负责组解析与路由策略委派。"""
def __init__(self, router: BaseModelRouter | None = None):
self.router = router or FallbackRouter()
async def invoke(
self,
request: Any,
model_name: str | None = None,
task: str = "chat",
override_config: GenerationConfig | dict | None = None,
cancellation_token: Any | None = None,
) -> Any:
resolved_model_name = model_name
if resolved_model_name is None:
resolved_model_name = get_default_model(task)
if resolved_model_name is None:
available_models = list_available_models()
if not available_models:
raise ConfigurationException("未配置任何AI模型")
resolved_model_name = available_models[0]["full_name"]
logger.warning(f"未指定模型,使用第一个可用模型: {resolved_model_name}")
group_name = _get_group_name(resolved_model_name)
if group_name is not None:
model_names = _resolve_model_group(group_name)
if not model_names:
raise ConfigurationException(
f"模型路由组 '{group_name}' 解析失败或为空,请检查配置。"
)
else:
model_names = [resolved_model_name]
return await self.router.route(
request=request,
model_names=model_names,
task=task,
override_config=override_config,
cancellation_token=cancellation_token,
)
LLMOrchestrator = BaseOrchestrator()