v0.1.0 现已支持可视化工作流与提示词优化

多模型流式并行对比与
大语言模型协同工作流工作台

一次提问,多模型并行流式竞速与质量对比。更集成了可视化工作流编排(Agent Studio)、提示词自优化(Prompt Coach)及智能体开发模块,完全本地运行,掌控数据隐私。

免费下载 了解核心特性 →

Windows x64 · Linux x86_64 · 免费安全

LLM Runner Workbench
Local Rust Backend Active
请用 Python 实现一个冒泡排序算法。
DeepSeek V3
deepseek-chat
Streaming
def bubble_sort(arr):
    n = len(arr)
    for i in range(n):
        for j in range(0, n-i-1):
            if arr[j] > arr[j+1]:
                arr[j], arr[j+1] = arr[j+1], arr[j]
GPT-4o
gpt-4o
完成 (1.2s)
def bubble_sort(arr):
    for i in range(len(arr)):
        for j in range(len(arr)-i-1):
            if arr[j] > arr[j+1]:
                arr[j], arr[j+1] = arr[j+1], arr[j]
    return arr
Claude 3.5
claude-3-5-sonnet
完成 (1.6s)
def bubbleSort(arr):
    n = len(arr)
    # 遍历所有数组元素
    for i in range(n):
        for j in range(0, n-i-1):
            if arr[j] > arr[j+1]:
                arr[j], arr[j+1] = arr[j+1], arr[j]
开始 (Start)
输入变量:query (string)
LLM 生成
模型: deepseek-chat
格式: JSON (Schema)
条件分支
规则: score >= 0.8
输出结果
返回翻译后的 JSON
HTTP 重试
POST: /api/fallback
优化任务名 JSON 结构化输出优化
评估用例数 10 个测试用例
评测模型 Claude 3.5 Sonnet
优选目标 准确率达到 90%
第 0 轮迭代 (基线 Baseline) 62%
部分测试用例中模型未采用规定的 JSON 格式,且在嵌套字段中存在少量幻觉内容。
第 1 轮自动优化 78%
自动向系统提示词中追加了“必须以严格的 JSON 块输出,不要有额外解释”约束。
+ 请在输出前校验 JSON Schema,并确保嵌套关系正确。
第 2 轮自动优化 (当前最佳) 94%
模型在所有用例中均生成了有效的 JSON 数据,并且完美匹配边界逻辑。
+ 仅返回符合以下 JSON 定义的格式,不可包含任何 ```json 标记之外的文本。
智能体名称 (Agent Name)
智能学术翻译官 (Academic Translator)
运行逻辑类型 (Agent Type)
ReAct 反思与工具迭代智能体
系统提示词 (System Prompt)
# 角色:你是一个专业的学术翻译智能体。 # 流程: 1. 收到文本后,优先分析专有名词。 2. 检索 web_search 工具获取最新学术翻译标准。 3. 按照“信、达、雅”的标准输出最终学术译文。
工具配置
🌐 web_search
📚 dictionary
📝 text_editor
执行限制
最大工具调用步数: 10
携带历史轮数: 8 轮

为大模型评测与协同研发而生

无论是做模型选型、评测速度,还是可视化编排复杂的工作流,LLM Runner 都是您的得力助手。

并行流式响应

支持一次提问向数十个模型同时发送请求,响应流实时同步输出。首 Token 延迟、生成速率(TPS)一目了然。

📊

速度可视化与排行

每个输出 Token 对应一个色彩方格,其颜色深浅动态映射生成速度,并在结束后自动为模型速度进行排行。

🌐

可视化工作流编排

基于 React Flow 编排 API、LLM 生成、条件分支和自定义插件节点。提供单步节点调试与完整的变量输入绑定。

🎓

提示词自优化 (Coach)

建立测试用例库,配置自动评估标准,模型将在多次运行中自我评估并自动修改 Prompt,直到符合最优表现。

🤖

智能体工作台

可快速开发配置 ReAct 智能体。绑定自定义 JSON 格式的 OpenAI 工具,并支持打包为单文件规格进行导出与分发。

🔒

100% 本地安全运行

您的所有 API Key、工作流及对话历史均存储在您本机,绝不经过第三方中转。全面保护您的数据资产安全。

节点式工作流:将复杂任务化繁为简

通过可视化的图形界面,像画思维导图一样编排大模型。实现逻辑分支判断、HTTP 外部 API 调用与本地插件的无缝衔接。

1

变量与输入绑定

在「开始」节点配置外部输入参数,支持强类型变量。在后续 LLM 及 HTTP 节点中,通过双大括号无缝插值引用。

2

JSON Schema 格式约束

设定 LLM 节点的输出格式为 JSON,在 UI 中直接配置期望的字段名称 and 类型,系统将发送严格的 JSON 约束并自动校验。

3

节点级单步调试

无需从头开始跑完整个图。右键点击任意节点即可填入模拟数据进行单步测试,直观查看耗时与输出结果,快速定位 bug。

基于测试用例的提示词自动教练

编写 Prompt 是个玄学?LLM Runner 将其转变为严谨的工程化测试。让模型在不断的反馈中自我调优,迭代出最佳版本。

用科学的方法调优系统提示词

在以往,修改 Prompt 往往是一次随意的尝试,并且极易引入“修好了一个,却改坏了其他用例”的问题(Regression)。

Prompt Coach 提供了一个科学的调优闭环:首先录入代表性的黄金测试用例,再配置目标准确率。启动任务后,模型会并发运行多个候选版本,自动评估输出并撰写针对性的微调指令,自动生成更强大的下一轮提示词。

优化引擎跑测流程 自动循环迭代
Baseline (配置基础提示词与测试用例)
↓ (并发跑测所有用例,收集评分)
评估分析 (LLM 自动诊断生成变体优化提示词)
↓ (生成迭代候选版本,重新评测)
生成最佳版本 (准确率提升达标,一键替换工作区)

实时响应,让大模型用速度说话

告别单凭感觉的响应速度判定。通过高精度时间戳统计与首 Token 延迟捕获,多模型速度直观对比。

DeepSeek V3 (API)
110 Tokens/s
极快
GPT-4o (API)
95 Tokens/s
极快
Claude 3.5 (API)
72 Tokens/s
Llama 3 8B (本地 Ollama)
28 Tokens/s
一般
极快 >80 t/s
快 >50 t/s
中等 >25 t/s
慢 ≤25 t/s

广泛接入您熟悉的全部接口

通过灵活的 Base URL 配置,您可以接入各大主流模型提供商,或任意第三方兼容转发接口,甚至是本地 Ollama 实例。

OpenAI (GPT-4o/GPT-3.5)
Anthropic (Claude 3.5 Sonnet)
DeepSeek 官方 API
SiliconFlow 硅基流动
Together AI
Groq (高速推理引擎)
OpenRouter
本地 Ollama (Llama/Mistral)
任意 OpenAI 兼容转发接口

开始体验 LLM Runner

完全本地运行的桌面工作台 · 现已提供 Windows 与 Linux x86_64 版本

Windows 10/11 x64

推荐使用 EXE 安装包,也可下载 MSI 用于集中部署。
下载 Windows EXE

Linux x86_64

面向银河麒麟 V10、统信 UOS 等 Debian 系桌面系统,需 WebKitGTK 4.1。
下载 Linux DEB
Windows / Linux x86_64
v0.1.0 · 桌面客户端
API Key 本地安全存储