Search

Search

Papers, wiki, Option Blackboard, encyclopedia, and cards.

Results for “eval” · papers 13 · wiki 36
Academic Papers · 13arXiv q-fin live 2 · desk corpus 11
arXiv · arXiv q-fin · 2026

Martingale Doppelgänger-Eval: An Identification Framework for Auditing Candlestick Understanding in Vision-Language Models

We introduce Martingale Doppelgänger-Eval, a public shadow-market benchmark for auditing whether vision-language models (VLMs) use candlestick evidence rather than extrapolate past trends. The central difficulty is identification: on real market histories, chart evidence and trend are strongly coupled, so an observational score cannot determine whether a fluent technical-analysis narrative is grounded in local visual

Ziyao Wang
arXiv · arXiv · 2026

Evaluation of gNB Monostatic Sensing for UAV Use Case

3GPP Release 19 has initiated the standardization of integrated sensing and communications (ISAC), including a channel model for monostatic sensing, evaluation scenarios, and performance assessment methodologies. These common assumptions provide an important basis for ISAC evaluation, but reproducible end-to-end studies still require a transparent sensing implementation. This paper evaluates 5G New Radio (NR) base st

Steve Blandino, Neeraj Varshney, Jian Wang, Jack Chuang, Camillo Gentile
arXiv · arXiv q-fin · 2025

Mathematical foundations of information economics

The state of economic theory and accumulated facts from the different branches of the economic science require to analyze the concept of the description of economy systems. The economic reality generates the problems the solution of that is only possible by a new paradigm of the description of economy system. The classical mathematical economics is based on a notion of the rational consumer choice generated by a cert

N. S. Gonchar
arXiv · arXiv · 2026

Mitigating Adverse Selection in Concentrated Liquidity AMMs with Dynamic Fees: An Agent-Based Model Approach

Automated Market Makers based on concentrated liquidity, such as Uniswap v3, significantly improve capital efficiency but expose Liquidity Providers (LPs) to adverse selection costs, formalized as Loss-Versus-Rebalancing (LVR). While theoretical literature quantifies these costs, the interplay between realistic blockchain microstructure and endogenous pricing mechanisms remains under-explored. This paper develops a g

Daniele Maria Di Nosse, Fabrizio Lillo
arXiv · arXiv · 2026

Data-Driven Duration Management -- Term Structure Forecasting Using Machine Learning

This paper compares different methods for forecasting the term structure of U.S. and European zero-coupon government bonds using both traditional econometric and Machine Learning (ML) approaches. We compare classical models (e.g., Dynamic Nelson-Siegel (DNS) and Principal Component Analysis (PCA)) with different Neural Network (NN) architectures, including those inspired by the classical models, on the U.S. Treasury

Tobias Lausser, Joao Eduardo Vuolo, Rudi Zagst
arXiv · arXiv · 2026

Quantifying Sub-Optimality in Routing for Automated Market Makers

We provide a large-scale empirical audit of DEX routing using 2.98 million WETH-USDC swaps on Ethereum. Comparing realized routes with optimized benchmarks, we measure an average shortfall of 2.02 bps per trade or \$24 million. To attribute losses, we introduce three reproducible optimal benchmarks: a Support-Constrained Optimum (SCO) that evaluates split quality conditional on the pools actually used; a Full-Venue O

Weiye Xi, Ciamac C. Moallemi
arXiv · arXiv · 2026

Predictive Extrema, Unprofitable Policies: An AI-Assisted Audit of Candle-Based Binance Spot Timing Models

We audit whether candle-based machine-learning models can turn predictions of cryptocurrency extrema or short-horizon outcomes into positive Binance Spot paper policies after assumed costs. Numerical results come from scripted fixed-seed model runs and deterministic simulators; human-supervised AI agents supported the July 20 evidence-integrity revision through literature retrieval, separately tasked critique, artifa

Ayoub Jadouli
arXiv · arXiv · 2026

Generative World Renderer

Scaling generative inverse and forward rendering to real-world scenarios is bottlenecked by the limited realism and temporal coherence of existing synthetic datasets. To bridge this persistent domain gap, we introduce a large-scale, dynamic dataset curated from visually complex AAA games. Using a novel dual-screen stitched capture method, we extracted 4M continuous frames (720p/30 FPS) of synchronized RGB and five G-

Zheng-Hui Huang, Zhixiang Wang, Jiaming Tan, Ruihan Yu, Yidan Zhang
arXiv · arXiv · 2026

The Retraction Epidemic in Science Across Publishers, Fields, and Countries

Retractions serve as an indicator of failures in research integrity, yet most analyses focus on absolute counts rather than risk per paper. We use one of the largest open bibliographic databases to develop incidence metrics normalized by population: retractions per publication and per active author annually. Applying an epidemiological framework that models counts with exposure, we find evidence of exponential growth

Sara Venturini, Alessandra Urbinati, Paola Gallo, Jessica T. Davis, Alessandro Vespignani
arXiv · arXiv · 2026

SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization

Agent skills, structured packages of procedural knowledge and executable resources that agents dynamically load at inference time, have become a reliable mechanism for augmenting LLM agents. Yet inference-time skill augmentation is fundamentally limited: retrieval noise introduces irrelevant guidance, injected skill content imposes substantial token overhead, and the model never truly acquires the knowledge it merely

Zhengxi Lu, Zhiyuan Yao, Jinyang Wu, Chengcheng Han, Qi Gu
arXiv · arXiv · 2026

BVFLMSP : Bayesian Vertical Federated Learning for Multimodal Survival with Privacy

Multimodal time-to-event prediction often requires integrating sensitive data distributed across multiple parties, making centralized model training impractical due to privacy constraints. At the same time, most existing multimodal survival models produce single deterministic predictions without indicating how confident the model is in its estimates, which can limit their reliability in real-world decision making. To

Abhilash Kar, Basisth Saha, Tanmay Sen, Biswabrata Pradhan
arXiv · arXiv · 2026

AEGIS: Adversarial Entropy-Guided Immune System -- Thermodynamic State Space Models for Zero-Day Network Evasion Detection

As TLS 1.3 encryption limits traditional Deep Packet Inspection (DPI), the security community has pivoted to Euclidean Transformer-based classifiers (e.g., ET-BERT) for encrypted traffic analysis. However, these models remain vulnerable to byte-level adversarial morphing -- recent pre-padding attacks reduced ET-BERT accuracy to 25.68%, while VLESS Reality bypasses certificate-based detection entirely. We introduce AE

Vickson Ferrel
arXiv · arXiv · 2026

Stabilizing Rubric Integration Training via Decoupled Advantage Normalization

We propose Process-Aware Policy Optimization (PAPO), a method that integrates process-level evaluation into Group Relative Policy Optimization (GRPO) through decoupled advantage normalization, to address two limitations of existing reward designs. Outcome reward models (ORM) evaluate only final-answer correctness, treating all correct responses identically regardless of reasoning quality, and gradually lose the advan

Zelin Tan, Zhouliang Yu, Bohan Lin, Zijie Geng, Hejia Geng
Wiki Entities · 36
Equity

Equity Risk Premium

Equity Risk Premium measures the excess return investors expect from equities over risk-free assets and is a core framework for evaluating relative equity valuation.

AI Systems

Retrieval-Augmented Generation

AI pattern combining vector retrieval with model reasoning to reduce hallucination and add memory.

AI Systems

LLM Retrieval Augmented Generation

LLM Retrieval Augmented Generation — Grounding model answers in retrieved documents.

AI Systems

Evaluation Harness Design

Evaluation Harness Design — Structured tests for quality, safety, and regression.

AI Systems

Embedding Similarity Search

Embedding Similarity Search — Vector nearest-neighbor retrieval for semantic search.

AI Systems

RAG Retrieval Quality chat

RAG Retrieval Quality chat — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

RAG Retrieval Quality lab

RAG Retrieval Quality lab — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

RAG Retrieval Quality rag

RAG Retrieval Quality rag — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

RAG Retrieval Quality research

RAG Retrieval Quality research — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

RAG Retrieval Quality trading desk

RAG Retrieval Quality trading desk — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

RAG Retrieval Quality ops

RAG Retrieval Quality ops — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

RAG Retrieval Quality batch

RAG Retrieval Quality batch — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

RAG Retrieval Quality streaming

RAG Retrieval Quality streaming — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

RAG Retrieval Quality founder mode

RAG Retrieval Quality founder mode — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

RAG Retrieval Quality production

RAG Retrieval Quality production — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

RAG Retrieval Quality canary

RAG Retrieval Quality canary — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

RAG Retrieval Quality shadow

RAG Retrieval Quality shadow — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

Chunk Overlap Strategy chat

Chunk Overlap Strategy chat — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

Chunk Overlap Strategy lab

Chunk Overlap Strategy lab — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

Chunk Overlap Strategy rag

Chunk Overlap Strategy rag — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

Chunk Overlap Strategy research

Chunk Overlap Strategy research — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

Chunk Overlap Strategy trading desk

Chunk Overlap Strategy trading desk — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

Chunk Overlap Strategy ops

Chunk Overlap Strategy ops — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

Chunk Overlap Strategy batch

Chunk Overlap Strategy batch — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

Chunk Overlap Strategy streaming

Chunk Overlap Strategy streaming — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

Chunk Overlap Strategy founder mode

Chunk Overlap Strategy founder mode — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

Chunk Overlap Strategy production

Chunk Overlap Strategy production — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

Chunk Overlap Strategy canary

Chunk Overlap Strategy canary — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

Chunk Overlap Strategy shadow

Chunk Overlap Strategy shadow — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

Embedding Drift chat

Embedding Drift chat — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

Embedding Drift lab

Embedding Drift lab — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

Embedding Drift rag

Embedding Drift rag — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

Embedding Drift research

Embedding Drift research — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

Embedding Drift trading desk

Embedding Drift trading desk — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

Embedding Drift ops

Embedding Drift ops — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems

Embedding Drift batch

Embedding Drift batch — AI retrieval, agent, evaluation, or production-reliability concept.

Option Blackboard · 0
No Option Blackboard entries matched.
Encyclopedia · 24
AI Systems · Foundations

Agent Loop Budget batch

Agent Loop Budget batch — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Agent Loop Budget canary

Agent Loop Budget canary — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Agent Loop Budget chat

Agent Loop Budget chat — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Agent Loop Budget founder mode

Agent Loop Budget founder mode — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Agent Loop Budget lab

Agent Loop Budget lab — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Agent Loop Budget ops

Agent Loop Budget ops — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Agent Loop Budget production

Agent Loop Budget production — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Agent Loop Budget rag

Agent Loop Budget rag — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Agent Loop Budget research

Agent Loop Budget research — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Agent Loop Budget shadow

Agent Loop Budget shadow — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Agent Loop Budget streaming

Agent Loop Budget streaming — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Agent Loop Budget trading desk

Agent Loop Budget trading desk — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Cache Hit Rate batch

Cache Hit Rate batch — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Cache Hit Rate chat

Cache Hit Rate chat — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Cache Hit Rate lab

Cache Hit Rate lab — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Cache Hit Rate ops

Cache Hit Rate ops — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Cache Hit Rate rag

Cache Hit Rate rag — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Cache Hit Rate research

Cache Hit Rate research — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Cache Hit Rate streaming

Cache Hit Rate streaming — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Cache Hit Rate trading desk

Cache Hit Rate trading desk — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Chunk Overlap Strategy batch

Chunk Overlap Strategy batch — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Chunk Overlap Strategy canary

Chunk Overlap Strategy canary — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Chunk Overlap Strategy chat

Chunk Overlap Strategy chat — AI retrieval, agent, evaluation, or production-reliability concept.

AI Systems · Foundations

Chunk Overlap Strategy founder mode

Chunk Overlap Strategy founder mode — AI retrieval, agent, evaluation, or production-reliability concept.

Cards · 0
No cards matched.
← Back to Codex